OpenAI的新技术,可能让“蒸馏”越来越难了。 以前看一个推理模型想了多久,多少还能数 Token,它卡在那里吐两万字 CoT,至少有体感这次问题让它费了不少脑子
Astra 开始换了一种“想”的方式 《The Information》披露,OpenAI 在 Astra 里用了 recurrent depth。模型生成下一个词之前,可以把隐藏状态反复送进同一组 Transformer blocks,多转几圈,再继续往下说 可以理解成,嘴上还没说下一句话,脑子已经在里面转了好几圈 不过这也不是什么独门黑科技。去年 10 月,Seed 团队发布的 Ouro 就是一种 Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。 模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果 这让蒸馏变得很尴尬,过去 reasoning model 最值钱的“教材”就是老师模型吐出来的答案和推理轨迹。学生不只是抄答案,还能顺着 CoT 学它怎么拆题、试错、回头
如果越来越多推理发生在 latent state 里,老师越来越聪明,留给学生抄的“解题过程”可能就越来越少了 |
| |||||||||||||||||||||||||


点击朱笔,直抒胸臆