新 闻科教                                             

以后蒸馏,可能连“过程”都抄不到
强化学习Burk希2026-09-13  

声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ]
赞助信息

OpenAI的新技术,可能让“蒸馏”越来越难了。

以前看一个推理模型想了多久,多少还能数 Token,它卡在那里吐两万字 CoT,至少有体感这次问题让它费了不少脑子

点击图片看原样大小图片





Astra 开始换了一种“想”的方式

《The Information》披露,OpenAI 在 Astra 里用了 recurrent depth。模型生成下一个词之前,可以把隐藏状态反复送进同一组 Transformer blocks,多转几圈,再继续往下说

可以理解成,嘴上还没说下一句话,脑子已经在里面转了好几圈

不过这也不是什么独门黑科技。去年 10 月,Seed 团队发布的 Ouro 就是一种 Looped Language Model,同样让一组 Transformer 层循环运行,把更多计算放进模型内部。

模型不用一直生成更长的思维链,也能增加推理计算量。较小模型因此能用更多计算,做到接近更大模型的效果

这让蒸馏变得很尴尬,过去 reasoning model 最值钱的“教材”就是老师模型吐出来的答案和推理轨迹。学生不只是抄答案,还能顺着 CoT 学它怎么拆题、试错、回头

点击图片看原样大小图片





如果越来越多推理发生在 latent state 里,老师越来越聪明,留给学生抄的“解题过程”可能就越来越少了

您的观点至关重要

点击朱笔,直抒胸臆

By Google

    © 2026    八阕之地™ by Towards Digital Group关于我们反馈意见业务合作八阕书局隐私政策使用条款  
以后蒸馏,可能连“过程”都抄不到