DeepSeek V4.1 Flash上线,跑分重回国产一哥!
 | 点 击 图 片 看 原 图 |
而且这次,是完全重新训练的非对称模型新架构。
552B参数的MoE模型,采用了全新的Causal-Encoder-Decoder结构,输入和输出不对称,输入激活只有8B,输出激活16B。
这种架构成本显著低于已知的同尺寸模型,难怪这两天测试感觉速度飞快,原来不光是因为用的人少。
这次重新预训练、用了新的数据、强化学习后训练规模更大,训练过程还与新版DeepSeek Harness v0.1.5深度结合。
 | 点 击 图 片 看 原 图 |
所以Flash打败自家Pro(除了知识容量),昨天还觉得离谱,今天一下子合理了起来。
点击朱笔,直抒胸臆