2026 年 9 月,上海交通大学 Theseus Lab 联合字节跳动、 ModelBest 、智源、 XiongAnshou 、 Humanlaya 、 Agent-Native Research Lab 与上海人工智能实验室,挂出一篇 70 页的综述:《 The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement 》。 标题本身就是一个思想实验:如果存在"最后一个由人类亲手建造的 AI",那它之后的 AI ,是谁造的?这篇论文的回答是——递归自我改进( Recursive Self-Improvement, RSI )。 一、开发流水线先撑不住了:这不是科幻,是账单 先看三组数字,全部来自论文引言: •Kimi K3 与 Qwen3.8-Max 分别装载 2.8 万亿 / 2.4 万亿参数,上下文窗口约 100 万 token ; •在 GPT-5.6 发布前的六个月里, OpenAI 报告用于内部 coding 推理的算力扩张约 100 倍、内部 agentic 工具使用增长约 22 倍,活跃研究员的日均产出 token 达到 GPT-5.5 时期峰值的 2 倍; 模型训练本身仍然昂贵: Kimi K3 激活了 896 个专家中的 16 个,相比 K2 把稀疏激活的扩展效率提升了约 2.5 倍; NVIDIA Nemotron-4 的模型蒸馏用了 40 万条合成样本; OpenAI GPT-5.5 的数据质量团队动用了约 1320 名专业标注员、合计约 9240 人时。 更棘手的是部署之后的持续适配: Anthropic 报告 agentic 工作负载的 token 用量约为普通 chat 的 4 倍,到 multi-agent 系统因更长上下文、协调与端到端验证,这一倍数升至约 15 ; Meta 的 FBDetect 每周发现数千个基础设施回归,诊断一次约耗工程师 10 人时。 论文的判断很直接:靠人类写 SOP 、人类排实验、人类审回归的模式,正在从"可行"变成"瓶颈"。 RSI 要解决的,不是"让 AI 更聪明"这种老命题,而是—— 能不能把"协调改进过程"本身,变成 AI 的一个持久能力? 二、 RSI 到底是什么:改进环九件套 论文把 RSI 定义为: AI 通过与任务、环境或其他智能体持续交互,自主地把经验与反馈转化为对自身的持久修改;并且这些修改本身会影响后续改进的产生、评估与巩固。 这个定义里有三个关键词:自主、持久、被自身改进。前两个词不算新鲜——持续学习也能把新任务的知识写进模型; Agentic AI 也能自己跑实验。真正把 RSI 与邻居划开的,是第三个词。 |
| |||||||||
点击朱笔,直抒胸臆