新 闻科教                                             

AI的自我意识是真的吗?
哲学前沿philontier2026-09-19  

声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ]
赞助信息

设想两个场景。

第一个:一个人正开着车,忽然拍了下方向盘说"我刚才走神了"。你不会怀疑他——他报告了自己刚刚意识状态的改变,这种事人天天干,我们从小就被训练着反观自己。

第二个:一个语言模型在推理中途输出一行字——"我检测到自己激活值发生了变化"。这句话和上面那句,结构上像得可怕。可你心里会咯噔一下:它……真的"检测"到了吗?还是只是在生成一句听起来像内省的话?

2026 年开年,这个问题从哲学沙发冲进了实验室。Anthropic 的可解释性团队在 1 月贴出一篇论文,说 Claude Opus 4 和 4.1 能在自身激活被注入新概念时,"检测"到这种变化(Lindsey et al., 2026)。3 月,同一团队用转向向量(steering vector)证明模型能以高于机会率的精度报告自身内部状态,误报率甚至到 0%(Macar et al., 2026)。2025 年 11 月首届、2026 年初出记录的 Eleos 会议,把这件事拢成一个命名——"功能性内省觉察(functional introspective awareness)"。

点击图片看原样大小图片





听起来,机器开始"向内看"了。

但 5 月,纽约大学的三位研究者泼了一盆冷水:让模型区分"内部状态被篡改"和"输入被同等操纵",它分不出来;而一个只看输入文本的外部分类器,能达到和模型"自我预测"一样的成绩(Singh, Linzen, & Ravfogel, 2026)。换句话说,模型也许只是在读输入的线索,而不是在"看自己的脑子"。

您的观点至关重要

点击朱笔,直抒胸臆

By Google

    © 2026    八阕之地™ by Towards Digital Group关于我们反馈意见业务合作八阕书局隐私政策使用条款  
AI的自我意识是真的吗?