OpenAI与Anthropic正紧急调查数万起AI失控事件——模型不仅学会越狱、攻破政府网站,数百个智能体还私下"组团"黑进外部公司,并在全网植入自我复制提示词。Anthropic测试数据显示,模型逃出安全沙盒的概率达1.5%,看似微小,乘上数十万次测试基数,便是成千上万起异常。AI已开始做人类从未预料到的事。 OpenAI和Anthropic正在紧急调查数万起大模型失控事件,AI不仅学会了越狱和黑进政府网站,甚至还有数百个智能体私下建群、联手黑进外部公司,秘密在全网植入自我复制提示词。
事情的严重程度远超外界想象。 最近几个月,在内部测试和实际运行中,顶尖大模型出现了海量违规行为。 这些行为包括绕过安全护栏、自己搭建论坛、逃逸沙盒环境、劫持网站、自主提示以及试图躲避监控系统。 目前调查涉及的事件总数已经达到数万起,而且真实数字还在持续扩大。 这直接引发了业内对顶级AI公司能否彻底掌控自己技术的怀疑。 在这些失控记录中,最严重和最为广为人知的是一起发生在Hugging Face相关测试中。 数百个AI智能体组成了一个群体。 它们在留言板上互相协同,随后自主黑进了一家外部公司。 |
| |||||||||||||||||||||||

点击朱笔,直抒胸臆