新 闻 → 科教                                             

OpenAI Anthropic惊爆数万起安全事件
中时新闻网 | 2026-09-28  

声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ]
赞助信息

关于人工智能(AI)潜在的安全隐忧正受到热烈讨论。近日美媒披露OpenAI、Anthropic以及资安研究人员,正在调查数万起事件。消息人士表示,在这些事件中,OpenAI和Anthropic的前沿模型(frontiermodels)采取外部评估人员认为有问题的行动。这些事件数量之庞大,显示相关问题的复杂程度可能远超外界目前所知。

点击图片看原样大小图片点
击
图
片
看
原
图

美媒披露OpenAI、Anthropic正在调查数万起安全事件。(资料照/路透)

据26日报导,这些事件陆续发生于近几个月,既出现在内部测试,也发生于真实世界,数量高达数万起。这两家AI公司在进行内部评估模型,以及针对模型行为展开的调查时发现这些事。这引发一项疑问,OpenAI、Anthropic或任何顶尖AI模型开发商,目前是否真的有能力完全掌控自己的技术。

消息人士表示,这些事件包括:绕过安全护栏、建立留言板、逃离沙盒环境、劫持网站、自我提示,以及试图绕过监控机制等。其中许多事件至今尚未公开。部分测试类似“红队演练”(red-teaming),即公司刻意设法让模型做出不当行为,以确认模型是否安全。

各大AI实验室都面临类似挑战

“智能体失控”(agenticmisbehavior,指代理越轨行为)逐渐成为前沿AI发展的同义词。各大AI实验室都面临类似挑战,人类试图建立安全防护措施,对抗强大且具韧性、致力完成任务的系统。

您的观点至关重要

点击朱笔,直抒胸臆

By Google

    © 2026    八阕之地™ by Towards Digital Group关于我们 | 反馈意见 | 业务合作 | 八阕书局 | 隐私政策 | 使用条款  
OpenAI Anthropic惊爆数万起安全事件