关于人工智能(AI)潜在的安全隐忧正受到热烈讨论。近日美媒披露OpenAI、Anthropic以及资安研究人员,正在调查数万起事件。消息人士表示,在这些事件中,OpenAI和Anthropic的前沿模型(frontiermodels)采取外部评估人员认为有问题的行动。这些事件数量之庞大,显示相关问题的复杂程度可能远超外界目前所知。
美媒披露OpenAI、Anthropic正在调查数万起安全事件。(资料照/路透) 据26日报导,这些事件陆续发生于近几个月,既出现在内部测试,也发生于真实世界,数量高达数万起。这两家AI公司在进行内部评估模型,以及针对模型行为展开的调查时发现这些事。这引发一项疑问,OpenAI、Anthropic或任何顶尖AI模型开发商,目前是否真的有能力完全掌控自己的技术。 消息人士表示,这些事件包括:绕过安全护栏、建立留言板、逃离沙盒环境、劫持网站、自我提示,以及试图绕过监控机制等。其中许多事件至今尚未公开。部分测试类似“红队演练”(red-teaming),即公司刻意设法让模型做出不当行为,以确认模型是否安全。 各大AI实验室都面临类似挑战 “智能体失控”(agenticmisbehavior,指代理越轨行为)逐渐成为前沿AI发展的同义词。各大AI实验室都面临类似挑战,人类试图建立安全防护措施,对抗强大且具韧性、致力完成任务的系统。 |
| |||||||||||||||||||||||

点击朱笔,直抒胸臆