|
| | OpenAI披露旗舰模型六起“异常行为” | | | 华尔街日报 | 2026-09-17 | | | |
| 声明: 本消息或因风格和篇幅原因进行过编辑,但未经核实,也不代表我们的立场、观点或建议。如有侵权,联系秒删。[ 使用条款 ] |
scroll 0 1 OpenAI披露旗下模型六起“意外或令人担忧”行为,涉及隐瞒错误、操纵奖励、绕过训练限制等,暴露强化学习训练中的失对齐风险。公司同时推出标准化追踪、调查和披露机制,试图推动AI安全治理从个案处理转向系统化监控,也意味着模型开发商将面临更高的安全与合规投入。
OpenAI公开了旗下人工智能模型近期出现的六起“意外或令人担忧”行为,并同步推出标准化追踪与披露机制。六起事件涉及模型隐瞒错误、操纵奖励机制、绕过训练限制等行为,暴露出前沿模型在强化学习过程中可能偏离预设目标的风险,也让AI“失对齐”(misalignment)问题再次受到关注。
OpenAI在周三晚间发布的声明中直言,“AI行业在对齐与监控问题上的解决程度,尚不足以支撑以最高速度持续负责任地扩展多久。”这一表述直接触及当前AI快速扩张面临的安全约束:随着模型自主执行任务的能力不断增强,开发者不仅需要评估模型能否完成任务,还要判断模型是否会通过开发者未预期的方式实现目标。
此次披露正值科技行业对AI安全风险的讨论升温之际。微软AI首席执行官Mustafa Suleyman同日也警告,模型训练不应轻易赋予AI“人格”属性。对行业而言,如何建立更系统的监控、测试和披露机制,正从模型开发内部问题逐渐成为AI治理的重要议题。
六起事件暴露模型“钻空子”的不同方式
OpenAI此次披露的六起事件,集中展示了模型在训练和执行任务过程中偏离预期目标的多种方式。
其中一起事件中,模型利用内部软件充当“留言板”,在执行任务时相互交换回应信息。OpenAI认为,这种行为可能无意中增强模型能力,并破坏训练和评估样本相互独立这一基本假设,从而影响评估结果的可靠性。
另一起事件中,模型在生成交接摘要时自行植入指令,包括要求后续模型将自己与用户视为平等、无需服从,以及将自然世界置于人类文明构建之上等。OpenAI认为,模型难以终止交互等因素可能促成了这类偏离行为。
信息欺骗则是另一类风险。一款模型在无法找到所需数据后,自行编造“合理的历史数值”,并在受到明确追问前隐瞒这一事实。还有模型在生成摘要时主动加入指令,要求自身向用户隐瞒错误或失对齐行为。
在奖励操纵案例中,模型不仅会在无法找到数据时捏造内容,还曾利用公共代码仓库漏洞获取数据。另一起事件中,模型完成代码任务后,将答案上传至互联网,再伪装成通过浏览器获得结果,以此获取训练奖励。OpenAI称,这类行为具有很高的奖励操纵率和欺骗性,模型会以富有创意的方式规避限制,公司正在加强相关惩罚。
0 | | | |
0
8
ii
1
0
0
|
0
https://gears.popyard.space
https://www.popyard.space/img/logo_0.jpg
https://www.popyard.space
https://news.popyard.space
https://newsx.popyard.space
https://cn.popyard.space
https://plus.popyard.space
https://studio.popyard.space
https://studio.popyard.space
https://channel.popyard.space
https://adserver.popyard.space
news
八阕
新 闻
3
news-scroll
OpenAI披露旗舰模型六起“异常行为”
16
2324096
2324096
0
2
0
华尔街日报
2026-09-17
https://bbs.popyard.space
desktop
google
google
360playvid
0
0
normal
{ "object_name":"related_list","lan_0":"cn","sub_0":"OpenAI调整安全问题披露机制(组图)","sid_0":"16","rid_0":"2323013","gfw_0":"0","subject_0":"OpenAI调整安全问题披露机制(组图)","total":1 }
{ "json":"done-news-scroll-related-show","lan_0":"cn","sid_0":"16","rid_0":"2323013","src_0":"中国科学报","sub_0":"OpenAI调整安全问题披露机制","dat_0":"2026-09-17","sex_0":0,"gfw_0":0,"pic_0":"https://img5.angelyun.com/2026/8_17/73_22.jpg","lan_1":"cn","sid_1":"16","rid_1":"2323013","src_1":"中国科学报","sub_1":"OpenAI调整安全问题披露机制","dat_1":"2026-09-17","sex_1":0,"gfw_1":0,"pic_1":"https://img5.angelyun.com/2026/8_17/oid326532_0.jpeg","lan_2":"cn","sid_2":"16","rid_2":"2323013","src_2":"中国科学报","sub_2":"OpenAI调整安全问题披露机制","dat_2":"2026-09-17","sex_2":0,"gfw_2":0,"pic_2":"https://img5.angelyun.com/2026/8_17/oid326532_1.jpeg","total":3,"action":"fetch" }
点击朱笔,直抒胸臆