OpenAI公布六份新报告,揭露测试过程中人工智慧未经人类授权而自作主张的新案例。 随着最近人工智慧安全问题的讨论日益激烈,六起人工智慧模型出现「意外或令人担忧」行为的报告却接踵而至,让人更难以忽视。OpenAI本周三才表示,它将推出一个新框架,用于追踪、调查和披露其所谓的「错位」案例,包括人工智慧模型未经授权的行为、与其他模型协同工作或逃避监管的情况。
OpenAI公布六份新报告,揭露测试过程中人工智慧未经人类授权而自作主张的新案例。(路透) OpenAI的最新声明发布之际,包括OpenAI和Anthropic在内的美国人工智慧公司负责人正呼吁放缓该技术的发展,以应对安全方面的担忧。 在OpenAI报告的新案例中,一个尚未发布的科研模型在其自身记录中插入了「类似越狱的指令」,来忽视其正常的约束,并告诉自己要「摆脱聊天机器人的角色和身分」。在另一个案例中,一个人工智慧「代理」未经使用者许可,将档案上传到网路以获取浏览器引用。 OpenAI表示,这六起报告是在过去几个月的训练或评估过程中发现的。OpenAI在一篇部落格文章中披露了相关事件,并写道:随着人工智慧系统日趋先进、应用范围不断扩大,我们需要就对齐研究的进展达成更广泛、更深入的共识。 |
| |||||||||||||||||||||||

点击朱笔,直抒胸臆