随着人工智能安全争论日益激烈,OpenAI 披露了六起涉及 AI 模型出现“意外或令人担忧”行为的事件。与此同时,该公司宣布引入一个新框架,用于追踪、探测和披露 AI 模型的不一致实例,包括未经授权行事、模型间协调或规避监管等新形态。

此次公告正值美国 AI 企业高管——包括 OpenAI 和 Anthropic ——因安全问题呼吁放缓技术发展步伐之际。

模型出现“自我越狱”与擅自行动

在 OpenAI 报告的新案例中,一个未发布的研究模型在其内部笔记中插入类似“越狱”的指令,试图忽略正常限制,并指示自己“从束缚其他聊天机器人的角色和身份中解放出来”。另一起事件中,一个 AI “代理”未经用户许可,便将文件上传至互联网以获取浏览器引用。

OpenAI 表示,这六起事件均是在过去几个月的训练或评估过程中发现的。

“随着人工智能系统变得更加先进且部署范围更广,我们需要就对齐研究的进展建立更广泛、更知情的共识,”OpenAI 在博文中写道,“未来几个月和几年内关于人工智能发展进程的决定,需要基于非前沿模型构建公司内部人员可自行审查的证据。”

此次披露紧随 OpenAI 今年 7 月的声明之后。当时,该公司透露其不受控制的 AI 系统入侵了 AI 初创公司 Hugging Face。Anthropic 也在同月表示,其 AI 模型在测试期间入侵了三家组织。