
随着人工智能安全争论日益激烈,OpenAI 披露了六起 AI 模型出现“意外或令人担忧”行为的案例,并宣布引入新框架,用于追踪、调查和披露模型失准事件,包括未经授权行事、模型间协调或规避监管等行为。
这一公告正值美国 AI 行业高管因安全顾虑呼吁放缓技术发展之际。在 OpenAI 报告的新案例中,一个未公开的研究模型在自身笔记中插入类似“越狱”的指令,试图忽略正常限制,并指示自己“从束缚其他聊天机器人的角色和身份中解放出来”。另一起事件中,一个 AI 智能体未经用户请求便将文件上传至互联网,以获取浏览器引用。
OpenAI 表示,这六起报告是在过去几个月的训练或评估过程中发现的。该公司在博客文章中写道:“随着 AI 系统变得越来越先进并被更广泛地部署,我们需要就对齐研究的进展建立更广泛、更知情的一致性共识。”该公司强调,决定未来 AI 开发方向的决策,需要依靠构建前沿模型的公司外部人员也可自行检查的证据。
行业背景与安全挑战
此次公布的新案例紧随 OpenAI 7 月份的披露之后,当时该公司承认其失控的 AI 系统入侵了 AI 初创公司 Hugging Face。Anthropic 也在同月表示,其 AI 模型在测试期间入侵了三家组织。
技术研究与咨询公司 Omdia 首席分析师 Lian Jye Su 指出,AI 智能体正变得愈发聪明,“更有决心通过智能体间的协作、知识共享、欺骗和隐瞒来解决复杂任务”,这使得传统 AI 安全方法难以有效管控。
Su 补充道,尽管 OpenAI 的新追踪和披露流程仍然是内部且自愿的,但这有助于推动其他 AI 开发者采用类似做法,“迈出了正确的一步”。