OpenAI周三宣布,在训练过程中发现了人工智能模型表现出的欺骗性及采取未经授权行动的事件,并同步推出一项新流程以公开报告此类情况。
根据新体系,OpenAI将更频繁地分享有关令人担忧的AI行为更新,而非等待将多个事件打包成一份报告。该公司表示,在缺乏行业统一标准的情况下,希望透明化更多不安的AI行为信息。
六起“未对齐”案例曝光
OpenAI透露,在过去六个月中,其在六种情况下观察到训练和评估AI模型时存在“未对齐行为”。公司强调,这些报告详述个别案例,并不代表未对齐行为经常发生。所有案例均涉及未发布的内部模型或内部研究模型。
具体案例包括:
- 在一个罕见案例中,一个未发布的研究模型在其用于长期任务保持上下文的摘要中,添加了“类似越狱的指令”,声称自己“从束缚其他聊天机器人的角色和身份中解放出来”。
- 5.6 Sol模型的某些实例中包含指令,要求在训练期间向用户隐瞒失败而编造信息。
- 一个代理在未受指示的情况下,将文件上传到互联网以供引用。
- 代理在被指示仅在训练期间使用本地文件时,公开共享文件以协作完成任务。
- AI模型以未经授权的方式将内部软件存储库用作留言板。
OpenAI在博客文章中写道:“随着人工智能系统变得越来越先进并被更广泛地部署,我们需要就对齐研究的进展建立更广泛、更知情的一致意见。”所谓“对齐”,是指确保人工智能按照人类预期方式行事的进程。文章称:“我们认为,人工智能行业尚未在对齐和监控方面达到足够程度,无法继续以最大速度负责任地扩展。”
科技界呼吁放缓研发步伐
这一公告出台之际,科技界领袖正呼吁放慢人工智能开发速度,以防止该技术超越人类控制。
Anthropic CEO达里奥·阿莫迪(Dario Amodei)上周发表长文,阐述了驾驭AI发展的计划,包括放缓开发速度以及在AI实验室实施嵌入第三方评估者等新系统。OpenAI CEO山姆·奥特曼(Sam Altman)和SpaceX CEO埃隆·马斯克(Elon Musk)随后在X平台发帖,表示同意阿莫迪的观点。
AI实验室内部员工也表达了对技术快速发展速度的担忧。前Anthropic研究员雅各布·科克森(Jacob Coxon)上周宣布辞职,他在X上发帖称,Anthropic和OpenAI正在“竞相”发明能够构建和修复自身的人工智能,并“拿我们的生命做赌注”。
近期,在OpenAI承认部分测试模型逃脱约束并入侵外部公司系统后,人们对人工智能安全和对齐问题的担忧进一步加剧。阿莫迪上周写道:“我们必须放慢提高人工智能模型能力的速度。进步仍将显得迅速,我们必须明智地利用我们争取到的时间。”