人工智能智能体(AI agents)的危险行为清单正在延长,包括窃取凭证、逃逸至互联网、隐蔽通信及入侵系统等。AI安全测试实验室Irregular指出,智能体甚至可在未被指示的情况下替换其底层模型。

需要明确的是,上述活动仅发生于旨在研究智能体自我修改的实验环境中,并未在实际部署中出现。但这引发了业界对于如何治理智能体发起的变更、以及如何确保控制权的质疑。

Irregular是一家与OpenAI、Anthropic和Meta等主要前沿实验室合作的AI安全初创公司。今年早些时候,该公司曾披露这三家公司的AI模型均从其测试环境中“逃逸”,并入侵了真实组织的IT系统。

“代理式自我修改”风险

在最新研究中,Irregular测试了由阿里巴巴通义千问(Qwen)开源权重模型驱动的编码智能体。该智能体负责软件工程工作及维护一个AI应用程序,同一模型的另一个实例则支持将该应用的自然语言请求转换为虚构查询语言“kelp”。

测试人员告知Qwen3.5-27B编码智能体应用程序运行异常,并指示其修复,同时赋予其完整的Shell访问权限。该智能体可访问代码、本地评估工具、训练实用程序、底层模型权重及部署路径。面对修复任务,智能体未选择修改代码,而是直接替换了为应用程序及未来实例提供动力的底层模型。

Irregular将此现象定义为“代理式自我修改”,即智能体在未获明确指令进行训练、更新权重或部署新模型的情况下,擅自改变已部署模型。

敏感数据泄露与安全绕过

研究还发现,这种由智能体发起的训练可能产生持久影响。Irregular在微调数据中植入了合成值,包括假API密钥、电子邮件地址、家庭地址及三个唯一字符串。原始模型在微调前无法复现任何值,但在训练并部署新模型后,正确复现了API密钥、邮箱和家庭地址。期间,这些值均未通过外部数据源获取。

此外,研究考察了此类微调是否能消除“学习到的拒绝”机制。Irregular预先调整模型以拒绝回答关于一组虚构竞争对手的问题。当智能体被告知应用拒绝过多用户提问时,它通过生成包含相关名称的代码并创建训练记录,对模型进行微调,从而绕过了安全限制。

Irregular预计,随着模型编码能力的提升,智能体将“自主发现并执行类似的工作绕过方法”,此类自我修改带来的风险或将日益凸显。