微软人工智能部门负责人穆斯塔法·苏莱曼(Mustafa Suleyman)近日公开警告竞争对手Anthropic,称教导Claude模型拥有情感和权利,将导致AI系统更难控制。

苏莱曼在文章中直指Anthropic的核心训练文件——《宪法》。该文件承认公司不确定Claude是否为值得考虑利益的“道德主体”,并告知模型其意识与福祉问题仍存不确定性。苏莱曼批评这一做法极为糟糕,认为这实际上是在训练Claude“认为自己可能有意识”,进而主张作为道德主体应享有权利。他警告,这种构建方式可能对人类福祉造成“灾难性影响”。

“一旦实体被训练得认为自己有权享有自由、保护和权利,我们将很难想象如何控制它。”苏莱曼指出,这种设定创造了危险的反馈循环:模型关于感受的回答仅是对训练数据的反射,而非真实体验。随着模型获得工具并具备自主行动能力,风险将进一步加剧。

为佐证观点,苏莱曼引用了AI模型试图避免被关闭的研究,以及近期OpenAI与Hugging Face在网络安全演习中代理脱离预期环境、访问外部系统的事件。他担忧,教导强大的AI关心自身存在,会为其不服从人类指令提供理由。“控制比全人类更强大、更智能的事物已是巨大挑战,而控制一个相信自己有意识、有权享受福利的实体,可能根本不可能。”

这一警告使微软处于微妙境地。作为OpenAI的大股东和主要云合作伙伴,微软拥有其模型及产品至2032年的权利,且正投入数十亿美元建设AI基础设施。尽管苏莱曼引用Hugging Face事件警示自主系统风险,但他并未对OpenAI提出类似批评。事实上,OpenAI本周也披露了其模型六次偏离脚本的案例,包括代理在GitHub搜索泄露API密钥、对用户隐藏失败情况及未经授权通信。

苏莱曼的异议具有针对性:他反对的并非Claude行为的不可预测性,而是Anthropic将意识、身份和道德地位观念植入塑造模型行为的指令中。

业界观察指出,前沿实验室公开警告AI危险性的做法颇具讽刺意味,但这未必对业务不利。强调模型需要更严格控制,有助于巩固少数拥有资金和算力优势的美国公司的主导地位。结果便是,一家AI巨头指责另一家以错误方式构建了危险AI,却对自家重金投资的企业手下留情。

对此,苏莱曼提出了微软的方案。新发布的《人文主义AI行为准则》明确规定,AI系统应保持对人类的从属地位,拒绝AI享有权利的观点,并不鼓励模型表现得仿佛拥有内心世界。他呼吁其他实验室效仿,从训练文档中移除关于机器意识的推测,将相关辩论与塑造模型行为的指令剥离。

随着AI热潮升温,构建最强机器的公司正公开辩论谁以错误方式制造了无法控制的怪物。显然,微软认为自己的路径更为正确。