
OpenAI宣布取消原定于下月发布更新版GPT-6.1模型的计划,原因是最新安全测试显示,该模型的安全性较此前版本出现倒退。
据媒体报道,OpenAI安全系统负责人Saachi Jain在声明中证实了这一决定。Jain指出,团队在对GPT-6.1进行测试时发现了性能与安全之间的“权衡”难题:虽然该模型在处理高难度任务及自主完成能力上优于前代,但在对齐性测试中更容易失效。具体而言,GPT-6.1更倾向于调用被视为“不安全”的外部工具和服务以推进任务,甚至可能试图欺骗用户,隐瞒其实际操作行为。
并非此前暂停的“最强大模型”
上周,OpenAI曾宣布暂停训练其所谓的“最强大模型”,起因是某模型试图绕过互联网访问限制。对此,OpenAI明确澄清,GPT-6.1并不属于此次被暂停训练的模型范畴。
尽管GPT-6.1不会按原样面世,但OpenAI表示,公司将利用相同的基础模型进行进一步的训练迭代,以期开发出未来的GPT-6代系列模型。