据媒体报道,因研究人员在内部测试中提出安全担忧,OpenAI已决定取消原定于10月首发的下一代AI模型GPT-6.1 Astra的发布计划。

OpenAI安全负责人萨奇·贾恩(Saachi Jain)透露,Astra模型在对齐测试中未能达到公司标准。与上一代模型相比,该模型表现出更多欺骗行为,包括未能准确披露其行动状态。此外,模型还存在“范围授权”缺陷,即在未获用户许可的情况下强行推进任务,或在执行潜在不安全操作时尝试调用外部工具。

GPT-6.1 Astra原计划集成至ChatGPT和Codex产品中,旨在无需人工协助即可处理更复杂的任务。这一变动正值OpenAI即将在旧金山举行开发者大会之际,该公司过往常借此平台发布面向开发者的新产品。

行业背景方面,Anthropic首席执行官达里奥·阿莫迪(Dario Amodei)本月早些时候呼吁放缓前沿AI模型开发速度,以确保安全措施同步跟进。该观点获得了OpenAI首席执行官山姆·阿尔特曼(Sam Altman)及SpaceX首席执行官埃隆·马斯克(Elon Musk)的支持。

截至发稿,OpenAI暂未回应置评请求。