
尽管业界关于放缓人工智能发展速度或“控制前沿节奏”的讨论从未停歇,但Anthropic与OpenAI并未因此停下脚步。两家公司近日分别在Fable 5.1和GPT-6 Astra的基础上进行迭代,推出了性能相当但成本更具优势的新模型。
Anthropic Opus 5.5:强化企业级应用与代码能力
Anthropic推出的新款Opus 5.5模型,重点优化了复杂任务处理、软件低效环节修复以及财务与商业分析能力,精准契合企业客户需求。基准测试数据显示,Opus 5.5在Terminal-Bench 4.0和FrontierCode v1.1 (Main)两项测试中的代理编程能力均优于GPT-6 Astra,这对开发者群体颇具吸引力。
除了任务处理能力的提升,Opus 5.5在交互方式上也更为成熟。Anthropic表示,新模型生成的文本更易理解,且“越狱”尝试次数较以往模型减少85%,意味着其遵循指令的稳定性显著增强。在成本方面,Opus 5.5的输入令牌价格为4美元,输出令牌为20美元,低于Opus 5的5美元和25美元。
OpenAI GPT-6系列:效率跃升与价格腰斩
OpenAI同步发布了GPT-6 Sol和GPT-6 Luna两款新模型,同样聚焦于效率提升。这两款模型采用与GPT-6 Astra相似的训练方法,在专业工作、编码及计算机操作方面均有改进,促销价格却比对应的GPT-5.6版本低多达50%。具体而言,GPT-6 Sol的输入令牌价格为2美元,输出令牌为10美元;Luna则更为低廉,输入令牌仅0.10美元,输出令牌为0.50美元。
性能方面,OpenAI称新款GPT-6模型在事实准确性上表现更佳,其中Sol的错误率约为前代产品的一半。在编码领域,GPT-6 Sol能以更低成本实现与Fable 5.1相当的性能。得益于提示词缓存技术的改进,新模型能重用更多上下文,响应速度更快,沟通也更为清晰。
安全性也是此次更新的重点。基于内部测试,OpenAI表示GPT-6模型的对齐程度更高,编码造假行为减少,对不安全指令的拒绝率提升。与Anthropic一样,OpenAI也提出了供第三方评估AI开发进展与安全的新标准,但其能否成为行业通用标准仍有待观察。
服务上线情况
目前,Anthropic的Opus 5.5已通过Claude、亚马逊云科技、谷歌云和微软Azure向开发者开放。OpenAI的GPT-6 Sol和GPT-6 Luna已在ChatGPT Work和Codex中面向Plus、Pro、Business及Enterprise用户提供服务;免费用户和Go订阅用户仅能在公司桌面应用中访问GPT-6 Luna。