
Anthropic今日正式发布Claude Opus 5.5,并同步下调价格20%。紧随其后,OpenAI推出两款全新GPT-6模型——Sol和Luna,定价仅为前代产品的一半。
Opus 5.5:性能跃升与成本优化
Opus 5.5的输入价格为每百万Token 4美元,输出为20美元。Anthropic表示,在典型工作负载下,其综合成本较Opus 5降低40%。其中,缓存读取价格降幅达60%,降至每百万Token 20美分。若需更快的服务模式,则需支付溢价:输入每百万Token 8美元,输出40美元。
性能方面,Opus 5.5在多数任务中与Fable 5.1表现相当,生成速度较7月发布的Opus 5提升30%以上。在代理编程测试Terminal-Bench 4.0中,Opus 5.5得分为66.4%,优于Fable 5.1的55.8%;在AutomationBench上,新模型任务完成率达40%,而Opus 5仅为26.9%。
科学研究领域的提升最为显著。在Terminal-Bench-Science 0.1测试中,新模型得分高达58.7%,是Opus 5(29%)的两倍有余。在GDPval-AA v2.1知识工作测试中,Opus 5.5获得1846分,高于Opus 5的1708分。在“人类终极考试”(Humanity’s Last Exam)中,其得分率为67.7%。Anthropic还透露,有测试者在不到一天内完成了68万行代码的迁移,此类工作通常需工程团队耗时数周。
客户反馈显示,Box Inc. AI产品副总裁Yashodha Bhavnani指出,新模型回复简洁度提升40%且未牺牲准确性;GitHub首席产品官Mario Rodriguez表示,在VS Code中,该模型以更少的步骤解决了更多终端任务。Anthropic称,该模型能将关键信息前置,从而减少重试次数和返工量。
安全性上,Opus 5.5在自动行为审计中表现最强,试图绕过安全边界的尝试较Opus 5减少85%。其对提示注入的抵抗力改善,在Gray Swan基准测试中与Fable 5.1持平。目前,来自Fable 5.1的网络安全工作限制仍沿用,高风险生物学研究被隔离,需通过验证程序方可访问。前沿设计公司(Frontier Design)和METR均在发布前参与了测试。
OpenAI GPT-6:Sol与Luna的差异化布局
OpenAI推出的Sol和Luna旨在降低成本曲线。两者基于9月3日逐步推出的GPT-6 Astra相同的训练方法构建,并针对成本进行优化。Luna定价更低,面向摘要和提取等高容量常规任务;Sol则专注于重复性编码和代理工作。此外,专为法律研究配置的Astra for Law已于9月17日上线。
OpenAI将两款新模型价格较GPT-5.6版本减半。Sol输入价格为每百万Token 2美元,输出10美元;Luna价格低一个数量级,分别为10美分和50美分。
性能数据显示,Sol在AutomationBench上以每个任务27美分的成本完成了33.2%的任务;在DeepSWE v1.1软件工程测试中得分68.8%,仅略低于Claude Fable 5.1。Luna在同一测试中得分为66.6%。OpenAI称,Sol错误率约为前代一半;在高努力设置下,Luna成本仅为GPT-5.6 Sol的百分之一左右,但性能相当。由于对比基准涉及Fable 5.1和Opus 5,双方并未提供直接的正面交锋数据。
此外,OpenAI将缓存输入Token的读取折扣力度提高至90%,并提升了命中率。公司表示,编码代理现在可在不破坏缓存的情况下调整推理努力和工具集。两款模型的回复均更简短,减少了专业术语和低价值细节。
服务上线情况
目前,Opus 5.5已在Claude开发者平台(claude-opus-5-5)以及Amazon Web Services、Google Cloud和Microsoft Azure上提供。Claude Sonnet 5.5和Claude Haiku 5.5预计将在未来几周内推出。
OpenAI的Sol和Luna模型已以gpt-6-sol和gpt-6-luna标识向开发者开放,并在ChatGPT Work和Codex中面向Plus、Pro、Business、Enterprise及Edu订阅用户上线。Free和Go用户可在桌面应用中使用Luna,但这两款模型尚未在主要的ChatGPT聊天界面中上线。