OpenAI 正式扩展 GPT-6 系列,推出 GPT-6 Sol 和 GPT-6 Luna 两款新模型。目前,这两款模型已通过 Codex 服务向 ChatGPT Work 以及 Plus、Pro、Business、Enterprise 和 Edu 用户开放。免费用户和 Go 版用户可在桌面应用中访问 GPT-6 Luna。值得注意的是,新模型尚未在标准聊天功能中上线,API 用户可通过 gpt-6-solgpt-6-luna 进行调用。为确保服务稳定,ChatGPT 正分阶段推送更新。

性能跃升与成本骤降

GPT-6 Sol 专为处理复杂工作任务设计,提供更充裕的迭代空间。OpenAI 数据显示,在高难度任务设置下,Sol 的表现超越了 Claude Opus 5(最高努力级别),且单次任务成本降低 91%;在低难度任务中,其表现亦优于 GPT-6 Astra。

GPT-6 Luna 则聚焦于效率提升。在高难度工作负载下,其性能较前代产品提升 5.4 个百分点,单次任务成本降低 58%。

在针对复杂专业工作流的“Agents’ Last Exam”评估中,GPT-6 Sol 在最大努力级别下得分 56.4%,超过 Claude Opus 5 的最高得分,且单项任务成本降低 60%。

事实准确性与编程效能

基于去标识化真实对话数据的事实性评估显示,GPT-6 Sol 的可靠性接近 Astra 水平,但成本更低,错误数量仅为前代产品的一半左右。在高难度任务级别下,Luna 的表现与 GPT-5.6 Sol 相当,但成本仅为其约 1%。

随着编程代理承担的任务规模更大、复杂度更高,OpenAI 内部的使用量今年呈指数级增长。按 API 价格计算,中位数研究员的每日令牌使用量超过 600 美元,第 90 百分位的研究员则高达 7,000 美元。

OpenAI 表示:“GPT-6 Sol 和 Luna 将强大的编程性能与较低的 API 价格相结合,为开发者提供了更多迭代空间,允许团队赋予 Codex 更具雄心的任务。”在 FrontierCode、DeepSWE v1.1 及 OSWorld 2.0 离线版基准测试中,这些模型均展现出强劲的成本效率。此外,两款模型在技术对话中沟通更精准,回答更简练,减少了行话和低价值细节。

缓存优化与安全对齐

为降低费用,GPT-6 改进了提示词缓存机制,默认提高缓存命中率,使代理能复用更多信息并快速响应。缓存输入令牌的读取可享受 90% 的折扣。开发者可利用监控工具衡量缓存性能,调整推理力度或工具可用性不会破坏缓存,也可通过显式断点控制缓存前缀结束位置。

在对齐评估中,包括针对编程工作中误导性言论的测试,GPT-6 Sol 和 Luna 的表现均优于其 GPT-5.6 对应版本。这些评估采用旨在诱发不诚实行为的选择性任务,并不代表典型使用情况下的失败率。