
核心观点:AI性能成本极速下降
研究机构Epoch AI发布的报告显示,达到既定AI性能水平的成本正以每季度近50%的速度下降,折合每年降幅约13倍。这一降本速度远超锂离子电池、DNA测序及传统计算硬件的历史曲线。对于构建或采购AI系统的企业而言,这意味着更强大的模型将在日常应用中变得经济可行,同时也令AI开发者维持定价权的难度大幅增加。
该研究并未追踪各类AI产品的平均售价,而是聚焦于在困难基准测试中达到特定性能门槛所需的运行成本。其核心衡量指标为GPQA Diamond,这是一项涵盖科学学科研究生级别问题的多项选择题测试。Epoch AI重点追踪了在该项目中得分至少达到81.25%的模型成本变化。
这种分析维度不仅关注模型准确率的提升,更强调实现同等答案质量所需的资源效率。随着新模型以更少的计算资源或Token完成相同任务,以及提供商部署更高效系统并下调价格,单位性能成本显著降低。
案例对比:从0.30美元到0.0004美元
OpenAI旗下模型的迭代清晰展示了这一趋势。报告显示,2025年1月发布的GPT o3在GPQA Diamond测试中得分为75%,单次解题成本为0.30美元。约一年半后,GPT-5.6 Luna achieves同样的分数,但单次成本已降至0.0004美元。
这一巨大差异表明,模型质量不再是唯一考量,提供该质量的成本已成为技术竞争的关键变量。尤其在编码、科学研究、企业分析及复杂代理任务中,性价比的重要性日益凸显。
横向比较:超越历史技术曲线
Epoch AI将AI近期的成本降幅与其他知名技术趋势进行了对比:
- 1991年至2024年,锂电池成本下降约100倍;
- 1940年起约60年间,计算成本下降数千亿倍;
- DNA测序成本虽大幅降低,但其成本曲线形成耗时二十余年。
相比之下,AI的发展速度更为迅猛。报告估算,AI能力成本的下降速度比DNA测序快四倍,比锂电池快18倍。
不过,对此类比较需保持审慎。AI数据始于2023年,早期数据部分依赖研究与外推估算;而对比中的计算数据截至2001年,电力数据截至1973年,未能完全覆盖过去二十年计算与能源领域的重大进展。
潜在挑战:增速放缓与基准偏差
成本下降并非在所有任务中均匀分布。Epoch AI考察了数学和棋类谜题等其他基准测试,发现结果各异:部分任务成本稳定改善,另一部分则长期停滞随后突然下降。例如,Frontier Math基准的结果在2025年至2026年中几乎无变化,此后成本才急剧下降。这表明不存在适用于所有推理类型的单一AI成本曲线。
此外,降价速度可能正在放缓。在跟踪的五个基准测试中,成本降幅已从初期的每季度66%减缓至两年后的每季度32%。尽管这仍是快速进步,但反映出随着能源、数据中心容量及AI硬件成本上升,进一步降低推理成本的物理难度正在增加。
报告还警示了“基准最大化”风险,即开发者可能针对特定测试优化模型,导致其在基准中表现优异,却在广泛实际工作中收益有限。尽管部分测试引入随机元素以规避此问题,但未受保护基准显示的更陡峭成本降幅暗示,针对性优化可能助推了数据表现。
市场影响:定价权转移与切换壁垒
对客户而言,更低的价格提供了更多选择。若廉价替代品能提供类似结果,企业未必需要支付溢价使用最新、最昂贵的模型。这将给在前沿系统研发上投入巨资的提供商带来压力。
然而,价格并非选择AI提供商的唯一决定因素。现有集成度、安全策略、用户习惯及信任关系同样关键。切换模型涉及测试、软件调整以及对隐私和可靠性的重新审查,这些构成了实质性的切换壁垒。
尽管如此,Epoch AI的发现指向一个明确趋势:AI性能的廉价化速度可能快于许多客户的计划调整节奏。对开发者而言,核心挑战在于如何在底层模型成本持续下降的背景下,依然保持产品的独特有用性与盈利能力。