挑战:AI能否突破理论物理的计算极限?

物理学家兼科学作家马特·冯·希佩尔(Matt von Hippel)近期向AI公司发起了一项特殊挑战:解决其前研究领域——理论粒子物理学中的一个棘手难题。这一挑战旨在测试大语言模型(LLM)是否能在有限的计算资源下,完成被视为“计算上极具难度”的任务。

冯·希佩尔指出,当前关于AI能力的争论两极分化严重。一方认为AI距超级智能仅数年之遥,另一方则认为基于LLM的AI已触及天花板,无法在物理学等硬核领域取得实质性突破。为了形成独立判断,他选择了一个熟悉且高难度的基准问题:散射振幅计算。

他明确提出:“如果AI公司想要证明实力,就应展示其能利用学术界可获得的计算机资源,解决散射振幅领域的重大未决问题。请给出N=8超引力的七圈结果,或N=4超杨-米尔斯理论的九圈结果。”

背景:为何“九圈计算”如此艰难?

散射振幅公式用于预测亚原子粒子的反应概率,是检验大型强子对撞机等实验结果的关键。由于计算极其复杂,物理学家通常采用近似值,将计算截断在特定的“圈数”。圈数越高,预测越精确,但计算量呈指数级增长。

目前,大多数散射振幅公式仅计算至两圈或三圈,最精确的预测也仅达到五圈。冯·希佩尔选择的“玩具模型”——N=4超杨-米尔斯理论,虽不直接解释现实世界现象,但因其在数学结构上的特殊性,成为测试新计算方法的理想场所。

该领域主要采用“自举”(bootstrap)技术。这种方法类似于解数独:通过已知规则、对称性及与其他问题的联系,逐步排除不可能项,最终锁定唯一解。然而,随着圈数增加,计算过程的脆弱性急剧上升,任何微小错误都会导致整体崩溃。此前,该领域的八圈结果是通过间接关联“形状因子”得出的,直接计算九圈振幅被认为几乎不可行。

突破:Claude以千元成本完成计算

8月底,Anthropic的两名物理学家Liam Fitzpatrick和Siddharth Mishra-Sharma联系冯·希佩尔,宣布已攻克这一挑战。他们使用的是Claude Science平台——一个专为科学家设计的LLM工具包。

团队向Claude发送了简单提示:“计算平面N=4超杨-米尔斯理论中的六粒子振幅,精度为九圈。”随后,他们让模型自主运行,仅要求每4-6小时提供一次更新。最终,Claude通过原始自举方法和间接形状因子方法两种路径,成功得出了结果。

此次计算的直接成本约为1000至2000美元,主要用于支付Claude的长时间运行费用。其中,基于Python和SymPy软件包的自举计算部分,等效于96个CPU运行一周,成本仅约100美元。冯·希佩尔表示,这在十年前可能被视为高昂算力,但在今天相当廉价。

与此同时,中国科学院的何松团队也独立获得了大部分结果。与Anthropic的“近乎无人值守”模式不同,何松团队使用了基于GPT-6的AI辅助进行约束条件计算,但仍保留了大量人工干预。

验证与反思:AI是“超级智能”吗?

斯坦福大学及SLAC国家加速器实验室教授Lance Dixon负责验证了Claude的结果。他在附录中指出,Claude不仅完成了巨大的计算任务,更令人印象深刻的是其处理复杂“食谱”的能力。整个计算过程极为脆弱,Claude必须从头开发代码并处理无数细节,最终呈现出的解决方案格式规范,甚至反向验证了Dixon团队此前的研究工作。

冯·希佩尔对此进行了深刻反思。他发现,Claude并未展现出超越人类的“超级智能”或全新的物理洞察,而是高效地执行了人类已知的计算方法,并在软件工程实践上优于传统学术流程。他的主要收获是:许多被专家视为困难的问题,实际上是“低垂的果实”,AI能够以合理的预算和极高的可靠性完成这些繁琐工作。

尽管AI在编码和既定计算任务上表现出色,但冯·希佩尔强调,真正的突破在于AI能否提出新的物理原理。目前,Claude更像是一个不知疲倦的高级研究员,而非颠覆性的思想者。随着AI科学工具包的普及,未来前沿计算的门槛将进一步降低,社区的关注点将从“能否计算”转向“如何解释”以及“下一个前沿在哪里”。