← 返回每日热点
BiFish original · 2026-09-27

Claude 用一句提示词干翻了物理学家八圈纪录,但中国团队早它 8 天就交了卷

同一个物理难题,Claude 花了几天、几千美元,在无人值守的情况下算到了九圈;人类顶尖团队花了两年、无数天才大脑,卡在八圈动弹不得。但故事没完——中科院何颂团队用 GPT-6 辅助,比 Anthro

同一个物理难题,Claude 花了几天、几千美元,在无人值守的情况下算到了九圈;人类顶尖团队花了两年、无数天才大脑,卡在八圈动弹不得。但故事没完——中科院何颂团队用 GPT-6 辅助,比 Anthropic 官宣还早 8 天就把论文挂上了 Zenodo。

有个细节很有意思:Claude 接到的提示词里,研究员只留了一句话——「我要去睡觉了,接下来的几个小时我都不会在。你继续算,除非我叫你停,每隔 4 到 6 小时给我汇报一次进度。」然后它就真的自己干了几天。

九圈到底难在哪

技术上来说,散射振幅是物理学家预测粒子怎么撞的工具。大型强子对撞机里质子对撞,末态粒子怎么飞、概率多大,全靠这个公式算。但公式本身是噩梦——每加一个「圈」,计算量指数级爆炸。

大多数人类工作停在第二圈或第三圈。粒子物理最精确的预测也才用到第五圈。在 N=4 超杨-米尔斯这个「测试沙盒」里,人类极限是八圈,由 SLAC 的 Lance Dixon 团队多年死磕拿下。九圈?看起来需要海量算力和无数天才大脑耗上数年。

每多加一个「圈」,答案就更精确,但计算量是呈指数级爆炸增长的。

Claude 怎么破的?它用了两种独立方法——原始自举法和间接形状因子法,分别算出了九圈结果。自举法像解数独:把所有可能的函数填进格子,用物理法则一个个排除。Claude 直接掏出 Python 和 SymPy,在六粒子振幅空间里硬算出一条血路。

形状因子那一路更绝。它没算一个费曼积分,把整个物理问题变成超大方程组,全程整数求解,没有小数误差,还能换几个大素数反复验算。第一道坎是内存:照老办法推到九圈,未知数有 185 万个,方程组大到内存装不下。Claude 借「对跖对偶」对称性先猜出一部分答案,未知数从 185 万降到 7.6 万。然后解数独,7.6 万个未知数被物理规则一轮轮排除,最后只剩唯一解。

最终翻译回振幅,光一个切面上的结果就有 300 多亿项。八圈时才 16.7 亿项。

成本才是真信号

这里有个数字我觉得比九圈本身更值得看:直接自举那一路,纯用于运行 Python 代码的算力成本,仅仅 100 美元。相当于租了 96 个 CPU 跑一个星期。两条路加起来几千美元,大头是 Claude 长时间运行的费用。

跟同类比怎么样?Dixon 团队冲八圈用了多年,算力资源、人力投入、试错成本,跟几千美元完全不在一个量级。更关键的是,Claude 从头到尾自己写代码,完美避开了所有坑。Dixon 说整个过程像搭扑克牌城堡或烤舒芙蕾,中间一个符号标反就全崩。

100 美金,一句提示词,Claude 在几天内就轻而易举地捅破了理论物理学的天花板。

这背后说明什么?AI 在符号推理和规则约束搜索上的能力,已经越过了「辅助工具」的临界点。 它不只是模仿数学证明,而是真的能在一个物理框架里自主推进、自主验证、自主汇报。

Dixon 给了个极高评价:「除了我和我的合著者,Claude 可能是这个世界上最懂我 2019 年和 2023 年发表的论文的『人』了。」

中国团队的反转

但故事最戏剧性的部分在这里。

Anthropic 刚找完出题人 Matt von Hippel 没几天,他又收到另一个消息——中科院理论物理所何颂团队,在 9 月 17 日把六粒子振幅从二圈到九圈的核心骨架数据公开挂上了 Zenodo。论公开发布时间,比 Anthropic 官宣还早 8 天。

何颂是国内散射振幅领域的大牛,代表性工作包括提出 Cachazo-何-袁形式,发现场论和弦论散射的几何起源。Dixon 透露,GPT-6 帮中国团队算了一部分约束条件,但整体框架还是人类自己搭的。von Hippel 也确认,他们确实用了 GPT-6 做辅助,但绝不是 Anthropic 那种纯 AI 打法。

Dixon 自嘲:「大家好像就是喜欢跑来告诉我,他们把九圈给搞定了。这下好了,我先被一台机器抢发,转头又被『人类+机器』联手抢发了一次。」

这个对比很有意思。Anthropic 走的是纯 AI 自主运行路线,何颂团队走的是人类搭框架、AI 算约束路线。两条路都到了九圈,但成本结构和可解释性完全不同。前者的震撼在于「无人干预」,后者的稳健在于「人机分工」。

我先被一台机器抢发,转头又被『人类+机器』联手抢发了一次。

对行业来说,这件事的信号很明确:AI 辅助理论物理已经不是「能不能」的问题,而是「谁先用、怎么用」的问题。 Dixon 团队本来就在训练定制的 transformer 模型预测更高圈数,口号是机器给出的任何候选答案都有工具验证。Claude 也是 transformer,只是大概比他们的大一百万倍。

跟你有什么关系

如果你是从业者,不管是物理、数学还是任何依赖符号推理的领域,这件事的核心启示不是「AI 要取代你」,而是验证工具链比模型本身更值钱。Dixon 团队能快速确认 Claude 的结果,是因为他们多年积累的验证方法和格式。Claude 交答案时还用了他们团队早就定好的格式——教授猜,这是 Claude 在给他们卖面子。

如果你只是普通读者,可以记住一个数字:185 万降到 7.6 万。这是 Claude 用对称性「猜」出部分答案后,未知数规模的变化。聪明的搜索比蛮力计算重要得多,这个道理放在哪都成立。

不过有个数据我没找到官方验证:Anthropic 说两条路各花一两千美元,但具体 token 消耗和运行时长没有公开。也可能是我想多了,毕竟他们没必要在这上面撒谎。

还有一点得说清楚:Claude 算的只是 N=4 超杨-米尔斯的「玩具模型」,距离解释真实宇宙的暗物质、反物质还有很长的路要走。杨-米尔斯理论本身是 1954 年杨振宁和米尔斯创立的,是整个现代粒子物理学的基石,但九圈振幅只是这个理论框架下的一个特殊计算,不是直接对应真实世界的粒子碰撞。

何颂团队的工作也提醒我们,纯 AI 路线和人类+AI 路线各有优势。Anthropic 证明了 AI 能自主干,何颂团队证明了人类搭框架、AI 算细节同样能到终点,而且发布时间还更早。

好了不吹了,我得回去继续搬砖了,今天的代码还没写完呢。

本文基于 media 公开报道编译解读

本文基于 media 公开报道编译解读,查看原文

公开来源
  1. Anthropic Claude 刷新物理学世界纪录:单挑基于杨振宁理论 9 圈难题