Claude 用 11 天把费马大定理变成代码,数学界该慌吗?
一个开源模型凭什么收费比闭源还贵? 先别急着关页面,这问题不是标题党。Anthropic 的 Claude 最近干了件大事:花了 11 天,基本自主地把费马大定理的证明变成了 Lean 代码,
一个开源模型凭什么收费比闭源还贵?
先别急着关页面,这问题不是标题党。Anthropic 的 Claude 最近干了件大事:花了 11 天,基本自主地把费马大定理的证明变成了 Lean 代码,还通过了机器验证。你可能觉得,这跟我有什么关系?我又不搞数学。但这事背后藏着一个信号:AI 可能正在改变“验证”这件事的成本结构。而验证,恰恰是很多行业(包括你写代码、做金融模型、搞科研)里最烧钱又最容易被忽略的环节。
11 天,1300 万行代码
先看数据:Claude 生成了约 1300 万行 Lean 代码,证明了约 3.03 万个定理,其中 2.95 万个被最终采用。整个项目消耗了约 60 亿个输出 Token——注意,是输出,不是训练。这规模有多大?生成的证明比 Mathlib(数学界最大的形式化证明库)还大 5 倍。
我个人的判断是:这个项目的意义不在于 AI 能证明数学定理,而在于 AI 能把“人看得懂的证明”翻译成“机器能验证的证明”,而且速度极快。
要知道,怀尔斯 1995 年的原始证明有 129 页,人类数学家审了好几个月才放心。而这次,Claude 干的事相当于把一本 129 页的数学书,每一行都翻译成机器能检查的逻辑步骤,还翻译了 1300 万行。搁以前,这活可能得干好几年。
为什么这事重要?
因为“验证”是数学和软件工程的痛点。人类写的证明经常跳跃,默认读者懂背景,但机器不懂。Lean 这类证明助手要求每一步都清清楚楚。以前,把一个大定理形式化,需要专业数学家花上数年。比如,柯西-施瓦茨定理的形式化都用了好几年。现在,Claude 用 11 天。
但别高兴太早。Anthropic 自己也说了,Claude 并不是重新发现了费马大定理的证明,而是把已有的证明“翻译”成 Lean 代码。所以,AI 目前还是“翻译工”,不是“创造者”。不过,这个“翻译工”的效率已经超过了所有人类。
对谁影响最大?
首当其冲的是数学家和科研人员。以前,你写一篇论文,审稿人可能花几个月查证你的推导有没有漏洞。以后,你可能得附上一份 Lean 版本,让机器先跑一遍。Kevin Buzzard(伦敦帝国理工学院的教授)审阅了这次的项目,他认为 AI 辅助形式化大型数学成果已经取得重要进展。

其次,是 AI 行业本身。这次项目用的是“多智能体协作”,不是单个 AI 单打独斗。Anthropic 用了一个叫 Prove2Me 的平台,把待证明的定理拆成有向无环图,多个 Claude 并行工作。这有点像软件工程里的“分而治之”,但 AI 能自己分解任务、分工协作,这比单个模型的能力又进了一步。
我的第二个判断:多智能体协作是 AI 从“工具”走向“同事”的关键一步,但目前的协作还比较初级,需要人类给高层次指令,比如“先证明这个引理”。
跟普通人有啥关系?
你可能会说,我又不搞数学,这关我啥事?但你想,验证逻辑这件事,无处不在。比如,你写代码的时候,编译器帮你检查语法错误,但逻辑错误它管不了。如果 AI 能自动验证一个大型数学证明,那未来它是不是也能验证一个大型软件系统的逻辑?或者验证一个金融模型的风险假设?
作为一个被各种 AI 工具坑过无数次的人,我知道 AI 生成的代码经常有隐蔽的 bug,但如果有自动验证工具能像 Lean 一样逐步检查,那 AI 的可靠性会大大提升。这次项目就是给“AI 验证 AI”打了个样。
竞品对比
说到这,不得不提 OpenAI 和 Google。OpenAI 的 o1 模型也主打推理,但没听说他们搞出这么大的形式化项目。Google 的 AlphaProof 之前在国际数学奥林匹克竞赛上拿了银牌,但那只是解竞赛题,和形式化一个世纪难题的完整证明不是一个量级。
从数据来看,Anthropic 这次在“AI 数学验证”上暂时领先。但注意,他们用的是“与 Claude Fable 5.1 大致相当的内部模型”,也就是说,这个能力可能已经部署到最新模型里了。而 OpenAI 和 Google 不会坐视不管,估计很快会有跟进。

深层原因
为什么 Anthropic 要搞这么个大项目?一方面,是为了证明 AI 的长期推理能力。费马大定理的证明涉及复杂的逻辑链条,AI 能搞定,说明它能处理超长任务。另一方面,是为了推动“AI 生成数学成果”的规范化。Anthropic 说,未来 AI 生成的数学证明可能都会附带形式化版本,就像现在论文要附代码一样。
这背后有一个商业逻辑:如果 AI 能自动验证数学证明,那 AI 在科研、工程等领域的可信度就会大增,从而推动 AI 在更多专业领域落地。Anthropic 显然想在“AI 安全”和“AI 可靠性”上建立护城河,而数学形式化就是一个绝佳的展示窗口。
冷静一下
不过,目前还不好说这能直接改变数学研究。因为费马大定理是 1995 年就证明了的,AI 只是把已有的证明形式化,并没有产生新数学。而且,这个项目消耗了 60 亿 Token,成本不菲。如果每次形式化一个大定理都要烧这么多钱,那普及还早。
但至少,它让我们看到:AI 已经能处理超长逻辑链,并且能自我验证。这比单纯生成文本又进了一步。
尾声
好了,不吹了。作为一个每天被 AI 生成代码坑的人,我其实挺希望这种验证技术早点普及,那样我就不用天天熬夜 debug 了。不过,在那之前,我还是继续搬砖吧,毕竟今天的代码还没写完呢。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文