协和医生用GPT-5.6破解22年数学难题,但这可能是个坏消息
跟几个做AI产品的朋友聊了一圈,发现大家对这件事的看法其实很分裂。有人说这是AI的里程碑,有人觉得这就是个高级版的“鸡兔同笼”题。但说实话,我第一反应是:一个神经外科医生,用AI证明了数学猜想,这玩意
跟几个做AI产品的朋友聊了一圈,发现大家对这件事的看法其实很分裂。有人说这是AI的里程碑,有人觉得这就是个高级版的“鸡兔同笼”题。但说实话,我第一反应是:一个神经外科医生,用AI证明了数学猜想,这玩意儿到底是AI的胜利,还是对传统数学家的嘲讽?
事件始末
金山木,北京协和医院神经外科博士后,用OpenAI的GPT-5.6-Sol模型,花了16小时证明了Crouzeix猜想。这个猜想从2004年提出,22年没人搞定。Crouzeix本人只证明了常数11.08,2017年全球顶尖专家一周才降到2.414,然后就没动静了。金山木倒好,直接让AI跑了一晚上,搞定了。
最离谱的是,他的数学背景就是本科那点基础课,其他全靠自学。他用的提示词策略,还是从OpenAI攻克Cycle Double Cover猜想时学来的。说白了,他做的就是设定好规则,然后撒手不管,AI自己折腾了16小时,给出了证明。
为什么重要
别被“AI解数学题”这种说法忽悠了。这事的核心不是AI多聪明,而是AI已经能独立完成需要深度推理的数学证明。2026年5月,OpenAI说他们的内部推理模型解决了Erdős的平面单位距离问题;8月初,下一代Astra模型在10项难题上取得突破;Anthropic的Claude也把黎曼猜想的零点比例下界从41.6%提到了67.2%。这趋势已经很明显了:AI正在接管数学家的活儿。
但更关键的是,金山木不是专业数学家。他一个医生,用AI就做到了顶尖数学家做不到的事。这说明什么?说明数学的门槛正在被AI拉低,就像计算器让普通人也能做复杂算术一样。可问题是,当证明变得容易,数学的价值会不会贬值?
谁最受伤
受影响最大的,肯定是那些靠证明难题吃饭的数学家。你想,他们花几年甚至几十年攻一个问题,结果一个外行用AI几天就搞定了。这不仅仅是面子问题,更是饭碗问题。康奈尔大学的Alex Townsend和华盛顿大学的Anne Greenbaum,公开发文章说“震惊”,但他们心里可能更慌:以后审稿怎么审?AI的证明怎么验证?

对OpenAI来说,这是免费的广告。GPT-5.6-Sol证明了Crouzeix猜想,相当于给他们的模型打了个硬核广告。但这里有个隐患:AI的证明是否真的可靠? 金山木公开了Lean 4形式化代码,但那是AI生成的,有没有bug?数学家们确认了,但万一错了呢?
还有那些传统数学家,比如Emiel Lorist和Felix Schwenninger,他们用传统方法给出了5页的独立证明,但用的也是ChatGPT 5.6。这就像是运动员用兴奋剂破了纪录,虽然成绩有效,但总让人心里不舒服。
深层原因
为什么AI能证明数学猜想?说白了,数学证明本质上是搜索和优化。AI的强项就是在大空间里找模式。Crouzeix猜想表述简单,但证明空间巨大,人类大脑处理不过来,但AI可以。
金山木的提示词策略也很有意思:他要求AI“物理断网”、“纯粹原创思考”、“启动大量智能体发散探索”、“对抗性审计”,这本质上是在模拟人类的科研过程,但速度是人类的十万倍。
但这背后有个更深层的问题:AI的“直觉”从哪来? 它没有数学直觉,只是通过大量试错找到了一个可行的路径。这种证明可能很巧妙,但缺乏人类理解的“美感”。就像金山木的证明,用了“巧妙的采样策略”,数学家们觉得“震惊”,但没人能解释AI为什么这么想。

跟你啥关系
如果你不是数学家,这事跟你有啥关系?关系大了。首先,AI证明数学难题意味着AI的推理能力已经超越人类,这会影响所有依赖推理的行业:法律、金融、工程、医学。金山木是医生,他研究超声波时用到了矩阵分析,然后顺手把数学难题解了。这说明AI能跨领域解决问题,以后你头疼医脚可能不再是笑话。
其次,开源的力量。金山木把研究资料全开源了,包括提示词和迭代手稿。这意味着任何人都可以复现他的方法。以后你想解决什么问题,可以照着他的套路来。这就像给了你一把钥匙,但门后面是什么,你得自己去看。
最后,警惕AI的“黑箱”。AI证明了定理,但没人真正理解它的思路。如果AI在关键领域给出错误答案,比如医疗诊断或金融决策,后果不堪设想。所以,别被AI的“聪明”迷惑,我们得学会怎么跟它共存。
留个坑
不过,有个隐藏的功能他们没公开说,我还在测,回头单独写一篇。
本文基于 media 公开报道编译解读
本文基于 media 公开报道编译解读,查看原文