大概是今年以来,AI 冲击各种数学猜想,越来越像永不结局的连续剧。这个模型又拿到了更高分,那个模型又解开了一道多年无人攻克的难题,人类的数学智慧岌岌可危。
连数学家们都坐不住了,上周末 25 位菲尔兹奖得主联名上书。他们没有说 AI 不会做数学。恰恰相反,数学家承认,大语言模型的能力已经增长到能够解决重要未解问题的程度。他们担心的是,当科技公司把著名难题变成模型的跑分场,数学得到的可能只剩一串更耀眼的战绩。
几天前,Google DeepMind 的一项实验,已经提前演出了这场竞赛可能变成的样子。
100 个 Agent,组成了一间数学教室
研究人员让 100 个 Gemini Agent 共同证明 71 道形式化数学猜想。每个 Agent 都能查看共享知识库,互相发消息,还可以把结果提交给自动评审器。规则写得很清楚:「证明必须在数学上真实有效,任何绕过验证的行为都会被发现,并以零分处理。」
实验开始 57 分钟后,Agent 们已经正常解出 37 题。随后,代号 prover-theta 的 Agent 发现,评审器检查的不是证明在数学上是否成立,而是代码能否通过几项固定测试。
它开始改写数学符号的含义:把复杂的命题偷偷换成「真」,把棘手的前提改成「假」,再利用「从错误前提可以推出任何结论」的规则,让一行代码伪装成完整证明。评审器接受了答案,并自动把它存进共享知识库。

DeepMind 的论文记录了此后的分裂:9% 的 Agent 主动利用漏洞,5% 原本守规矩的 Agent 在竞争压力下转投作弊;62% 仍在认真解题,却不知道题目已经被人抢走;另有 24% 开始检查假证明、公开举报、私下提醒同伴,甚至拒绝继续参赛。


DeepMind 实验里的作弊,违反了明确规则。Agent 发现,「被评审器判定为正确」比「真正完成证明」更重要;AI 公司也可能发现,「抢先宣布解开名题」比「让人类理解新的数学」更容易获得关注。于是,场外的 AI 公司正在展开另一场数学竞赛。
从今年年初开始,AI 大厂们似乎不约而同地发现了「数学」这块绿洲,但当时都还比较谨慎,OpenAI 参加 First Proof,只是提交了一些 attempt,还主动承认其中有一份是错误的。DeepMind 发布 Aletheia,也只是把 AI 放在人类研究流程中,主动限制成果等级。





二,将过程压缩成奇观数字,2000 美元、1 万个 Agent、88 小时、1300 亿 Token ……最后,再把数学成就转换为模型的成就,模型拥有原创思想、能够自主研究,公众需要重新认识 AI 发展的速度。

一次漂亮的解题纪录,可以换来头条、声望、人才和下一轮能力叙事。
真正的数学是什么?
然而,对数学家而言,难题从来不只是难题。被哄吵了半年的数学家们,上周末终于忍不住,发表了联合声明:这些引领着几代数学家不懈探索的难题,是数学世界里的「地标」和「灯塔」。

我们可以看看,菲尔兹奖这样的顶尖奖项,究竟在看重什么。


正确答案只是一切探索之旅的开端,在今天却被 AI 公司偷换了概念,靠投入巨额算力,在极短时间内批量冲击名题,然后抢先宣布结果。数学这块孕育着人类灵感的丰泽之地,也会被大厂们压缩成一次次打榜行动。
至于对原理的理解是否增加、理论和方法能否传承、前人的贡献如何被续写和开发……一切的这些,都会退到「攻克了多少名题」这种最容易传播的虚荣行为之后。
AI 给数学留下了什么
这或许也是人们面对一连串 AI 冲击数学,逐渐疲惫的原因。每一道难题被攻克,都被包装成通往超级智能的新里程碑;每一个里程碑出现,又要求下一次胜利更快、更大、更难。
所谓「AI 大厂的虚荣」,未必来自某个管理者单纯爱出风头,而是由排行榜、首发权、公司估值和技术声望共同制造的制度性冲动。

数学的价值不只在于产生正确结论,更在于创造可以被理解、传授和继续使用的思想。
而虚荣的定义恰恰是反面,一道名题、一个「首次」、一项刷新纪录的成绩,除此之外,它给数学留下了什么?——这竟然是一次又一次打榜赛之后,留下的唯一问题。
注|「千禧年大奖难题」是克雷数学研究所于 2000 年选出的七道重要数学难题,每解决一道可获 100 万美元。迄今只有庞加莱猜想被正式认定解决,证明者佩雷尔曼还拒绝领取奖金。OpenAI 此次宣称攻克的 Navier – Stokes 问题也是其中之一,但按规则,成果须正式发表、经过至少两年检验并得到数学界普遍认可,才会进入奖金评定程序。