AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看

源自111位全网作者

17:29

如果你常逛数论相关的评论区,一定见过这句经典玩梗:「我已经有了一个绝妙的证明,可惜评论区太小,写不下。」这个源自费马的老梗,在数论圈被复读了无数次。但最近半年,这个梗正在变成现实——只不过写出「绝妙证明」的不再只是民间爱好者,还有 AI。

从今年 1 月 GPT-5.2 Pro 独立证出一道 45 年没人解决的埃尔德什猜想,到 8 月一位顶尖学者因为 AI 帮他解开了苦熬多年的博士课题、反而宣布退出学术圈,再到各种难题网站上堆满没人来得及核实的 AI 证明——数论这个「数学王冠上的明珠」,正在经历一场前所未有的变化:证明,正在变得廉价;而验证,成了最稀缺的东西。

如果你也被「AI 又证明了 XX 猜想」这类标题刷过屏,却分不清哪条是真突破、哪条是标题党,这篇就是替你把这些信息筛一遍。


一、这波「AI 做数论」到底发生了什么

先说真正站得住脚的那一条。

2026 年 1 月 17 日,研究者 Neel Somani 把埃尔德什问题库里的第 281 号问题丢给了 GPT-5.2 Pro。这道题由传奇数学家保罗·埃尔德什和罗纳德·格雷厄姆在 1980 年提出,涉及同余覆盖系统和自然密度的深层关系,45 年没人解决。结果模型给出了一份完整证明。知乎

AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看

菲尔兹奖得主陶哲轩没有直接采信,而是亲自动手,把整套遍历论论证翻译成组合学语言、换掉其中一个关键定理,重新走了一遍全部推导,结论是:证明成立。知乎他评价这是「迄今为止最明确的第一类结果(AI 主要贡献)」。

但这个故事最有意思的地方,反而是后面的反转。评论区一位叫 KoishiChan 的用户指出:这道题其实有更简单的解法——把 1936 年的达文波特–埃尔德什密度收敛定理和 1966 年的罗杰斯定理拼在一起,第 281 号问题几乎是个直接推论。知乎换句话说,连提出这道题的埃尔德什本人(他正是 1936 年那篇论文的合著者),当年都没意识到答案近在眼前。一段尘封在冷门专著里、几乎没人引用的定理,就这样被重新挖了出来。

看起来是 AI 的高光时刻,对吧?但陶哲轩紧接着泼了一盆冷水,而这盆冷水恰恰是整件事里最值钱的信息:

评估 AI 工具的真实成功率时,最大的偏差来自「报告偏差」——负面结果几乎不会被披露。某个人或某家 AI 公司把模型用在开放问题上没有进展,他们没有动力去报告这个失败;即使报告了,也不会像成功那样在社交媒体上传播开来。

他引用了一个由 Ivanisvili 和 Seven 发起的开源项目,系统记录前沿大模型在埃尔德什问题上的正面和负面结果。数据显示,这些工具在埃尔德什问题上的真实成功率大约只有 1% 到 2%知乎也就是说,你在 feed 里看到的每一条「AI 证明了 XX」,背后可能藏着几十上百次没人提的失败。这是单刷社交媒体永远看不到的分布。


二、为什么偏偏是数论

AI 能做数学题的领域那么多,为什么数论成了这波讨论的风暴眼?原因其实很朴素:数论是门槛最低、天花板最高的数学分支。

哥德巴赫猜想——「任何大于 2 的偶数都能写成两个素数之和」;孪生素数猜想——「存在无穷多对相差 2 的素数」。这些问题一句话就能讲清楚,一个小学生都能听懂它在问什么,不需要任何高等数学就能上手尝试。这跟需要十年才能看懂题面是什么的代数几何、朗兰兹纲领完全是两个物种。

AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看

B 站有一条 22 万播放的科普视频,标题就叫《哥德巴赫猜想:看起来必然成立,为什么就是证明不了?》,评论区近千条。哔哩哔哩其中被反复点赞的一句是:「素数是用乘法定义出来的,1+1 却在研究素数的加法。」 乘法结构和加法结构是两套完全不同的体系,素数的分布规律藏在乘法里,而哥德巴赫偏要问加法——这就是它看起来几乎一定对、却怎么也证不了的根本原因。

AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看

正因为「表述初等、验证直觉简单、上手门槛极低」,数论历来是民间爱好者最爱冲锋的地方。知乎上有个被浏览二十多万的问题:「数学民科为啥偏爱数论?」答案说的就是这个——你不需要懂微积分、不需要懂抽象代数,只要认识整数,就敢向哥德巴赫发起挑战。知乎而现在,AI 把「人人都有绝妙证明」这句话真正量产了。打开微博、小红书,随处可见「我用 AI 证明了 XX」「AI 帮我证伪了三素数定理」这类帖子,署名往往是「小学数学家」「野生研究者」。真突破、报告偏差、民科狂欢,三种东西混在同一个信息流里——这正是普通人最容易看走眼的地方。


三、瓶颈变了:从「找证明」到「验证证明」

如果说前面的故事还只是「AI 偶尔能做出真东西」,那么接下来发生的事,才真正改变了数论这门学科的生态位。

陶哲轩在 2026 年国际数学家大会(ICM)的演讲《AI 时代的数学》里,造了一个很传神的词——「证明的消化不良」(indigestion of proofs)。意思是:AI 生成证明的速度,已经远远超过了人类审核证明的速度。各个收集数学难题的网站,正在被 AI 生成的证明提交淹没,其中很多可能是对的,但没有人有时间去核实。数学正冲进一个「证明过剩」的时代。微博

AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看

当「找到证明」不再是瓶颈,「确认证明是对的」就成了新的稀缺资源。最戏剧性的例子,是学者 Rishikesh Gajjala。据新智元报道,他在纽约大学阿布扎比分校做完博士后,过去几个月里 AI 帮他在最在乎的问题上接连取得突破——本该更确信数学是天命,结果他反而觉得自己越来越像个多余的人。微博他的原话很扎心:

「在通过验证之前,一份漂亮的证明和垃圾没有区别。」

想透这一点后,他做了一个在外人看来很意外的选择:退出学术圈,但没离开数学,而是转身走进形式化验证领域,用 Lean 把借助大模型发现的猜想和埃尔德什问题一条条形式化,随后加入了一家刚拿到 2700 万美元种子轮的创业公司,专门研究「如何证明 AI 的答案是对的」。用一句话概括:他从「找真理的人」,变成了「给真理盖章的人」。

这条路上已经出现了迄今最硬的战果。一个名为 AxiomProver 的多智能体系统,首次自动完成了「246 定理」证明的形式化验证——即「存在无穷多对相差 246 的素数」。这是人类离孪生素数猜想最近的一次。回望这条素数间隙的压缩之路:张益唐 2013 年把间隙从无穷大压到 7000 万,Maynard 很快压到 600,再到 Maynard 与陶哲轩合作压到 246——三步走了十年。微博如今,连「把这些证明搬进计算机里逐行核验」这件事,AI 也开始能自动完成了。

你会发现一个清晰的趋势:AI 越强,「验证」就越值钱。 会做证明的工具在增多,但能判断证明对不对的人(和能机器核验证明的系统),反而成了最抢手的资源。


四、看到这,对你意味着什么

聊了这么多,落到一个普通兴趣用户身上,其实就两件事:怎么不被标题党忽悠,以及接下来值得盯什么。

先给你一个「看到『AI 证明了 XX 猜想』时的五条鉴别清单」,下次刷到这类消息,照着过一遍基本不会翻车:

  1. 有没有权威逐行验证? 像陶哲轩对 281 号问题那样亲手翻译、重推一遍的,才算数;只有模型自说自话、或者「某某用 AI 跑了一下」的,先打个问号。

  2. 是新结果,还是旧定理的重新表述? 281 号问题差点就是两个上世纪经典定理的直接推论。很多「AI 证明」其实是把已知结论换了个说法。

  3. 能不能形式化? 能被 Lean、AxiomProver 这类系统逐行核验的证明,可信度远高于只存在于截图里的证明。

  4. 警惕报告偏差。 你看到的成功背后,是海量没被报道的失败。真实成功率目前只有 1%~2%,别被幸存者偏差带偏。

  5. 分清「AI 主要贡献」和「AI 辅助」。 前者(第一类结果)是模型独立给出的证明,后者是人主导、AI 打下手——两者的含金量完全不是一回事。

再说值得持续关注的信号:

  • 形式化验证的进展:Lean 生态、以及把数论定理搬进机器核验的项目,是判断「AI 证明」能不能落地的硬指标。

  • 埃尔德什问题库的 AI 结果记录:那个同时记录正面和负面结果的开源项目,比任何单条热搜都更能反映真实水平。

  • 陶哲轩等一线学者的讨论:他们既是最严格的验证者,也是最早指出坑在哪的人。

顺带一提,国内数论方向最近也有个值得记的名字:北京大学袁新意教授凭借在算术几何领域的贡献,拿到了 2026 年未来科学大奖「数学与计算机科学奖」。微博这条线和 AI 无关,但如果你在意华人数论的力量版图,可以留意。

AI 证出 45 年没人解的数论猜想,真实成功率却只有 1%~2%:「证明过剩」时代怎么看


结语

数论大概是数学里最「热闹」的分支:人人看得懂题面,人人觉得自己能试试。过去这份热闹里掺着大量民科式的自信,而现在,AI 把这份「人人都能给出证明」的热闹,放大了成百上千倍。

但热闹不等于进展。真正的变化在于:当证明变得唾手可得,愿意且有能力把它从头到尾验证一遍的人,才成了这门学科最稀缺的资源。 下次再刷到「AI 证明了 XX 猜想」,别急着转发或惊叹——先问一句:这份证明,有人看完了吗?

这大概就是这波浪潮给所有兴趣用户最实在的一个提醒:在信息过剩的时代,判断力比信息本身更值钱。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章