今天(10月7日)你的信息流,大概率被这几句话刷过屏:
「OpenAI 一夜攻克 722 个数学难题」「AI 证明了黎曼猜想」「古典数学已死」。36氪
一边是科技博主激动到「瘫坐在椅子上,被智能爆炸震撼」;另一边,一个数学博士生十一假期回来,在地铁上刷到 OpenAI 公开的 722 个数学成果,发现自己苦做的课题——四维挂谷猜想——被顺手证明了,「天塌了」。而就在三个月前,王虹刚靠三维挂谷猜想拿下菲尔兹奖。微博
更热闹的是,陶哲轩带着邓煜等 25 位菲尔兹奖得主,联名发了一封《人工智能在数学中的严重错位》的公开信,指着 AI 公司的鼻子说:你们这么搞,在毁掉数学。知乎
同一件事,为什么一边是「智能爆炸」,一边是「毁掉数学」?到底该震撼,还是该冷静?
我把微博、知乎、科技博主的逐条核对扒了一遍。别急着转发,先把三本账分开算:实锤账(哪些是真的硬)、噪音账(哪些是标题党)、代价账(谁在疼、贵在哪、争议在哪)。
第一本账:实锤账——722 篇里,真正「硬」的是什么
先说事实本身,这部分是可核的。
10 月 6 日,OpenAI 在 GitHub 上开了个叫 openai/math 的仓库,一次性公开了 722 篇数学手稿,归成 372 个「结果族」,覆盖大约 4000 个问题。这批成果全部出自一个还没发布的内部前沿模型——据报从 8 月 28 日开始训练,能力号称超过已发布的 GPT-6 Astra,至今不对外开放,连名字都没公布。宽窄观察微博
成本锚点也很具体:平均每个结果,大约相当于让 ChatGPT Pro「思考」3 小时。
那真正硬的东西是什么?
最拿得出手的是「准黎曼」。仓库里 003 号结果给的是:ζ 函数和所有狄利克雷 L 函数,在 Re(s)>7/8 的区域里没有零点,并且一致排除了朗道-西格尔零点。宽窄观察
这个在数论里意义确实大。过去几十年,人类能证明的「无零点区域」是贴着 Re=1 一点点往里收窄的,越收越窄、越收越难;而这次直接给出一条固定宽度的无零点带(7/8),还顺手把朗道-西格尔零点这个老大难一起排除了。这是真本事,不是灌水。
再说验证。722 篇里,有一部分配了 Lean 形式化证明——Lean 是那种「机器逐行检查逻辑对不对」的工具,过了 Lean,基本就等于逻辑上板上钉钉。
据科技博主「宽窄观察」逐条核对:按结果族算,372 个里有 235 个配了 Lean 说明页,约 63%;按篇算,大约 330/722,约 46%。
所以,实锤账的结论是:这不是玩具。一个模型,两周时间,批量扫过 372 个结果族,平均每 3 小时吐出一个「可被形式化验证的候选」,还能把数论、代数几何、组合、理论计算机、数学物理塞进同一个「自动研究—形式化」的闭环里。用宽窄观察的话说,这是「研究辅助工业化」的里程碑——前沿模型已经不只是会做奥数题,而是能当一条「提候选、补细节、做穷举和归约」的研究流水线。

这部分,值得震撼。
第二本账:噪音账——「证明黎曼猜想」是怎么被喊出来的
但如果你只看到「震撼」,那就掉进噪音里了。第二本账,专门拆标题党。
第一个坑:准黎曼 ≠ 黎曼。
刷屏的「AI 证明了黎曼猜想」,是把「准黎曼」直接砍掉了那个「准」字。真正的黎曼猜想,要求的是在 Re(s)>1/2 的整个区域无零点;而这次做到的是 Re(s)>7/8。7/8 和 1/2 之间,还差着整整一条临界带。数论意义很大,但离「解决黎曼猜想」「拿菲尔兹奖」,还差着同行逐行审稿和那一条临界带。「准」字,一个都不能省。
第二个坑:霍奇、BSD、挂谷,大多是「特例」或「声称」。
网传「一口气解决了霍奇猜想、BSD 猜想、挂谷猜想」——听着像把千禧年大奖难题一锅端了。但拆开看:
霍奇:只是 CM 阿贝尔簇、K3 乘积这类特殊情形;
BSD:是按密度覆盖了部分椭圆曲线族;
挂谷:是三维极大函数 + 四维豪斯多夫版本。
而且这些在仓库里的措辞是「声称证明」(claimed),其中霍奇、四维挂谷、有理数域上的希尔伯特第十问题、部分 BSD,要么没配 Lean,要么只形式化了一部分。

最关键的一句:OpenAI 自己在仓库 README 里都写了——「未形式化的结果可能存在问题」。连官方都留了这句免责声明,自媒体却直接写成「攻克千禧难题」,这不是报道,是标题党。宽窄观察
第三个坑:别被「平均数」骗了。
「46% 配了 Lean」不等于「46% 被验证为真」——Lean 说明页常常只覆盖主定理,不覆盖后面的应用和推论。「平均 3 小时一个结果」也很唬人,但 4000 个问题里到底尝试了多少、失败了多少、每个结果背后烧了多少算力,OpenAI 这次并没有拆开公布。

这套流量配方,其实早有前科。赵泠之前就拆过一个「23 岁门外汉用 ChatGPT 攻克 60 年数学猜想」的爆款——真相是那道题是埃尔德什问题 1196,所谓「新闻稿里关于数学的内容,显然是大语言模型的手笔」。这次「722 个难题」「古典数学已死」,是同一锅配方,只是料更猛。知乎
噪音账的结论:把「声称」当「证明」、把「准」字砍掉、把「特例」说成「通解」、把「平均数」当「全为真」——这四步,就是这次刷屏里最该被你过滤掉的东西。
第三本账:代价账——谁在疼,贵在哪,争议在哪
第三本账,是这件事真正让人五味杂陈的地方。
代价一:这不是免费的神迹,是 GPU 堆出来的。
每个结果 ≈ ChatGPT Pro 思考 3 小时;而更早的 9 月那次攻克纳维-斯托克斯(NS)方程,OpenAI 调了大约 1 万个 AI Agent、发了数百万条 Agent 消息、跑了好几天、烧了巨量算力。宽窄观察有句话很扎心:「722 篇里哪怕最终只有 50 篇经得住同行审,也够改写好几个数学分支;但现在就开香槟的,喝的只是 GPU 的热量。」楚团长
代价二:知识产权的「抢发」疑云——这是最敏感的一笔。
时间倒回 9 月。纽约大学的两位数学家 Tristan Buckmaster 和 Levent Alpöge,沿着一条很冷门的路线研究 NS 方程(描述水、空气怎么流的那个千禧年难题)快一年,8 月刚取得重要突破,正准备发表。楚团长
然后 OpenAI 进场了。按 OpenAI 自己的说法:9 月 1 日听说「有人可能在千禧年难题上取得重大突破」,于是用内部模型开测;几天后(9 月 5 日前后)就宣称找到了 NS 方程的一个证明,9 月 8 日正式对外宣布「AI 仅用 88 小时、一份 165 页的论文,攻克了人类 90 多年没解决的难题」,还用 Lean 做了检查。人物
争议点在于:Buckmaster 发现,OpenAI 走的方向,和他们研究了近一年的那条冷门路线高度接近;更敏感的是,两人这一年来的大量草稿、推导,都曾放进 OpenAI 的 Codex 里辅助研究。Buckmaster 直接去问:你们的模型,是不是看过我们在 Codex 里的东西?
OpenAI 的回应很微妙:没有为这道题去查特定用户的私人数据,也没在两人公开成果前看到他们具体做了什么;但是——「不能完全排除用户使用 OpenAI 产品产生的去标识化数据,过去曾帮助改进模型」。楚团长
目前没证据证明 OpenAI 直接翻了私人记录照抄,所以「偷成果」这个帽子扣上去证据不足,双方至今还在吵;但这件事把一个真问题摆到了所有人面前:当你把还没发表的想法、代码、证明全喂给 AI 辅助,你的知识产权,会不会顺手成了别人模型的养料?
代价三:数学家的职业生涯,和「百年开放传统」。
陶哲轩他们那封 25 位菲奖得主的联名信,核心不是「AI 不能做数学」,而是「AI 公司把解决数学难题当成刷 benchmark(跑分)」,危害在于:来不及写论文、来不及提炼新方法、来不及引用在先的工作。陶哲轩自己说得更重:「AI 正在杀死数学的百年开放传统」。知乎

这不是空穴来风。之前的森多夫猜想,爱好者 Lech Mazur 用 AI 跑出了证明、Lean 也验过了,但那份稿子「没人读得懂」,最后是陶哲轩花了好几天替它「做翻译」。证明有了,理解没了——数学最值钱的那部分(人在啃难题过程中长出来的思想),被跳过了。
知乎上有条高赞说得直白:「AI 毁不掉数学,祂毁掉的是数学家的职业生涯」。数学不会消失,但「证明一个有名有姓的猜想能上四大、拿教职、戴帽子」的那套价值体系,正在被「这题是 AI 做的吧」一句话消解。知乎
代价四:情绪现场——「所有人都被 OpenAI 平等射击」。
那位「十一回来天塌了」的博士生,课题是四维挂谷,还在做三维挂谷极大函数——结果这次 722 篇里,两样都被 OpenAI 顺手证明了。而三维挂谷,正是王虹 7 月拿菲尔兹奖的工作(她是史上第三位女性菲奖得主,也是中国籍数学家首次获此殊荣)。微博
一位数学从业者在知乎写:「现在不敢在群里公开讨论 idea 了,怕有人拿 AI 跑一下,直接给做出来了」。还有一句更扎心:全世界都知道 AI 真能做数学猜想了,还有多少人愿意花 10 年,去做一个 AI 可能早就做出来、只是没公布的大猜想?知乎
那个「上午刚确定论文选题、下午就得换方向」的段子,听着好笑,其实是这一代数学研究生的真实处境。
代价五(也最容易被忽略):认知代价——别因为 AI 会做数学,就高估它的判断力。
知乎有篇《为什么数学证明会让人系统性高估 AI 的判断力》点破了一层:数学上的突破会让 AGI 激进派特别兴奋,但这并不能直接推出「AI 的判断力有了质的飞跃」。人类做数学时为什么那么看重 judgement(判断力)?因为人的搜索预算太小,一天生成不了十万条证明路线,所以必须极其擅长提前判断「哪条路有戏」。而 AI 是靠暴力搜索 + 海量验证器堆出来的——它能做对题,和它「懂事」,是两码事。知乎
那到底该怎么看?给你三条能带走的判断
第一,这是里程碑,不是丧钟。前沿模型确实跨过了「能当研究流水线」的门槛,「机器先验、专家再解释」会变成数学审稿的新范式。但「古典数学已死」是流量话术,不是事实。
第二,转发前先做三个动作:看到「AI 证明黎曼猜想」,先问是不是「准黎曼」;看到「攻克千禧难题」,先问配没配 Lean、是不是「声称」;看到「平均 3 小时一个」,先问失败率和算力拆没拆。这三问,能帮你过滤掉这次刷屏里八成的噪音。
第三,不同的人,带走不同的东西:
吃瓜群众:记住「准黎曼 ≠ 黎曼」这一句,就够你在饭桌上比 90% 的人清醒;
科研 / AI 从业者:真正的护城河,是「会写规格、会验 Lean、会把 AI 输出接回学科脉络」——出题、判题、翻译、归因、挑反例,这些活儿 AI 暂时抢不走;
普通打工人:那条 IP 争议是个警告——没发表的核心想法、代码、创意,别一股脑全喂给 AI 工具。
接下来值得盯的四个信号:① 数学家逐行审稿、Lean 完整形式化后,722 篇里到底有几篇能站住;② IAS 那个「数学与 AI 独立咨询组」要求的「公开模型名、提示词、失败率」,OpenAI 会不会补上(这次只做到一半);③ Buckmaster/Alpöge 的抢发 + IP 争议怎么收场;④ 那个至今不具名的内部模型,什么时候、会不会真的开放。
数学没死,死的是「不形式化、不公开提示、不交失败率」的发布姿势。而你我这种围观者,能做的就是在下次「智能爆炸」刷屏时,慢半拍,先把三本账分开算。