数学没有被干废——但如果把"做题、出答案、抢首发"当成数学的全部,它确实正在被AI干废。2026年10月11日,“AI把数学干废了"登上热搜,源头是两件事的相撞:OpenAI把数百份AI生成的数学手稿一次性扔上GitHub,宣称触及准黎曼猜想等一批悬置多年甚至几十年的开放问题;而早在今年9月,25位菲尔兹奖得主已经联名发文,警告AI正在毁掉数学。真正值得弄清楚的是:这些手稿到底算不算"成果”,数学家反对的究竟是什么,以及这门学科接下来会被改写到哪里。
722份手稿,究竟拿出了什么
10月7日早上(北京时间),OpenAI在没有任何预兆的情况下,于GitHub发布了一个名字朴素的新仓库,里面躺着722份数学手稿、372个相关成果,覆盖数论、代数几何、实分析、组合数学、理论计算机、数学物理、偏微分方程等等方向,全部出自一个内部未公开名字的模型。知乎
分量最重的是"准黎曼猜想":人类在这一方向最好的纪录停在1958年,之后将近七十年几乎没有实质进展,OpenAI声称这次一步把无零点区域推到了实部大于7/8;另一组结果声称把复数域上的矩阵乘法效率指数压到2.25,而人类五十多年才压到2.37附近;还有一篇175页的手稿直指四维挂谷猜想——三维版本2025年2月才由王虹与Joshua Zahl攻下,王虹也因此拿下了今年7月的菲尔兹奖。知乎36氪
这些结果来自OpenAI挑出的大约4000个数学界尚未解决的研究问题:一股脑喂给那个未公开模型,再筛出有分量的成果,平均每个结果大约花了Pro级别的三小时思考算力。知乎
赛道上也不止它一家:就在OpenAI宣布解决纳维-斯托克斯方程的前几天,Anthropic的员工利用Claude模型找到了困扰数学界一个多世纪的雅可比猜想的反例。 OpenAI自身的节奏则是五个月连翻两个数量级:今年5月1项,8月10项,9月一百多项,10月就是372组。36氪知乎
最关键的一道裂缝:生成了证明,不等于解决了问题
"模型生成了一个自称有效的证明"和"一个数学问题真的已经被解决"是两个不同的主张——甩出几百份手稿只能证明前者,不能自动推出后者。检验这些手稿靠的是Lean——数学界的编译器:把证明逐行翻译成机器可读的代码,编译通过就说明每一步推理合规;但它只管推理对不对,不管题目有没有被抄错、有没有被换成简单版本,更不回答结果新不新、重不重要。知乎知乎
而社区里有统计指出,722份手稿中完成Lean形式化验证的不到一半(约42%),手稿到形式化代码的转换步骤本身也没有人复核。这种怀疑有先例:2025年10月,OpenAI的一位副总裁曾发推宣称GPT-5解决了10个此前未解的埃尔德什问题,很快被扒出模型只是在浩如烟海的文献里翻出了早有人写过、却被遗忘的现成答案。所以在数学界真正消化完这批成果之前,"已解决"目前只是OpenAI的单方面主张。知乎知乎
25位菲尔兹奖得主的联名,反对的不是AI
数学界的反弹比热搜更早。今年9月,陶哲轩等25名数学家发布《人工智能在数学中的严重错位》,提前预警AI介入基础数学研究的巨大风险。署名的25人都是菲尔兹奖得主,名单里有陶哲轩、德国的舒尔策、乌克兰的维亚佐夫斯卡、比利时的德利涅和华人数学家邓煜,一周之内又有七千多人联署;这封信没有反对AI,信里承认AI有潜力增强和加速真正的数学研究,他们要的只是给论文的撰写、署名和消化留出时间。36氪知乎
9月29日,一个设在普林斯顿高等研究院的独立顾问组收集了数学界600多份反馈后,要求公开模型名字、提示词、推理过程和算力花费,能形式化的尽量形式化,失败的尝试也要报告,还特意加了一条:别拿数学成果给自家模型打广告。OpenAI没有回复,一周后,722份手稿照样上线。陶哲轩还在个人博客转载了一份数学家团体的声明,其中写道:“一次放出七百多份文件,不是学术的展示,是力量的展示”。一位研究了一辈子唯一博弈猜想的理论计算机科学家打开这批文档时,发现自己的猜想已被AI"证明",那篇充斥混乱与逻辑跳跃的论文在她看来,“就像是吃了致幻剂的人写出来的东西”。知乎哔哩哔哩36氪
被"干废"的到底是什么
当年AlphaGo击败李世石时,几乎所有人都以为围棋要完。但2023年一篇PNAS论文分析了1950到2021年间职业棋手超过580万步落子:AI出现后,棋手的决策质量明显提高,剔除与AI最优推荐相同的着法之后进步仍然存在,下法的新颖性反而上升。也就是说,AI赢了棋,也把围棋的边界拓宽了。但这个类比迁移到数学有一个前提差异:棋下得好不好,棋盘当场就能裁决,人类还能看AI的着法学习;而数学证明如果人类读不懂、验不了,它连"对不对"都还悬着,更谈不上吸收。微博
所以真正被改写的是数学生产的瓶颈位置:生成证明变得廉价,审核证明、理解证明、判断哪个问题值得做,成了最稀缺的人类工作。陶哲轩把这称为"证明消化不良"——AI以工业化速度批量生产证明,但人类根本来不及验证、理解和吸收。多伦多大学一位数学教授的经历更直观:模型曾给他输出一份十页长、正确但毫无洞见的暴力计算证明,他拒绝只交这份"丑"证明,反而逼出了一个更漂亮的概念性解释——在他所属的这个共同体看来,数学的目标不是生产论文,而是产生理解。36氪
回到标题的问题。在"产出"一侧,AI已经证明了实力:竞赛和题库类评测被刷满,开放问题被成建制解决,产出节奏五个月翻两个数量级;但数学从来不只是答案。这些手稿里最终有多少能成为定理,取决于人类验证的速度;数学会不会"干废",取决于人能不能看懂AI的方法、再顺着它问出新的问题。这一半答案现在还悬着——而写下它的,仍然是人类。