10月7日,OpenAI从自己四天前刚公开的722篇数学手稿里撤回了3篇;截至10月10日,撤稿数字没有再扩大,涉及纳维–斯托克斯方程的草稿也未被撤回。这场被称作"数学末日"的风波,撤掉的不是"AI会不会做数学",而是"这批成果可以直接被采信"的错觉——在AI科研与"完美可信"之间,隔着机器验证、忠实性检验、同行消化三道工序。比起急着站队喊"AI取代数学家",先理清满天飞的722、719、3、42%、24%才更有意义。IT时代网
撤掉的3篇,错在一个加减号
美国时间10月6日,OpenAI在GitHub上线openai/math仓库:722篇数学手稿、372个结果族,全部出自一个尚未发布的内部模型;模型在内部评测中被投喂约4000个开放数学问题,平均每个结果消耗约3小时ChatGPT Pro"思考"算力。4000道题里筛出372组站得住的,存活率不到一成。知乎知乎
10月7日,仓库第一份更新日志挂出:撤回3篇、修订14篇、另有13篇更新引用,手稿总数从722降为719;“372个家族"这个数从头到尾没变——722和719数的是手稿,372数的是成果组。被撤三篇里出问题的是标注9月18日、讨论Weil类代数性的几何手稿,撤稿说明写着"证明存在符号错误”:证明需要把几何交点的正负计数补到零才能调用后面的定理,原以为某项操作增加正数,实际却增加负数,定理的使用条件没有满足,另外两篇借用这套构造的手稿也一起失去支撑。仓库此后仍在动:10月8日合并的更新PR来自codex/update-10-7分支——OpenAI在用自家编程代理Codex,维护自家数学模型产出的成果库。36氪36氪
六成、42%、24%:形式化率三个数打架
传播最广的说法是"约六成成果带机器验证",连首报媒体自己都做了修正:所谓六成是按成果族统计,一族中只要有一篇附带形式化就计入;官方公布的42%(300/719)按单篇主结果统计,且把配套与支撑结果的验证也计入top-line口径,其余依赖人工审阅的部分,OpenAI自述可能存在质量问题。逐篇清点目录会更冷静:发布当天162篇论文的主结果有机器验证,约占722篇的22%;10月7日更新后涨到173篇,按目录现列719篇算约24%。看到哪个数,取决于你要问"有没有验证过一部分",还是"主定理是否被机器逐行检查过"。36氪知乎知乎
Lean通过,不等于论文说对了
比口径差异更实质的,是剑桥大学、伦敦国王学院等机构研究者10月6日发布的《Navier-Stokes lost in translation》提出的"不忠实形式化"指控:自然语言证明与Lean形式化代码之间存在实质性错配,这并非断言证明本身错误,而是指出计算机验证的实际上是另一个(可能更弱的)命题。另一处细节是:验证中间计算的那段代码,加入了比论文声明更强的条件——论文称该计算在更少条件下即可成立,计算机却只在附加约束下完成验证。知乎IT时代网
而"忠实与否"这一判断本身没有机械手段可言:在数学自然语言中消解歧义以达到语义忠实的翻译,计算复杂度位于可解性复杂度指数(SCI)层级的任意高位,比包括停机问题在内的任何可计算问题都更难。OpenAI的回应与其仓库自述一致:相关错误系内部审查发现,将尽快更正,若无法修正则会撤稿。知乎IT时代网
另外两道验证同样没有进展:模型未发布、提示词未公开,MIT的Andrew Sutherland通过《科学美国人》表态——在他人能够复现之前,"单个提示词、单个智能体完成"的说法应视为未经验证。同时,全部成果零同行评审,数字上还有个悬案:《纽约时报》写377道问题,仓库目录是372组,两个数对不上;编号001到377中间恰好缺了45、61、70、123、163五个号,OpenAI一直没有解释。知乎知乎
数学家抵制的是"一次性倒货",不是AI
10月7日,人类数学协会(AHM)发布声明呼吁数学家停止与OpenAI合作,声明里最狠的一句是:数学家并没有要求OpenAI做这些工作,一次性放出超过700个文件,不是学术能力的展示,而是权力的展示。语气缓和得多的另一份联合声明出自9月,陶哲轩等25位菲尔兹奖得主作为初始署名者:承认AI数学能力的进步,同时批评企业把解题当作评测竞赛、忽视理解与知识传承。图灵奖得主杨立昆则站到了对面:数学正迎来新时代,形式证明将大幅自动化,重点将转向发展新概念、新抽象、新定义和新猜想。知乎36氪36氪
需要纠正一个流行的标题——“陶哲轩带头抵制”。这个组织2026年8月才成立、成员约800人且大部分是研究生,陶哲轩并不在会员名单里,只是10月7日以客座文章形式把声明转到了自己博客。他真正的主张写在发布当天的帖子里:Math 1.0时代,一个大猜想被解决会催生讲学、研讨班和新合作,证明被慢慢消化、简化、写进教材;而现在,开放问题像庄稼一样被大规模收割。他下的判断很硬:一个问题一旦被宣称解决,就再也回不到未解决的状态;哪怕只是知道解存在,也会污染其他可能带来更深刻洞见的研究路径。评论区获赞最高的反驳同样直白:数学从不问一个结果是不是被别人要求的,只问它是不是对的。知乎36氪
缺的不是产能,是消化能力
最直观的冲击来自具体的人。研究"唯一博弈猜想"二十多年的Dana Moshkovitz,看到AI声称证明了她毕生课题时,短信里的反应是:这感觉就像是吃了致幻剂的人写出来的东西,论文写得太烂,没有AI辅助根本读不懂。她的丈夫Scott Aaronson把这一天称作"Mathocalypse",数学末日。36氪知乎
两边其实都没说谎:OpenAI说公开总比锁着好,还承诺出资办研讨班帮社区消化这些结果;数学家这边的处境,是一个成本倒挂——生产的成本崩塌了,理解的成本原地不动。一篇论文从写完到被数学界真正消化,正常要以年计,这次722篇一次性砸出来,连读都读不完。当三小时算力就能碾碎一个学者数年甚至一生的积累,稀缺的不再是证明,而是读懂证明的人和时间。知乎知乎
10月7日,组合数学家吉尔·卡莱称这次发布是"数学的一个惊人里程碑",他紧接着提醒:证明仍需人类数学家核验、消化。一位数学工作者的反问则指向历史:当年Appel和Haken用计算机辅助证明四色定理,你们抵制他们吗?他自己的答案同样清醒:这700多份稿件不能直接当成可信的学术文献,要引用其中的结论,必须独立给出证明。36氪知乎
离完美还有多远:三条可观察的进度线
生成端已经跨过门槛,缺口全在验证端。OpenAI自己列出了后续可观察的信号:撤回与修订的节奏,形式化比例相对300/719的变化,提示词与模型是否公开,以及它承诺的研讨会成果。这次被撤回和实质修订的内容,几乎都落在没有Lean形式化的部分——没经过形式化和同行评审的结果目前只能算"声称";这次勘误处理得算规范,错误写明、依赖链交代、旧版留档,可700多篇手稿才公开两天,第一份勘误单就来了,大概率不会是最后一份。三道工序里,目前只有机器验证推进了四分之一左右。等这些"有待消化的草稿"被读进教材、被第三方复现、被评审期刊接住之前,这轮闪电战只能叫"声称",还不能叫"完成"——AI科研离完美差的从来不是一次发布,而是一整套验证制度。知乎36氪