撤回的理由朴素得像玩笑:一篇论文里一个几何操作的符号写反,关键论证随之失效,两篇依赖它构造的下游论文一起被拉下架,仓库里的手稿总数从722篇变成719篇。 比正负号更值得注意的,是这批论文从头到尾没有经过任何期刊同行评审。AI学术圈的“审核”,目前靠一套全新的潜规则运转:发布先行,机器抽验,读稿的人靠自愿,撤稿就是直接删文件。哔哩哔哩
一push即发表,一删除即撤稿——这里没有撤稿声明
2026年10月6日,OpenAI把一批出自一个没有名字的内部模型的数学手稿推上GitHub,共722篇、归为372个成果族,平均每个结果只消耗约三小时ChatGPT Pro算力,准黎曼猜想、唯一博弈猜想等著名难题都在这批手稿的声称清单里。 出事的是霍奇猜想方向的一组成果:写错符号的是关于分裂八维阿贝尔簇上证毕类代数性的一篇论文,论文自身约定为-1,模型写成了+1;靠它的构造展开的两篇K3曲面论文连带失效。OpenAI随后把对应成果族改名、移除K3曲面结论、修补14篇手稿、更新13篇引用信息。 整套“撤稿—勘误”没有期刊、没有审稿人、没有正式撤稿声明,唯一的公告是更新日志里的一行字。这是第一条潜规则:发布和修正,都是作者的单方行为。哔哩哔哩知乎
Lean能检查逻辑,检查不了定理有没有翻译对
722篇并非全无验证:372个成果族中235族附带Lean形式化证明,也就是能让计算机逐行核对的证明代码。 但机器审查有个更根本的盲区,而且不在证明环节,在定理陈述环节:AI把自然语言手稿翻译成形式语言时,两份文本可能说的不是同一件事。发布当天,Bastounis等研究者放出预印本(arXiv:2610.08144),他们检查了OpenAI纳维–斯托克斯相关成果的Lean代码,发现代码实际证明的陈述比书面论文宣称的更弱,其中一个估计还改变了输入导数的阶数。 有社区核对进一步指出,这次被撤回的三篇手稿都不在其Lean形式化清单里。 “形式化验证通过”和“定理陈述正确”在AI学术圈还不是同一个词——机器审查看住了推导链条,定理陈述的翻译环节却没有人把关。这是第二条潜规则。哔哩哔哩知乎小红书
719篇论文,没人付工资去读
OpenAI并非没做“审核”姿态:发布前,它宣布组建独立数学审查小组,班底包括下一届国际数学联盟主席、美国和伦敦数学会主席。知乎
但验证的真实瓶颈靠姿态解决不了:一位技术博主在自己的Mac上跑仓库里π相关成果的Lean证明,84分钟后,869个文件只完成检查了630个。 NYU数学教授Tristan Buckmaster在CNBC访谈中直言,这次批量发布直接摧毁了多位早期职业数学家的研究项目与职业生涯。 验证一场就耗尽一个普通人的整个下午,而对面是719篇论文,也没有人为阅读和验证发工资。 第三条潜规则:审稿人不再是期刊邀请的专家,而是全球义务劳动的同行——验证队列的长度,就是这批成果可信度的上限。哔哩哔哩小红书哔哩哔哩
数学圈破防的不是AI,是发布方式
最激烈的反弹来自一个新组织:8月成立、约800名成员的人类数学协会(AHM)发布声明,呼吁数学家停止与OpenAI合作。菲尔兹奖得主陶哲轩在个人博客全文转载了这份声明,但他并非起草人、也不是该协会会员,只是转发背书。 值得注意的是,声明没有否定任何一篇证明,它骂的是发布方式本身:一次放出700多个文件,展示的不是学术研究,是权力。微博哔哩哔哩
发布前一个月,陶哲轩等25位菲尔兹奖得主联署的那封公开信,警告的是AI与数学的错位,语气比AHM声明缓和得多。 社区对这套发布逻辑的概括是flooding the zone——用算力淹没学术验证,随后部分手稿因符号错误被撤回、Lean形式化和自然语言证明对不上,让争议彻底炸开。哔哩哔哩微博
普通读者现在该把什么当可信
先把定位摆正:这不是722个已解决的问题,而是719份待消化的手稿——形式化清单内的陈述可以被机器复核,未形式化的结果按OpenAI自己README里的坦白,可能存在问题。 机器辅助证明被同行体系排斥早有先例,1976年Appel和Haken用计算机辅助证明四色定理,长期被相当一部分数学家认为“不算真正的证明”。 比起站队,更有用的是盯住三个信号:719篇里会不会继续出现撤回——撤稿在这个仓库里已经是常态而非事故;独立数学审查小组的意见何时公开;OpenAI承诺出资、帮助学界消化成果的研讨班能否真的运转起来。AI学术圈的审核潜规则还在起草中,读者自己的验证习惯,是这条新审核链的最后一环。知乎知乎