OpenAI撤回3项数学成果:一个符号错误,为什么会带崩三篇论文

源自48位全网作者

13:17

10月7日,OpenAI 的 openai/math 成果仓库贴出了上线以来的第一份修订记录:3 篇数学手稿被公开撤回。这是该仓库前一天放出 722 篇手稿之后第一批被撤下的成果,原因不是三个彼此独立的错误——一个符号错误让一篇论文的论证失效,两篇依赖其构造的论文跟着倒下。GitHub

三篇被撤回的手稿分别是《分裂阿贝尔八次折叠上 Weil 类的代数性》(Algebraicity of Weil classes on split abelian eightfolds)、《K3 曲面 Kuga–Satake 对应的代数性》(Algebraicity of Kuga–Satake Correspondences for K3 Surfaces)和《K3 曲面乘积的有理 Hodge 猜想》(The rational Hodge conjecture for products of K3 surfaces)。仓库更新日志把原因写得非常具体:一个符号错误导致稳定化迹抵消论证失效,还连累了依赖它的另外两篇。 被撤回的论文没有被删除——仓库里仍保留它们,各附一段说明论证缺口的提示并链接到归档原稿,读者可以逐篇核对。知乎GitHub

撤回之外:14篇被修订,形式化率停在42%

同一份修订记录里还有一串更长的动作:14 篇手稿因证明修补、陈述更正和假设、依赖关系的澄清而被修订,13 篇相应更新了对修订版的引用,另有 6 项新增的 Lean 形式化。 10月8日,OpenAI 研究员 Dan Roberts 在 X 上公布了这次修正,称目前约 42% 的主要成果已完成形式化,团队将持续补充新的形式化内容,并在发现错误时公布勘误。 被修掉的只是问题的一角:其余约 58% 的顶层结果目前只有人类可读的手稿,没有经过机器编译验证。README 对此的说法是 Some of the unformalized results could have issues——部分未形式化的结果可能存在问题。GitHub微博GitHub

这批成果为什么值得盯

722 篇手稿没有提前预告、未走同行评审流程,一次性全部放入 GitHub,按官方口径归入 372 个成果族。 这些产出也不是竞赛题:模型在整个评估过程中被喂了大约 4000 个开放研究问题,平均每个结果消耗约 3 小时的 ChatGPT Pro 级思考算力。 其中最受瞩目的成果之一是在 CM 阿贝尔簇上证明 Hodge 猜想——Hodge 猜想是克雷数学研究所七个千禧年大奖难题之一,放在任何数学系都是多年一遇的进展。微博GitHub知乎

README 还注明,CM 阿贝尔簇 Hodge 猜想与黎曼ζ函数零自由区域这两个成果没有走同一套生成流程,且 Re(s) > 11/12 零自由区域那篇的表述经过人工编辑。 这次被撤的三篇并不包含 CM 阿贝尔簇 Hodge 猜想论文,该旗舰结果目前仍在库中。GitHub

撤回落在争议最高点

撤回发生的 10 月 7 日,正是数学界与 OpenAI 冲突升级的日子。前一天,曾为发布方式提供咨询的普林斯顿高等研究院数学与人工智能独立咨询小组(AGMAI)专门发表声明,强调其咨询工作不代表认可 OpenAI 的研究方式。 据科学网援引《自然》报道,不少数学家抱怨自己的在研课题被抢先发表。知乎微博

而撤回当天,菲尔兹奖得主陶哲轩在个人博客上转载了"人类数学协会"(AHM)呼吁数学家停止与 OpenAI 合作的声明,声明中的一句话措辞很重,指一次性发布700多份文件展示的不是学术研究,而是权力。知乎

摩擦其实更早开始:今年8月,OpenAI 曾召集约 40 位数学家闭门开会,学者给出的建议是逐篇按学术规范发表论文,给数学界留出消化和验证的时间。 9月,OpenAI 宣布内部模型给出千禧年难题纳维—斯托克斯方程的 Lean 验证证明,纽约大学数学家特里斯坦·巴克马斯特随即质疑 OpenAI 抢先推进了他与同事正在开展的工作。微博知乎

形式化不等于正确

42% 的形式化率容易被读成"四成结果已确认无误",这并不准确。Lean 检查的是推导是否逻辑自洽,至于被机器验证的命题是否对应原问题真正的数学内涵,仍然要靠人工核实。知乎

可读性是另一道坎:以最受关注的理论计算机科学成果之一为例,OpenAI 的手稿声称证明了唯一博弈猜想,而长期深耕该猜想的达娜·莫什科维茨在论文公布后第一时间进行了研读,结果发现论文里充斥着难以理解的构造、语焉不详的推理步骤以及让人摸不着头脑的文献引用。知乎

陶哲轩把这种状态概括为"证明消化不良"——AI 以工业化速度批量生产证明,但人类根本来不及验证、理解和吸收。 当机器生成证明的速度远快于人类消化速度,矛盾的焦点已经不是 AI 能不能做数学,而是数学的学术生态如何承接产出。36氪

接下来盯什么

截至 10 月 11 日,openai/math 的修订记录仍然只有 10 月 7 日这一批,仓库总目仍是 719 篇手稿、372 个成果族、约 42% 的形式化率。OpenAI 已在 README 中写明,他们也在探索由社区托管这批材料——这意味着这批结果最终能否沉淀为数学界的公共知识,取决于人类的审查与消化,而不是发布动作本身。GitHub

对想持续跟踪这件事的读者,接下来的信号有三个:修订清单里会不会再出现新的撤回,形式化率会不会从 42% 继续上行,以及那 58% 未经机器验证的手稿在人工审查中会暴露出什么。这次撤回同时给出了一个超出数学圈的技术信号:当机器生成的证明开始互相引用、构成依赖链,错误的代价不再按篇计,而是按依赖链计。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章