10月11日,在清华大学丘成桐数学与人工智能实验室联盟成立仪式上,清华大学讲席教授、求真书院院长丘成桐对这场持续发酵五天的风波给出了自己的注解:对学者来说,这是“最兴奋的时代,也是最危险的时代”。 AI解题靠不靠谱,短答案是:成果是真的,水准也是真的,但手稿上写的“已解决”,目前大多只能算“声称”——公开仅两天,第一份勘误单就到了,仓库手稿总数从722降为719。中国青年报机器之心
AI的输出确实是真的,而且分量不轻
10月6日,OpenAI在GitHub上一次性公开了722篇由内部AI模型生成的数学手稿,涉及372个成果组,涵盖数论、几何、代数、理论计算机科学等多个领域,其中不乏长期困扰数学家的著名开放难题。 这批成果出自一个尚未公开的内部前沿模型。在整个评估过程中,模型一共尝试了解答约4000道数学问题。 按OpenAI的说法,平均每项成果消耗的算力约相当于ChatGPT Pro三个小时的思考计算量。中国青年报DeepTech深科技
最受关注的是“准黎曼猜想”:OpenAI声称证明了黎曼ζ函数及相关L函数在某个固定半平面内不存在非平凡零点,这与完整的黎曼猜想仍有差距,但若结论属实,是解析数论领域的重大突破。 仓库里还声称在四维挂谷问题上取得突破——这正是王虹因证明三维情形而获2026年菲尔兹奖的方向——以及声称证明了2002年提出的“唯一博弈猜想”。其中任何一项定理,只要得到严格确认,都足以成为相应领域的重磅里程碑。DeepTech深科技
但只有约42%通过了机器验证,靠谱的要打折扣
发布两天后,OpenAI在仓库给出第一份更新日志:撤回3篇手稿,修订14篇,另有13篇更新了引用。被撤回的三篇都与霍奇猜想相关成果组有关,问题出在第一篇——一处关键论证把一类几何操作的符号记成了+1,而按论文自己的约定,它应当是-1。 借用这套构造的另外两篇随之撤回,OpenAI同时强调,撤回的是证明,并不意味着数学命题本身错了。机器之心
更有意味的是错误分布的规律:这次被撤回和实质修订的内容,几乎都落在没有Lean形式化的部分。 Lean是让计算机逐步检查推导是否逻辑自洽的证明辅助工具,目前已有300篇手稿的主结果完成这类验证,约占719篇的42%。但机器验证也有边界:计算机确认推导自洽之后,被验证的命题有没有准确对应原问题真正的数学内涵,仍需数学家人工核实。机器之心DeepTech深科技
靠谱与否还不只是对错问题,也是能否读懂的问题。长期从事唯一博弈猜想研究的学者莫什科维茨研读对应手稿后,发现论文里充斥着难以理解的构造、语焉不详的推理步骤和让人摸不着头脑的文献引用。 理论计算机科学家阿伦森把这一天称为“数学末日”,却也承认这可能是数学史上极其重要的一天。对人类几乎读不懂的证明,无法立刻变成可用的知识。DeepTech深科技
数学界没有欢呼,担心的不是智力而是生态
9月11日,陶哲轩、邓煜等25位菲尔兹奖得主联合发表声明《人工智能在数学中的严重错位》;10月7日,陶哲轩又在博客全文转载“人类数学协会”呼吁数学家停止与OpenAI合作的声明,并直言“一次性发布700多份文件,展示的不是学术研究,而是权力”。中国青年报
更现实的矛盾在消化成本。传统上,证出一个大定理只是起点,学界要靠论文、研讨会长年讲清证明思想、新工具和可推广性。当商业实验室能以“批发”速度抛出几百份复杂证明,数学家可能被迫沦为“专职校对员”。 OpenAI已承诺出资赞助研讨会帮助数学界消化,但若哪道题先做、何时发布都由公司决定,研究议程就可能被商业资本牵着走。争议早有铺垫:8月OpenAI公布10项成果即被发现部分存在缺陷,9月8日宣布纳维-斯托克斯方程的解答后,纽约大学数学家巴克马斯特质疑其抢先推进了自己正开展的工作,OpenAI否认不当使用数据,双方至今仍有分歧。DeepTech深科技
抵制之外也有另一种声音。此前数学与人工智能咨询小组(AGMAI)曾建议OpenAI按学术标准发布论文、公开算力与失败记录,这次OpenAI采纳了部分建议但模型仍未公开,AGMAI在10月6日专门声明这不代表认可其研究方式。菲尔兹奖得主海雷尔的态度是:如果数学家拒绝与AI公司接触,也就很难影响这些公司的行为。 还有学者指出,一些问题因多年无人解决已被视为不可突破,AI的进展反而可能帮研究者重新打开这些被搁置的方向。DeepTech深科技
中国数学界的回答:一边下场用,一边立规矩
丘成桐口中的“危险”,在他自己的解释里指向年轻人。他提到“机器的宏大势力让许多人不想再做了,尤其是年轻的学者们感到灰心,不想做”,并称这是一个很严重的问题。 他的选择不是回避:“我们需要在大潮上冲浪,而不是躲起来、避开它。我们在进行研究时,会遇到很多大风大浪,关键是能迎着浪、继续走。”中国青年报
丘成桐也不是旁观者。他对AI的看法从“不会有任何影响”,变成今年1月在世界华人数学家大会上说AI改变的是科研效率。 他在新论文里公开致谢GPT和Claude,团队借助AI为所有7维奇异球构造正截面曲率度量,也一度是热议成果。 “兴奋/危险”的两段式判断,出自一个已经亲自下水的人。量子位知乎
同场仪式上,中国科学院院士、中国数学会会长席南华点出了制度症结:企业不受学术规则约束,发布成果不需要经过同行严谨核验,甚至允许错误内容流出,给数学界带来巨大冲击。 他的结论是不必陷入焦虑:新的共识还在形成,数学界可以与AI产业界一起,逐步建立一套各方都能接受的规则体系。中国青年报
判断“靠谱”,看三个信号
把这次风波当作标尺,AI解题的可靠性要分三层看:发布时全部722篇只是“声称”;其中约42%已交给计算机逐行检查过逻辑;而真正被数学界接受为定理,还需要同行评审与长期消化——没有经过形式化和同行评审的结果,目前只能算“声称”。 这不等于AI不可信,恰恰说明失效方式是具体、可检查的:出错的那组恰在没有机器验证把关的地方,且勘误保留了旧版本和依赖链。机器之心
700多篇手稿才公开两天,第一份勘误单就来了,它大概率不会是最后一份。 接下来比“AI解了多少题”更值得盯的,是三件事:仓库的勘误与形式化比例是否持续可见地更新,准黎曼猜想、四维挂谷这类名题能否通过外部团队的独立核验,数学界与产业界能否尽快形成新的规则体系。对普通读者,最有用的结论是:“AI说它解出来了”和“AI解对了”不是一回事,两者之间的距离,正是接下来整个数学生态要赛跑的赛道。机器之心