美国时间10月6日,OpenAI在GitHub挂出一个名为math的仓库,把一个尚未发布模型产出的数学成果整体公开:722篇手稿、归成372个结果族。第二天,仓库更新日志新增撤稿3篇、修订14篇——撤稿源于一篇八维阿贝尔簇上Weil代数性证明里的符号错误,还连累两篇依赖它的K3曲面手稿一起下架。10月7日,菲尔兹奖得主陶哲轩在博客全文转载“人类数学协会”(AHM)的声明,“一次性发布700多份文件,展示的不是学术研究,而是权力”一句迅速刷屏。知乎知乎知乎
很多人把这轮爆火翻译成:AI解题都靠谱到这份上了,孩子的数学作业尽管交给它。方向多半搞反了:按OpenAI自己的口径,约42%的顶层结果配有机器验证,专家审阅和独立复现都尚未完成。 这恰恰是事件钉给跟风者的第一枚警示——连最强的模型批量生产证明,都得在验证关前停下来排队。下面这三个误区,每一个都错在把“生成”当成了别的东西。知乎
误区一:把“看着完整”当成“验证过”
AI给出的解题过程天然流畅:步骤长、符号规范、结论笃定,但这些都和论证成立是两回事。看这组成果的质检水位:有人把仓库新旧两版逐个数过,发布当天主结果有机器验证的是162篇,约占722篇的22%,更新后173篇,按719篇算约24%。 OpenAI自己也承认,尚未完成形式化的证明可能存在漏洞。 换句话说,多数成果目前只能算“声称”,把它直接当“定理”抄,就是误区一的起点。知乎知乎
用户端其实早就踩过这个坑。有用户发帖问,豆包算54加12,答案写成了76,这么简单的题怎么会错。这条提问下,一种解释并不神秘:很多聊天型AI的主任务是根据上下文,生成最像正确答案的文字,和逐项进位的计算器不是一套逻辑。AI很擅长“看起来对”,它只是恰好也很可能对。知乎
遇到判断不了的“AI证明”,先分级再决定信多少:哪些结果经过机器验证;哪些经过领域专家逐篇审阅;是否有第三方独立复现——目前三项中仅第一项有部分进展。落到孩子的作业上同理:先盖住答案自己做一遍,再对照AI的步骤。口算题尚且要验算,AI给出的答案,在验算前都只能当候选。知乎
误区二:把“解出难题”当成“解什么题都稳”
这轮传播本身就是活标本。小红书上一条收获43赞30收藏的帖子宣布:OpenAI一夜攻克722道数学难题,顺手拿下160年无解的黎曼猜想。数字全读歪了。722与719只是同一份仓库不同时点的手稿数,二者都不等于被解决的问题数。被讨论最多的003号结果,证明的是Re s>7/8内无零点的“准黎曼猜想”,OpenAI并没有宣布证明了黎曼猜想。小红书知乎知乎
即便看真正硬的成果,剧本也不是“天才灵光一闪”。模型在评估期被投喂约4000个开放数学问题,平均每项结果烧掉约3小时ChatGPT Pro的思考算力,最后筛出372组,存活率不到10%。剩下的是大规模试错后被严格筛选的候选,有的能站住,有的站不住。研究级突破并不自动转移成日常做题的零错误——能力不是同一条轨道。知乎
反向的误区同源:AI连千禧年难题都能碰,于是“数学课没用了”“加密要完蛋”。这类宣判同样等不起时间表——真要等人类验证,需要耐心,审稿审一年以上都是正常的。按热搜速度给AI数学下结论,不管押哪一头,都抢跑了。知乎
误区三:把“拿到答案”当成“学会了”
AHM声明的要害,是要求研究重回以人类理解为核心的科学愿景。最有讽刺意味的注脚是唯一博弈猜想那篇:为此猜想工作二十多年的得州奥斯汀分校学者Dana Moshkovitz,第一时间研读OpenAI的“证明”,发现里面充斥着难以理解的构造、语焉不详的推理和莫名其妙的文献引用,最后不得不借助另一个AI工具才勉强读下去。面对一个可能为真的证明,人类的理解链条都可能断掉——答案的“对”要变成知识,前提是人读得懂。量子位知乎
搬回普通课桌,这条链更短。学生把理论力学题拍给AI,它很快列出答案,可自己连第一句该怎样问都不清楚,看完一整页公式还是没底。大学生让AI代写Python作业,交上去全错,被点破的正是那个常识:作业存在的意义,是让你通过动手写的过程学会这个东西,用AI写完交上去、过了又怎样,知识是AI的,不是你的。知乎知乎
可用的姿势其实早有人总结:AI能帮助我们检查解题步骤,但不能直接提供答案。让它讲解卡住的那一步、把同一道题改个数字重做、自己解完后让它挑毛病——这几种用法里,学习的主体还是你;把它当答案机,主体就悄悄换成了AI。小红书
这波OpenAI数学成果最终能站住几成,要由形式化验证、专家审稿和独立复现慢慢给出,轮不到热搜转发来决定。普通用户此刻能带走的教训只有一条:AI的输出要过验证关,人类的练习要过理解关——两关都在,跟风才不至于翻车。