2026年10月上旬,OpenAI在GitHub上一次性放出722篇数学手稿,全部出自一个尚未公开的内部模型,覆盖数论、几何、概率、理论计算机等17个数学分支。 这个夏天,王虹刚因证明三维挂谷猜想拿下菲尔兹奖,不到三个月,OpenAI的模型声称把四维版本也解决了。 热榜话题“AI把数学干废了”由此炸开。微博知乎
但对学生来说,要不要因此放弃刷题,答案不在发布规模里:AI碾平的是已知问题的“答案”,不是数学思维本身;真正该调整的不是停止练习,而是换掉练法和“练会”的标准。接下来三个数字,说清为什么。
372组成果、平均3小时算力:会解题正在变便宜
OpenAI把大约4000个悬而未决的开放问题喂给模型,最终在372组问题上拿出结果,平均每个结果耗费的算力,大约相当于ChatGPT付费高级版思考3个小时。 曾经衡量人有多聪明的标准也已被击穿:AI去年就达到国际数学奥林匹克金牌水平,题库刷满之后,分数上涨本身已经说明不了什么,OpenAI只能改用开放问题做标尺。 翻译到考场上:同类题AI秒出正解,靠“会做、记住套路”堆出来的题量,这部分价值确实在缩水。微博知乎
42%:答案变便宜的同时,“确认”变贵了
这批手稿没有一篇经过同行评审,也没有人类作者署名;发布第2天,OpenAI撤回了3篇,毛病出在第一篇的一个符号上——该写负号的地方写成了正号,另14篇当天修补。微博
数学的特殊之处是证明可以翻译成Lean这类机器语言逐行检查,但按对仓库目录的统计,372组成果里约六成三附带Lean形式化说明页,截至10月10日只有约42%的结果真正通过了机器检查,OpenAI也承认其余结果可能有问题。 整件事的瓶颈已经从“AI会不会做”变成了“人能不能确认”。知乎微博
机器检查还有盲区:Lean只能保证拿到的那句话被证明,它和论文里的自然语言原题是不是一回事,仍要靠人核对,剑桥大学研究者已发表论文提醒翻译为Lean代码时可能发生意义上的偏移。知乎
人肉消化更跟不上。帝国理工学院的凯文·巴扎德数过落进自己数论领域的稿件:一共30篇,只有7篇看起来质量突出,只有1篇通过Lean验证。 这722篇手稿至今没人通读过一遍,连OpenAI自己的研究人员也没有。知乎微博
联名信反对的不是AI,是军备竞赛
热榜流传最广的说法“数学家联名喊AI毁掉数学”,被原始文本纠偏了。9月12日,陶哲轩、邓煜等25位菲尔兹奖得主联合发表公开信《人工智能在数学中的严重错位》,指出AI公司把解决数学问题当作基准测试推进、对数学共同体有害,同时承认AI有加速数学研究的潜力,反对的是匆忙公布结果。 手稿发布后,陶哲轩进一步主张“数学2.0时代”应淡化攻克难题的叙事,转向理解与分享。 数学圈最焦虑的不是被替代,而是一个原本靠研究者不断尝试的过程有了新生产方式,而人的理解、学习和成长还需要时间。知乎知乎知乎
学生该改的不是少练,是换练法
先把AI从答案查询机改成陪练。知乎“怎么利用AI学习数学”的问答点破关键:只让AI答题就只得答案,应当把AI当一起解题的伙伴,主动告诉它自己卡在哪一步。 一个符号写错就撤掉3篇的事实也说明:AI的输出不是终点,而是你题目的起点。知乎
再把刷题目标从“会做”换成“会验”。做完一道题合上AI独立复写一遍再对照,挑AI解答找可疑步骤,应当成为日常动作。372组成果只有约42%经机器确认的现实意味着:答案越便宜,能判断答案对不对的人越稀缺。选题时保留一定比例必须写出完整推理链条的题,而不是只要数答案的题。
把思维训练的单位从“解题”换成“表述与提问”。机器的盲区恰恰是人的护城河:陈述与原题是否一致,最终要人核对。具体练法是给自己定两个小动作——把AI的解答改写成同学能看懂的版本,再改条件追问“结论还成立吗”。准确地把问题说清楚、把道理讲明白,比多算一道题更接近“数学2.0”稀缺的能力。
最后,把“难受”的部分留住。有考研学生在知乎回答里写,真正用了AI反而对它祛魅:在自己的研究问题上,AI无法克服本质困难,而不同学生的知识消化能力差距很大。 理解无法外包,坐得住、硬啃一道不会的题的能力,正是不会随AI能力增长而贬值的那部分训练。知乎
边界:这些都是手稿级的声称
即便分量最重的“准黎曼猜想”,把零点无零点区域推进到实部大于7/8,也仍是有待独立验证的声称——离猜想要求的实部等于1/2还差得远,美国佐治亚理工学院的马特·贝克提醒,完整证明可能需要完全不同的方法。 上面的学习策略,是基于“生成速度超过验证速度”这一现状的条件化判断,不是已被证明的结论。但至少一件事是确定的:AI干废的是只会追答案的学数学方式;要求理解、验证和表达的数学,从没像现在这样值钱。微博