这几天刷微博和知乎,你大概率会遇到一位协和医院的医生。
协和神经外科住院医师金山木,本科读的是地质,数学全靠自学,他用GPT-5.6跑了约16小时运算,提交了一份预印本,声称证明了困扰数学界22年的Crouzeix猜想。知乎猜想原作者Crouzeix本人看完预印本后,评价论证逻辑"震惊"。微博随后话题冲上热搜,他过往的博士论文又被网友翻出来审视,舆论迅速分成两派。
这是2026年8月AI数学连环爆雷里争议最大的一条。而这个夏天的事件按时间排开,更魔幻:
7月中旬:AI证伪了1939年由Keller提出的雅可比猜想,悬置87年。微博
7月29日:三位数学家上传四页短文《麦克斯韦猜想是错的》,推翻了麦克斯韦1873年讨论过的点电荷平衡猜想,反例构建的核心思路来自GPT-5.6 Sol。MIT科技评论这个被讨论了152年的问题里,n=5时猜想预测平衡点最多16个,论文给出至少24个。知乎
8月1日:OpenAI宣布未发布的内部模型Astra一口气解决十个长期悬而未决的数学与理论计算机问题,包括宣称推翻Connes刚性猜想、首次显式构造出非sofic群。36氪
8月2日至4日:学者J. L. Nielsen把OpenAI公开的37000行Lean 4代码逐行追查,指出Connes刚性猜想的反例不成立。知乎
8月11日:Anthropic宣布未发布的研究版Claude挑战167年的黎曼猜想,把临界线上零点比例的下界从41.6%提升到67.2%。澎湃新闻这个数字在过去37年里,人类数学家只推进了0.8%。新智元
8月12日:创业公司CEO Lech Mazur借助GPT-5.6 Pro证明了约70年的森多夫猜想,附约9万行Lean形式化代码。机器之心
8月14日:协和事件在微博、知乎集中引爆,而那份预印本7月底就已挂出,尚未经过同行评审。微博
一个夏天,AI接连碰了几十年、上百年没人碰动的问题。知乎上"如何看待大量有名有姓的数学猜想被AI解决"这类问题,浏览量动辄几十万。
这批成果里验证最扎实的是森多夫猜想。说人话就是:如果一个复系数多项式的所有根都位于单位圆内,那么每一个根附近,是否一定存在一个距离不超过 1 的临界点?机器之心

Mazur的证明附了9万行可被机器逐条验证的Lean代码,陶哲轩又亲自把它消化、简化到约1.5万行并重新形式化。机器之心过程中他还发现,这套论证顺手解决了1972年提出的Phelps-Rodriguez猜想。这才叫完整的验证链。对照还停在预印本阶段的协和事件,就能理解舆论为什么会分裂。
但对我们这些天天用AI答题的人来说,这波热闹真正该消化的不是数学,而是一个问题:AI都能证猜想了,它给我的答案到底能信多少?
成绩单的另一面:37000行代码句句通过,却被判"答错了题"
上面那串事件里,传播最少、但最该被盯着看的,是Nielsen的这次"挑刺"。
OpenAI对Connes刚性猜想的证明,写成了37000行Lean 4代码,由Lean内核逐条验证通过。如果把"对"定义成"形式上成立",这份答案无可挑剔。但Nielsen逐行追查、把每个对象对回数学原型后发现,AI构造的其中一个群其实没有满足附加条件,既不是ICC,也没有性质(T)。知乎证明通过了验证,但它证的已经不是原来那道题。
有科技博主复盘了这戏剧性的一幕:OpenAI宣称用推理模型攻破一道80年悬而未决的数学猜想,24小时内被数学家亲自下场打回。微博这其实正是陶哲轩早就给出的提醒:验证证明的是形式陈述本身,而不是这个陈述和意图相符,所以人类的审查不能直接被取代。知乎更早一些,他在国际数学家大会上演讲,警示数学界正从"证明稀缺"进入"证明过剩"的时代。MIT科技评论
这类"答错题"还不是孤例。一份针对五个常用Lean基准的审计给出了4833条发现,包括反例、空洞定理和不可靠公理,全都通过了机器验证。知乎社区里的质疑声也没停:最近一批数学猜想号称被AI解决了,问题是我到现在也没看见这些结果被投稿,以及同行评议的意见,请问怎么就知道证明了呢?微博这句话同样适用于协和热搜:猜想提出者的初步认可、当事人自述的验证,都不等于学术确认。
AI凭什么这么能打:菲尔兹奖得主的总结是"抬杠"和"输得起"
Gowers在8月12日的博客值得单独一看。他把这几个月AI最轰动的数学战绩往桌上一摊,发现画风非常统一:雅可比猜想,找反例;非sofic群问题,构造一个过去没人找到的例子。用一句话概括这种反差:人类数学家问"这个结论到底为什么成立",AI的第一反应是"你这结论,真成立吗"。36氪

连悬了80年的埃尔德什平面单位距离猜想,也是被AI构造的反例推翻的。36氪
5月这个消息刚传出时,Gowers以为AI给出的是一个证明,花了整整一晚上重新调整自己的世界观,第二天早上才收到澄清邮件:AI不是证明了这个猜想,是推翻了它。36氪人类此前能找到的最好构造,基于缩放方格网格,AI则把代数数论的工具搬进离散几何,构造出了单位距离更多的点集。

为什么AI现在做数学这么高产?Gowers的答案很朴素:它的优势不在于比人聪明,在于它"输得起",同一道题人只够试几条路,它可以把几百条都试一遍。36氪跟进研究的数学家也给出过类似比喻:AI不受时间和资源的限制,所以它可以不停往墙上扔东西,看哪个粘得住。但也正因为答案来自海量试错,"看起来对"和"真的对"永远是两回事。
AI的答案有两种错
把这个夏天的事件合起来,AI答错的方式可以归成两类,用AI答题的人都该分清:
第一类:答错了。事实、数据、引用搞错,也就是大家熟悉的"幻觉"。它的特点是能被查证,一查就知道。
第二类:答错题。Connes事件是极端版:答案流畅、自洽、每一步都通过形式验证,但题目悄悄换了。这类错误靠"读起来顺"防不住,答案越完整越自信,越容易让人放下戒心。启动Claude挑战黎曼猜想的Anthropic员工Jarred Sumner,给模型的提示大多只有两个意思:继续,以及相信你自己。新智元鼓励式提示能逼出模型的极限产出,同样也提醒我们:产出的方向对不对,终究要人来把关。
这也解释了为什么协和事件里"人主导思考、AI负责推导和试错"的结构值得重视:AI强在执行,弱在对齐,"我们在解哪道题"这个判断,永远得由人钉死。
所以日常使用,我建议把AI的答案分三档验收:
第一档:有标准答案、你自己能验。算数、翻译、格式化、跑代码、对着原文做信息抽取。可以放心重用,但要把结果过一遍。森多夫证明附9万行Lean代码,本质上就是这个逻辑的极端版:让结论通过一个能机器验证的流程。
第二档:有答案、但你验不了。医疗建议、法律条款、理财产品、学术引用。把AI输出当"值得查证的线索",而不是"结论",再往下查一层权威原始来源。协和事件就是例子:猜想提出者初步认可之后,同行评审通过之前,它依然只是"声称证明"。
第三档:没有标准答案、流畅容易冒充正确。方案、建议、评价、论证、重大决策。这是"答错题"的重灾区,采纳前至少多做一步:让AI先复述它理解的题目,确认和你的本意一致。
五件今天就能用的事
重要问题先问一句"你理解我在问什么"。一句话就能过滤掉大部分语义偏移。陶哲轩消化Mazur证明时的重构、简化、再形式化,做的也是同一件事。
关键结论多问一句"依据是什么"。AI给不出可查证的出处,就把这条结论降级为"观点供参考"。
同一问题换个问法、或换个模型再问一遍。看两次答案在哪里一致、哪里分叉,分叉点就是风险点。
对开放复杂问题的"完整自信答案"格外警惕。OpenAI被驳回的Connes猜想、协和眼下的预印本都是例子:答案越斩钉截铁,越要去查它的验证链。
学数学家的"用AI但不外包脑子"。这个夏天最顶级的人机协作都是同一个结构:AI负责搜索、推导、试错,人负责定题、消化结果、决定是否接受。
这个夏天的数学圈,相当于给所有用AI答题的人上了一节免费公开课:AI的"能解"在狂飙,它能推翻猜想、刷新纪录、海量试错;但"可信"永远是使用者的活,你定义问题、你验证结果、你保留怀疑。AI到底会不会取代数学家、普通人还有没有必要死磕数学,这两个拷问短期内不会有答案。中国网
下次AI给你一个完美答案,先别急着收藏,想想这个夏天的数学家们面对AI输出时做的第一件事:消化、简化、验证,再决定接不接受。这套动作,比任何一个答案都值钱。