AI证对了约70年的数学猜想,也“证对了每句话却答错了题”:AI的答案到底能信多少?

源自14位全网作者

05:40

这几天刷微博和知乎,你大概率会遇到一位协和医院的医生。

协和神经外科住院医师金山木,本科读的是地质,数学全靠自学,他用GPT-5.6跑了约16小时运算,提交了一份预印本,声称证明了困扰数学界22年的Crouzeix猜想。知乎猜想原作者Crouzeix本人看完预印本后,评价论证逻辑"震惊"。微博随后话题冲上热搜,他过往的博士论文又被网友翻出来审视,舆论迅速分成两派。

这是2026年8月AI数学连环爆雷里争议最大的一条。而这个夏天的事件按时间排开,更魔幻:

  • 7月中旬:AI证伪了1939年由Keller提出的雅可比猜想,悬置87年。微博

  • 7月29日:三位数学家上传四页短文《麦克斯韦猜想是错的》,推翻了麦克斯韦1873年讨论过的点电荷平衡猜想,反例构建的核心思路来自GPT-5.6 Sol。MIT科技评论这个被讨论了152年的问题里,n=5时猜想预测平衡点最多16个,论文给出至少24个。知乎

  • 8月1日:OpenAI宣布未发布的内部模型Astra一口气解决十个长期悬而未决的数学与理论计算机问题,包括宣称推翻Connes刚性猜想、首次显式构造出非sofic群。36氪

  • 8月2日至4日:学者J. L. Nielsen把OpenAI公开的37000行Lean 4代码逐行追查,指出Connes刚性猜想的反例不成立。知乎

  • 8月11日:Anthropic宣布未发布的研究版Claude挑战167年的黎曼猜想,把临界线上零点比例的下界从41.6%提升到67.2%。澎湃新闻这个数字在过去37年里,人类数学家只推进了0.8%。新智元

  • 8月12日:创业公司CEO Lech Mazur借助GPT-5.6 Pro证明了约70年的森多夫猜想,附约9万行Lean形式化代码。机器之心

  • 8月14日:协和事件在微博、知乎集中引爆,而那份预印本7月底就已挂出,尚未经过同行评审。微博

一个夏天,AI接连碰了几十年、上百年没人碰动的问题。知乎上"如何看待大量有名有姓的数学猜想被AI解决"这类问题,浏览量动辄几十万。

这批成果里验证最扎实的是森多夫猜想。说人话就是:如果一个复系数多项式的所有根都位于单位圆内,那么每一个根附近,是否一定存在一个距离不超过 1 的临界点?机器之心

AI证对了约70年的数学猜想,也“证对了每句话却答错了题”:AI的答案到底能信多少?

Mazur的证明附了9万行可被机器逐条验证的Lean代码,陶哲轩又亲自把它消化、简化到约1.5万行并重新形式化。机器之心过程中他还发现,这套论证顺手解决了1972年提出的Phelps-Rodriguez猜想。这才叫完整的验证链。对照还停在预印本阶段的协和事件,就能理解舆论为什么会分裂。

但对我们这些天天用AI答题的人来说,这波热闹真正该消化的不是数学,而是一个问题:AI都能证猜想了,它给我的答案到底能信多少?

成绩单的另一面:37000行代码句句通过,却被判"答错了题"

上面那串事件里,传播最少、但最该被盯着看的,是Nielsen的这次"挑刺"。

OpenAI对Connes刚性猜想的证明,写成了37000行Lean 4代码,由Lean内核逐条验证通过。如果把"对"定义成"形式上成立",这份答案无可挑剔。但Nielsen逐行追查、把每个对象对回数学原型后发现,AI构造的其中一个群其实没有满足附加条件,既不是ICC,也没有性质(T)。知乎证明通过了验证,但它证的已经不是原来那道题。

有科技博主复盘了这戏剧性的一幕:OpenAI宣称用推理模型攻破一道80年悬而未决的数学猜想,24小时内被数学家亲自下场打回。微博这其实正是陶哲轩早就给出的提醒:验证证明的是形式陈述本身,而不是这个陈述和意图相符,所以人类的审查不能直接被取代。知乎更早一些,他在国际数学家大会上演讲,警示数学界正从"证明稀缺"进入"证明过剩"的时代。MIT科技评论

这类"答错题"还不是孤例。一份针对五个常用Lean基准的审计给出了4833条发现,包括反例、空洞定理和不可靠公理,全都通过了机器验证。知乎社区里的质疑声也没停:最近一批数学猜想号称被AI解决了,问题是我到现在也没看见这些结果被投稿,以及同行评议的意见,请问怎么就知道证明了呢?微博这句话同样适用于协和热搜:猜想提出者的初步认可、当事人自述的验证,都不等于学术确认。

AI凭什么这么能打:菲尔兹奖得主的总结是"抬杠"和"输得起"

Gowers在8月12日的博客值得单独一看。他把这几个月AI最轰动的数学战绩往桌上一摊,发现画风非常统一:雅可比猜想,找反例;非sofic群问题,构造一个过去没人找到的例子。用一句话概括这种反差:人类数学家问"这个结论到底为什么成立",AI的第一反应是"你这结论,真成立吗"。36氪

AI证对了约70年的数学猜想,也“证对了每句话却答错了题”:AI的答案到底能信多少?

连悬了80年的埃尔德什平面单位距离猜想,也是被AI构造的反例推翻的。36氪

5月这个消息刚传出时,Gowers以为AI给出的是一个证明,花了整整一晚上重新调整自己的世界观,第二天早上才收到澄清邮件:AI不是证明了这个猜想,是推翻了它。36氪人类此前能找到的最好构造,基于缩放方格网格,AI则把代数数论的工具搬进离散几何,构造出了单位距离更多的点集。

AI证对了约70年的数学猜想,也“证对了每句话却答错了题”:AI的答案到底能信多少?

为什么AI现在做数学这么高产?Gowers的答案很朴素:它的优势不在于比人聪明,在于它"输得起",同一道题人只够试几条路,它可以把几百条都试一遍。36氪跟进研究的数学家也给出过类似比喻:AI不受时间和资源的限制,所以它可以不停往墙上扔东西,看哪个粘得住。但也正因为答案来自海量试错,"看起来对"和"真的对"永远是两回事。

AI的答案有两种错

把这个夏天的事件合起来,AI答错的方式可以归成两类,用AI答题的人都该分清:

第一类:答错了。事实、数据、引用搞错,也就是大家熟悉的"幻觉"。它的特点是能被查证,一查就知道。

第二类:答错题。Connes事件是极端版:答案流畅、自洽、每一步都通过形式验证,但题目悄悄换了。这类错误靠"读起来顺"防不住,答案越完整越自信,越容易让人放下戒心。启动Claude挑战黎曼猜想的Anthropic员工Jarred Sumner,给模型的提示大多只有两个意思:继续,以及相信你自己。新智元鼓励式提示能逼出模型的极限产出,同样也提醒我们:产出的方向对不对,终究要人来把关。

这也解释了为什么协和事件里"人主导思考、AI负责推导和试错"的结构值得重视:AI强在执行,弱在对齐,"我们在解哪道题"这个判断,永远得由人钉死。

所以日常使用,我建议把AI的答案分三档验收:

第一档:有标准答案、你自己能验。算数、翻译、格式化、跑代码、对着原文做信息抽取。可以放心重用,但要把结果过一遍。森多夫证明附9万行Lean代码,本质上就是这个逻辑的极端版:让结论通过一个能机器验证的流程。

第二档:有答案、但你验不了。医疗建议、法律条款、理财产品、学术引用。把AI输出当"值得查证的线索",而不是"结论",再往下查一层权威原始来源。协和事件就是例子:猜想提出者初步认可之后,同行评审通过之前,它依然只是"声称证明"。

第三档:没有标准答案、流畅容易冒充正确。方案、建议、评价、论证、重大决策。这是"答错题"的重灾区,采纳前至少多做一步:让AI先复述它理解的题目,确认和你的本意一致。

五件今天就能用的事

  1. 重要问题先问一句"你理解我在问什么"。一句话就能过滤掉大部分语义偏移。陶哲轩消化Mazur证明时的重构、简化、再形式化,做的也是同一件事。

  2. 关键结论多问一句"依据是什么"。AI给不出可查证的出处,就把这条结论降级为"观点供参考"。

  3. 同一问题换个问法、或换个模型再问一遍。看两次答案在哪里一致、哪里分叉,分叉点就是风险点。

  4. 对开放复杂问题的"完整自信答案"格外警惕。OpenAI被驳回的Connes猜想、协和眼下的预印本都是例子:答案越斩钉截铁,越要去查它的验证链。

  5. 学数学家的"用AI但不外包脑子"。这个夏天最顶级的人机协作都是同一个结构:AI负责搜索、推导、试错,人负责定题、消化结果、决定是否接受。

这个夏天的数学圈,相当于给所有用AI答题的人上了一节免费公开课:AI的"能解"在狂飙,它能推翻猜想、刷新纪录、海量试错;但"可信"永远是使用者的活,你定义问题、你验证结果、你保留怀疑。AI到底会不会取代数学家、普通人还有没有必要死磕数学,这两个拷问短期内不会有答案。中国网

下次AI给你一个完美答案,先别急着收藏,想想这个夏天的数学家们面对AI输出时做的第一件事:消化、简化、验证,再决定接不接受。这套动作,比任何一个答案都值钱。

精选参考来源

1
22年数学难题被AI证明,方法普通人能抄
2
最近全网吵翻的这个瓜,实在太魔幻了协和神经外科医生金山木,也就是网传董小姐的同班同学,本科北大地质学,走协和4+4项目拿到医学博士,现在是住院医师博士后。他业余时间靠GPT‑5.6,号称16小时运算,给出了Crouzeix猜想的完整证明,这个猜想可是卡了数学界整整22年,2004年提出来之后无数大佬都啃不动。猜想原作者Crouzeix,还有国外两位该领域专家看完预印本,都说论证逻辑看上去没问题,评价是“震惊”。后续还有另外数学家独立给出另一个版本证明,算是侧面互相印证。但这只是预印本,还没有走完正式期刊同行评审,还不能说100%盖棺定论。可有意思的来了!一部分人直呼传奇!完全跨圈,没科班数学训练,全靠自学+AI,打破学科壁垒,AI科研的典型案例。另一波网友直接扒出他当年的博士论文!正文只有十几页,课题是胶质瘤生存预测模型。总共102例病历,只给15个人做了基因检测,剩下87例直接放弃。用上一堆听着很高级的机器学习算法,最后模型C‑index只有0.652,仅仅比抛硬币0.5强一点点,却写成可以用于临床参考的工具,被很多人吐槽。一边是号称攻克世界级数学猜想,一边是临床博士论文被质疑数据、模型说服力不足,这!多少有点尴尬。 冰彬兵的微博视频
全部
来源
内容由AI生成

精选参考来源

1. 22年数学难题被AI证明,方法普通人能抄

2. 最近全网吵翻的这个瓜,实在太魔幻了协和神经外科医生金山木,也就是网传董小姐的同班同学,本科北大地质学,走协和4+4项目拿到医学博士,现在是住院医师博士后。他业余时间靠GPT‑5.6,号称16小时运算,给出了Crouzeix猜想的完整证明,这个猜想可是卡了数学界整整22年,2004年提出来之后无数大佬都啃不动。猜想原作者Crouzeix,还有国外两位该领域专家看完预印本,都说论证逻辑看上去没问题,评价是“震惊”。后续还有另外数学家独立给出另一个版本证明,算是侧面互相印证。但这只是预印本,还没有走完正式期刊同行评审,还不能说100%盖棺定论。可有意思的来了!一部分人直呼传奇!完全跨圈,没科班数学训练,全靠自学+AI,打破学科壁垒,AI科研的典型案例。另一波网友直接扒出他当年的博士论文!正文只有十几页,课题是胶质瘤生存预测模型。总共102例病历,只给15个人做了基因检测,剩下87例直接放弃。用上一堆听着很高级的机器学习算法,最后模型C‑index只有0.652,仅仅比抛硬币0.5强一点点,却写成可以用于临床参考的工具,被很多人吐槽。一边是号称攻克世界级数学猜想,一边是临床博士论文被质疑数据、模型说服力不足,这!多少有点尴尬。 冰彬兵的微博视频

3. 这个是真让人震惊,AI居然证伪了雅可比猜想。这个猜想最初是由数学家Keller于1939年提出,离现在已经87年了。这个问题难倒了无数人类中最聪明的大脑,包括张益唐和张益唐的导师。这个猜想,大一新生,只要学了高数,就能看懂。但是你们现在不是已经不是大一了么?离你们巅峰的数学水平越来越远了,所以也看不懂了,就没必要讲猜想本身了。我们主要讲AI在这个过程中的作用。事情是这么回事。就是anthropic公司的研究员,也是一个数学家levent,用fable5大模型找到了一个反例,证明雅可比猜想从n=3的时候,就是不成立的,而且很容易扩展到n>3的情形。具体怎么搞的,细节不是很清楚。只知道fable5搜到了一个俄罗斯数学家的论文,然后推广到n=3的情形,就构造了一个简单的反例。奇怪的是,这个反例,非常非常简单,简单到似乎用计算机进行暴力搜索应该也能找到。如果把这层窗户纸捅破,甚至用手算都能构造出来。这个俄罗斯数学家,实在太可惜了,就差一步,就能拿到这个大成果了。当时他要是解出来了,那菲尔兹奖问题不是很大。既然以前计算机找不到,只能说明找的过程,需要的算力极大,没想的那么简单。用上大模型之后,就轻松找到了。说明大模型相比传统的计算机方法,还是有过人之处的。这个猜想,坑了张益唐,也坑了张益唐的导师。张益唐的博士论文就是讲这个的,只是讲的是n=2的情形。由于在论文中引用了他导师的一个引理,导致结论是错误了。但是所在大学认为张益唐在这个过程中已经体现了高超的水准,还是给了他博士学位。他导师估计是觉得丢脸了,都没给他写推荐信,那么张益唐就找不到教职,后来去赛百味打工了。其实张的导师更惨,一辈子花了大量精力搞这个方面的研究,现在证明几乎白费了。而张后面在孪生素数猜想上取得了重大突破。如果AI早出来,证伪了雅可比猜想,那么张益唐就没必要把时间浪费在这个上面了。因为证伪的反例,是如此的简单,才让人觉得可惜。这一届菲尔兹奖,可能是最后一届不用AI的菲尔兹奖了。后面数学家,除了纸和笔,还需要token,这也有个好处,可以申请预算了。所以,能用AI,尽量用起来,说不定耗尽你一生精力的难题,AI两下三下就解决了。

4. 【AI接连证伪百年数学猜想,却难发明新理论,世界模型能否补齐短板?】7 月 29 日,三位美国数学家在 arXiv 上传了一篇四页短文,题为《麦克斯韦猜想是错的》(The Maxwell Conjecture is False)。论文中,他们构造出一个精巧的反例,推翻了这一物理学经典猜想。致谢信息显示,反例构建的核心思路,来自 GPT-5.6 Sol。再早几天,7 月 20 日,Anthropic 一位数论学家宣布借助 Claude Fable 5 推翻雅可比猜想,#陶哲轩# (Terence Tao)随后快速用 ChatGPT 跟进,并公开了验证过程。7 月 24 日,他在国际数学家大会上发表演讲,警示数学界正从“证明稀缺”进入“证明过剩”的时代。在密集涌现的 AI 辅助科学发现浪潮中,一篇写就于 2026 年 1 月、题为《大语言模型无法跳跃》(LLMs can't jump)的立场论文突然被广泛传播,给大众的狂欢泼了盆“冷水”。文章作者是谷歌 DeepMind 研究员、#AlphaProof# 的核心开发者汤姆·扎哈维(Tom Zahava)。他判断,当前的大语言模型在科学发现中缺失溯因推理(abduction)这一关键环节,即在数据稀缺、没有现成框架的情况下提出全新解释性假设的能力。而这,恰恰是从无到有发明新理论所必需的。戳链接查看详情:网页链接

5. AI科研来了,GPT-5.6参与推翻麦克斯韦提出152年的猜想

6. AI不是比人聪明,是输得起,菲尔兹奖得主点破OpenAI十项成果

7. 数学家24小时驳回OpenAI攻破的猜想!“AI证对了每句话,但已不是原猜想”

8. 【#Anthropic挑战黎曼猜想失败#,但意外刷新一项数学纪录】8月11日,Anthropic在社交媒体上表示,一个未发布的研究版Claude尝试攻克黎曼猜想,尽管并未解决黎曼猜想本身,但借助数学家们过去数十年的大量前期研究,Claude将满足黎曼猜想的黎曼ζ函数零点比例的下界从41.6%提升到了67.2%。Anthropic表示,Anthropic的两位数学家研究并验证了Claude的论文,并撰写了一份非正式说明,简洁陈述Claude的证明。“我们不指望Claude所用的技术能最终证明黎曼猜想,但这项工作再次展示了AI模型数学能力进步的速度。”黎曼猜想由德国数学家黎曼于1859提出,是关于黎曼ζ函数零点分布的猜想。黎曼发现,素数分布的奥秘蕴藏在一个特殊的函数之中,也就是黎曼ζ函数。黎曼ζ函数的所有非平凡零点都分布在复平面上一条被称为“临界线”的特殊直线上。但证明黎曼猜想却是一个世纪难题,至今无人能证明或证伪。美国克莱数学研究所2000年公布世界七大数学难题,并为每个难题设立100万美元奖金,黎曼猜想便是其中之一。不过,数学家们在研究黎曼ζ函数及其零点的相关方向上取得了进展,其中之一就是量化位于该直线上的零点的最小比例并提高到41.6%。网页链接

9. 突发,Claude首破黎曼猜想新纪录!

10. AI宣布森多夫猜想告破!陶哲轩发现它隐藏的更强结果

11. #OpenAI数学翻车##陶哲轩早有预警##AI证对了一切却答错了题#今天科技圈最戏剧的一幕:OpenAI宣称用推理模型攻破一道80年悬而未决的数学猜想,24小时内被数学家亲自下场打回——不是证明错了,是"AI证对了每句话,但已跟原猜想无关"。这比单纯证错更值得警惕。翻车复盘:(1)AI证明的逻辑链每一句形式上...全文

12. #协和医生破解22年数学难题论文被扒#最近一批数学猜想号称被ai解决了,问题是我到现在也没看见这些结果被投稿,以及同行评议的意见,请问怎么就知道证明了呢

13. 菲尔兹奖得主:AI现在主要靠“抬杠”突破重大数学猜想

14. 【#AI接连推翻数学猜想#】AI越来越擅长数学,#普通人还有必要深耕数学吗#?前不久的2026年国际数学家大会,中国数学家王虹、邓煜历史性拿下菲尔兹奖。这一奖项被誉为数学领域“诺贝尔奖”。本届国际数学家大会还深入探讨了一个非常关键的问题:迅猛发展的AI究竟会不会取代数学家?会场外,AI也接连推翻悬置数十年的数学猜想,并在国际奥数赛场交出满分答卷。两个拷问扑面而来:AI真的会彻底取代数学家吗?我们普通人还有没有必要死磕数学?#DeepSeek一天消耗了8万亿# 央视网的微博视频

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章