9月28日开始,知乎上"如何看待北京大学数学教授刘济豪发布未经验证的AI生成文章引发争议"这个问题一直热到今天。时间点很微妙:过去两个月,陶哲轩刚带着24位菲尔兹奖得主发完公开信、启动完SAIR开放数学模型计划,全球都在吵"AI生成的数学论文谁来验证"。国内这边,真有人把"还没验证"的AI论文挂上了网。
一路追着陶哲轩这条线的读者,大概率想问同一个问题:刘济豪是在踩陶哲轩划的红线吗?把两篇文本放在一起读完,你会发现他们其实在答同一道题,只是给出的解法不同。
先把这条时间线铺全:大多数人只看到了最后一环
5月,arXiv代数几何板块出现一批署名刘济豪的论文,共7篇以上,每篇末尾都老老实实写了"Use of generative AI"披露小节;核查它的知乎答主注意到,他们的系统跑了12小时。当时舆论的口径还是"AI生成、人类检查"。知乎
同一周的5月21日,《自然》杂志发专题报道,头条案例正是北大AI4MATH团队——文再文、刘若川、董彬、肖梁几人。他们牵头研发的AI系统Rethlas-Archon,在全自动、无人类参与的条件下,否定了交换代数领域悬置十余年的Anderson猜想,并完成近两万行Lean 4形式化验证。注意这条路线的特点:验证直接交给计算机逐行检查。今日头条
8月,刘济豪与董彬、高国雄合作的预印本构造出丘成桐-田刚-唐纳森(YTD)猜想的反例,推翻的是Donaldson 2002年的原始版本(不影响已被证明的Fano情形)。按知乎核稿人赵泠的梳理,这篇预印本里的88个核心事实有82个是人工智能证明的,改进版的多智能体系统Danus在只拿到原始问题、没有任何此前发现的情况下,运行5小时29分就独立复现了反例。知乎
9月11日,陶哲轩、邓煜等25位菲尔兹奖得主联合发表公开信《人工智能在数学中的严重错位》。一周后的9月18日,陶哲轩在个人博客宣布由其参与创立的SAIR基金会正式启动"开放数学模型计划",第一步不冲解题,而是帮数学家消化证明。微博今日头条
9月28日,就是这次的争议。评论区有参与者辨析:刘老师没挂出来啊,他只是放在个人主页上的。也就是说,这轮论文没走arXiv、没走期刊,先出现在个人主页上——并且"未经验证"的状态是明说的。知乎
争议真正吵的:不是"该不该用AI",是"验证的债记在谁头上"
翻下来,评论区的火力集中在三点。一种是有道理的技术质疑:有网友认为这套系统只是在热门编码智能体外套了一层流程管理的壳,学术含量被夸大了。知乎
一种是利益结构分析:提前挂出论文就是在宣称此问题已解决,向全网相关研究者发起挑战——有人去验,验对了作者共享成果;验出漏洞(大概率事件)就浪费检查者的精力,而这份精力本该是作者自己的成本;没人愿意验,投稿时就没人肯审稿。这位网友半开玩笑地下了结论:我单方面宣布数学研究生的好日子到头了。知乎
还有一种最朴素的:不经过检查就乱发,确实不对。
这三个方向,恰好都对上了陶哲轩过去两个月说的话。陶哲轩的原话是:数学家的成果验证能力已供不应求。他还打过一个比方:数学家原本行驶在专为行人和马车修建的老旧道路上,如今AI开着更大更快的车驶入同一条路,交通堵塞和事故几乎不可避免。刘济豪这次风波,等于国内第一次在这条路上演"追尾现场"。今日头条
两篇文本对照读:一个在改路,一个在写交规
风波爆发后,知乎流传出刘济豪团队研究准则的长文,几乎可以当成陶哲轩主张的"中国落地版"来对照。
共同点一:验证责任必须是人。 陶哲轩坚持证明要写得人类可读、要被共同体消化接纳才算完成产出流程;刘济豪的团队准则把责任切成三层——想法来源由人主导、执行可以大量交给AI、署名作者必须对最终论文兜底:“Provenance 可以由人主导,Execution 可以由人与 AI 共同完成,而 Responsibility 必须最终由作者承担”,并补了一句AI不能承担作者责任。一个是社区基建派,一个是团队自律派,回答的却是同一个问题。知乎
共同点二:都反对把数学当竞赛。 陶哲轩批评不少AI玩家把数学当竞技赛事、只追解题数量。刘济豪的准则白纸黑字写着:AI时代证明一个定理本身正在变得越来越便宜,不能再把"这个问题能不能做出来"作为主要选题标准。准则里还给了立项五问:核心贡献是不是新的数学思想、别人即使拿到最终定理也不容易复制整个研究框架、做完能不能自然产生下一批重要问题、是不是会被多团队同时抢跑。两处几乎是同一个意思的两种说法。今日头条知乎
刘济豪多走了一步:署名测试。 每篇准备投稿的论文,作者要能在不看原稿、不靠AI的情况下在黑板上讲清主要定理,数月后仍能重建证明路线。这正好接住陶哲轩那句打趣——“真希望AI模型先去读完研究生”:陶哲轩要AI学会人类训练出来的判断力,刘济豪则先把这份判断力变成作者自己的自检程序。一个在改路,一个在写交规,说的其实是同一条路。知乎
接下来半年,普通人读"AI数学论文"就看这四个信号
验证有没有进计算机。 给不给Lean形式化证据(比如北大AI4MATH那近两万行的做法),只交自然语言证明的先存疑。
披露颗粒度。 敢写"88个核心事实里82个由AI证明"的,比只写"使用了AI辅助润色"的可信;后者往往在藏。
挂在哪、谁在读。 个人主页、arXiv、同行评审中,是三个不同的信用档级。这次争议之所以炸,就炸在"主页直挂+未验证"的组合上。
别看"攻克某某难题"的标题,看社区验证进展。 反例、勘误、独立复现出现之前,所有结论都是期货。陶哲轩在菲尔兹颁奖现场其实已经把话说透:一个猜想是不是真的,和你希不希望它是真的,是两回事。知乎
值得继续盯的信号:刘济豪这轮论文有没有期刊敢接、社区验证结果、SAIR的消化型工具会不会用在这类论文的审查流程上、以及那套"AI被广泛使用"的披露模板会不会成为事实标准。
最后补一句公道话:陶哲轩那25人联署并不是要拦AI,他们担心的是数学研究原本重视的理解、解释、知识积累和学术协作,可能会被解题速度挤到一旁。刘济豪的爆雷把这场全球论战拽回了国内:陶哲轩说路上会出事,第一起事故真来了——只不过刘本人大概不觉得车有问题,他把责任交还给司机。改路和写交规的两篇文本,值得钉在同一面墙上对照读;谁的定义会成为AI数学论文的验收标准,半年后见分晓。知乎