9月8日,OpenAI 官宣:一个未发布的内部模型驱动约1万个智能体,88小时、约1300亿输出 token、约1500万美元,"解决"了纳维-斯托克斯方程存在性与光滑性问题——七大千禧年难题之一,此前人类只解决过庞加莱猜想。微博·智东西微博·人物
三周后风向全变:25位菲尔兹奖得主联名抗议,纽约大学数学家公开指控 OpenAI 施压撤署名;9月29日,o1 核心作者、人称"OpenAI推理之父"的 Noam Brown 说出最有分量的一句——这道千禧年难题的突破,10000个 Agent 最多占了10%的功劳。36氪
官方最性感的叙事,被自己人当场拆台。这25天发生了什么,一篇捋完——接下来几个月,"AI攻克XX难题"还会一轮一轮地来,看懂这一轮,后面的你都会看了。

一、先把时间线捋直:25天,三次反转
9月8-9日:官宣与对峙。 OpenAI 公布数字几小时后,纽大数学家 Tristan Buckmaster 发布声明。两边叙事对不上:OpenAI 说9月1日听到"两个千禧年问题被解决"的传言才启动评估,还主动提联合发布、承认优先权;Buckmaster 的版本是——他和在 Anthropic 工作的合作者 Levent Alpöge 整个8月都在攻这个问题、且用过 OpenAI 的 Codex,OpenAI 得知进展后沿同一条路线冲刺,抢在他们前面发。他怀疑自己的数据被用于训练,OpenAI 否认访问用户数据,但留下一句耐人寻味的话:无法排除去标识化数据帮助改进了模型。微博·宝玉
更炸裂的是谈判细节:OpenAI 数学负责人 Bubeck 向 Buckmaster 开出条件——你可以先发、可以当 OpenAI 论文一作、给算力、甚至分你一百万美元奖金的一部分,条件是把合作者 Alpöge 从论文上拿掉,只因为他在 Anthropic 工作。 Buckmaster 拒绝后,被反问"你为什么要毁掉自己的职业生涯"。OpenAI 声明里,也没有提这套爆破策略真正的奠基者——西班牙数学家 Córdoba 和 Martínez-Zoroa。钛媒体
9月11日: 陶哲轩、邓煜、舒尔茨等25位菲尔兹奖得主联合发表《人工智能在数学中的严重错位》。微博·人物
9月下旬-10月3日: 竞速全面开花:Claude 被曝刷新物理学纪录;OpenAI 再发博客宣称24天攻破100多个世界级难题;10月3日 Meta 放出六篇 AI 合作论文;同一天 arXiv 限流新规刚跑第一周。哔哩哔哩
二、到底证明了什么?大多数转帖都没说清
OpenAI 内部模型给出的是一个解析构造:三维不可压缩流体在光滑外力下,可以从光滑初始状态在有限时间内形成奇点(速度趋于无穷、能量保持有限),对应千禧年问题 Fefferman 表述中的 C、D 两项——注意,证明的是"会坏"而不是"全局光滑",跟"AI证明流体力学没问题"的直觉正好相反。顺带还宣称解决了无外力 Euler 方程——Buckmaster 们做的是带外力的版本,若成立这是严格更强的结果。微博·宝玉
全程:约1万个 Agent 分组并发、互相通信270万条消息,NS 的解88小时后到达,GPT-6 Astra 花17小时完成 Lean 形式化;"顺带"的 Euler 是约100个 Agent 当热身题50小时做出来的。微博·宝玉

165页论文和形式化代码都在 GitHub。但三件事没完成:外部数学家还没独立跑完验证;Clay 规则要求的期刊发表+两年审查还没开始(OpenAI 自己表态不打算领那100万美元);数据使用疑问没有被回答。微博·宝玉
三、被误读最深的,恰恰是"功劳不到10%"
很多帖子把 Brown 这句话读成"OpenAI 自己承认突破是假的"。恰恰相反。这场长访谈里,他否定的是"万Agent军团"这套叙事,而不是结果本身:
他直说:我们并没有测量过1万个Agent的协调究竟有多有效,手上没有足够扎实的测量结果,能说出1万个比2000个快一倍这类结论。 他甚至认为,1 万个人的协调能力比 1 万个 Agent 更强,也完全有可能。36氪
但他同样承认数学进展"比我预期更快":按人类专家解题时间折算,模型能胜任的难度每年翻十倍(GSM8K的5秒→MATH的1分钟→AIME的10分钟→IMO金牌的1.5小时),他原以为千禧年级别要2028年——解题两周前,还有同行押他1000美元"2027年底前做不到";
他的真实判断:数学的瓶颈是纯粹的思考,而这恰好是模型最强的部分;Euler"热身题"的意外收获说明,强的是模型推理能力,Agent 军团更接近算力堆法的包装。
一句话:官方卖的是"军团协作",自家研究员说功臣是"单体暴力"。
四、数学家抗议的不是"AI解题",是"当KPI解题"
联名信承认 AI 有加速数学的潜力,火力集中在"把解题当基准测试":“解决方案往往仓促发布,根本没有时间充分撰写、提炼新方法、引用他人工作”,并警告"和所有创意行业一样,这引发了严重的归属与抄袭问题"。加州理工的数学家们称之为"粗糙的数学":AI 宣称解决,人类数学家免费验证、修正、有时还要公开驳斥,“没有报酬、没有署名、没有得到承认”。陶哲轩早在一个多月前的国际数学家大会上就说过"数学不能再这样下去"。钛媒体
OpenAI 研究负责人 Dan Roberts 的回应是:我们意识到会有颠覆性影响,希望与数学界进行更多交流。 但行动则很诚实:一边撤回对加州理工数学活动的赞助,一边继续发下一个"攻克100+难题"的喜报。钛媒体
五、顺便算一笔成本账
1万个 Agent、88小时、1300亿输出 token、约1500万美元,换来一道90年没解动的题——对顶级人才梯队来说是白菜价。OpenAI 内部同样在燃烧:Brown 披露,截至8月初,内部 Codex 支出最高的那1%研究员,人均每天花7000-8000美元。 他预估内部加速带来3倍提速已是"天翻地覆",明确不信"一夜之间快100倍的智能爆炸"——瓶颈是串行跑实验和 GPU,不是聪明程度。36氪
当解一道世纪难题的成本降到一间中型办公室一年的云账单,问题就不再是"AI行不行",而是学术共同体怎么消化这个产能。

六、下次再看到"AI攻克",先过这五问
这轮风波最大的实用价值是一套判断模板。下一轮"攻克"公告大概率在 Q4,先过这五条:
验证时钟:有没有外部数学家实际跑过形式化证明?期刊投稿了吗(Clay 要求两年审查)?
引用名单:参考文献认不认人类的在先工作?不提 Córdoba 们的团队,就要多问一句它从谁的路线图上抄的近道;
功劳口径:军团数字是官方通稿,还是自家研究员访谈愿意认的?Brown 那句"最多10%"是现成的照妖镜;
数据边界:有没有"无法排除用用户数据训练"这类留活口的表述?
基建温度:arXiv 9月收到40363篇投稿创历史新高、10月1日起每账号月限2篇、300名志愿审核扛不住了——发布系统开始报警的时候,才是这场军备竞赛真实的水温计。36氪
至于"孩子还要不要学数学"这类9月冲上热搜的问题,Brown 给了目前最诚实的答案:AI 在某些维度远胜人类,在另外一些维度——提出新问题、判断哪个方向值得做——仍然明显弱于人。尖峰还在继续变尖,但长尾没消失。这场风波里唯一确定的是:千禧年难题的评审时钟还没开始走,而我们判断"AI突破"的时钟,最好现在就调准。