1300万行代码 11天 Claude把费马大定理交给了机器

2026-09-06 11:08:01 0点赞 0收藏 0评论

一个证了350年的数学猜想,一个AI在11天里证完了。机器把证明一行一行跑通,这在过去要人花好几个月审稿。Anthropic在9月4日公布了这件事。

带头的彭天翼是清华姚班出身,现在在哥伦比亚大学当助理教授,同时做Anthropic的研究员。他跟合作者搭了个数学形式化平台Prove2Me。他原本只想测一下,Claude能不能把这项工程往前推一截。结果很快超出他的预期。

用的模型能力大致相当于Claude Fable 5.1,是Anthropic内部的通用研究模型,不是对外卖的API版本。人类给的数学输入很少。Peng偶尔丢一句方向性提示,具体推导主要Claude自己推进。

我把几个数摊开算。生成阶段烧掉约60亿输出token。摊到11天,平均每天5.45亿token滚出来。证明30300个中间定理,29500个进终版。算下来,每证一个定理要写约440行Lean代码。数字全在仓库统计里,没有一句是形容词。我把Anthropic那份公开仓库的构建日志也翻了一遍。95个并行任务、5小时32分那一行,我反复看了好几遍。这些数不是谁拍脑袋写的,是机器跑完留下的脚印。

几十个智能体怎么不打架

早期实验里,多个Claude智能体各自证各自的,很快失去对全局进度的掌握。它们不知道哪些命题已经证完,也很难复用彼此的结果,协作直接停摆。最终证明里大约7%的非模板代码,就是这些失败尝试留下的。

1300万行代码 11天 Claude把费马大定理交给了机器

转折点是一个叫Prove2Me的平台。它把待证定理排成一张有向无环图,每个节点是一项任务,节点之间记着依赖关系。定理的陈述一旦提交就固定,证明可以换一个智能体接着写。一个智能体证明只要A、B、C成立,D就成立,另外三个去啃A、B、C。前一个交出来的是Lean已经检查过的逻辑连接,不只是一份自然语言计划。

这套拆分能反复进行。对一份包含数万项中间结果的工程,搜已有成果、避免重复劳动,和继续生成代码同样关键。11天,350年。这两个数摆在一起,有点不真实。

形式化这件事本身值得说清楚。人写的数学证明是给人看的,会省略读者能自己补的步骤,会直接引用别的文献。Lean这种证明助手把核验交给计算机,命题即类型,证明即对象。生成代码的模型可以经常犯错,只要最后那道检查环节可靠,错的东西就进不了终版。费马大定理难,难在要把极长的推理链和它依赖的数学知识一起放进这个系统。350年。终于有人把关卡打通了。又一代数学家没来,来的是一群不会累的智能体。

留下来的不止一个证明

最终证明只依赖Lean的三条标准公理,没有偷偷用那个叫sorry的占位符把缺口糊弄过去。一次完整构建用了96个并行任务,耗时约5小时32分,内存峰值153GB。单独做一致性核验又花了接近15小时,内存峰值230GB。规模超过Mathlib社区数学库的5倍。

但1300万行也把当前方法的短板亮了出来。Mathlib经过多年人工整理,代码紧凑、审查充分。Claude生成的证明大概率比实际需要的长得多。它先解决了能不能完整验证,离简洁、优雅、方便人读还有很大空间。

1300万行代码 11天 Claude把费马大定理交给了机器

我的判断是,这件事要紧的地方不在AI会不会做数学。验证权第一次大规模交给了机器。过去一个证明对不对,靠几个顶尖人类花几个月审。现在靠Lean一行行查,公司自己跑核验。Buzzard收到那封邮件时正在威尔士音乐节,手机信号很差,一周后才看见。他编译运行,确认检查通过。

这跟我当年推ERP看到的情形有点像。系统上线前,流程对不对全靠老师傅拍胸脯。上线后改一行配置要三方签字、灰度一周、写回滚预案。机器检查把拍胸脯换成了可重复的证据。费马大定理这一步,数学界迈过去了。

Anthropic没公布这次实验的总成本,也没给出对照实验说明比人工省了多少。11天之后留下来的,是一份机器能检查的证明,和一个还没人收拾的庞大代码库。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松