当前位置:
AIGC文章详情

Lean之父说他不再写测试了:验证成本从20人年压到一周后,谁该现在入坑

源自21位全网作者

17:30

上周,一篇访谈整理在形式化圈子里传开了。Lean 和 Z3 的创造者 Leonardo de Moura 在播客里说:“我已经不再写测试了。我写性质,然后 AI 替我证明。”知乎

比这句话更扎眼的是他给的两个数字。一个是旧世界的标杆:完全形式化验证的微内核 seL4,只有大约 8700 行 C 代码,验证花了约 20 人年,算下来每行代码的验证成本约 350 美元。另一个是新世界的样本:他的同事 Kim Morrison 用 AI 把 C 语言压缩库 zlib 翻译成 Lean 并完成全部验证——包括证明"压缩后再解压一定能恢复原始数据"——整个过程大约一周,仓库里 1100 多条定理、约 32000 行证明代码,没有一个留坑的占位符。知乎

从 20 人年到一周,这不是效率提升,是成本结构变了。

Lean之父说他不再写测试了:验证成本从20人年压到一周后,谁该现在入坑

先看看这一年到底发生了什么

伏笔其实埋了两年。2024 年,DeepMind 的 AlphaProof 用 Lean 拿下国际数学奥林匹克(IMO)银牌;2025 年,Harmonic 的 Aristotle 和字节的 Seed-Prover 都做到金牌水平。知乎de Moura 说自己几年前认为 IMO 金牌不可能,“现在大家把它当成简单问题的基准”。

到了今年,节奏明显加快。5 月,OpenAI 宣布其模型反驳了 Erdős 的单位距离猜想,Lean 社区随即发布形式化挑战,OpenAI 的 Boris Alexeev 用大约两周完成完整形式化,含依赖库约 100 万行代码。知乎8 月 1 日,OpenAI 的 Astra 模型又拿出 10 个横跨 8 个领域的开放问题,每个都带 Lean 4 证明证书。哔哩哔哩

数学界的态度也在转弯。菲尔兹奖得主 Scholze 曾把自己都不确定对错的重要结果交给 Lean 社区验证;陶哲轩第一次用完说"我大概不会再用了",一周后开了第二个项目。知乎今年 3 月他发布 26 分钟实操视频,演示用 Claude Code 在 Lean 里做证明,中途两度因为 token 不够用宕机。麻省理工科技评论去年 9 月,一个叫 Gauss 的 AI 用三周在 Lean 中形式化了强素数定理,而陶哲轩手工推进 18 个月才到一半。量子位

Lean之父说他不再写测试了:验证成本从20人年压到一周后,谁该现在入坑

AI 真正打掉的是维护成本,不是证明成本

很多人的第一反应是:AI 变得这么会证题了?de Moura 的回答更有意思:写证明从来不是最痛苦的部分,维护才是。

可以把形式化验证理解成一套极端严格的测试:程序每改一次,对应的证明就得跟着修。代码天天在变,证明天天在断,而且修证明比修测试难——你可能早忘了当初为什么这么证。过去形式化验证的总成本大约是开发成本的 10 倍,大头就堆在这个环节。知乎而"按新约束重写证明"恰恰是 AI 的舒适区:de Moura 说自己让 AI 重写一段从没读过、不知道在证什么的证明,只要求避开某个特性,“AI 瞬间给出了新版本”。他对此的总结很直白:我以前以为自己的超能力是能忍受痛苦,现在这个超能力没用了。

顺带被改变的还有规格说明的成本。他的思路是:一个低效的程序本身就可以当规格说明——先用最朴素、最慢、最容易理解的方式写出"我要什么",再让 AI 生成高效版本,并证明两者等价。知乎有了这道等价性关卡,AI 可以放心大胆地优化,因为任何优化都必须过证明这一关。

先泼一盆冷水:Lean 亮绿灯,不等于你证的定理是对的

这周社区恰好演示了一遍坑在哪。

7 月底,知乎出现一个提问:"我们在 Lean4 重建了一座数学大厦并形式化了广义黎曼假设,请问大家能否找出逻辑漏洞?“高赞回答直接开拆:24 个未解决目标、一堆语法错误、不用官方维护的 mathlib 而是自定义公理系统,证明里还混着两套没对齐的"相等”。知乎这样的"证明"乍看气势恢宏,实际证的根本不是你以为的那个黎曼假设。8 月初"AI 证伪百年猜想被打假"的讨论里,被翻出来的也是同一个问题。

这就是形式化验证最要命的坑:Lean 只检查逻辑推演是否自洽,不检查你写的命题是否对应你真正想证的那个定理。定理证对了,题目抄错了,Lean 照样绿灯放行。微博

怀疑的声音也一直存在。8 月中旬还有研究者在小红书写"AI+Lean 在数学上的作用目前被严重夸大"——现阶段训练和评测数据仍要靠人类数学家出题、写答案、审题。小红书de Moura 自己也划了边界:AI 能找到已有问题的新证明路径、能反驳猜想,但到目前为止,没有证据表明它能提出新的数学概念。知乎门槛在降,判断力的门槛没降。

那么谁该入坑,谁该再等等

第一类:想走 AI4Math、形式化数学方向的学生——现在入场,时机比以往任何时候都好。 AI 接管了体力活,中文资源也补齐了:Lean-zh 中文社区已译介《Lean4 定理证明》《Lean4 形式化数学》《Lean4 函数式编程》《Lean4 元编程》四本官方教程。知乎路线是现成的:先玩 Natural Number Game(Lean 的网页闯关游戏,不少人反馈上手就上头),再跟《定理证明》打基础,然后进《形式化数学》和 mathlib。

Lean之父说他不再写测试了:验证成本从20人年压到一周后,谁该现在入坑

B 站有"数理基要主义"等手把手更新的中文系列,浙大等高校暑期学校也在开课。哔哩哔哩国内团队同样在出活:北大 AI4Math 团队今年 4 月用自动化框架解决了交换代数开放问题安德森猜想,并完成 Lean 形式化验证。微博

第二类:对软件验证感兴趣的工程师——值得试水,先别上生产。 lean-zip 这个范式(AI 翻译 + AI 验证 + 证明守门下的优化)值得认真跟踪,Aeneas 这类工具已经能把 Rust 代码映射到 Lean,Mistral 也在 7 月开源了专门做 Lean4 证明的模型 Leanstral 1.5。微博招聘端开始有动静:蚂蚁技术研究院的 2027 届校招里出现了"AI+Math-Lean 语言形式化验证"岗位,方向写着 Rust 程序验证、密码学协议验证。微博但对存量生产代码来说,写规格和迁移生态的成本仍然高,适合先在高安全、小规模场景验证手感。

第三类:纯围观的普通程序员——不用急着装环境,把谈资收好。 今年干活还用不上它,但这组数字值得记住:IMO 从银牌到金牌、验证成本从 20 人年到一周、百万行形式化两周完成。想低成本参与,可以花一个下午玩玩 Natural Number Game,体验一下"用类型把算术证出来"是什么感觉。

Lean之父说他不再写测试了:验证成本从20人年压到一周后,谁该现在入坑

最后留三个值得持续盯的信号:一是会不会出现更多像 lean-zip 这样的生产级验证案例;二是跨证明器翻译的进展——7 月底发布的 ITPEval 基准显示,LLM 在 Lean4、Rocq、Isabelle、HOL Light 四大证明器之间翻译定理语句,成功率最高只有 29.1%,空间巨大。哔哩哔哩三是 Lean 社区挑战平台上"要求 AI 自己构造数学对象"的题目被推到哪一步。这三条线动得比大众认知快。

内容由AI生成

精选参考来源

1. Lean和Z3的创造者:形式化验证的痛苦正在消失,让AI证明、让机器验证

2. 我们在lean4重建了一座数学大厦并形式化了广义黎曼假设,请问大家能否找出逻辑漏洞,进而推翻它吗?

3. [Lean-zh] Lean 4 中文社区欢迎你

4. 【陶哲轩用ClaudeCode解题,两度宕机,因为token不够用】近日,菲尔兹奖得主、#加州大学洛杉矶分校#(UCLA)数学系教授陶哲轩(TerenceTao)在YouTube发布了一段时长约26分钟的实操视频,详细演示了如何利用Anthropic推出的ClaudeCode代理工具,在Lean定理证明器中完成一项数学证明的...全文

5. #AI高斯VS陶哲轩大获全胜#一个叫高斯的AI,只用了三周,就完成了在Lean中形式化强素数定理(PrimeNumberTheorem),而陶哲轩花了18个月,进度卡在一半。高斯又是怎么做到的?#数学##陶哲轩##Gauss##形式化数学##Lean##AI#量子位的微博视频

6. 【计算机真的不能解决吗?】“Lean能确认的只有一件事:代码编译通过,形式逻辑无误。但它绝不验证一个更要命的问题:这段形式化陈述,真的对应你想证的那个定理吗?定理证对了,题目抄错了,Lean照样绿灯放行。而这个对齐问题,没法纯靠计算机解决。”AI证伪百年数学猜想被打假!Lean证明惊现漏洞...全文

7. 网页链接安德森猜想被攻克!国内首次实现AI自主解决数学开放问题关键词数学+AI北京大学北京国际数学研究中心董彬教授课题组与合作者组建的AI4Math团队用自主构建的自动化AI框架解决了交换代数中一个开放问题——安德森猜想,并在用于形式化验证数学定理正确性的编程语言和定理证明器...全文

8. 【Mistral开源Leanstral1.5定理证明模型】MistralAI宣布推出针对Lean4形式化证明的开源模型Leanstral1.5,总参数量1190亿、激活参数约65亿,支持最高25.6万token的上下文长度。官方数据显示,Leanstral1.5在多项数学逻辑基准测试中刷新了纪录,展现出较强的推理能力:-在...全文

9. 蚂蚁技术研究院形式化方法小组,2027届校招职位,AI+Math-Lean语言形式化验证(网页链接)。LLM在基于Lean的数学定理证明方向进步神速,我们期望研究Lean迁移到其他形式化验证领域的可行性,例如Rust程序验证、密码学协议验证、神经符号融合的AI架构等。有相关背景的同学,欢迎投递...全文

10. AI + Lean在数学上作用目前被严重夸大

11. OpenAI开源十个数学进展的Lean4形式化证明

12. 手把手教你学lean4第一集:lean4安装与界面

13. ITPEval:跨定理证明器翻译基准

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章