陶哲轩启动"开放数学模型计划":公告里一个模型参数都没有,3条规则+5个空格才是"数学2.0"的真议程

源自276位全网作者

14:36

9 月 18 日,陶哲轩在个人博客发了一篇公告:他参与创立的非营利机构 SAIR 基金会,正式启动"开放数学模型计划"(Open Math Model Initiative),要联合数学界和产业界,为数学和基础科学研究做一套开源、开放权重的模型。量子位

公告发出两天内,转发和争论一起涌进来,最集中的质疑就两条:这不就是"大号版开源声明"吗?模型呢?

第二个问题,恰恰是读懂这件事的钥匙——这是一条没有模型的发布。公告里没有架构、没有参数规模、没有训练时间表,连 SAIR 此前办的"数学蒸馏挑战赛"的成绩都没当主打。陶哲轩自己在声明里交代了原因:团队原本计划未来几个月先跑几个小规模试点,再逐步扩大,但考虑到"近期发生的一系列事件"和学界对开放科学模型的需求,他们决定把宣布提前,“尽管部分关键规划仍在推进之中”。DeepTech深科技

一句话定性:9 月 18 日发布的不是产品,是一份规则草案。而数学圈这两个月吵的所有事,最后争的都是这份草案里的东西。

先把这两周的牌局摆回桌上

对没完整跟下来的读者,这条时间线只需要记四个点:

  • 9 月 8 日,OpenAI 方面宣称其未发布的内部模型率领约一万个 AI 智能体并行工作约 88 小时,为纳维-斯托克斯方程(N-S 方程)找到了一个"爆破"反例——一个不断向内旋转、核心持续收缩拉长的涡旋,随即"攻克千禧年难题"的说法刷屏。中国新闻周刊

  • 9 月 11 日,陶哲轩、邓煜等 25 位菲尔兹奖得主联名发表《数学领域中人工智能的严重失衡》,反对把"解了多少著名难题"当作模型能力的标尺。 同一天,陶哲轩在加州理工 SciencexAI 峰会的主题演讲里预告了开放数学模型计划。中国新闻网哔哩哔哩

  • 9 月 15 日,前 OpenAI 后训练负责人 Liam Fedus 公开回应联名信:赞同"要重视理解",但认为数学家"可能还是太小瞧 AI 了";

  • 9 月 18 日,SAIR 公告落地,即日起向全球征集资金、算力、专业经验和社区建设四方面的合作伙伴,意向可在公告页面底部登记,合作邮箱 collaboration@sair.foundation,讨论区开在 Zulip 上。量子位

陶哲轩启动

值得注意的是最后两个点的组合:一个刚把 OpenAI 的外部数学家顾问组向公众说清楚的当事人,转身启动了一个明确写着"不依附于任何大型 AI 公司"的自建计划。很多人第一眼觉得这是"分裂",其实三件事指向同一个目标——把定义权拿回数学共同体手里。

公告里的三条规则,才是这条新闻的本体

把英文原文对照下来,SAIR 这份计划真正的干货是三条可执行的原则:

第一条:模型由社区塑造。 训练什么、测什么、怎么服务科研和教学,由研究者参与决定;模型要能被检视、修改、独立运行,开发由"共同的科学优先事项"引导,而不是由发布节奏引导。公告原文还专门写了一句:欢迎跨越机构、地域与职业阶段的参与——潜台词很清楚,它不想只对名校教授开放。

第二条:数据归数学界自己所有。 这是全文最硬的一条:未经研究者明确同意、没有提前约定用途的数据,不进入训练集;论文、私人通信、研究笔记、正在推进中的证明,共享与否由研究者自己决定。模型、代码与工具按 Apache 2.0、MIT 或 CC BY 4.0 这类开放许可共享,联合开发的权属、许可与署名"从一开始就与贡献者约定",研究者保留既有独立成果的权属,并把思想贡献写进署名。

第三条:评价标准换掉。 不看基准榜正确率,改看三个指标:日常科研中辅助是否足够可靠、输出能否留下可重复可检查的验证过程、长期使用成本普通大学和研究机构扛不扛得住。模型发布时必须同时报告失败案例和能力边界,而不是只宣传成功。DeepTech深科技

三条合起来看,它反对的不是 AI 做数学,而是过去两个月大家熟悉的那套玩法:拿一万个智能体跑 88 小时,砸出一道千禧年难题,发新闻稿,再被质疑"证明没人看得懂、没人来得及审"。

第一阶段为什么专门挑"脏活"

开放数学模型计划的首阶段任务清单,说出来会让围观群众失望:不是攻克哪个猜想,而是理解艰深论证、核对文献、探索算例与反例、编写计算实验代码、把自然语言证明翻译成 Lean 4 等形式化工具能检查的代码。

这个选择背后是陶在 9 月 11 日峰会上给出的框架。他把数学与 AI 的协作拆成三个环节:证明生成、证明验证、证明消化。前两个环节正在被 AI 以远超第三个的速度自动化——证明被生成出来,甚至被机器验证通过,但没有人真正读懂它、把它接入既有的知识网络。他给这种状态起的名字很直白:proof indigestion,证明消化不良。微博

理解了这个词,再看 SAIR 之前那场已经有超千人参加的"数学蒸馏挑战赛"就通了。 比赛要求的不是让 AI 生成更长的推理链,而是把机器产出的大量推演压缩成数学家真正能读、能检查的证明文本,后续阶段还要通过 Lean 4 验证。 生成能力是大厂的主场,消化能力才是数学共同体缺的那块——开放数学模型计划从第一天起就没打算在别人的主场打比赛。DeepTech深科技

陶哲轩启动

五个空格:这条公告没说、但你必须知道的事

判断一个计划是宣言还是实事,最好的办法是把没公布的东西列出来。目前这份公告至少有五个空格:

  1. 模型架构与参数规模:没有;

  2. 训练与发布时间表:没有,原定的试点计划被宣布本身替代了;

  3. 预算与算力规模:没有;

  4. 第一批合作机构名单:没有,仍在征集意向;

  5. 具体评测基准怎么设计:公告给了指标方向,没有细则。

社区里的质疑也都打在这几个空格上,值得如实摆出来:

  • 算力现实:大型实验室可以为一道题投入数以万计的 GPU 和巨额推理成本,非营利机构很难复制这种规模。SAIR 的运营资源此前主要靠播客、短期活动和竞赛撑着,公告里能点名的资助方是刚赞助了下一轮竞赛的 XTX Markets——一家量化交易公司。 "不依附大型 AI 公司"是真的,"背靠单一金融资本"也是真的。量子位

  • "教授玩具"风险:知乎上讨论"陶透露正在洽谈数学大模型合作"的问题下,有研究者提醒,这类计划若只停留在小部分教授之间,就会沦为自嗨——上一波学术形式化工具的教训就在眼前。知乎

  • 反对派的声音:别忘了另一侧也有高赞。"AI 正杀死数学开放传统"的知乎问题下,381 赞同的回答反过来说:没有这轮 AI 冲击,形式化验证还没这么受重视。 “数学家批量抵制 AI"被另一部分人看成"卢德分子”。这场争论没有共识,只有阵营在积累证据。知乎

证据覆盖到这里为止——以下判断是待观察清单,不是结论:这件事成色的第一个验证节点,是公告承诺的"近期更多更新",尤其是合作伙伴名单和首批试点;如果两三个月后只有博客更新、没有算力和机构落地,它就停在宣言层;反之,一旦有大学或机构把研究数据签进"明确同意"条款,规则就真的开始跑。

三类人怎么用这条信息

  • 研究生/青年科研工作者:这是唯一一条和你的手稿有直接关系的信息。数据同意、来源可追溯、输出可验证这三条原则,正在被工具化——公告发出两天内,已有第三方开发者做出开源的"AI 行为见证层"。 发草稿给任何模型前先在本地算指纹、按厂商分别记录"是否允许用我的数据训练"、调用记录导出可离线核验的证据链。工具能证明"某个时点这份东西确实存在、这次调用发生了什么",不能证明"某厂商读了你的内容"。把它当记账工具用,别当法律武器用。知乎

  • 用 AI 学数学的人:这个计划短期内不会给你提供任何新模型,别等。但"拿到答案,然后呢,你学会了什么"这个消化问题,明天就能用:让 AI 给完证明后自己重写一遍中间步骤、把它的跳步标出来,比多问一道题有用。联名信吵两个月,落到个人层面的启示就这一条。

  • 围观 AI×数学这场仗的读者:不用在"AI 已击穿数学"和"数学家抵制进步"之间选边。看三个信号就够:OpenAI 那批"雪藏证明"的发布决定、顾问组"谁来审"的结果、SAIR 的合作名单。这三件事会互相校准。

陶哲轩启动

陶哲轩把这套设想叫 Math 2.0。这个名字容易被当成口号,但它其实说得很准:1.0 时代,研究者是别人造好的工具的用户——大厂决定训练什么、测什么,学者调整自己去适配;2.0 想改的是顺序本身。公告里连一个参数都没给,恰恰是对的——如果顺序真能换过来,规则本来就该比模型先到。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章