OpenAI新模型破10道数学难题,成本仅两千美元
源自44位全网作者
12:32
精选参考来源
1
互联网技术【249页PDF、10项成果、2000美元——OpenAI这一炸,数学界的"人类中心主义"开始塌方】2026年8月1日,OpenAI在官网挂出一篇249页的论文,标题平实得近乎克制:《Ten advances in mathematics and theoretical computer science》。但内容一点都不克制——一个尚未发布的内部模型"Astra",在10个横跨八大领域的数学与理论计算机科学难题上同时给出突破性结果,每项都附带Lean 4形式化证书,解题词元成本总计约2000美元。新智元那篇《突发!OpenAI下一代AI攻克10项菲尔兹奖级难题》的标题够炸,但"菲尔兹奖级"这五个字是媒体加速,不是OpenAI自己的说法。真正的故事比"菲尔兹奖级"更刺激,也更值得冷静拆解——这不是AI拿了十个奖,这是AI在数学这个"人类心智最后圣地"上,完成了一次跨领域的、可机器验证的、成本约为一部iPhone的原创研究突袭。 第一层:十个结果是什么——一份"跨领域降维打击"的清单OpenAI官方列出的十项,覆盖高维几何、编码理论、群论、算子代数、算术电路复杂度、量子复杂度、格密码学、极值组合学八大领域:1. 高维球体堆积:首次将Cohn-Elkies线性规划方法的渐近强度精确算出,把一般堆积密度的上界收紧到该阈值——这是1978年以来该领域第一个一般性改进2. 二进制与球面码:在任意给定最小距离下,对二进制码最大规模的界限做出指数级改进3. 非Sofic群:构造出无限有限呈现的非Sofic群,27年来首次回答Gromov 1999年提出的"所有可数群都是Sofic吗"这个群论核心问题4. Connes刚性猜想证伪:不止一个反例,而是构造出可数无限的群家族,彼此互不同构但生成的冯·诺依曼代数完全一样5. 算术电路复杂度:对计算积和式的算术电路与公式给出新下界,包含n⁴/log n量级的公式下界6. 量子并行重复:对任意有限双人量子博弈的指数级并行重复定理7. 最近向量问题(CVP):多项式因子硬度近似结果,关联后量子密码学8. Ehrhart体积猜想:在每一维度确定了"质心是唯一内格点"的凸体最大可能体积9. 多色三角形Ramsey数:超指数下界,解决Erdős问题18310. 极值图论猜想:推翻紧致性与退化猜想,解决Erdős问题146和180 这十个结果里,三类性质完全不同:- 完全解决(非Sofic群存在性、Connes刚性猜想、Ehrhart体积猜想、紧致性与退化猜想)- 渐近确定(球体堆积的Cohn-Elkies方法强度、Ramsey数增长阶)- 界限改进(二进制码、积和式下界、CVP硬度)把它们一概称为"攻克10项菲尔兹奖级难题",是媒体修辞。但即使按最严格的口径——仅"非Sofic群存在性"这一项,就足以在任何数学期刊上发一篇顶级论文;而这是十个结果里的一个。 第二层:为什么这次"可信"——Lean 4证书把"信AI"变成"跑代码"过去所有"AI攻克数学难题"的宣布,都卡在一个死结上:AI生成的证明太长、太复杂,人类审稿人没法在合理时间内验证。这次OpenAI换了个玩法——每个结果都附带Lean 4形式化证书,开源在GitHub上。仓库"openai/ten-proofs"包含:- 10个".lean"文件,对应10个结果- 使用Lean 4.32.0 + mathlib- 配备"lake"构建系统和形式化清单- 第三方开发者拉到本地实测:约47.4万行Lean代码,sorry占位0,自定义axiom 0 这里有个关键的技术常识需要讲清楚:Lean证书通过 ≠ 数学界已接受。Lean能验证的是"在形式系统内,从给定的定义和公理出发,这个证明项具有所声称的类型"——它不能自动保证"形式化语句精确捕捉了数学界原本的问题意图"、"结果的创新性和历史定位准确"。这两件事仍需要人类数学家审计。但即便如此,这次交付的形态依然碾压式地优于以往所有AI数学宣布:- 5月的Erdős单位距离猜想反证:Tim Gowers直言"如果是人类写的投稿到《数学年刊》,我会毫不犹豫推荐接收"- 这次的十个结果:Manchester大学数学家Thomas Bloom评价"作为数学构造,比Erdős单位距离猜想的反证更大"- 美国数学学会Fellow、Rutgers大学Alex Kontorovich:只留了两个惊叹号翻译:数学界顶层的反应不是"质疑AI作弊",而是"震惊到失语"。 第三层:2000美元这个数字的真相与误导"2000美元搞定10个世界级数学难题"——这个数字极具传播力,但需要拆开看: 真实的部分:OpenAI官方说明:在Sol API费率下,找到这十个解所需的词元总成本约2000美元。平均每个问题200美元——确实只相当于"一个研究生一个周末的津贴"。 被掩盖的部分:- 2000美元不含训练成本:Astra作为"下一代主要模型",其训练开销是数十亿级别的,只是被摊销到无数次推理里- 2000美元不含人工整理:OpenAI明确说"论证由模型生成,人类研究员用同一模型协助撰写可读手稿,然后模型再将每个论证形式化为Lean证书"- 2000美元不含形式化工程:47.4万行Lean代码的生成、调试、类型检查,背后是大量工程和算力- Noam Brown的坦白:"我们也尝试过其他重大问题,目前还没有成功解决一个类似黎曼猜想这样的千禧年大奖难题"所以"2000美元"的真正含义是:当一个具备前沿推理能力的模型存在时,边际上探索一个新数学猜想的算力成本,已经降到一部iPhone的价格。这本身就是生产关系级的变革——它改写的不是"AI强不强",是"数学发现的成本结构"。但Noam Brown那句"测试时计算远未封顶"更值得玩味——这意味着2000美元不是下限,是起点。当test-time compute继续往上推,连百万美元级别的世界性难题也可能被啃下。第四层:对数学界意味着什么——"人类心智荣耀"的黄昏?Hinton的预言是"未来10-20年AI可能创造出人类无法理解的新数学",而Astra让这个时间表看起来"太保守了"。但这件事的真正冲击,不在技术层面,在哲学和社会学层面:冲击一|数学发现的生产函数被改写过去:一个菲尔兹奖级成果 = 一个天才数学家 + 10年苦修 + 一篇里程碑论文现在:一个内部模型 + 2000美元词元 + 人类协助整理 = 10个跨领域突破稀缺资源从"人类天才"切换到"问题选择能力 + 计算预算"冲击二|"原创性"概念的重构OpenAI在公告里专门讲了署名伦理:"一份完全由AI系统生成的证明如果被说成人类独立完成,既抹掉了系统的贡献,也模糊了人类智力劳动的真实分量"。这是在主动拒绝"挂名"——AI不再是人类数学家的"助手",而是共同作者甚至主要作者。这一立场如果被广泛接受,数学论文的署名规则将面临自17世纪以来最大的重构。冲击三|"人类直觉"不再是人类专属Astra展现的不是"暴力搜索",是真正的数学直觉——它把Kun-Thom扩展图理论和Thompson群V糅合起来构造非Sofic群,把代数数论的精巧工具用到平面几何的Erdős问题上。这种"跨领域类比+构造性直觉"一直是数学大师的标志性能力,现在被模型掌握了。冲击四|形式化验证成为新的黄金标准Lean证书的引入,让"AI证明"从"可信or不可信"的玄学问题,变成"代码编译通过or不通过"的工程问题。这长远看会倒逼整个数学界的形式化转型——未来顶级期刊可能要求重要结果附带Lean/Coq证书,否则审稿周期将长到不可接受。第五层:需要冷静的三件事在欢呼"AI征服数学"之前,有三个 caveat 必须摆在桌面上:Caveat 1|同行评审还在路上截至8月1日发布,这十个结果尚未经过独立专家的系统性同行评审。Lean证书保证了形式推导的正确性,但"形式化语句是否精确捕捉了原问题的意图"、"结果的创新性能否经得住细致比对",仍需要数学界花数月甚至数年去消化。Retraction(撤稿)在任何一项上如果出现,都会很响。Caveat 2|Astra本身未公开外界无法独立复现这个工作流程——Astra是内部模型,外部数学家没办法"自己跑一遍验证"。所有成果的可信度目前仍依赖OpenAI的单方面背书+Lean证书的机器检查。这是一个结构性的信任缺口。Caveat 3|"精选后的十个"OpenAI自己承认:这十个是"精选之后的结果"。Noam Brown也坦白"其他重大问题也试过,没成功"。这意味着Astra的能力边界远未被摸清——它在某些问题上展现出惊人能力,但在黎曼猜想、P vs NP等千禧年问题上仍未突破。把这十个结果理解为"AI数学能力的样本",而非"AI数学能力的上限"。2026年8月1日这份249页的论文,是AI发展史上的分水岭时刻——但分水岭的意义不在"AI赢了",而在"游戏规则被重写了"。OpenAI用内部版Astra,以约2000美元的词元成本,在八大数学领域同时给出十个突破性结果,每个都附带可机器检查的Lean 4证书——其中"非Sofic群存在性"这一项,就终结了Gromov 1999年提出、27年来无人能答的群论核心问题;Connes刚性猜想被以"构造可数无限群家族"的方式证伪,其优雅程度让Manchester的数学家直言"比Erdős单位距离猜想的反证更大"。但"菲尔兹奖级"这五个字,是媒体的加速,不是数学界的判词。真正的判定权在人类数学界手上——Lean证书能保证形式推导无误,但不能替代同行评审对"问题意图捕捉是否精确、创新性定位是否准确"的审计。未来6-18个月,才是这十个结果真正接受时间考验的时刻。不过即便如此,这件事的冲击已经不可逆:当数学发现的边际成本从"一个天才的一生"降到"2000美元的词元",当原创数学直觉从人类专属变成AI可展现的能力,当形式化验证从"可选"变成"标配"——数学这门学科的生产关系,已经被永久改写了。Noam Brown那句"测试时计算远未封顶",是整件事里最冷的一刀。2000美元是起点,不是终点。当test-time compute继续往上推,当Astra或它的继承者明年再次揭开面纱——黎曼猜想、P vs NP、杨-米尔理论这些"百万美元级"的千禧年难题,可能就不再是人类数学家的专属猎场。Hinton预言的"AI创造出人类无法理解的新数学",时间表看起来确实太保守了。但比"AI多强"更值得追问的是:当数学发现的生产函数被重写,人类数学家将扮演什么角色?是AI的"问题提出者"和"结果审计员",还是退化为"形式化证书的整理工"?这个问题,比"AI是否攻克了10项菲尔兹奖级难题"更刺痛。因为前者是媒体标题,后者是数学这门古老学科在21世纪20年代的生存问题。249页PDF的最后一页,或许写着数学史一个新章节的目录——而这一章的作者栏,第一次出现了非人类的名字。一个细节值得记住:OpenAI在公告里专门强调"署名应诚实反映成果是如何产生的"——这家公司主动拒绝让人类"挂名"AI的成果。这种态度本身,比十个数学结果更 revolutionary。因为它意味着:AI不再甘心做工具,它要求被承认为研究者。当一台机器开始要求署名的伦理权利时,"人类心智荣耀"这个延续了三千年的叙事,才真正开始塌方。
2
刚刚,OpenAI全新模型Astra曝光!
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹