246卡了十二年,GPT-6几天压到186:翻完OpenAI论文原件和四家同天对账,这个首发成果有几分成色

源自244位全网作者

05:56

发布这48小时,OpenAI的新闻评论区是分裂的:一半人在算订阅涨价和重置额度,一半人在对"GPT-6=AGI"这句官方话术冷嘲。B站那期《GPT-6推进孪生素数猜想》的视频下,点赞最高的几条评论都是玩梗,最高的一条写着"我还是喜欢你以前桀骜不驯的样子"。哔哩哔哩——老观众对AI发布会的信任额度,明显比ChatGPT的额度先到账期。

但有个东西不太一样:这次发布真正"硬"的成果,可能是一个绝大多数转发文章自己都讲不明白的数字——186。我把OpenAI论文原文、四家机构同天的成绩单和数学圈的讨论翻了一遍,这篇只干一件事:告诉你这个成果有几分真、哪几分被讲岔了、接下来该盯什么。

先对表:186不是证出了孪生素数猜想,而是一条跑了13年的纪录赛道被AI刷新了

素数间隔问题的经典表述是:是否存在无穷多对相差2的素数(孪生素数猜想)。这个至今没人证出来,GPT-6也没证出来——所有标题里写"攻破千年难题"的,先扣一半可信度。

数学家退而求其次的赛道是:证明存在无穷多对素数,间隔不超过某个数H。H越小越好,这是一条全球数学家接力压纪录的赛道。

发布会那几天你肯定刷到过官方基准表——FrontierMath这类数学分数全线登顶、把Claude和自家上代甩在身后。但那些考卷测的是"解题",而素数间隔是另一件事:这是全球数学界共同卡了十几年的研究前沿。这条赛道的纪录线长这样:

  • 2013年,张益唐首次证明H有限,上界7000万;

  • 随后Polymath 8a压到4680,Maynard(陶哲轩独立路线)用多维筛法做到600;

  • 2014年Polymath 8b把纪录钉在246,此后一卡就是十几年

  • 2026年8月底,年轻数学家Julia Stadlmann证明H≤240,并打开了通往226的路线(论文标注Forthcoming,待刊);

  • 然后是这次:OpenAI宣布GPT-6 Astra把上界推进到186,且完成了Lean形式化。

246卡了十二年,GPT-6几天压到186:翻完OpenAI论文原件和四家同天对账,这个首发成果有几分成色

从7000万到186,这条赛道十几年的每一次进步都是人类筛法智慧的累积。186的分量在于:246这个数字,是全世界解析数论学家一起卡住的墙。36氪

我翻了论文原件:关于AI的角色,OpenAI自己也只敢写一句话

论文在OpenAI官网(标题《Improved Short Gaps Between Primes》),署名只有机构"OPENAI",日期是8月30日——注意,这比GPT-6 Astra对媒体的正式发布早了好几天,发布日是美东时间9月3日。微博也就是说,小红书上流传的"首发即破纪录"其实不太准确:模型在内部测试阶段就把活干完了,成果是跟着发布会一起官宣的。小红书

全文最关键的证据,是摘要末尾那句中文译文:该数学证明由GPT-6 Astra给出。36氪除此之外,正文通篇是传统数学论文的写法,对"AI怎么参与的"没有任何展开。官宣这项成果的是OpenAI研究员、宾夕法尼亚大学沃顿商学院统计学教授苏炜杰——他8月初刚获颁2026年度考普斯奖,这一统计学领域国际最高奖项之一被媒体称为"统计学界的诺贝尔奖",还是北大数院07级出身,这位宣布者的分量本身就值得记一笔。微博结合这条官宣与论文的技术内容,可以拼出真实分工:

  • 路线是人类铺的:整个证明仍然在Maynard-Tao多维Selberg筛的框架内,用的是经典解析数论工具箱(Heath-Brown恒等式、Harman筛的素数下界函数等);

  • AI干的是搜索空间里找组合:据苏炜杰说明,GPT-6探索了新的因子分解条件,把筛权重的适用范围扩展到"三重稠密可除",让多维筛的支持参数推得比Polymath 8b当年能算动的范围更远(当年卡在k≈50时积分算不动),最后构造出一个40元、直径186的容许数组并跑通全套数值优化。36氪

一句话校准:这不是"AI凭空想出一个新公式",而是"人类画好了赛道边界,AI在人类算力穷举不到的组合空间里,找到了那条以前没人走过的路径"。这是真实的科研参与,不是演示视频级别的过拟合——但离"AI独立做数学研究"也还差着一整个方法论,论文里对过程的沉默本身就是提示。

Lean验证比你想的更硬,但"条件式"三个字被大部分转发吃掉了

这次成果最被低估的细节是形式化验证。传统论文靠同行评审"人肉查证明",Lean是计算机逐步检查证明代码的每一步逻辑。OpenAI开源了Lean 4项目(GitHub仓库openai/PrimeGaps186),这在AI发布的成果里几乎是前所未有的透明度。36氪

但论文自己写得很清楚:这个Lean验证是有条件的——两大前提尚未被完全形式化检验:一是数值积分上界(用一个叫prime_gap_186_certificate.py的FLINT程序出具数值证书),二是有限域指数和估计(最终依赖Deligne的大定理,作为显式假设写进Lean代码)。

所以正确的表述是:证明的逻辑链条已经机器核验,链条两端的两块砖目前是"抵押状态"。严格度高于普通预印本,但还不等于数学界公认的无条件定理。另外一个小信号:论文附录还顺手对Stadlmann前作中两处minorant构造做了勘误性修正(不影响她的主结论)——AI不但交了卷,还开始给同行批注了,这事在十年前难以想象。

同一天四张成绩单互相"撞车":数字打架不是有人造假,是口径不同

最有意思的是社区信息乱源:OpenAI发186的当天,另外三家也晒了成绩单——

  • Anthropic研究者称Claude团队此前已完成H≤188的形式化证明,与186"高度呼应,也可能只是个非常有趣的数字巧合"(原话带调侃);

  • Axiom宣称自己在同一问题上创造世界纪录:H≤212;

  • 人类数学家Stadlmann的240也在此前几天刚被同行转发。36氪

246卡了十二年,GPT-6几天压到186:翻完OpenAI论文原件和四家同天对账,这个首发成果有几分成色

四张单子放一起,才是这事的完整图景:AI数学已经卷成了赛道竞赛,而且各家口径不一——有没有形式化、形式化是不是无条件、投没投稿,都会让"纪录"两个字的含金量差一档。以后看到任何"AI突破数学难题",先对齐三个问题:和谁比、验证到什么程度、发表状态如何。这次的排序(按公开口径)是186 > 188(未公开细节)> 212 > 240(人类,最慢但最"干净")。

还有一个容易被忽略的官方口径注脚:发布材料里 OpenAI 连安全自测图也一并放出——ExploitGym 蜜罐攻击任务上,上一代 GPT-5.6 Sol 的利用率为 48.2%,Astra 被标注为 0.0%。能力宣称、安全宣称、科研宣称同屏发布,透明是真透明,但也都在等同样等级的第三方复核。

246卡了十二年,GPT-6几天压到186:翻完OpenAI论文原件和四家同天对账,这个首发成果有几分成色

评论区吵的才是重点:这次大家怕的不是涨价,是研究这个职业

社区信号比发布会诚实。B站那期视频1358条评论里,点赞598的那条替Stadlmann鸣不平:人类数年心血发现了新的方法从246突破到240,并且开启了前往226的道路,AI几天到了186。哔哩哔哩;有人拿2022年底ChatGPT冲击"古法NLP"圈子、大佬连夜放出教材草稿PDF作类比;也有高赞在抬杠——“都这样了还有人说AI只是鹦鹉学舌,我不知道怎么反驳”。

这些争论指向同一件事:大模型下一阶段的竞争维度,正在从聊天、写代码、跑Agent,转向谁能为人类知识前沿净增量。OpenAI、Anthropic、Axiom同天在同一个数论问题上交卷,就是最直白的信号。对普通用户,这轮竞赛暂时不改变你的订阅账单;但对"AI能不能干正经科研"这个老疑问,这次是第一个带着可机检证明来回答的样本。

谁该继续盯、盯什么:三个后续观察信号

  1. 验证升级信号:openai/PrimeGaps186的Lean项目会不会把两处"条件"补成无条件验证,会不会出现arXiv正式投稿和数学家公开背书。目前没有同行评审,这是186离"定论"之间唯一的缺口。

  2. 说法消化信号:社区流传"GPT-6第一天攻破5道Erdős难题"等更强的说法,目前都还没有论文级实锤。哔哩哔哩下次刷到,先等原件。

  3. 赛道跟进信号:Anthropic的188到底拿不拿出来、Axiom后续成绩、以及有没有数学家宣布"用这套方法我还能往下压"——如果纪录开始由人类和AI交替刷新,才说明这真的是科研方式变了,而不是一场发布营销。

给不同人的一句话结论:看热闹的,这是2026年最拿得出手的AI谈资,记住"186、Lean、没证孪生"三个词就够用;每天拿大模型干活的开发者和重度用户,该关注的是两批信号的同时出现——一批是把百年建筑原样搬进Blender这类工程演示(下图),另一批是数论研究里的真实参与,前者预示生成能力,后者才预示Agent在明确规则、巨大搜索空间任务里的上限;学术相关的人,直接去读那篇PDF和开源Lean仓库,别转述自媒体的版本——那才是这次发布里唯一值得熬夜的东西。

246卡了十二年,GPT-6几天压到186:翻完OpenAI论文原件和四家同天对账,这个首发成果有几分成色

至于AGI来没来,这次还是不下结论。但"AI参与数学研究"这个新时代,确实拿出了一个可以被机器检查的出生证明。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章