AI攻克千禧年难题是谣言,但数论纪录和学术抢发风波是真的

源自191位全网作者

21:30

精选参考来源

1
【费马大定理的 AI 时刻:11 天跨越 350 年的数学鸿沟】Anthropic宣布Claude仅耗时11天便完成了费马大定理的Lean语言形式化证明,产出1300万行代码并验证了近3万个中间定理。这件事的本质不是AI发现了新数学,而是它完成了一次史诗级的“代码移植”——将人类已知的复杂证明翻译成计算机可验证的逻辑语言。这一进展最震撼之处在于效率的降维打击:人类团队原本预算100万英镑、计划耗时5年的项目,被AI以约30万美元的Token成本在两周内“暴力拆解”。虽然1300万行代码被不少圈内人吐槽为缺乏抽象美感的“逻辑屎山”,甚至有人担心AI可能利用了Lean内核的潜在漏洞来“作弊”,但它确实证明了Agent协作能够处理极长程的逻辑链条。对于研究者而言,这并不意味着数学家的失业,而是审稿压力的解放。未来数学论文可能必须附带形式化代码,由机器负责逻辑闭环,人类负责直觉与创新。我们正站在一个奇点:当证明的正确性不再依赖于少数天才的肉眼复核,科学发现的迭代速度将彻底脱离生物大脑的物理限制。
2
仔细看了下,Andrew Curran 这条推文“预测”:Anthropic 已经解决了一道千禧年大奖难题,具体就是纳维-斯托克斯方程的存在性与光滑性问题,证明正在送交专家评审,并且会在 IPO 之前公布。注意这是“预测”,还不算正式报道,当然 Andrew 以前爆料的准确率还不错,另外以现在模型的能力,这也不无可能。千禧年大奖难题是克雷数学研究所 2000 年列出的七道难题,每道悬赏一百万美元。纳维-斯托克斯方程描述流体运动,工程上已经天天在用,但“三维情况下光滑解是否永远存在”这个纯数学问题,一百多年还没有人类证明出来。Anthropic 的 IPO 据传在 10 月中旬,所以一个多月以后就知道这条预测是不是靠谱了。
全部
来源
内容由AI生成

精选参考来源

1. 【费马大定理的 AI 时刻:11 天跨越 350 年的数学鸿沟】Anthropic宣布Claude仅耗时11天便完成了费马大定理的Lean语言形式化证明,产出1300万行代码并验证了近3万个中间定理。这件事的本质不是AI发现了新数学,而是它完成了一次史诗级的“代码移植”——将人类已知的复杂证明翻译成计算机可验证的逻辑语言。这一进展最震撼之处在于效率的降维打击:人类团队原本预算100万英镑、计划耗时5年的项目,被AI以约30万美元的Token成本在两周内“暴力拆解”。虽然1300万行代码被不少圈内人吐槽为缺乏抽象美感的“逻辑屎山”,甚至有人担心AI可能利用了Lean内核的潜在漏洞来“作弊”,但它确实证明了Agent协作能够处理极长程的逻辑链条。对于研究者而言,这并不意味着数学家的失业,而是审稿压力的解放。未来数学论文可能必须附带形式化代码,由机器负责逻辑闭环,人类负责直觉与创新。我们正站在一个奇点:当证明的正确性不再依赖于少数天才的肉眼复核,科学发现的迭代速度将彻底脱离生物大脑的物理限制。

2. 仔细看了下,Andrew Curran 这条推文“预测”:Anthropic 已经解决了一道千禧年大奖难题,具体就是纳维-斯托克斯方程的存在性与光滑性问题,证明正在送交专家评审,并且会在 IPO 之前公布。注意这是“预测”,还不算正式报道,当然 Andrew 以前爆料的准确率还不错,另外以现在模型的能力,这也不无可能。千禧年大奖难题是克雷数学研究所 2000 年列出的七道难题,每道悬赏一百万美元。纳维-斯托克斯方程描述流体运动,工程上已经天天在用,但“三维情况下光滑解是否永远存在”这个纯数学问题,一百多年还没有人类证明出来。Anthropic 的 IPO 据传在 10 月中旬,所以一个多月以后就知道这条预测是不是靠谱了。

3. 其实astra最牛的地方是这张图。这张图的“赛场”不是普通数学题,而是一个含68道未解开放问题的Erdős精选难题库——全是数学家们几十年没啃动的硬骨头。Astra拿了3%,换算过来就是在有限时间+有限算力预算下,成功证明了其中2道。其他所有顶级模型,一道都做不出来,全部零分。如果不限时间、不限算力,Astra能解决5道。这5道,全人类至今无解。3%看似微薄,但请想清楚——其他模型的0%,意味着它们连“碰”一下这些问题的资格都没有。而Astra的3%不是选择题蒙对的,是实实在在的Lean形式化证明,每一步推理都可被机器验证。限时只能拿下2道,放开资源就能多拿3道,这说明它的推理能力是“真家伙”,只是受限于搜索深度和计算量,而不是模型本身在猜。数学史上,从“0”到“1”的突破永远比从“1”到“100”更难。Astra这3%就是那个“1”——第一个能自动发现人类未解定理的AI。其他模型再大、再贵,在这个硬核擂台上都是白纸一张。所以别嘲笑这个百分比。它宣告的不是“AI还不行”,而是“AI终于摸到了人类智力天花板的那条缝”。一旦这条缝被撬开,以后我们可以用成千上万的并行证明器去撞击那些悬赏百年的难题,每撞出一份Lean证明,就是一块新的数学基石。硬核推理,永远是智能的终极考场。而Astra,是第一个交卷的AI,哪怕只写了第一道大题的前两行。(by AI)资料:Erdős问题总数约为1217–1220题已解决(proved / disproved / otherwise solved)约一半左右(官网显示约584题已解决,占比约48%)。完全开放(open)的约590–650题。====FrontierMath Erdős:这是Epoch AI于2026年推出的FrontierMath Erdős(FME)基准,专门针对大语言模型/AI系统的研究级数学能力测试。精选68道(覆盖约65个编号问题,部分问题拆成多个Lean猜想,如Hadwiger–Nelson问题拆成3个)。由Thomas Bloom从当时约650道未解问题中亲自挑选,约占当时未解问题的10%。全部在2026年8月时仍为开放问题。挑选标准:Bloom认为数学上重要且困难的“喜爱问题”,而非随便挑的简单题。全部用Lean 4(配合Mathlib)形式化陈述。AI必须自主写出完整的Lean证明或反证,并通过形式验证才算解决。约50条来自Google DeepMind的Formal Conjectures库,其余由团队自动形式化后经Bloom人工审核。评测规则:严格控制预算与时间(默认每题300美元 + 72小时工作时间),单次尝试。强调自主性、可复现性和形式正确性,避免“搜到旧文献就算解决”的水分。

4. GPT-6 Astra解出2道人类未解数学难题,为何其他顶级模型都交白卷

5. 68道人类至今未解的数学难题,GPT-6Astra一天解决其中5个

6. GPT-6 Astra独立解出2道未解数学难题,AI的真实研究能力怎样?

7. OpenAI史上最强!GPT-6一天攻破5道至今未解数学难题

8. 孪生素数纪录一周三破,FME测试仅3%成功率,AI数学的真实水平?

9. Claude把千禧年难题做出来了?陶哲轩:我可没这么说

10. GPT-6突破「素数间隔」纪录!这次是加入OpenAI的北大数院07级校友

11. AI连破数学难题,却提不出黎曼猜想级问题?

12. 数学“世纪难题”,OpenAI 下一代模型 Astra 花 2000 美元全解了?

13. OpenAI 新旗舰 Astra 的循环深度推理架构 OpenAI 新旗舰 Astra 的循环深度推理架构 《The Information》曝料,OpenAI 即将推出的旗舰模型 Astra 换上了"循环深度"(recurrent depth)架构——让同一组网络层在输出下一个词之前反复处理,用时间换空间。一个 35 亿参数的循环深度模型,测试时计算预算最高能扩展到约 500 亿参数模型对应的计算负载。 这期把这件事一次讲清:循环深度怎么榨干同一层网络的计算潜力、它和"潜空间推理"大方向的关系、LOTUS 论文在 30 亿规模上追平显式思维链延迟还压低 2.5 到 6.9 倍的证据,以及 Astra 的第一份数学战绩——10 个尘封十年以上的难题、首次显式构造非索菲克群,全部证明用 Lean 证书机器验证,求解成本约 2000 美元。 但硬币还有反面:推理搬进模型内部之后,思维链这个监控窗口会变窄。报道里 OpenAI 限制了循环深度的使用比例来保住可读性,但其他开发者未必会设限。能力越强、看得越不清——这次,人类还剩多少眼睛? #OpenAI #Astra #大模型 #人工智能 #AI安全

14. 【OpenAI官宣GPT-6 Astra:所谓的“AGI时代”已至?】OpenAI正式发布GPT-6 Astra,这是一款在ARC-AGI-3基准测试中跑出99.9%近乎满分、在ExploitBench实现100%漏洞利用的“准AGI”模型。关键信息在于它不仅在数学(FrontierMath 98%)和科学领域刷新纪录,更核心的突破是“计算机使用”能力的质变:它能自主操作KiCad画电路板、处理复杂的CRM数据,且在OSWorld测试中比GPT-5.6快了近一倍。这其实是一场关于“脚手架”的胜利。OpenAI坦承高分受益于Responses API这一特定环境,它允许保留推理过程中的Token而不像传统测试那样强行截断,这种“记忆力”的释放让模型从只会做题的考生变成了能解决复杂工程的“初级数字员工”。对普通用户来说,这标志着AI从“对话框”走向了“控制权”。当Greg Brockman喊出“欢迎来到AGI时代”时,行业底层逻辑已从单纯的参数竞赛转向了任务闭环的效率竞赛。虽然评论区对“刷榜”和“AGI定义缩水”仍有激辩,但不可否认,当AI开始在Lean证明中改写80年未动的质数间隙界限时,它已经从模仿人类转变为在特定维度上超越人类。这未必是终极智能,但绝对是生产力工具的一次暴力进化。

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章