当前位置:
AIGC文章详情

AI又证伪一个百年数学猜想,但3Blue1Brown创始人的90分钟对谈,比热搜更值得一看

源自20位全网作者

19:15

如果你最近关注科技圈,大概率被「AI又破了个百年数学猜想」这类标题刷过屏。而且这一次,密度确实有点高。

就在今天,一份在数学圈流传了整整一周的论文正式公开:数学家Levent Alpöge联合Claude,用一个显式反例证伪了已有102年历史的Carathéodory猜想,顺带还证伪了与之绑定的Loewner指数猜想。新智元这个猜想说的是什么?用最直白的话讲:「脐点」是曲面上各个方向弯曲程度都一样的点,球面上每个点都是脐点,椭球恰好有两个。Carathéodory在1924年断言:任何一个足够光滑的闭合凸曲面,至少有两个脐点。这事直觉上「看起来很对」,但一百年来既没人证出来,也没人构造出只有一个脐点的反例。这次Alpöge和合作者John-Paul Smith构造出了一个C∞(无限次可微)光滑的凸面,恰好只有一个脐点,而且脐点指数是2——一个反例,同时放倒两个猜想。

AI又证伪一个百年数学猜想,但3Blue1Brown创始人的90分钟对谈,比热搜更值得一看

再往前还有两件大事。8月10日,Anthropic发布技术说明,称其未公开的研究版Claude把黎曼ζ函数”零点落在临界线上的比例”的已知下界,从41.6%推到了67.2%,并公开了论文、Lean形式化工件和专家检查过程。知乎而在此前的37年里,人类只把这个数字推进了0.8个百分点。新智元这半年AI数学成果的密度前所未有:4月,23岁的年轻人Liam Price把Erdős问题1196号喂给GPT-5.4 Pro,约80分钟拿到正确解答,核心思路是把整数的整除结构建模成马尔可夫链随机游走,随后陶哲轩带领8人团队正式发表了证明;5月20日,OpenAI又推翻了Erdős于1946年提出、存在了80年的单位距离猜想。知乎

评论区基本分成了两派:一派惊呼「AI要取代数学家了」;另一派提醒「下界提升不等于证明猜想」「大厂专家检查不等于同行评议」——真正的科学结论,需要被其他团队复现、在期刊经过评审、被社区长期检验。知乎也有用户直接质疑黎曼成果的实际含金量:人类最前沿的研究进展其实早已将边界提高到67.2,只是有一个前提条件没解决。知乎两派都有道理。而这件事上,我认为最值得听的人,是Grant Sanderson——3Blue1Brown的创始人。他刚好最近系统地聊了这件事。

7月初,Sanderson上了Dwarkesh Patel的播客,聊了90分钟「AI与数学」。对话的中文完整版8月7日由DwarkeshPatel的B站账号放出,截至发稿播放量约8.4万,收藏近2000——收藏比点赞还多,说明大家是把它当参考资料存下来的。评论区也很有代表性:有人已经开始讨论技术细节:「ai 在黎曼猜想上又有突破了,密度大于 2/3。」;有人调侃「3b1b自己频道挖了好几个坑拖更,反倒是在别人频道里玩得挺嗨」;也有人感慨「突然感觉 3b1b 也变得更加成熟了,回想起来确实转眼几年又几年」。哔哩哔哩

靠《线性代数的本质》封神的这个频道,全网订阅读者已超过849万。知乎它现在正用看数学的那双眼睛看AI。我把对谈里最值钱的部分替你整理出来了,没空看90分钟正片的,看这篇。

他先给了一张「记分牌」:不是所有AI破猜想都是同一回事

Sanderson把AI在数学上的突破分成三类,每一类的含义天差地别。

第一类叫「闪电连接」:AI同时是多个领域的专家,能在两个看似无关的领域之间找到意想不到的桥。上面的Erdős问题1196就是这种——用马尔可夫链的概率语言重新表述一个数论问题,「小想法,大效果」,把这个思路讲给一位懂行的数学家,对方基本能自己补完剩下的证明。知乎

第二类叫「建山」:类似费马大定理的证明路径,先花数百年建起椭圆曲线、模形式这样的理论大山,才有资格谈它们之间的联系。如果AI真会「建山」,能凭空创造一整套新理论框架,那这种智能水平高到很难想象它不扩散到其他行业;最坏的情况是AI建了一座山,人类花数年爬上去,发现山顶什么都没有——ABC猜想的教训就在眼前。

第三类叫「蛮力推演」:一份上千页的证明,每一步都对,但没人能从中获得洞见。

用这张记分牌去看这几条新闻,画面一下就清楚了:Erdős 1196属于闪电连接;黎曼67.2%只是已有框架内的数值推进,不是对黎曼猜想本身的证明,离「证明黎曼猜想」还差着十万八千里。知乎Carathéodory证伪则是最扎实的「构造与搜索」——数学上证伪一个猜想只需要一个反例,但找到那个反例,可能比证明猜想本身还难,而AI的并行穷举和构造能力,恰好最擅长这个。新智元

然后是三个冷静判断,都有点反直觉

判断一:IMO金牌已经不是新闻了。三年前Dwarkesh问他,AI在IMO拿金牌算不算AGI?他当时说:那只会变成又一个被攻克的基准测试。2024年AI已经具备IMO金牌水平,短板是组合题。知乎结果呢?世界没有变化。基准测试就是用来被刷穿的。

判断二:真正的门槛是「猜想生成」和「定义创造」。他引用数学圈那句分层:好的数学家证明定理,伟大的数学家提出猜想,最伟大的数学家创造定义。知乎后两件事做不成基准测试——你没法写一条「GPT提出了一个好猜想」的标题,因为没人能量化什么叫「好」。做不成基准测试的能力,在当前范式下就无法直接训练。那怎么衡量进步?看数学家谈论AI时的语气变化:从「它帮我解了题」,变成「它帮我想清楚了该研究什么方向」。

判断三:Lean作为AI训练环境被高估了,但作为「验证机器」越来越重要。DeepMind在2024年IMO用全Lean方案,第二年就换成了全自然语言。但他引用另一位数学家的话很实在:当AI每天能产出10篇论文时,哪怕99%是对的,对数学家也无法忍受——找出那1%的错误本身就极费时间。知乎这时Lean形式化验证的绿色对勾,是唯一能让人安心读论文的东西。

AI又证伪一个百年数学猜想,但3Blue1Brown创始人的90分钟对谈,比热搜更值得一看

当然,冷静不等于唱衰。这一轮和以往「AI数学热」不同的地方在于,成果越来越像正经数学:显式构造、可验证的推导、公开可查的工件。上面这个Carathéodory反例,就是一步步摆出来、可以逐行核验的推导。新智元

跟我们有什么关系?他给了两条建议

一条关于学习。他说自己最高效的学习状态,是屏幕分三份:一份Strogatz的课堂录像负责叙事框架和动机,一份教材负责细节,一份LLM负责卡住时的即时补讲。知乎他有句话特别清醒:LLM最擅长的是帮你找到「该跟谁学」,而不是替代那个人——因为好老师会告诉你「你的问题本身就问错了」,而LLM只会顺着你的错误框架一路跑下去。选书也一样,他的原则是:喜欢一本书,下一本就读这个作者的其他作品。

另一条关于未来。他判断教学是后AGI时代最稳定的职业之一,因为教学的核心是人与人的关系,不只是解释。知乎而有一类人的价值会被放大——能看懂AI数学成果、并判断它该指向哪个应用方向的「策展人」。他给想进入数学和科研行业的学生一条通用建议:搞清楚你的薪水到底从哪里来,你到底在为谁解决什么问题。

最后,值得看什么、值得等什么

现在值得看的:

  • 完整对谈在B站DwarkeshPatel官方账号,搜「AI证伪了一个数学猜想」就能找到,约90分钟,有中文字幕。哔哩哔哩

  • 没时间看正片,同账号还在持续更新切片,《AI时代还值得学数学吗》和《爱因斯坦和香农为什么都很会解释》这两条都值得一看。哔哩哔哩哔哩哔哩

  • 他今年的新系列《压缩即智能》力证「压缩=预测=智能」,一共三集已出两集,第二集讲交叉熵,正好解释LLM的损失函数从哪来。微博

值得等的:

  • 他正在拍一部数学家纪录片,第一集聚焦一道连陶哲轩和AI都做错的IMO题,按他的说法,破题关键是「逃离你的上下文」。知乎

  • 未来五年AI的数学进展会不会溢出到有经济价值的应用——他自己也在等。原话是:如果没有,「那会让人有点失望,也有点奇怪」。

  • 以及最近的一个观察点:今天刚公开的Carathéodory反例,能不能经受住整个数学社区的检验。下面这张是论文里的核心构造图——他构造的这个凸面,原点处只有一个脐点。数学里反例只需要成立一次,但成立,就得经得起看。

AI又证伪一个百年数学猜想,但3Blue1Brown创始人的90分钟对谈,比热搜更值得一看

这也是整场热闹里我认为最值得关注的部分:当AI已经会做题,判断哪些问题值得做、哪些答案值得信,才是真正的稀缺能力。而3b1b的这90分钟,聊的恰好就是这件事。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章