强化学习之父Sutton炮轰合成数据:“大错误”背后,一半是硬证据,一半是豪赌

源自32位全网作者

14:11

前两天(8月18日),图灵奖得主、“强化学习之父"Richard Sutton 在红杉资本的播客上,说了一句挺重的话:AI 行业对合成数据的过度依赖,正在把整个行业带向错误的方向,这是一个"大错误”。微博

第二天,#图灵奖得主萨顿警告AI行业# 就上了微博热搜,知乎紧跟着冒出两个热门问题。评论区迅速分成两派:一派说"老爷子看得透",另一派说"他又出来倚老卖老了"。

对关注强化学习的人来说,这件事值得认真对待——不是因为 Sutton 是祖师爷,而是因为他这次不只是说说而已。

强化学习之父Sutton炮轰合成数据:“大错误”背后,一半是硬证据,一半是豪赌

先去噪:Sutton 到底说了什么

不少标题把这件事概括成"Sutton 反对合成数据",其实不太准确。把他的原话拆开,大致是三层意思:

第一层,合成数据撑不起"继续扩展"。他的判断很直接:行业越来越依赖合成训练数据,这正在把整个行业带向错误的方向。

第二层,真实世界超越任何模拟。这是他反复讲的"大世界假说"(Big World Hypothesis):现实世界的复杂性远超任何模拟系统,不存在能覆盖全部场景的静态数据集,智能体必须通过自主经验获取知识。哔哩哔哩

第三层,智能来自经验,而不是模仿。上个月在 WAIC 的采访里他说得更直白:如果把智能看作一个整体,语言能力也许只占其中四分之一左右。知乎今天的大模型也许有博士级别的知识,但知识不等于智能——说它们有博士级别的智能,是荒谬的。

这里有个容易误解的点要说清楚:Sutton 反对的不是"一切模拟经验"。WAIC 采访里他明确承认,AlphaGo、AlphaZero 已经证明 AI 可以通过经验——包括模拟经验——学到大量东西。他反对的是把"模型输出和人类文本"当主食、训练完就冻结权重的路线。两者区别是:一个是让智能体在环境里"活一遍",一个是让它"读别人的日记"。

不是突然开炮:看看他这一个月的时间表

如果你觉得这只是老教授又一次口头批评,看看他今年干了什么:

4 月,战略白皮书《The Alberta Plan for AI Research》发布,用 12 个渐进步骤给出一份 5 到 10 年的路线图,目标是构建能在复杂环境中持续学习、基于模型计算的 AI 原型。知乎

7 月 17 日,上海 WAIC 主论坛演讲,直指当前大模型的底层软肋——“大模型不具备原生智能”。知乎他还提出了"经验时代"的概念:过去几年的 AI 产业处于"人类数据时代",而静态标注数据的时代正在走向终点。

还是 7 月,他在多伦多正式创立 Oak Lab。36氪此前他刚离开 John Carmack 创办的 Keen Technologies,告别文里把第一句话留给了老东家、极尽赞美,但路线分歧是真的:他认为当前深度学习方法薄弱、低效,需要的不是修修补补,而是全新的基础思想与彻底重构。今日头条

Oak Lab 立的目标相当激进:万亿参数、能实时学习和规划、整机功耗只有 20 瓦的智能体——功耗刚好对标人脑。36氪训练方式上则彻底抛弃静态数据集,用单步流式的在线学习:每一次与环境交互,同时完成学习。

再往前,他和 Carmack 的 Keen Technologies 团队联合发布的 Physical Atari 论文已经出炉:一个总造价不到 1000 美元、能连续跑几个星期不坏的机器人玩家,直接在物理世界里做强化学习。知乎

强化学习之父Sutton炮轰合成数据:“大错误”背后,一半是硬证据,一半是豪赌

把时间线连起来看,这是一套组合拳:先发白皮书,再公开演讲,然后开公司,最后对着整个行业开火。连融资他都不避讳——在 WAIC 期间的媒体采访里直说,Oak Lab 融资"进展相当顺利"。知乎

强化学习之父Sutton炮轰合成数据:“大错误”背后,一半是硬证据,一半是豪赌

更有意思的是他周围的阵营。他最出名的学生 David Silver,也离开了待了 15 年的 DeepMind,创办 Ineffable Intelligence。36氪Silver 继续走自博弈路线,做聚焦数学与代码这类可验证领域的"超级学习者"。知乎LeCun 的 AMI Labs 则押注世界模型。这几位都站在"纯 LLM 路线不对"的一边,但打法完全不同:LeCun 攻视觉表征,Silver 做形式化领域的自验证,Sutton 则押低功耗的在线持续学习。反 LLM 联盟,其实各打各的仗。

他的底气是什么:一篇绕不开的 Nature 论文

Sutton 的警告之所以能上热搜,不是靠名气,而是确实有硬证据托底。最核心的一篇,是"模型崩溃"(Model Collapse)研究。

2024 年,牛津、剑桥和帝国理工的研究者在 Nature 上发表研究:让大模型在 AI 自己生成的合成数据上反复训练,它们不会变得更好,而是不可逆地退化。知乎一代比一代更重复、更缺乏多样性、更偏离真实分布,到最后输出在统计意义上接近噪声。

一个流传很广的类比是复印机复印自己:第一次还能辨认,第二次开始模糊,到第十次只剩一张灰纸。

机制也不难懂:合成数据本质上是真实分布的"统计近似",从近似里学习,每一代都会把尾部的细节和异常值再抹平一次;更麻烦的是,上一代的幻觉会被下一代当成知识学走,错误被逐代固化。

叠加的行业现实是:公开互联网上可用的高质量人类文本,已经被第一代大模型基本吃完了。有分析估算,当前头部实验室每年需要的训练数据增量,已经超过了全球人类每年产出的高质量公开文本总量。知乎也就是说,行业不是不知道合成数据有风险,而是骑虎难下。知乎上甚至有人直接把窗户纸捅破:AI 实验室一边大量使用合成数据一边警告模型崩溃,是否说明业界对合成数据可靠性其实心里没底?知乎

从这个角度看,Sutton 那句"大错误",至少说中了一半。

但冷水也要泼:反方的论据同样不弱

社区里最有力的反驳,不是说 Sutton 错了,而是说就算他对了,行业也没得选。

知乎上一个高赞回答借用了 Wolfram 的"计算不可约"概念:自然是复杂混沌系统,不存在任何能加速它的算法或模拟器。知乎想知道结果,只能让 agent 到真实世界里把整个任务跑完。问题来了——如果只有自然真实数据能驱动模型,那 physical AI 可能不是三五年、甚至三五十年内的事。所以 sim-to-real 对机器人行业是生死问题:以前自动驾驶早就试过纯仿真训练,效果很糟,因为仿真里的微小扰动传到现实会被蝴蝶效应完全放大;但谁要是公开说"仿真搞不定",等于砸了整个 physical AI 的饭碗。

Oak Lab 自己的路线也有三道坎,一个都没过:

一是灾难性遗忘,学新任务会覆盖旧任务的知识;二是可塑性丧失,网络训练久了会逐渐失去学新东西的能力,这是终身学习领域悬了几十年的难题;三是规模验证,他们的核心算法 NetworkIDBD 目前只在小规模网络上做过实验,万亿参数在线学习能不能稳定跑,没有任何先例。知乎而 20 瓦功耗也无法单纯靠软件算法实现,高度依赖神经拟态硬件的产业化进度——与其说是算法赌注,不如说同时押了一把硬件。

所以比较公允的判断是:Sutton 的诊断——靠模仿数据继续 scaling 有天花板——有相当扎实的证据支撑;但他的药方——全面转向经验学习——目前仍是高风险假说,离被验证还早。

值得盯的三个信号,和一个判断轴

对关注强化学习的人来说,这场路线之争比任何单条新闻都值得追。这里给三个具体的观察信号:

第一,看算法能不能放大。Oak Lab 的 NetworkIDBD 后续如果能在 Atari 仿真、机器人连续控制这类复杂环境里拿出扩展实验结果,才算真正迈过第一道坎;

第二,看师徒对垒。Sutton 的经验学习路线,对阵学生 David Silver 的自博弈超级学习者,两边都是 RL 正统,谁的成果先跑出来,会直接影响资本和人才往哪边流;

第三,看开源和硬件。Oak Lab 会不会开放可复现的 OaK 架构原型,会不会有神经拟态硬件厂商入伙。这两个如果一两年内都没动静,20 瓦的故事大概率只是故事。

强化学习之父Sutton炮轰合成数据:“大错误”背后,一半是硬证据,一半是豪赌

另外一个更实用的东西,是一个判断轴:以后看到机器人、大模型、自动驾驶的新闻,可以先问一句——这个系统是在"模仿数据",还是在"从经验中学习"?如果是前者,它的数据吃完了怎么办?未来三年,这个问题大概率会一直有效。

最后留一句谈资:这个夏天,OpenAI 刚因为安全问题暂停了前沿模型的 RL 训练。36氪而 RL 的奠基人转头就在说,大语言模型这条路不会成为通往超级智能的主要路径。知乎强化学习从来没有像今天这样站在 AI 叙事的正中央——只不过这种"正中央",未必是它的支持者想象的那种方式。

内容由AI生成

精选参考来源

1. #图灵奖得主萨顿警告AI行业#【图灵奖得主萨顿警告:AI 行业过度依赖合成数据是一个大错误】

2. [附文稿]里奇·萨顿(RichSutton)与库拉姆·贾韦德(KhurramJaved):人工智能模型为何停止学习,以及如何重启学习

3. RichardSutton:真正的智能来自于经验,而不只是语言|RichardSutton在WAIC会后的精彩采访

4. 【论文导读】《TheAlbertaPlanforAIResearch》

5. WAIC现场|Sutton演讲的“校准”价值:他替整个产业界回答了一个悬而未决的问题

6. 69岁强化学习之父Richard Sutton创业:造20瓦人脑级智能体

7. 强化学习之父萨顿演讲:大模型不是超级智能,真正的AI还在后面

8. 如何评价Sutton与JohnCarmack团队最新论文《PhysicalAtari》?

9. 强化学习之父Sutton联手毁灭战士之父Carmack:让机器人进入真实世界打游戏

10. DeepMind强化学习掌门人David Silver离职创业,Alpha系列AI缔造者,哈萨比斯左膀右臂

11. RichardSutton「OakLab」及「20瓦万亿参数」AGI路线深度研究报告

12. 合成数据vs真实网页数据:大模型训练的博弈

13. AI实验室一边大量使用合成数据一边警告模型崩溃,是否说明业界对合成数据可靠性其实心里没底?

14. 图灵奖得主RichardSutton称依赖合成数据继续扩展大模型是「巨大错误」,如何评价这一观点?

15. 突发,OpenAI停止强化学习训练两周

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章