5. 把LLM送进博物馆,还是给它装上世界模型?——读杨立昆的“反共识”冲击波
杨立昆近期播客带来的最大价值,并非颠覆现有认知,而是完成了一次AI发展边界的重新定义。
他的核心观点很清晰:LLM在语言生成、代码编写、工作流自动化领域优势突出,但存在本质短板。仅依靠“自回归下一个token预测”的训练逻辑,无法预判行为后果、无法自主规划推理,这也让LLM难以成为可与物理世界深度交互的通用智能底座。
这个逻辑十分扎实:语言是规整的离散符号系统,而真实世界是高维、连续、充满随机变化且存在不可逆结果的复杂环境。单纯依靠模型参数扩容、数据增量的规模化堆叠,永远无法自主生长出可靠的因果逻辑,也搭建不出安全稳定的行动闭环。
正因如此,杨立昆主推的JEPA(联合嵌入预测架构)具备极强合理性。它摒弃了在原始像素、文本符号层面强行复刻所有信息的低效模式,转而在抽象表征空间学习、预测、推理。既能过滤海量冗余噪声,抓取世界底层结构规律,也更适配现实场景的规划决策与不确定性处理,是机器人、具身智能、工业AI闭环的核心突破方向。
但我们无需将JEPA神化为终极技术路线,这套框架仍存在明显短板。
首先,这类思路本质上将智能核心定义为“物理具身行动”,把语言、符号认知降级为外在辅助工具。可人类绝大多数高阶思维、逻辑推理、社会认知,都诞生于语言符号体系中,并非所有智能价值都需要依托物理行动实现。
其次,世界模型至今仍有诸多未解难题:真实因果对齐、稳定大规模训练、表征可解释性、安全合规验证,都是亟待攻克的硬骨头。抛开这些前提,JEPA只是更优秀的目标函数,并不等同于通往AGI的标准答案。
未来AI的终极形态,大概率是多范式融合,而非单一赛道的零和博弈。
最优架构一定是组合式的:LLM承载语义理解、代码生成、人机通信的上层能力;JEPA类世界模型提供预测推理、行动规划的底层底座;再结合检索增强、工具调用、安全约束、验证优化等模块,构成完整的混合智能体系。当下顶尖的AI Agent,早已脱离纯token预测的单一范式,走的正是多组件协同的融合路线。
杨立昆的发声,为行业纠偏了关键方向,让AI研发从“只靠堆规模”的单一内卷,转向结构化归纳偏置、世界模型、因果规划的深度探索,补齐了具身智能的行业短板。
但如果行业过度推崇单一范式,也会形成新的认知盲区:忽视语言层推理的工程落地价值,回避混合架构的集成难度与对齐成本。
最后总结一句:LLM不会被淘汰,只会成为通用智能的重要组件。未来胜出的AI,从来不是某一种范式的终极胜利,而是能把语言智能、世界表征、安全行动闭环高效融合的完整体系。