这两年,杨立昆(Yann LeCun)大概是AI圈最高调的"唱反调者"。图灵奖得主、卷积神经网络之父,隔三差五就放话:大语言模型只是对海量文本的模式拟合,不懂意义,这条路走不到真正的智能。知乎骂了两年,其实所有人都在等一件事——你自己的东西呢?
这个夏天,东西来了。不是一个炸场的大模型,而是一组密集的组合拳,全部出自杨立昆的团队和他押注多年的JEPA(联合嵌入预测架构)谱系。我把这几份"成绩单"逐个看了一遍,哪些是实打实的证据、哪些还不能高兴太早,一次说清。
一、0.7%的参数,在真机上打赢7B模型
最出圈的是PatchPolicy,纽约大学杨立昆团队联合Meta FAIR在7月发布。知乎
先看数字:参数量只有OpenVLA-OFT(一个7B级的视觉-语言-动作模型)的约0.7%,在多套仿真与真机操控任务上综合成功率高出18%。知乎
推理延迟的差距更夸张:10.99毫秒对61.71毫秒,一个能跑100Hz高频机械臂控制,一个只能跑20Hz。知乎
训练也不挑硬件,一张消费级RTX显卡6.5小时就能搞定,不用多卡集群。知乎B站
最难的2mm公差线缆插入任务里,OpenVLA完整插入成功率只有30%,PatchPolicy做到70%;收笔任务85%对基线65%,挂工具90%对70%。知乎
在从没见过的新物体上做零样本抓取,成功率也有87%对79%。知乎
思路其实很朴素:主流VLA模型会先把图像压成一两个全局特征向量再喂给模型,省算力,但精细空间信息也跟着丢了,机器人干不了"穿针引线"的活。PatchPolicy干脆不压缩,把视觉骨干输出的所有局部图块特征原样喂给策略网络,再用一个块因果注意力做约束——同一帧内的图块可以互相参照,跨帧只能看历史、不许偷看未来。知乎

这个结果真正说明的是:机器人精细操控,不必绑在语言大模型上。“听懂指令"和"手到擒来"是两件事,至少在桌面操控这个场景里,后者不需要时刻背着一个7B的"理解者”。
但也别急着沸腾。它赢的是几组桌面精细装配任务,仿真场景光线纹理单一,论文自己也承认仿真高分不能完全等同于真机表现;要谈"碾压全场",还得等更多任务和更大规模的真机验证。知乎
二、世界模型开始"边干活边学习"
第二份成绩单是AdaJEPA,6月底由纽约大学联合杨立昆的创业公司AMI Labs发布,也是他离开Meta后的第一个世界模型成果。知乎知乎
世界模型此前有个通病:模型训练完,参数就冻结。知乎环境一变,预测容易失准,规划跟着崩。
AdaJEPA的做法相反:在与环境的交互中持续学习,基于测试时自适应实时调整世界模型的编码器和预测器参数,等于让模型一边干活一边给自己校准。知乎按杨立昆的说法,这套迭代升级的自适应架构可在任务执行中实时校正预测偏差,将来还要支撑复杂的具身规划与自主操作。知乎

证据强度怎么算?它解决的是世界模型落地的真痛点,也已经进入学术共同体的讨论议程,智源TALK专门做了一期报告。知乎但目前,还没看到大规模复杂真实场景的验证。
三、中国团队跟进了,还带了点"叛逆"
第三件事最有意思。7月底,浙江大学孙俊涵、清华大学赵昊、章国锋等提出INTACT,免去了JEPA世界模型的"搜索税"。知乎
"搜索税"是什么?LeCun团队自己的世界模型LeWM,每次决策要评估9000条候选动作序列,单次推理约1.48秒。知乎这个延迟,工业界的实时控制等不起。
INTACT让世界模型零搜索、毫秒级直接输出动作,宏平均成功率95.33%;Cube E5的300次同起点审计里,98.7%对LeWM CEM搜索的67.0%。知乎

对JEPA来说,这是一步关键的棋:从"会预测但不方便控制"的学术架构,变成一条可工程化部署的控制接口。知乎
杨立昆本人也在X上给这篇论文点了赞。知乎
但更值得说的是采访里的一段话。第一作者孙俊涵直言:LeWM的预测器"在我眼里跟Dreamer的decoder是一回事,都是生成器",没有真正把架构优势用起来。知乎跟进者直接指出宗师作品的问题,这其实比任何一篇论文都更说明问题:JEPA谱系已经变成有人搭、有人挑刺的公共研究领域,而不是杨立昆的独角戏。
四、先别急着下结论,看看另一面
反面的信号,至少有三个。
第一,大模型阵营不买账。杨立昆"大模型只是对海量文本做复杂的模式拟合,它根本不懂意义"的论断,8月在知乎被一篇文章逐条反驳。知乎商业化上,大模型仍然遥遥领先,世界模型还没跑出任何爆款应用。
第二,世界模型阵营自己是分裂的。像素生成(谷歌Genie 3)、3D空间(李飞飞World Labs)、潜空间预测(杨立昆的JEPA)、英伟达卖全栈工具链(Cosmos 3),四条路线押注的东西并不一样。知乎
有基于18个信源交叉验证的深度复盘说得更直接:大模型有Chatbot Arena这种共享基准让各路人马收敛,世界模型至今没有,RoboArena、WorldGym都还是早期尝试。知乎没有统一标尺,每条路线都在自说自话。

第三,融资热不等于技术收敛。今年上半年,世界模型方向融资超13亿美元,其中李飞飞的World Labs以约10亿美元融资把估值推到50亿美元。知乎
杨立昆自己的AMI Labs 3月完成10.3亿美元种子轮,投前估值35亿美元,凯辉、Greycroft、Hiro Capital、贝索斯旗下Bezos Expeditions等机构参投。36氪黄仁勋的英伟达也投了。36氪钱投的是方向,不保结果。
五、杨立昆自己在干嘛
7月的RAISE峰会上,杨立昆以AMI Labs执行董事长身份说得依旧直白:LLM擅长离散的符号序列,但面对工业传感器、摄像头视频流这类连续信号时,基本"完全无用"。B站他还给了个时间表:2027年,AI全面进入物理世界时代。知乎
8月,他又下场做VC:和Gemini联合技术负责人Oriol Vinyals组成核心投资团队,通过新基金投早期AI项目。36氪一边出论文,一边跑资本。你可以不认同他的判断,但得承认,这位66岁的老人不是在打嘴炮。
六、三种人,三种看法,以及值得盯住的信号
如果你是AI研究者或机器人工程师:JEPA谱系这个夏天给出了两个可以直接评估的方向——可部署的控制接口(INTACT)和轻量化精细操控(PatchPolicy)。如果你的项目正被VLA的推理成本和数据采集成本卡住,这两篇论文值得精读。
如果你关注一级市场:世界模型的融资潮是真的,但四条路线分裂、统一基准缺席,押单一路线的标的风险不小。真要下注,不如盯"谁先证明合成数据能让真机稳定涨点"。知乎
如果你只是科技爱好者:这场路线之争值得长期追。四个信号可以先收藏:①AMI Labs什么时候放出第一个完整模型;②会不会出现统一的世界模型评测基准;③世界模型生成的合成数据能不能在真机上兑现;④JEPA系成果会不会从操控扩到导航、自动驾驶。
杨立昆的赌局还没赢。但这个夏天,它确实不再只是嘴炮了。
2027年见分晓?那就等着看。