世界模型中的模拟器,为何比AI画画更难突破?

源自123位全网作者

06-10 09:24

精选参考来源

1
盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型
2
节目都看了,很多人也摸过车了,热闹之后,写点蔚来AD团队是如何做的?以下内容来自去年12月底与任少卿的面对面交流,时间过去很久,凭记忆和自己的理解,写下这些文字,如有错误,请帮忙指正: 任少卿眼中的范式演进:Code 1.0 -> 2.0 -> 3.0 Code 1.0(规则时代): 靠程序员写代码(If-else)解决问题。缺点是代码量爆炸(百万行级),逻辑打架,维护困难,无法穷尽Corner Case。 Code 2.0(数据/模仿学习时代): 给模型看人类驾驶数据,让它模仿。痛点是:数据“脏”:包含违规变道等人类不规范的行为; “平均化”陷阱,导致面对路口博弈时,倾向于保守或随机,缺乏主动性。 什么是平均化陷阱?它把人类两种截然不同但都正确的选择:要么快走,要么停,中和成了一种既不快也不停的“中间态”。而在道路博弈中,“中间态”=“最差的选择”。为了避免这种危险的中间态造成事故,工程上往往会强制叠加安全兜底策略,最终导致车辆表现得极度保守、不敢动弹。 Code 3.0(强化学习RL时代): 不再单纯模仿人类怎么开,而是告诉模型“什么是好的结果”;训练方式: 构建仿真环境(世界模型),设定奖励机制(Reward)。比如:安全通过路口+10分,用时短+5分,压线-2分。 RL的泛化能力强。不需要见过所有路口,只要会解题逻辑;能解决长时序博弈,学会为了长远目标做短期调整,如先让车、再通过;利用量产“脏”数据,通过Reward机制筛选出最优解,改变模型概率分布。 如何实现工程落地: - 世界模型(World Model)作为考场: 建立一个基于真实数据的仿真器。静态: 自动生成路口地形。动态: 生成会交互的虚拟车辆,不仅仅是回放录像,而是能根据自车的动作做出反应(打游戏,闭环仿真)。 - 数据闭环: 人机共驾收集用户打方向盘的轨迹(正样本)vs 模型原有轨迹(负样本),形成成对数据(Pair),用于训练Reward模型。还有NT2的群体智能,影子模式。 - 量产数据利用: 相比专家数据,量产数据量大但质量参差不齐。强化学习通过“评分”机制,从海量数据中提取有效策略,降低对昂贵专家数据的依赖。 - 算力与芯片: 自研神玑芯片全面上车,与Orin平台代码共线率95%,迭代周期压缩至2周。 这就是蔚来NWM2.0,正在使用的方法。 我们常说的数据驱动,通常包含了模仿学习IL和强化学习RL,其实两者并不互斥,我理解它更像是一个 “预训练(Pre-training)+ 微调(Fine-tuning)” 的组合关系。 通过模仿学习IL进行预训练,模型拥有了基座能力,学会了90%的技能:红灯要停、会跟车、认识车道和交通箭头。预训练保证了模型的行为底色是像人的。 而强化学习RL做的是 “去粗取精” 的工作:人类数据里有犹豫的坏样本,也有果断的好样本。RL不需要创造新动作,只需要调整概率分布——把“果断”的概率提上去,把“犹豫”的概率压下来。 而这里面的难点和挑战是: 仿真世界的真实度要求极高,必须避免出现 Sim-to-Real Gap(仿真与现实的鸿沟),即把仿真中的完美模型,部署到真实世界后,性能大幅度下降或失效的问题。 请教了下专业人士,以他的视角来看,纯仿真训练会面临“数据漂移(Data Drift)”的风险——如果仿真里的物理参数,如摩擦力或NPC博弈逻辑与现实有偏差,模型在虚拟世界里“考了满分”,到了真实马路上可能就会“高分低能”。 此外,相比实车录制的物理数据,仿真生成的数据往往缺乏可追溯性,这在汽车功能安全体系中是一个硬伤。这也是为什么行业谈RL很多,但真正上车的case却很少的原因。 所以,Code 3.0 并非要抛弃真实路测,工程上依然需要海量的实车数据作为“锚点”,而超46万台的NT2量产车,和蔚来早期搭建的数据闭环能力,恰恰提供了这个验证土壤。 任少卿所提到的:蔚来NWM2.0在RL的领先性,大概率是说:蔚来是少数完成从仿真到严格的实车验证后,没有发生逻辑漂移问题,让RL训练后的模型,真正落地到了用户车上。
全部
来源
内容由AI生成

精选参考来源

1. 盘点一周AI大事(5月3日)|Google上线AI口语陪练 Google IO即将发布Gemini 4和Veo 4 Gemini上线原生文件生成 Google推出AI衣柜 Google翻译上线AI口语陪练 Claude 接入50多款创作软件,能直接操作Photoshop修图、做海报,接管Blender建模,用Ableton创作音乐 英伟达开源全模态模型Nemotron 3 Nano Omni 研究员训练出复古大模型talkie KAIKAKU发布食品大模型Epicure 研究员开源突破性智能体协作框架Recursive MAS Moonlake上线Blender智能体Moonlake 3D Agent #前沿科技趋势发布月 #AI新星计划 #AI #AIGC #大模型

2. 节目都看了,很多人也摸过车了,热闹之后,写点蔚来AD团队是如何做的?以下内容来自去年12月底与任少卿的面对面交流,时间过去很久,凭记忆和自己的理解,写下这些文字,如有错误,请帮忙指正: 任少卿眼中的范式演进:Code 1.0 -> 2.0 -> 3.0 Code 1.0(规则时代): 靠程序员写代码(If-else)解决问题。缺点是代码量爆炸(百万行级),逻辑打架,维护困难,无法穷尽Corner Case。 Code 2.0(数据/模仿学习时代): 给模型看人类驾驶数据,让它模仿。痛点是:数据“脏”:包含违规变道等人类不规范的行为; “平均化”陷阱,导致面对路口博弈时,倾向于保守或随机,缺乏主动性。 什么是平均化陷阱?它把人类两种截然不同但都正确的选择:要么快走,要么停,中和成了一种既不快也不停的“中间态”。而在道路博弈中,“中间态”=“最差的选择”。为了避免这种危险的中间态造成事故,工程上往往会强制叠加安全兜底策略,最终导致车辆表现得极度保守、不敢动弹。 Code 3.0(强化学习RL时代): 不再单纯模仿人类怎么开,而是告诉模型“什么是好的结果”;训练方式: 构建仿真环境(世界模型),设定奖励机制(Reward)。比如:安全通过路口+10分,用时短+5分,压线-2分。 RL的泛化能力强。不需要见过所有路口,只要会解题逻辑;能解决长时序博弈,学会为了长远目标做短期调整,如先让车、再通过;利用量产“脏”数据,通过Reward机制筛选出最优解,改变模型概率分布。 如何实现工程落地: - 世界模型(World Model)作为考场: 建立一个基于真实数据的仿真器。静态: 自动生成路口地形。动态: 生成会交互的虚拟车辆,不仅仅是回放录像,而是能根据自车的动作做出反应(打游戏,闭环仿真)。 - 数据闭环: 人机共驾收集用户打方向盘的轨迹(正样本)vs 模型原有轨迹(负样本),形成成对数据(Pair),用于训练Reward模型。还有NT2的群体智能,影子模式。 - 量产数据利用: 相比专家数据,量产数据量大但质量参差不齐。强化学习通过“评分”机制,从海量数据中提取有效策略,降低对昂贵专家数据的依赖。 - 算力与芯片: 自研神玑芯片全面上车,与Orin平台代码共线率95%,迭代周期压缩至2周。 这就是蔚来NWM2.0,正在使用的方法。 我们常说的数据驱动,通常包含了模仿学习IL和强化学习RL,其实两者并不互斥,我理解它更像是一个 “预训练(Pre-training)+ 微调(Fine-tuning)” 的组合关系。 通过模仿学习IL进行预训练,模型拥有了基座能力,学会了90%的技能:红灯要停、会跟车、认识车道和交通箭头。预训练保证了模型的行为底色是像人的。 而强化学习RL做的是 “去粗取精” 的工作:人类数据里有犹豫的坏样本,也有果断的好样本。RL不需要创造新动作,只需要调整概率分布——把“果断”的概率提上去,把“犹豫”的概率压下来。 而这里面的难点和挑战是: 仿真世界的真实度要求极高,必须避免出现 Sim-to-Real Gap(仿真与现实的鸿沟),即把仿真中的完美模型,部署到真实世界后,性能大幅度下降或失效的问题。 请教了下专业人士,以他的视角来看,纯仿真训练会面临“数据漂移(Data Drift)”的风险——如果仿真里的物理参数,如摩擦力或NPC博弈逻辑与现实有偏差,模型在虚拟世界里“考了满分”,到了真实马路上可能就会“高分低能”。 此外,相比实车录制的物理数据,仿真生成的数据往往缺乏可追溯性,这在汽车功能安全体系中是一个硬伤。这也是为什么行业谈RL很多,但真正上车的case却很少的原因。 所以,Code 3.0 并非要抛弃真实路测,工程上依然需要海量的实车数据作为“锚点”,而超46万台的NT2量产车,和蔚来早期搭建的数据闭环能力,恰恰提供了这个验证土壤。 任少卿所提到的:蔚来NWM2.0在RL的领先性,大概率是说:蔚来是少数完成从仿真到严格的实车验证后,没有发生逻辑漂移问题,让RL训练后的模型,真正落地到了用户车上。

3. 小鹏Drive-JEPA:结合JEPA的世界模型端到端框架,最新SOTA!

4. AI圈最顶级的一次争吵,理解世界还是堆模型? #大咖观察 #红衣聊AI #大模型 #人工智能

5. 文远WeRide GENESIS世界模拟器方案解析

6. 拆解理想在世界模型方向的工作

7. 前xAI 员工Sulaiman Ghori在播客节目里爆料:xAI曾设想,利用北美数百万辆配备AI4芯片的闲置特斯拉,运行模拟器。这些车会有闲置时间,例如停放充电。通过支付车主租赁计算时间,在车辆上运行模拟器。这会拥有更好的成本优势。这个模拟器在xAI内部叫做Macrohard,核心是开发人类模拟器:AI代理通过屏幕视觉感知、键盘输入和鼠标操作,自主执行任何数字任务,如编码、办公、设计、运营等,实现大规模自动化白领工作流程。车辆分布式计算更适合推理/运行已训练模型,或模拟任务,确实相比单独建立服务器中心更具性价比。

8. 机器人长出800个心眼?阿里达摩院开源具身新大脑,硅谷又坐不住了

9. 一模双擎三端破局:灵境引擎3.0开启具身智能的「物理真实」训练新范式

10. 人脑的学习模式,是人类进化的多元奖励函数、主动探索与因果推理共同作用的结果,而当前大语言模型的学习,仍停留在单一目标、海量数据与统计拟合的层面。二者的差距并非架构或算力的落差,而是智能底层逻辑的代际分野。//@高飞://@出版人周筠://@韦恩卑鄙:这个可能是正解 这个奖励系统可太难了

11. 国产模型开源封神,谷歌Genie3紧急开源?蚂蚁AGI撕开世界模型闭源防线

12. 物理 AI 将重构汽车生产模式|凡拓数创叶密兴分享智造新路径

13. 特斯拉OpenAI数据路线遇挫!8千平具身「兵工厂」+ego众包狂飙

14. 全面解析“世界模型”:定义、路线、实践与AGI的更近一步【硅谷101】

15. 世界模型双冠王诞生!国产世界模型力压谷歌、英伟达等持续领跑

16. 登顶全球权威榜单!浙大创业团队百卡打造开源实时世界模型,视频秒变可交互4D世界

17. 被@首席线索官 按着重新复习了一下NV的Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail【衔接推理与动作预测,实现长尾场景下的泛化自动驾驶】简单在写一点个人理解:①:来自模仿学习的端到端构架,可以通过扩大数据集的方式提升能力,但是在关键的安全长尾场景下,因为数据分布、因果理解有限,所以安全兜底能力不足。【很难用端到端去做L4的安全兜底】②:面向#自动驾驶# 的长尾场景,通过因果链推理【Chain of Causation】和轨迹规划相结合,可以显著的提升复杂场景下的驾驶决策能力。【Alpamayo-R1】VLA模型③:如何将因果链和推理轨迹对齐是一个核心难点?【来自强化学习RL的思路,可以激发这个能力@本诺__ 】⭐实验的结果表现⭐与仅基于轨迹的基线模型相比,AR1 在复杂场景下的规划精度提升高达 12%,在闭环仿真中,偏离道路率降低 35%,近距离碰撞率降低 25%。经强化学习后训练,大型推理模型评估显示推理质量提升 45%,推理 - 动作一致性提升 37%。模型参数从 0.5B 扩展至 7B 时,性能持续提升。这个能力提升已经是非常明显了~里面有几个细节:①:因为VLM【LLM】通常用单独处理的图像和视频流信息,而AD车往往用环视多摄像头、多时间维度的感知。因此直接用VLM处理多个视频流信息会导致Token数量太大【讲人话,显存和带宽爆掉了,我需要更强的芯片@Rocky刘毅林 】②:基于传统非驾驶专用的LLM的描述是自由的形式【废话太多,而且和驾驶领域无关信息更多】,无法形成严格的因果化推理。因此不能直接用,需要基于现有帧关键特征进行因果化的推理才能解决长尾场景。③:整个R1模型是输入多摄像头、多时间帧作为视觉输入、外加用户指令和高纬导航需求,用【Cosmos-Reason】作为主干网络,直接输出推理轨迹、原动作和预测未来轨迹的token。图二④:NV为了开发这个VLA的视觉语言模型,进一步增强其自动驾驶的能力。包含370万视觉问答【VQA】包含2.47万个驾驶场景的视觉问答。然后额外增加了10万自动驾驶场景的样本【在监督微调阶段】。这里注意一个事情数据收集,在自动标注里面用了Qwen3-VL这个教师视觉语言模型【👍】⑤:多摄像头视频信息进VLA ,token太多这里AR1用了一个新的压缩方式【Ivanovic ,2025】。简单来说,可以每一步多摄像头的token表征可以少至288个【等效7个摄像头,每个摄像头用41.1个token】,且不牺牲端到端驾驶的性能指标。此外还通过压缩帧之间的信息冗余等方式进一步压缩Token 数量。【考点,VLA不是不能做,只是车端算力不够。必须要压缩同一时间进模型的Token数量】有趣的尝试+1⑥:为了让VLA这个构架能有效运行:三个必要条件,(1)动作表示必须准确,同时保持保真度和多模态;(2)解码过程必须足够快,以支持实时推理;(3)解码机制应与 VLA 训练流水线无缝整合。【研究发现原始位置,坐标点】很容易受到传感器噪音影响,导致模型收敛不佳。因此R1 不直接在原始位置路点空间学习 ,而是采用基于单轮车动力学的动作表示,以实现更好的闭环性能。【有趣的尝试+2】⑦:传统的VLA/VLM会存在行为描述模糊、推理表面化和因果混淆的情况【图三】,因此R1构建了推理轨迹 关联显式的驾驶决策,构建因果链。具体来说,R1构建了具体的推理因果的分类【图四/图五/图六】图四:用于将推理轨迹锚定到显式控制意图的封闭集驾驶决策(纵向和横向)图五:可能作为驾驶决策因果因素的关键组件类别和示例属性图六:片段选择中使用的场景,以及 CoC 标注的关键帧和关键帧范围定义这里在简单解释一下,为了让模型收敛。R1进行了结构化组件的定义,获得了和自动驾驶相关的关键帧。【这里每个Clips 包含20S的数据,在训练里用2秒的历史数据和6秒的推测数据】。为了进一步提升模型的泛化能力。R1利用远动作定义分类去开发了一套自动标注系统。见图七,在每个8秒的数据样本里面最多标注一个纵向和横向的高级驾驶决策,而元动作以10hz的速度自动标注。⑧:最后模型的训练方式怕【图八】:采用三阶段训练策略,将视觉语言模型转化为具备推理能力的自动驾驶策略。1. 离散轨迹令牌训练并添加基于流匹配的动作专家,将动作模态注入视觉语言模型,使模型能够预测车辆控制输出2. 通过在 因果链 数据集上进行监督微调,提升模型的推理能力,教会模型生成基于因果的解释,以支持更好的驾驶决策3. 利用大型推理模型反馈的强化学习,优化推理质量、使推理轨迹与执行的动作对齐,并优化轨迹质量,从而产生可解释且安全的驾驶行为⑨:基于强化学习的后训练【图九】,通过优化三个互补的奖励信号:推理质量(通过大型推理模型反馈)、推理 - 动作一致性和轨迹质量的方式进一步提升模型的稳健性和泛化能力。最后实际表现,前面已经说了。在移动端跑得动跑不动?在 NVIDIA RTX 6000 Pro Blackwell 跑的延迟是99ms?跑得动,还不错? 但是现阶段车端Thor还是跑不动的...所以 真满血 学术 VLA上车?还是要 等到千T以上的车端芯片再看看?不得不说,NV 的Alpamayo-R1 研究还是做的非常扎实的.从学术上看,VLA 确实是一条能跑的通的明确的路线~@大雁jassy @电动知士大雨 #懒博小课堂##微博新知#

18. 自动化所 x 引望提出DynVLA:一种基于 World Dynamics的VLA推理模型

19. Alluxio AI——构建面向具身智能数据闭环的高性能数据访问平台

20. 【高德全量开源具身操作基座模型 ABot-M0】 高德宣布全量开源 ABot-M0,称其为全球首个基于统一架构的机器人具身操作基座模型,可实现“一个通用大脑”适配多种形态的具身机器人。 核心信息:在 Libero-Plus 基准上任务成功率达 80.5%,较业界标杆方案 Pi0 提升近 30%;开源涵盖数据(超 600 万条真实操作轨迹的 UniACT 数据集)、算法(动作流形学习 AML、双流感知架构)与模型三大维度。 观察:高德从地图服务向具身智能底层技术延伸,以“开源数据集+算法+模型”构建通用技术基座,为“通用大脑+专用躯体”的产业标准落地提供实证支撑。 #高德 #具身智能 #开源模型 #机器人#

21. 万亿具身智能赛道,被数据卡住了

22. 评论中很多人都嘲笑李飞飞过于悲观,是因为混淆了工业机器人与人形机器人的差别,前者多为固定臂与AGV,环境可控;后者需在三维开放环境中与人与物的交互,难度量级不同。另外,人们也低估了数据与仿真的核心价值:真实世界的数据既稀缺又昂贵,生成式世界模型与仿真训练仍有很长的路要走。

23. //@高飞:谢赛宁:业界谈"世界模型"常联想到Sora式的视频生成,但Waymo的世界模型指向更本质的东西:自动驾驶要同时建模LiDAR点云、摄像头、毫米波雷达、IMU、GPS、车辆动力学等异构信号,它们是连续、高维、带噪声的,与离散token完全不同。真正的世界模型必须统一建模这些信号及其耦合关系——这才是"multimodal"的本义,而非业界常说的"文本+图片+视频"拼接。 查看图片 //@来去之间:转发微博

24. #小鹏第二代VLA发布#小鹏的世界模型进步非常快,目前世界模型生成海量的优质长尾场景用于仿真测试,小鹏仿真场景从一年前的3万增加到50多万个,每日仿真测试里程等效于3,000万公里实车测试~世界模型还可以根据VLA输出的动作,调整场景,进行RL强化学习

25. 世界模型VLA SOTA!DriveWorld-VLA:自驾VLA的统一潜在空间世界建模(小米&北交)

26. Waymo的自动驾驶二十年:世界模型+端到端,然后呢?

27. 🔬 #理想汽车CVPR2026入选12篇论文# 从感知到世界模型🌟三个核心看点🌟1. 感知与规划:让车更会"看"、更会"想"SparseWorld-TC被收录为Oral报告(顶会最高荣誉之一),直接跳过传统鸟瞰图投影,从原始图像端到端预测未来1-3秒三维场景变化,相当于给车装上了"预判雷达"。SGDrive框架模仿人类驾驶逻辑:先感知环境→再锁定周围车辆行人→最后决策怎么开。在NAVSIM纯视觉方案中做到当前最优。PlannerRFT解决AI规划器"路况一换就不会开"的问题,配合自研nuMax仿真器(推演速度提升10倍),让强化学习训练效率大幅跃升。2. 世界模型四项突破:仿真更真、评测更严• InfiniDepth:用神经隐式场做深度估计,突破分辨率上限,距离判断更精准• Unposed-to-3D:从真实驾驶图像直接重建3D车辆模型,降低仿真资产成本• DriveCombo:揭露现有评测基准的盲区——只测单一规则,真实路况是多规则并发甚至冲突。自建双模态基准,覆盖从单规则到规则冲突消解的完整链路• AD-R1:解决世界模型"只见过安全驾驶数据,遇到危险反而预测为安全"的偏见,用反事实合成训练更公正的因果预测器3. 认知、语言与视觉:推理更快、模型更轻• CogDriver:给AI加上"记忆",记住历史驾驶状态,驾驶得分提升22%,轨迹误差降低21%• LinkVLA:语音指令理解准确率提升,推理延迟降低86%• FastMMoE:无需重新训练,直接精简MoE冗余计算,解决大模型部署贵的问题• CoV-Align:视觉语义优先对齐,推理速度提升3-5倍• Switch-KD:0.5B小模型逼近1.5B能力,为车端边缘计算提供轻量化方案理想这次12篇论文入选,覆盖的维度很完整——感知、规划、世界模型、仿真、评测、轻量化部署,几乎把自动驾驶的技术栈从头到尾梳理了一遍。有几个信号值得关注:第一,"自己造工具"的意识在觉醒。 nuMax仿真器、DriveCombo评测基准,这些不是直接提升算法指标,而是解决行业基础设施的短板。当大家都用同一套公开数据集和仿真器刷榜时,真正的差异化恰恰来自"定义问题"的能力。第二,开始直面AI的"安全幻觉"。 AD-R1这篇很有意思——世界模型只在安全数据上训练,遇到危险反而预测为安全,这是行业长期回避的隐患。当然,论文到量产还有距离。SparseWorld-TC的端到端预测能否在雨天、夜间等低质量图像条件下保持稳定性,Switch-KD的轻量化方案能否通过车规验证,这些都需要时间检验。

28. 为什么AI短期内革不了游戏引擎的命?

29. 刚刚,高德ABot-Claw亦庄半马封神!具身智能的Harness来了

30. 当AI学会了创造世界,科幻电影中的机器人时代开始全面加速! #AI新星计划 #科技改变生活 #玩个很新的东西 #世界模型 #具身智能

31. #小米新SU7XLA大模型揭秘# 新一代 SU7 搭载的XLA 认知大模型,依托小米自研MiMo-Embodied 具身智能基座,实现行业重大突破:首次彻底打通辅助驾驶与具身机器人两大核心任务,完成知识双向迁移那区别于传统 VLA 架构,XLA 升级多模态感知,融合视觉、雷达、声音及机器人交互数据,结合世界建模、潜空间推理技术,兼顾端到端快速响应与语义理解能力。厘米级环境感知、毫秒级极速决策,不再机械识别路况,而是真正理解真实世界、预判风险、自主规划路径小米用 2 年走完同行 5-10 年技术路XLA 大模型以统一具身架构领跑行业,让汽车成为最先落地的民用具身智能载体,重新定义高阶辅助驾驶新范式#车是最先落地的具身智能 #

32. 盘点一周AI大事(2月15日)|王炸视频模型 字节正式上线最强视频模型「Seedance 2.0」 字节发布最强开源视频模型「Alive」 工程师davidohyun开源龙虾女友「Clawra」爆火 Google升级最强推理模型「Gemini 3 Deep Think」 智谱发布最强开源大模型「GLM-5」 MiniMax发布最强开源编码模型「M2.5」 Google官宣AI互联网协议「WebMCP」 Claude上线Windows版「Cowork」 Google Stitch炸裂升级 千问发布最强开源图像模型「Qwen-Image-2.0」 研究员开源最强语音合成模型「MOSS-TTS」 研究员推出最强开源音乐模型「SoulX-Singer」 研究员开源最强配音模型「Just-Dub-It」 #AI新星计划 #抖音年味新知贺岁 #前沿科技趋势发布月 #AIGC #人工智能

33. 中科院&长安汽车提出Latent-WAM:隐式世界动作建模+3D几何感知蒸馏实现双榜SOTA

34. CVPR2026上,刘先明分享了小鹏的进展,以及对基座模型的思考:小鹏的技术路径并非在 VLA 和世界模型中二选一,而是将两者结合,构成物理世界基座模型。两者训练目标不同,互为补充。第二代 VLA 负责“如何行动”。通过人类驾驶行为的输入(视频/指令)与输出(动作)进行建模。这种方式的挑战是人类行为数据在时间上是稀疏的,只能提供结果监督。世界模型负责“理解行动后的世界变化”。采用类似大语言模型预测“下一个 Token”的逻辑,在海量视频上密集预测下一帧画面或下一个物理状态。提供高密度的训练信号。小鹏通过四篇学术论文,来展示世界模型的具体作用:可控生成(X-World): 给定一个驾驶动作,模型能生成符合物理规律的未来视频。用于闭环仿真和造数据。长时序推演(X-Foresight): 将视觉与动作结合,预测未来场景演化,直接给 VLA 的控车决策提供支持。加速推理(X-Cache): 提出跨段块级缓存技术,极大减少重复计算,将推理速度最高提升 2.7倍。主动思考(X-mind 待发): 解决端到端模型的“黑盒”痛点,输出决策的中间推理过程,提升可解释性。在训练端,小鹏的单版模型训练量超 4万亿 Token,集群 GPU 硬件利用率达 90%。VLA2.0+图灵芯片,相较于开源模型+通用芯片,计算利用率从 22.8% 提升至 82.5%,推理时延从 800毫秒 压缩至极限的 80毫秒。小鹏的最终目标,是 L4 级自动驾驶及具身智能。

35. CVPR'26 FastGS 开源!3DGS训练的全能加速器,覆盖静态/动态/表面/大场景/稀疏视角/SLAM六大重建任务!

36. 【当大模型不再扮演一个人,而是模拟一个社会】Karpathy 最近投资了一家叫 Simile 的公司,他的投资逻辑很有意思:我们一直在用错误的方式理解大模型。通常我们和大模型对话时,它扮演的是一个精心设计的单一人格。但如果回到预训练的原始状态,大模型的本质其实是一个模拟引擎,它在互联网上海量人群的文本中训练而成。既然如此,为什么只让它模拟一个人?为什么不让它模拟一个群体?这个视角一旦打开,问题就变得有趣了:如何构建这样的模拟器?如何管理它的熵?模拟的忠实度如何衡量?当这些模拟体形成循环时,会涌现出什么特性?MIT 的团队已经在做类似的事情,他们用 1.51 亿个智能体模拟整个美国,研究劳动力市场、供应链和生物安全风险。这不是科幻,是正在发生的研究。有人提出了一个尖锐的问题:一个模型模拟一百个人,本质上还是一个模型的盲区。人格多样性不等于认知多样性。不同的训练数据带来的是不同的失败模式,而不仅仅是不同的观点。这个批评很到位。但反过来想,如果我们能忠实地模拟一个多样化的群体,就可能观察到意见级联、共识形成、文化漂移这些社会学现象。这意味着可以做那些在真实人类身上无法进行的实验。熵的管理可能是核心难题。一个在互联网文本上训练的群体模拟器,如果没有结构化的真实锚点,会不可避免地漂移。真正的突破或许在于群体模拟加上持久的结构化记忆。大多数人还没有内化这个认知:大模型从根本上是一个群体模拟器,而不是单一人格的扮演者。当我们开始认真对待这个本质,新的可能性才刚刚展开。x.com/karpathy/status/2022041235188580788

37. CVPR'26 Highlight | ParticleGS:首个物理驱动4DGS预测新范式,通向4D世界模型

38. 一个月的活一周干完!英伟达世界模型训练速度飙升400%

39. 盘点一周AI大事(2月1日)|AI乌托邦魔幻开局 Google上线世界模型Project Genie 阿里开源实时世界模型LingBot-World AI乌托邦社区Moltbook爆火 Chrome升级为AI浏览器 月之暗面发布最强开源大模型Kimi K2.5 Gemini 3 Flash升级视觉能力 腾讯发布最强开源图像模型HunyuanImage 3.0-Instruct 阿里开源Z image Base满血版 OpenMOSS发布最强开源视频模型MOVA MIniMax上线顶级音乐模型MiniMax Music 2.5 英伟达开源天气预测模型Earth-2 #AI新星计划 #前沿科技趋势发布月 #抖音知识年终大赏 #AI #AIGC

40. #大众9X首发MomentaR7世界模型# 可以说是德系品牌和智驾的强强联合了,这套世界模型最牛的是可以让汽车AI自己探索该怎么样开车。这套智驾系统将会搭载于ID.ERA 9X上,3月30日正式开启预售,顺利的话,应该会助力大众进入智能辅助驾驶的第一梯队,感兴趣的同学可以期待下。不同于传统的智驾,大众的R7模型是通过虚拟环境的自主推演,然后让AI找出一个最优策略,再通过引入世界的模型,可以做到30秒内预判交通动态,包括鬼探头这种极限场景,这套系统相较于上代的R6提升了5倍多,既然正式商用,可靠性就不需要太担心~

41. 车企的云端世界大模型,跟之前的仿真世界有啥不同?就是主次关系的不同:过去都是数据直接训车载小模型,然后放到仿真世界测试但是大家的仿真世界都做的稀巴烂,根本没法反映现实世界的物理规律、交通情况;所以极度依赖测试车到处跑,甚至拿用户当小白鼠现在不一样了,新势力头部做 AD,都是先拿数据训练云端 WM(世界模型),充分模拟反映现实世界的物理规律、交通情况,然后再用云端 WM训练车端小模型你们可以理解为:云端 WM 是母体,我们车里跑的那些什么 E2E、VLA...是子体母体的水平,直接决定了小模型的能力所以不要纠结子体小模型走了什么技术路线,母体 WM 的算力大小、模拟水平才是核心

42. 双SOTA!GenieDrive:物理一致的自动驾驶世界模型(港大&华为诺亚)

43. 盘点一周AI大事(12月21日)|谷歌手撕OpenAI OpenAI 上线最强图像模型GPT Image 1.5 OpenAI发布最强编码模型GPT-5.2-Codex Google发布 Gemini 3 Flash Google开源A2UI协议 微软开源最强3D模型TRELLIS 2 阿里开源分层编辑图像模型Qwen-Image-Layered 阿里发布Veo 3平替Wan2.6 字节发布Veo 3平替Seedance 1.5 pro 腾讯开源首个实时交互世界模型WorldPlay 研究员开源照片重新对焦Genfocus Pipeline 研究员开源实时换脸视频模型PersonaLive Meta开源最强声音分割模型SAM Audio #抖音知识年终大赏 #AI新星计划 #OpenAI #AIGC #前沿科技趋势发布月

44. 图灵奖得主跑来中国,居然是为了给机器人开家幼儿园? #科技改变生活 #玩个很新的东西 #具身智能 #机器人 #图灵奖

45. 除了影像硬件升级,这次Pura90 Pro软件同样有新玩法~XMAGE智拍:最大的提升不是单一的后期帮你修图,而是从按下快门之前就帮你安排好,除了之前的AI辅助构图和和XMAGE色卡,这次还新增了AI姿势推荐,根据环境给出相应的姿势推荐,照着预览框做就行。3D动态照片(图4/5/6):只需拍一个机位一张普通Live图,不用其它设备就能直接变成环绕运镜的3D动态效果,成本低操作简单。而且可以保存为视频或动图,发圈或者剪辑都很方便。#曝iPhone18Pro定价激进#

46. 世界模型+闭环强化学习怎么理解?少卿还是举了一个路口选道到最右侧的场景来说明通过奖惩的方式,让系统自己学会选道,模型在仿真器中像玩游戏一样不断去做尝试,怎么选道,什么时候发起选道,由模型自己去摸索,它只看结果这个选道场景当中有几个指标,安全、安心、舒适、合规,效率模型过的好,就给它奖励,过的不好则进行处罚,所以大家能感受到新版上面,选道正确的优先级特别高,几乎没有选道错误的情况发生图2是强化学习的训练方式,少卿上次跟我们讲的时候说是有3种,1种是车端打分器,第2种是开环训练,第3种是现在蔚来上的闭环强化学习,车端打分器的逻辑就是多条轨迹筛选出最好的,大家应该也有印象,别的品牌也上过,蔚来在上个版本也有车端打分器,所以模型有时候总有跳变,它的限制主要是模仿学习的质量开环强化学习就像是PPT,车不动,环境动,如果老司机操作就会给高分,急刹或重刹就给高分,但是模型不知道我如果不按照PPT开会发生什么闭环强化学习,必须要有一个非常还愿物理世界的世界模型,在仿真器中打游戏,模型不断输出轨迹,然后环境跟车都跟着它动,在互动当中尝试蔚来Banyan 3.3.0 用的是闭环强化学习,仿真的效果比以前要好不少,只要有见过的场景,都能造出来进行训练,这次的能力提升,很大程度取决于强化学习,过程当中也有跟AI的斗智斗勇,因为AI还是会耍小聪明去拿高分,也看到一些强化学习带来的负体验,甚至有点强规则感的选道逻辑,可能只有1%的情况会遇到,下面几个版本还得慢慢去调#新能源汽车#

47. 300美元跑通世界模型!比老黄便宜10倍

48. 「被动感知」到「理解接触」!它石智航重磅发布OmniVTA视触觉世界模型

49. #小米新SU7XLA大模型揭秘##车是最先落地的具身智能#智能驾驶赛道竞速进入深水区,小米以惊人迭代速度改写行业节奏。过去两年,小米HAD辅助驾驶完成3个大版本迭代,走完诸多同行5年甚至10年的技术演进之路,实现从行业跟跑到技术引领的跨越式突破。 从初代无图方案落地,到数据驱动端到端模型规模化交付,再到新一代SU7搭载的XLA认知大模型,小米完成从规则驱动、数据驱动到认知驱动的三级跳。XLA架构突破传统VLA模型局限,融合多模态输入、世界建模与自研MiMo-Embodied具身基座能力,为自动驾驶演进开辟全新路径,也印证了车是具身智能最佳落地场景。

50. 击败PI ,清华系具身公司包揽「具身奥林匹克」三项全球第一,刷新世界纪录!

51. 2025设计师必学的AI生图方法,0基础教程来了! AI出图别只磕关键词,1期视频总结超多的AI出图方法,还有图文教程!#设计 #平面设计 #Lovart #ai新星计划 #抖音知识年终大赏

52. 为什么蔚来会押注世界模型?

53. 如何在短时间内学习Multi-Agent(有翻译成智能体or代理)建模?

54. 李飞飞长文拆解世界模型实现路径

55. 李飞飞厘清世界模型分类 模拟器才是行业核心枢纽

56. 李飞飞看不下去了!亲自下场“辟谣”世界模型

57. 李飞飞厘清世界模型定义 仿真器才是核心支柱

58. 以后谁再管自己叫世界模型,你就问他一个问题

59. 世界模型

60. 李飞飞

61. 可解释、高精度、低功耗、能自主推演的物理智能体大脑。

62. 物理引擎正在重塑AI!英伟达Omniverse成最大赢家

63. AI告别 “物理盲”!国产可微分物理仿真引擎突破,让智能更贴近生活

64. 打破国外垄断!国产物理仿真引擎让AI告别“物理盲”

65. 仿真器 vs 世界模型,具身智能的两条主路终于被画进同一张地图

66. 世界模型系列109

67. GeoCausal

68. 具身大模型架构

69. 空间智能与世界模型的宏伟宣言—从三维感知到因果推理的范式革命

70. World Model三部曲(二) Simulator

71. 世界模型四大范式:规划器、模拟器、合成器、动作模型

72. 世界模型再进化!VLAW框架打造机器人“虚拟训练场”

73. 世界模型:赋能物理智能的新一代神经网络

74. (全)【2026·春】CMU 10799《扩散模型与流匹配》 中英字幕

75. 世界模型系列79:外部模拟器

76. 动态操控进入统一坐标:DOMINO 与 PUMA 如何重构具身评测与建模

77. 世界模型,是自动驾驶的终极答案吗?

78. 世界模型202604

79. IPR-1:交互式物理推理器

80. 一文读懂世界模型(World Models)

81. 万帧照片级仿真,打通视觉机器人学习的感知与物理鸿沟:国产仿真器GS-Playground入选RSS 2026

82. Grounded World Model 语义泛化规划

83. 什么是世界模型?探讨 WMs 的关键技术及其价值

84. World Model 进阶式论文【一】

85. DriveDreamer-Policy:深度帮助生成视频,提升轨迹性能

86. TapNow让我一个不会建模的人做出了3D世界

87. 增强规划的自动驾驶world model -- 路线探讨

88. AIGC核心技术拆解:从模型训练到生成逻辑,为什么它能颠覆内容创作?

89. 世界模型系列36:建模层-状态预测

90. 物理AI系列|从显式规划到物理直觉:具身智能重构家庭机器人任务规划

91. 高精地图、神经重建与世界模型:三套架构,同一个问题

92. LeWorldModel:世界模型稳定训练

93. 飞捷科思可微分物理仿真引擎发布,构筑从物理AI仿真到基础模型全栈体系

94. [作者说-具身VLA] 第三期:构建世界模型环境协助 VLA 模型进行后训练:中山大学联合其他机构联合发布 RehearseVLA

95. 可以互动的世界模型:Interactive World Simulator

96. 多模态生成基础——DDPM与VAE

97. Physics-grounded World Model Slides 分享

98. 告别纯相关学习!因果赋能深度学习,模型泛化与鲁棒性全面跃升

99. 可交互世界模型lingbot-vla、HY-WorldPlay、Genie3

100. “世界模型”是怎么被一步步引入到“智能体”当中的?【雷达】

101. 捕捉轨迹的场景演变!浙大开源DynFlowDrive:用于自动驾驶的动态世界建模

102. 从单张图片到可巡航空间:世界模型如何用1%数据实现机器人训练突破

103. 世界模型:让AI看懂真实世界的“超级大脑”

104. 上海AI Lab定义具身智能「第三类范式」:构建一个可被控制的三维世界模型

105. 别再用MSE训练世界模型了!清华发布 RoboAlign-R1,具身世界模型终于对齐了任务目标

106. Micro-World:AMD 首个开源交互式世界模型,面向开放域场景的动作可控视频生成

107. 南开具身智能中的世界模型!世界模型的分类、评估与未来趋势

108. 什么是世界模型(World Models)?

109. 35+程序员从零开始学AI——DALL·E和Stable Diffusion背后的原理

110. 李飞飞世界模型的功能分类法:当渲染、模拟与规划走向融合

111. 世界模型让机器人“想象”世界

112. 世界模型与世界动作模型(WAM):从基础模拟器到具身动作

113. 具身智能实战教程,第三章 仿真器原理与实战

114. 任意新视角合成!丰田AnyView:基于扩散模型,无需显式几何的端到端时空建模

115. 世界模型,为什么突然成了一门显学?

116. WorldReel

117. TapNow X 世界模型|一键连接想象与生成

118. “优化管线”决胜,“数据筛选”筑基:从ICRA 2026看世界模型的技术发展趋势

119. 基于扩散模型无需显式几何的端到端时空建模

120. 《具身智能发展报告(2025)》(六)具身智能产业展望:技术架构重构、应用场景深化、安全伦理构建

121. 《神经符号架构的邻域:与其他AGI路径的交叉与融合》

122. 联汇科技CEO赵天成:解码具身智能的共识与分歧,寻找下一个十万亿产业的“破局点”

123. 基于事实与价值混合的人机融合推演系统

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章