李飞飞WorldLabs发布Atlas,几张照片生成1分钟1440p视频

源自300位全网作者

16:28

内容由AI生成

精选参考来源

1. 物理AI真正的难题,是理解世界,并在充满限制的真实世界里行动。半年前,小鹏提出物理AI能力公式:能力 = 模型 × 算力 × 数据 × 本体。其中,模型决定智能上限,数据提供世界经验,算力支撑训练与运行,本体让AI真正落地物理世界。一个完整的物理AI系统,其能力不取决于任何单点突破,而来自四者的共同Scaling。#小鹏第二代VLA首次模型重大升级##小鹏G9L首发第二代VLA全新版本#

2. Code-as-World:从一段视频,逆推整个物理世界

3. 半年前,小鹏提出物理AI能力公式:能力 = 模型 × 算力 × 数据 × 本体。其中,模型决定智能上限,数据提供世界经验,算力支撑训练与运行,本体让AI真正落地物理世界。一个完整的物理AI系统,其能力不取决于任何单点突破,而来自四者的共同Scaling。

4. #小鹏一套AI底座打通汽车和机器人##小鹏G9L首发第二代VLA全新版本#物理AI真正的难题,是理解世界,并在充满限制的真实世界里行动。半年前,小鹏提出物理AI能力公式:能力 = 模型 × 算力 × 数据 × 本体。模型决定智能上限,数据提供世界经验,算力支撑模型进化,本体则让AI真正进入物理世界。 如今,小鹏第二代VLA迎来模型首次重大升级。背后依托的,正是过去几年持续建设的AI Infra——从数据采集、训练、仿真、评估,到部署和算力,逐步形成从真实世界数据到模型迭代的完整闭环。随着数据持续积累、算力不断提升、工具链持续完善,这套AI Infra正在形成规模效应和复利效应,沉淀为可跨产品、跨场景复用的底层能力。“One Infra, Two Products”,从汽车到机器人,同一个基座模型,正在学会控制不同的本体。 小鹏通用智能中心负责人刘先明表示,真正的AI公司,必须具备持续解决“Unknown Unknown Problems”的能力——那些未知的未知问题。只有建立完整的AI体系,才能不断从真实世界中发现问题、解决问题,并推动技术持续迭代。因此,小鹏做的并不只是自动驾驶、机器人或汽车,而是在围绕物理AI持续建设一套通用的底层能力。从汽车到机器人,从模型到芯片、数据和Infra,小鹏正在以一套通用AI基座,走向更广阔的物理世界。

5. 物理AI真正的难题,是理解世界。真实世界并不是一张张静止的图片,而是一个不断变化、连续演进的过程。世界除了三维,还有时间维度,就是四维。小鹏第二代VLA升级的核心,是让模型第一次建立起对时间维度的理解。小鹏物理世界基座模型,首次把“时间”纳入模型,AI理解世界的维度,从“3D空间”跃迁至“4D时空”。第二代VLA同步提升了模型推理效率,采用Streaming Inference(流式自回归推理),从离散推理走向连续推理,端到端响应速度提升300%。面对不断变化的道路状况,传统的模型是“看 → 算 → 输出 → 再看”的模式,而第二代VLA能够做到“边看、边想、边行动”的并行处理。遇到前车突然刹停、行人折返、旁车强行加塞等突发情况,车辆提前做出预判。蒸馏后的图灵VLA 2.0 Lite预计9月开启首批推送,小鹏G9L Max版本将首发搭载这一蒸馏版本。#小鹏第二代VLA首次模型重大升级##小鹏G9L首发第二代VLA全新版本#

6. #小鹏第二代VLA首次模型重大升级##小鹏高管称一套AI底座打通汽车和机器人# One Infra, Two Products一套AI底座打通汽车和机器人从汽车到机器人,同一个基座模型,正在学会控制不同的本体。小鹏通用人形机器人IRON搭载3颗图灵AI芯片,有效算力高达2,250 TOPS,小鹏物理世界基座模型已实现端侧部署,无需远程遥操作即可自主完成复杂工作任务,同时保障推理低时延与数据安全。模型能力的持续进化,背后依赖的是一整套长期建设的AI Infra。过去几年,小鹏持续投入建设覆盖数据、训练、仿真、评估、部署和算力的物理AI Infra 体系,以自动驾驶作为第一个规模化应用场景,逐步建立起从真实世界数据采集,到模型训练、测试、部署,再到用户反馈和持续优化的完整闭环。数据规模在增长,模型训练效率在提升,算力和工具链持续完善,越来越多真实世界的问题能够被纳入模型迭代,数据规模的护城河正逐步形成,小鹏集团在AI Infra领域的长期投入,已逐步沉淀为可持续复用的基础能力,呈现出明显的规模效应,开始产生复利。

7. 最近又回顾了下理想被 CVPR 2025 收录的一篇文章:《DrivingSphere: Building a High-fidelity 4D World for Closed-loop Simulation》 🔗论文链接:网页链接大致意思就是传统开环评测通常是拿一段真实录像给智驾模型,模型输出轨迹,但环境不会因为模型的动作发生变化。这样能评估感知、规划是否接近参考答案,但很难测试真正的连续决策。DrivingSphere 做的是一个高保真闭环环境:模型输出动作以后,虚拟世界会更新,再重新生成下一时刻的视觉输入它的技术结构大概可以理解成三层:1️⃣第一层是先搭世界。不是直接用视频生成模型“画下一帧”,而是构建一个带时间维度的 4D Occupancy 世界,把静态道路、建筑,以及车辆等动态物体放进统一空间表达里。这个空间表达是后续所有生成和交互的“骨架”2️⃣第二层是把世界渲染成智驾真正能看的画面。它再用 Visual Scene Synthesis,把 4D 世界转换成高保真、多摄像头、时间连续的视频。这点很关键,因为现在很多端到端/VLA 智驾最终吃的仍然是视觉传感器输入3️⃣第三层才是真正的闭环:模型看画面 → 输出轨迹/控制 → Ego 位置改变 → 周围交通环境变化 → 世界重新更新 → 再生成新的视觉输入它是先有一个明确的 4D 空间世界,再基于这个世界生成视觉结果。这样车道线、车辆距离、遮挡关系、道路拓扑这些几何和时空关系,会有一个相对稳定的锚点,不然完全依赖视频生成,自动驾驶这种场景很容易出问题今天前车离你 10 米,下一帧偷偷变成 8 米;车道线位置漂了一点;遮挡关系变了;对于普通视频可能看不出来,对于智驾测试来说,这些误差都会直接影响决策所以这套思路本身是很 make sense 的本质上是在搭一个智驾模型可以真正“进去开车”的虚拟世界:模型做决策,世界给反馈,模型继续决策。犯错可以复现,极端场景可以重复测试,最后把智驾评测从【做题】慢慢变成【实战】#理想汽车##懒博小课堂##大v聊车#

8. 为何谷歌Veo与李飞飞Marble都选择视频生成作为世界模型起点?

9. 李飞飞、杨立昆纷纷入局,AI“下一个必争之地”会诞生人类智能吗?

10. 机器人落地难并非缺更强大模型,而是缺少可供训练的数字世界! #具身智能 #世界模型 #空间智能 #李飞飞 #机器人仿真 机器人为什么迟迟难以大规模落地?李飞飞创办的 World Labs 收购机器人仿真公司 SceniX,背后指向一个关键瓶颈:真实世界的训练数据昂贵、缓慢且存在风险,机器人还缺少可规模化训练和评估的“数字世界”。这期从世界模型、3D仿真到真实—仿真—真实的数据飞轮,拆解机器人进入物理世界前必须补上的基础设施。机器人真正普及,最先突破的会是模型、硬件,还是训练环境?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章