9月2日,你的信息流大概率被李飞飞刷屏了。
她创办的 World Labs 发布新一代世界模型 Atlas,官方名号是"全球首个多模态世界模型"。IT之家一天之内,麻省理工科技评论、财联社跟进报道,B站相关视频播放量最高的已经冲到三万。麻省理工科技评论财联社
但评论区是大型分裂现场。一边有人说"又一个ChatGPT时刻"。哔哩哔哩另一边最高赞评论60个赞:“这个人很喜欢炒作”。哔哩哔哩还有人更直接:“真有本事去上CVPR2026,而不是登广告。”
兴奋和泼冷水都先放一放,Atlas 到底做了什么、哪些地方被吹过头了、跟你有没有关系,值得先看清楚。

它真正做的事:不猜画面,先把世界搭出来让你走进去
要理解 Atlas,先回想一下 Sora、可灵这类视频生成的核心问题:猜。
你在提示词里写"镜头缓慢向左推、海边日出",模型做的是在二维像素平面上按概率补全——它从训练数据里见过很多"左推镜头"对应的像素变化,于是模仿那种变化。镜头路径一长一复杂,画面就开始飘:墙的角度歪了,桌子的位置跳了,光影前后断了。创作者的自嘲很形象:像在拉老虎机的拉杆,每次摇出来都不一样,而且你控制不了。视频播完,那个"世界"也就消失了,你不能回到三秒前的位置换个角度看。
Atlas 的范式变化,是把每张输入图像"钉"在三维空间里的一个精确相机位姿上。微博官方的说法叫"空间上下文":过去模型靠文本上下文理解世界,现在每张图都带着"我在哪里拍的"这个地址一起进模型。
由此带来三件事,都有硬数字。
第一,相机从"形容词"变成"坐标"。 你不用再用提示词祈祷运镜,而是直接给一条相机轨迹,Atlas 按轨迹渲染,最高 1440p、最长 1 分钟。麻省理工科技评论官方给的例子:7 张参考图加一条轨迹,出一条完整可控的镜头,缓推、环绕、拔高你说了算。World Labs 自己有个很锋利的说法:你是坐进了导演椅,而不是在拉老虎机的拉杆。微博

第二,游客随手拍的照片,能还原出一个 3D 世界。 斯坦福 Main Quad 的演示里,输入的是 2 到 25 张游客视角的地面平拍照——构图歪歪扭扭、光线忽明忽暗那种——Atlas 把草坪、拱廊、教堂外墙的细节全部还原,连你没拍到的屋顶和背面都补出来,镜头还能直接拔地而起切上帝视角。知乎在稀疏视角 3D 重建基准上,Atlas 的平均误差 25.3,好于最新的开源专用重建模型 Pi3X 的 28.7。微博

第三,几台手机能干几百个机位的活。 用 3 到 5 台普通手机或运动相机,从几个方向拍一个动态事件,Atlas 把这些视角在空间里对齐——事件结束后,你还能从现实中根本不存在的机位,回看同一个瞬间。就是《黑客帝国》里那种"子弹时间",以前拍这个要围几百台摄影机。知乎
但有三笔账,得先泼清楚
看到这里你可能觉得是真神作。把多个信源对完,有三件事必须先摆出来。
第一,"全球首个"这个头衔,水分不小。 在 Atlas 之前,DeepMind 的 Genie 系列、NVIDIA 的 Cosmos、Meta 的世界模型都是这个方向上的探索者。微博Atlas 真正的推进,是把文本、图像、视频、3D、相机位姿、深度统一进一个从零预训练的架构,用空间上下文做统一表示——这是工程范式上的推进,不是从 0 到 1 的发明。媒体标题里的"全球首个",本质是产品包装话术。
第二,94% 的胜率,赢的是"接口",不全是"能力"。 官方给的数字:相机控制对 MiniMax H3 胜率 75%、对 Gemini Omni Flash 81%、对 Seedance 2.5 高达 94%。听着碾压,但问题是,这几个对手模型都不接受相机位姿作为原生输入,运镜只能靠文本提示描述。微博这等于拿一辆带方向盘的车,去跟三辆靠喊话控制方向的车比过弯——衡量的是"原生相机接口"对"文本描述运镜"的差距,不是纯画面质量的差距。
第三,没拍到的地方,依然是"脑补"。 Atlas 有一条很漂亮的规律:喂得越多,想象越少——单张照片主要靠模型先验补全,加到第三张照片场景才基本对上真实,最多能吃下 100 多张输入图。但想象的部分再少,也是预测,不是真相。而且 World Labs 没公布参数量、训练数据规模和推理成本,也没有可供独立验证的论文——严格说,这是一次产品级发布,不是学术成果。微博有技术博主对评测数字的提醒很中肯:对比基线是 World Labs 自己复现的,Atlas 也并非在每个数据集上都排第一。
真正的争议不在数字,在路线
比泼冷水更值得看的,是评论区打起来的一个更根本的问题:这玩意儿到底是杨立昆说的那个"世界模型"吗?
B站好几条技术向评论都在问这个。杨立昆一直公开表示,纯 Transformer 做不出真正的世界模型,而 Atlas 的内核还是 Transformer,只是加了相机位姿。微博有评论说得更直白:“感觉不像世界模型,更像大模型加一个虚幻引擎。”
这不是抠字眼,两条路线要的东西不一样。杨立昆要的世界模型,是让机器预测"动作的后果",服务决策;李飞飞的空间智能,是让机器理解三维空间的结构和变化,服务感知和交互。Atlas 属于后者——World Labs 的创始团队除了李飞飞,还有 Justin Johnson、Christoph Lassner、Ben Mildenhall,分别来自计算机视觉、生成式 AI 和图形学三个领域。麻省理工科技评论公司名字叫 World Labs,押的其实是"空间智能"这条注。
钱也在往这条路上押。2024 年 World Labs 拿着 2.3 亿美元融资走出隐身模式,今年 2 月又完成 10 亿美元新融资,Autodesk 一家就投了 2 亿美元,AMD、英伟达、Fidelity 都跟了。知乎Autodesk 自己就是做 3D 设计软件的,它投的不是热闹,是基础设施。今年 7 月,World Labs 又收购了仿真公司 SceniX——Atlas 发布时机器人仿真这条线已经落地,这不是巧合,是给具身智能铺路的连续动作。微博
所以,谁该当真?
直接按人群给判断。
最该上心的:具身智能、机器人方向。 这是 Atlas 真正的王牌。机器人训练长期卡在数据上:真实世界试错又慢又贵,手工搭仿真场景也贵。Atlas 的 Real-to-Sim,是把手机拍的真实环境取 24 帧就重建成可交互的仿真场景。微博场景涵盖刚体、关节物体、柔性线缆,还能对接主流物理引擎。微博机器人沿任意路径在里面走,模型就按位置生成机载摄像头"应该看到"的 RGB 和深度数据。以前重建和渲染是两套系统,误差在接缝处累积,现在一个模型全包。机器人训练环境,正在从"手工搭建的限量品"变成"照片批量生产的日用品"。

其次:影视、3D 内容行业。 几百个机位换成几台手机,子弹时间、预演、虚拟拍摄的成本结构会变。但要清楚,目前演示的主要是"视角重建",离真正替代实拍和成熟制作管线,还有工程距离。
再次:游戏和场景搭建。 B站评论区已经有人在琢磨"概念图生成视频、视频再生成 3D"的快速场景流,方向没问题,但内测还没开放,先别急着搭工作流。
普通 AI 爱好者:不用急着兴奋,盯三个信号。 一是开放时间。目前 Atlas 只对少数合作伙伴做早期测试,官方说未来几周会开放更多访问。知乎二是推理成本——生成 1 分钟 1440p 要多久、多少钱,决定它是生产工具还是演示玩具。三是后续会不会补技术报告——补了,那些基准数字的可信度才上一个台阶。另外,Atlas 接下来会成为 World Labs 旗下 3D 世界生成产品 Marble 的底层模型,产品化节奏不会慢。麻省理工科技评论
最后说句实在的:Atlas 最值得看的,不是"视频生成得更漂亮了",而是多模态大模型的竞争焦点,正在从"理解内容"转向"理解空间"。以前的视频模型里,相机只是个输入设备;在 Atlas 这里,相机是模型的一等公民。
这一步值得追。但在它真正开放之前,先把"划时代"三个字收一收。