你手里的 Seedance、Wan 还没抽熟,李飞飞就把考题换了——从「谁生成的视频更好看」换成了「谁真的理解空间」。
北京时间 9 月 2 日凌晨,World Labs 在官方博客发布了新一代模型 Atlas,官网文章日期标注的是 9 月 1 日。知乎 按照官方定义,这是一款面向空间智能的全模态世界模型(omni world model):从零开始预训练,原生处理文本、图像、视频、相机位姿与 3D 深度,在同一套模型里完成世界生成、空间重建和时空模拟。36氪 几小时内,「全球首个多模态世界模型」刷满中文 AI 圈,知乎同天开出四五个相关问题,小红书热帖点赞破千。微博
被 DeepSeek「开眼」和各家降价轰炸了一整个 8 月的你,现在大概三个问题:这跟视频生成到底差在哪?「首个」这个名头有几分成色?现在能不能上手、要花多少钱?我把官方博客、几篇拆得很细的技术文和社区实测串了一遍,一个个说。
一、先别把它当「更会拍片的视频模型」
Atlas 和普通视频生成模型的分水岭,不是画质,是相机位姿成了原生输入。
在视频模型里写「镜头缓慢左移、绕人物旋转」,本质是跟模型许愿,出片全凭手气。Atlas 的做法是直接喂坐标和朝向:丢进去 1 到 6 张普通照片,定一条相机轨迹,就能输出最高 1440p 分辨率、长达 1 分钟的连贯视频,镜头转回来看见的还是同一个空间——因为它内部维护着一份「空间上下文」,每张图片都被钉在三维坐标上,而不是只记得上一帧长什么样。微博

它的输出也不只是一条视频,还能吐出深度、点云和 3D 高斯泼溅(3DGS)场景,可以直接接进 World Labs 自家的 Marble 平台实时渲染。知乎 官方演示里最有代表性的两个:斯坦福主方庭,只喂 2 到 25 张游客地面平拍照片,就能补全细节并生成一段航拍漫游。36氪 「子弹时间」重定框,几台普通相机随手一架,就能在后期里从任何没拍过的机位看这段画面。微博

对做机器人训练的人来说,真正的大饼是 Real-to-Sim:手机拍几十帧视频,模型还原出一个 3D 物理空间,机器人钻进去跑图试错,走到哪,模型当场渲染出机载相机应该看到的 RGB 和深度画面,刚性、关节、可变形物体的交互都能模拟。知乎 官方演示文章援引的行业估算称,按传统方式采集够规模机器人训练数据的成本可能到百万亿美元量级——这个数听听就好,但「一次采集变成无限变体」的方向是实的。36氪
一句好话要配一句真话:没被镜头拍到的区域,模型是靠先验「编」出来的——没有被摄像机覆盖的区域,首先是模型推断,而不是事实记录。知乎 视角跨度越大、生成路径越长,局部几何漂移、物体变形、纹理闪烁越容易出现。它给你的是一个视觉上合理的三维世界,不是原来那个世界的精确数字孪生。
二、「首个」名头的三层成色
第一层:全称很长,「首个」是截短的说法。 官方完整表述是「首个能够以像素级相机控制生成图像和视频帧,并把它们重建为 3D 的多模态世界模型」——限定词叠了三层,「首个」也是公司的官方表述,而不是已经被行业独立验证的结论。知乎 知乎上有高赞回答直接吐槽「我迄今为止不知道『首个原生多模态世界模型』是何意味」,这不是抬杠,是这个定语确实需要还原。知乎
第二层:所有好看的数字都是官方自述。 稀疏视角重建误差(AbsRel,越低越好),官方报 Atlas 拿下 25.3,对比 Pi3X 28.7、DepthAnything3 39.3、MapAnything 47.7。36氪

镜头运动控制的真人盲测,官方报出的胜率是:对 MiniMax H3 75%、对 Gemini Omni Flash 81%、对 FLUX3 93%、对 Seedance 2.5 达到 94%。注意:盲测是 World Labs 自己组织的,公开结果主要来自官方自己的演示和评测,模型成本、推理速度、复杂场景失败率和物理准确性尚缺少第三方验证。36氪 发布会惯例如此,但作为「值不值得信」的判断依据,得先打八折——这条规矩你用 DeepSeek 视觉那篇就懂了。

第三层:成本、速度、失败率,全部没披露。 一分钟 1440p 的连贯世界生成,外加上百张输入图的空间上下文,推理开销不会便宜。一位做视觉落地的从业者长文数得很细:全篇没有给一张定量的评测表,「超过专门做三维重建的最先进模型」这类话配的只是自家挑的对比。知乎 目前 Atlas 只向部分合作伙伴开放 Early Access,能不能落地成基础设施,要看后续开放测试、第三方复现和真实生产环境中的成本-质量平衡。知乎
三、同一天,国产公司发了另一种「世界」
有意思的是,9 月 1 日,国内影眸科技 Hyper3D 正式发布世界生成模型 WorldGen,它背后的场景级生成技术 CAST 拿下了 SIGGRAPH 2025 最佳论文,同届获此殊荣的商业公司只有谷歌、Meta 和影眸三家。知乎
两个模型放一起看特别清楚路线分歧:Atlas 是把整个世界压进一个自回归扩散 Transformer,从空间上下文里「长」出连续世界;WorldGen 走资产路线,一张照片进去,桌子还是桌子、杯子还是杯子,每个物体可以单独选中、移动、替换,还能带上碰撞体、质量和摩擦等物理属性,并进入真实的生产工作流,背景用高斯、可交互物体直接给 Mesh。知乎 前者赌「一个模型通吃生成和重建」,后者赌「拆开的东西能直接进生产管线」。
再算上 MiniMax H3 宣布发布并计划开源、Matrix-Game 这类交互式世界模型论文扎堆刷榜、HappyOyster 已经在让用户用它的世界探索模式做互动内容——世界模型这个赛道不是过热,是刚开始排兵布阵。对普通玩家的含义:不用急着信仰某一个,卷起来才有免费额度和白菜价。
四、现在能上手的三条路,别走错门
Atlas 本体:只对部分合作伙伴 Early Access,官网申请,审核节奏未知。今天刷到演示就想直接体验 Atlas 的,基本都得等。
Marble(人人可玩的入口):2025 年 11 月公测开放,Atlas 是继它之后 World Labs 的第二款模型;今年 4 月 Marble 升到 1.1 / 1.1-Plus,网页端 marble.worldlabs.ai 加 World API 双通道,API 今年 1 月就上线了,开发者可以用接口调用世界生成能力。微博 但注意:现在线上 Marble 跑的不是 Atlas 这个底——官方原话是 Atlas 将在未来成为 Marble 和 WorldLabs 其他产品的底层模型。36氪 现在玩 Marble 和 Atlas 演示的差距,大概像一个 GPT-3.5 用户围观 GPT-4 发布会。

价格参考:Marble 走积分制,社区有实测帖晒「花 1 美元肝了 4 万积分」的玩法。小红书 去年就有用户拿 Vision Pro 进 Marble 生成的世界漫游,评论区至今有人蹲 Atlas 什么时候接进 XR。
五、谁该冲、谁再等、谁看演示就行
做视频/广告/分镜的人:相机可控长镜头对你们是真需求,结构化控制比「多抽几次」值钱。但等价格表和开放注册,现在入场只有申请试用一条路。
做游戏、关卡原型的人:3DGS 输出还不是生产级资产——缺传统网格、材质分层、碰撞体、导航网格和物体语义。知乎 拿来搭世界草模、预演空间感够用,别直接当管线用。
机器人、具身方向的开发者:想象空间最大的一块,但视觉逼真不等于摩擦、碰撞、接触力都算对了,Atlas 不能直接等同于完整的机器人「大脑」,真机闭环验证一步都省不了。 WorldGen 那种带物理属性的可编辑场景,值得放进取舍对照清单。
每天抽两把 AI 的泛玩家:现在就能做的事只有一件——打开 Marble 造个世界转转,奶茶钱级别的成本;想摸 Atlas 本体,收藏本文说的三个信号再回来。
最后
语言模型压缩的是人类写下的知识,世界模型想压缩的是我们对空间、运动和变化的经验。方向是真方向,演示是真炸裂,但 Atlas 现在交付的只有 demo、自述数字和一个「未来接入」的承诺。
盯三件事,再决定要不要为这条赛道花钱花算力:一,带完整评测表的技术报告什么时候放出来;二,Marble 接入 Atlas 的版本和时间点;三,API 计费标准。三个里任何一栏见光,这篇的账就值得重算一遍。