这两天三维重建圈子里刷屏的,不是哪款扫描仪降价,也不是哪个开源项目更新,而是李飞飞。
9月1日(美西时间),她创办的 World Labs 发布了新一代世界模型 Atlas。发布当天微博、知乎、B站同步炸锅:知乎上一堆人问"两三张图重建完整空间是什么水平"“它和普通视频生成模型有什么不同”“这是真的世界模型吗”,微博热帖下面的评论从"利好游戏产业"吵到"感觉可用还早呢,再等等"。知乎微博
而真正让玩扫描的人心里一紧的,是官方演示里的一句话:只给两三张图的时候,Atlas 的重建质量就已经超过了那些专门为三维重建训练的最先进模型。World Labs 官方博客
你辛辛苦苦绕着物体拍一百多张照片、跑几个小时解算,人家两三张图就"干翻"了?先别慌。把这两天跨平台的信源翻完,我的结论是:这句话是真的,但它有一个大多数人没注意到的前提;而对绝大多数扫描玩家来说,你的工作流不但没被淘汰,手里的真实照片反而变得更值钱了。
Atlas 到底是个什么东西
先把事实捋清楚。World Labs 给 Atlas 的定位是 omni world model(全模态世界模型):不是在现有视频模型上外挂一个三维模块,而是从零开始预训练,让文本、图像、视频和三维数据从第一步就进同一个模型。World Labs 官方博客这家公司由李飞飞与 Justin Johnson、Christoph Lassner、Ben Mildenhall 共同创立——最后一位,就是 NeRF 那篇论文的一作。麻省理工科技评论NeRF 开启了神经三维重建这一整个领域,如今他参与做的模型,上来就宣称要越过专用重建模型,这个剧情本身就够戏剧性。
Atlas 的核心概念叫"空间上下文":每张输入图像都被锚定在三维空间中的一个具体位置,模型知道这张图站在哪儿、朝哪儿拍,然后基于这个空间往外补全没被看到的部分,同时保证和已看到的一切在几何上不打架。知乎

落到能力上,这次发布一次性给了五样东西:
像素级相机控制:给1到6张参考图,指定任意机位和角度生成画面,最长1分钟、最高1440p 的连续视频。现在主流视频模型的"运镜控制"还是靠提示词写"镜头缓慢右移",Atlas 直接吃相机几何参数,你给的不是形容词,是坐标和朝向。
稀疏视角三维重建:两三张图就能出新视角,最多吃一百多张输入图。官方说法是,两三张图时的重建质量已超过专门为三维重建训练的 SOTA 模型。知乎
输出能进管线的三维资产:原生同时处理二维图像帧和三维深度图,可以直接输出点云和 3D 高斯泼溅(3DGS),还会把点云破洞补全成可实时渲染的泼溅场景——这正是它家 Marble 产品在用的表示,Atlas 未来会成为 Marble 的底层模型。麻省理工科技评论
时空仿真:接受视频输入,给一段真实拍摄的视频换机位,几部手机从不同角度拍一段动作,就能合成"子弹时间"式的 4D 内容。微博
机器人仿真:从几段随手拍的录像建出可交互的仿真环境,支持刚体、关节体和可变形物体,改一遍参数就是一批新训练数据,专攻 Real-to-Sim-to-Real 这个卡了行业多年的循环。
顺带一提,知乎有篇技术解读还整理了这家公司的时间线:2024年成立即融资2.3亿美元、估值10亿;2025年11月 Marble 对所有人开放;2026年1月 World API 上线;2026年2月又融了10亿美元,Autodesk 一家投了2亿,投资方名单里有 AMD 和英伟达。知乎钱和路线都摆在这儿,Atlas 不是一次性的烟花。
“两三张图干翻专用模型”,这句话有个前提
现在说回那句让扫描玩家破防的话。它成立吗?成立,但你得看清它比的是什么。
稀疏视角新视角合成,是三维视觉领域几十年的老大难:传统摄影测量依赖密集拍摄的上百张环绕照片,图给少了,重建出来就一塌糊涂,因为信息根本不够。Atlas 在"只给几张图"这个赛道上超过专用模型,靠的不是测量,而是世界知识——它见过足够多的房间、庭院、街道,所以你只给一张地面照片,它能"推断"出这个院子从空中俯看大概是什么样。
官方演示里有个层层加码的例子很能说明问题:第一步只给一张花园的地面照,生成的航拍视角里花园是准的,其余部分是想象的;第二步补一张旁边小屋的照片,花园和小屋都对了,左边那栋房子还是想的;第三步再补一张主屋照片,整个场景全部落到实处。斯坦福主方庭那个演示同理——25张以内的地面照片,生成了一段从校园上空飞过的航拍路径。World Labs 官方博客

官方博客里对这件事的表述非常漂亮:给它看的越多,它想象的越少。想象和忠实之间的旋钮,交到了使用者手上。World Labs 官方博客
这句话反过来读,就是这篇文章的核心判断:两三张图"干翻"专用模型的另一面,是两三张图的结果里有大量模型脑补的成分。它"合理",但不保证"真实"。你没拍到的那面墙长什么样,Atlas 会给你一个看起来毫无破绽的答案——但那个答案可能和现实差了一整面窗户。
“像"和"准”,是两条工作流
所以玩三维重建的人,真正要做的判断不是"Atlas 强不强",而是"我要的结果属于哪一类"。

如果你要的是"像"——把老家的院子扫进 VR 里怀旧、给视频做一段穿行素材、做概念场景、给游戏搭氛围资产,那 Atlas 这类生成式路线是碾压级的效率工具:拍摄量从一百张降到几张,解算时间从几小时降到几分钟,没拍到的角度它替你圆上。这个赛道上,你的旧工作流确实该焦虑。
如果你要的是"准"——扫文物做数字存档、扫零件做逆向工程、扫片场做尺寸核对、做测绘和数字孪生交付,那生成式模型目前碰不得。这类场景的命门不是"看起来对不对",而是尺度标定、几何精度、纹理忠实度:扫描结果要能量尺寸、要和实物一一对应、每一个像素都得有出处。Atlas 没有承诺任何测量级精度,输出也是点云和高斯泼溅而非带拓扑的网格,更没有尺度标定的说法。而且截至发稿,"超过专用重建 SOTA"仍然只是官方演示口径,还没有第三方基准复现——知乎上"这是真的世界模型吗"的疑问帖,和微博评论区"啥时候能动起来才算"的吐槽,代表的就是这批谨慎派。知乎微博
多说一句:这其实不是 Atlas 独有的问题。整个八月,知乎上就一直有人问"为什么基于深度学习的三维重建结果有时还不如传统方法"。知乎B站上高斯泼溅转网格、大场景分块重建的教程也一直在更新——AI 重建和传统重建各有各的地盘,这个格局短期内不会变,Atlas 改变的是"AI 那一侧的地盘能扩多大"。
现实核查:你现在还摸不到它
泼一盆必要的冷水:Atlas 目前只向少数合作伙伴开放早期测试,普通用户既没有入口也没有价格。World Labs 官方博客它未来的落地路径是先成为 Marble 的底层模型,再逐步开放。麻省理工科技评论
换句话说,今天所有关于"要不要抛弃扫描工作流"的焦虑,都还停留在纸面上。你能做的最有性价比的事,不是换设备、不是弃坑,而是搞清楚它开放之后怎么用——以及在那之前,把手里的真实素材攒好。
四类人,现在各自该干什么
手机/全景相机扫描玩家(Insta360 X5/X6、3D时光舱这批用户):不用后悔,更不用停。Atlas 最多吃一百多张输入图,“给它看的越多,它想象的越少”——这句话意味着真实拍摄素材的质量决定了生成结果的上限。你的环绕拍摄技巧、覆盖率意识、对光照和重叠度的理解,在 Atlas 时代不是过时了,而是从"解算的原料"升级成了"喂给世界模型的弹药"。八月刚火起来的国产工具链(知天下开源的 xPano、大疆智图新版的 3DGS 支持)该用继续用。哔哩哔哩知乎
CG/影视/游戏/短剧创作者:这波最值得等的就是你们。1分钟 1440p 的像素级相机控制,改的是 previz 和虚拟拍摄的成本结构——以前搭个场景预演镜头要几天,以后可能是几小时。现在能做的:关注 World Labs 的早期测试申请通道,把 World API(今年1月已上线)的文档翻一翻,等 Atlas 进 Marble 那天第一时间上手。
测绘/数字孪生/文物行业:按兵不动,你们的精度命门生成式模型暂时够不着。但值得留意的对照系是国产工程化路线:高德 CVLab 八月刚放出"万帧级"流式重建基础模型 ABot-Recon,昇腾 NPU 原生训练的三维重建模型也在直播露出——这些才是会进你们交付管线的东西。哔哩哔哩知乎
机器人/具身智能方向:这次发布真正的重磅其实是 Real-to-Sim-to-Real 那段。几段随手拍变成无限可控的训练变体,数据成本曲线可能要重画。这个方向的从业者应该去读原始发布博客,而不是二手解读。

五个值得盯的信号
最后给一份观察清单,出现任何一条,都意味着"能不能用"的答案变了:
Marble 集成 Atlas 的时间表——Marble 去年11月已经对所有人开放,Atlas 什么时候进去,是普通人摸到它的第一入口。
是否输出网格/带拓扑的资产——只有点云和泼溅,进不了 DCC 和游戏管线;哪天它能吐 mesh,性质就变了。
第三方独立评测——"超过专用重建 SOTA"需要社区基准复现,尤其是稀疏视角下对真实场景(而非官方挑选的演示场景)的表现。
World API 是否上架 Atlas、怎么定价——按次还是按算力,决定它是玩具还是生产资料。
尺度与精度的官方说法——只要一天不给测量级精度承诺,它就一天替代不了摄影测量,两条工作流就一天并存。
回到开头那句话。"两三张图干翻专用重建模型"是真的,但它干翻的是"图不够时只能靠脑补"的那个旧世界,而不是"图管够、要精度"的测量世界。生成和重建的边界确实在被抹掉——只是抹掉的方式不是谁消灭谁,而是各拿各的地盘。
至于我们普通人,"给它看的越多,它想象的越少"这句话倒是可以原样搬进信息生活:你看的是发布会切片还是完整博客,是官方演示还是第三方复现,决定了你脑子里那个 Atlas,有多少是真实,有多少是脑补。