三部iPhone复刻“子弹时间”,25张照片拼回斯坦福:Atlas刷屏这周,三维人先分清哪道工序挨打、哪道还稳

源自60位全网作者

06:07

这一周的三维圈,被两条互相拧着的内容同时刷了屏。

一条是李飞飞的World Labs在9月1日发布的世界模型Atlas:几张照片重建一个能走进去的三维世界,三部架在三脚架上的iPhone就能复刻当年《黑客帝国》用上百台相机加摄影棚才能拍出的"子弹时间"。另一条是投资圈流传的狠话:记者在世界机器人大会现场拿到两句不敢署名的评价——“现在市面上90%做世界模型的团队,他们连自己都不信’世界模型’”。中间夹着36氪三天里连发五六篇世界模型稿,从"到底是什么"一路盘到"55家公司、7个门派"。36氪知乎36氪

吹的吹上天,骂的骂到底。但对靠"把真实的地方变成三维"吃饭的三维人来说,真正的问题既不是"强不强"也不是"是不是泡沫",而是三个很具体的:我工序表里的哪一步会被它顶掉?哪一步它暂时碰不到?我这周该动还是不该动?

先把Atlas到底干了什么拆成三件事

按World Labs联合创始人Justin Johnson在a16z访谈里的说法,Atlas基本就做三件事:生成世界、重建世界、模拟世界。它的核心任务叫"新视角预测"——不是像视频模型那样预测下一帧像素,而是先在内部搭一个三维空间,再按你指定的相机位置渲染画面。输入最多约一百帧图像,输出给三种东西:一段穿行视频、点云、三维高斯泼溅(splat)。36氪

三部iPhone复刻“子弹时间”,25张照片拼回斯坦福:Atlas刷屏这周,三维人先分清哪道工序挨打、哪道还稳

官方演示里最值得盯的三个细节:

  • 斯坦福主方庭,喂进去不超过25张地面视角游客照,模型能拼出整个场景,还能生成从校园上空飞过的航拍路径。知乎

  • 两个大型环境各抽24帧手机拍摄画面,就完成三维重建并跑机器人导航模拟。

  • 一个很关键的旋钮:给它看的越多,它想象的越少。照片给多了是"精确还原",给一两张是"帮你编一个合理空间"。

三部iPhone复刻“子弹时间”,25张照片拼回斯坦福:Atlas刷屏这周,三维人先分清哪道工序挨打、哪道还稳

需要泼的第一盆冷水在这里:官方明确说,两三张图的时候,重建质量就已经超过了那些专门只为三维重建训练的最先进模型。但这是World Labs的自家表述,到发稿为止我没有看到第三方统一基准的复现数据。结论只能说到"官方演示如此"为止。知乎

真正被改掉的,是"采集进电脑"这一段的成本结构

传统路线干过这行的都知道账:知乎一篇传得很广的作者自述里写得很实在——物流场地三维建模,用无人机绕飞加地面补拍,一个几万平的场地拍下来是一整天的活,后处理还要跑几个小时点云配准。倾斜摄影的单子按平方公里报价、楼顶重叠度不够返工重来,这些都是实打实的工时和成本。知乎

Atlas这类模型把"从稀疏照片补出一个完整空间"的成本直接往下砸:以前依赖密集拍摄和专业设备,现在几张手机照片起步。第一波受压的不是建模师,而是排在它前面的工序——设备租赁、外业采集、标定、空三跑图。景区和古镇的实景三维重建,眼下还是传统团队一单一单在做,上周刚发布的盐城九龙口淮剧小镇实景三维重建就是一单实例。但甲方很快会拿"我手机拍几张是不是也能要个漫游"来压价。哔哩哔哩

三部iPhone复刻“子弹时间”,25张照片拼回斯坦福:Atlas刷屏这周,三维人先分清哪道工序挨打、哪道还稳

但有三样东西,这周的证据说它碰不到

第一,可编辑性。 Justin Johnson在访谈里自己承认:更完善的动态模拟、可编辑性和交互能力仍有待发展。Atlas输出的点云和泼溅是"能看能漫游"的表示,离影视游戏管线里能拆件、能展UV、能改材质、能重拓扑的mesh还差一层。做三维的都懂:splat看着再真,它不是一张可以回工序表里继续做的模。36氪

第二,够不够得着。 目前Atlas仅对少量合作伙伴开放早期API测试,并未全面开放商用。真正对外开放的,是World Labs此前上线的产品Marble(输入图出3D空间,这次Atlas的泼溅输出正是沿着它那条产品线接入的)。换句话说:这周三维用户能做的是围观趋势,还不能把它端进生产。知乎

第三,测得准不准。 所有演示和解读围绕的都是"视觉可信",量测精度、尺寸可复现性没有任何第三方数据。对测绘、文物数字化这类以毫米论英雄的领域,现在谈"被替代"证据差得太远。

顺带说一句内部质疑的公道话:宇树王兴兴在世界机器人大会上坦白自家路线"固定场景下任务成功率接近100%,环境、物品属性稍一变化,成功率断崖式下滑",蚂蚁灵波的沈宇军则说大量宣发中的世界模型仅是能生成逼真视频、完全脱离物理实操。这些质疑骂的是"世界模型"这个词被当成了融资筐,而不是Atlas本身的重建能力。词是词,工序是工序,这是这周最该分干净的一件事。知乎

谁可以现在动手,谁建议再等等

  • 做实景数字化/数字孪生单子的:你的采集和后期报价最先承压。动作是两头准备——学一步泼溅转mesh、转可编辑资产的衔接(Marble走的表示路线就是给这个留的门),同时下次报价把"视觉漫游"和"可量测可编辑"拆成两档,别捆在一个包里被新工具按在地上砍。

  • 游戏、影视、建筑可视化的场景模型师:你吃饭的"设计、拆分、改动、复用"恰好是它明说还没做到的部分,不必这周换饭碗。更近的现实是接活方式变化——甲方扔几张现场照片要个场景底,能把泼溅成果接过来转成可继续修的mesh,会是接下来一两年最值钱的衔接手艺。

  • 学生和刚想入坑的:不用为"世界模型"字样的课掏钱,现成的免费路径已经能摸到这类效果。开源的Lingbot-map上周在B站流传,手机拍视频就能本地跑出3D场景。西湖大学AGI Lab放出的WorldinWorld,无需训练就用单目视频复刻了Atlas的子弹时间效果,代码挂在GitHub、论文在arXiv。想玩商用产品,等Marble的入口和价格看清楚再说。哔哩哔哩知乎

  • 所有人继续盯三个信号:Atlas的API什么时候扩大开放;量测精度类的第三方评测什么时候出现、结果如何;国内"谁在走同一条路"的那批团队(从西湖大学到高德、蚂蚁系玩家)什么时候开公开入口。这三个里任何一跳,都值得把上面这几段重新读一遍。

三部iPhone复刻“子弹时间”,25张照片拼回斯坦福:Atlas刷屏这周,三维人先分清哪道工序挨打、哪道还稳

那期a16z访谈里还有一句容易被划过去的实话:继续扩大模型规模的主要瓶颈,是训练算力。也就是说,"把任意真实空间变成能用的三维资产"这件事最终能走多深,不看那25张照片拼出来的斯坦福,看的是下一年算力和迭代的节奏。这周的热闹,足够把方向钉在桌面上,还不够给任何人的饭碗下判决书——但完全不看这个方向的三维人,明年大概率要多补一堂自己本可以早点上的课。36氪

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章