张大妈

谷歌4D世界模型来了,比SOTA快300倍!

源自知乎:新智元

01-24 19:57

谷歌DeepMind发布D4RT技术,用统一的时空查询接口彻底改变动态4D重建。这项突破性技术不仅精度领先,速度更比现有SOTA快300倍,让AI能像人类一样实时理解动态世界,为具身智能、自动驾驶和AR领域带来新可能。

谷歌4D世界模型来了,比SOTA快300倍!智能速览

  • D4RT用统一查询接口替代传统复杂流水线,同时解决追踪、深度估计和相机位姿

  • 推理速度比SOTA技术快18-300倍,处理1分钟视频仅需5秒

  • 能够精准处理动态场景,如天鹅游动、花朵绽放等复杂运动

  • 采用先全局记忆再按需搜索的架构,支持大规模并行计算

  • 对具身智能、自动驾驶和AR等应用场景具有重大影响

  • 训练阶段仍需64个TPU芯片训练两天,属于大厂重武器

谷歌4D世界模型来了,比SOTA快300倍!精华内容

传统的4D重建需要多步骤复杂流程,而D4RT的革命性在于将整个流程简化为一次查询动作。这不仅是技术层面的突破,更是效率的飞跃。

技术突破

D4RT的核心创新在于架构层面的统一。传统方案需要为深度、位姿分别设计解码器,形成复杂的流水线。D4RT则用一个通用的查询接口解决所有问题,将原本割裂的3D重建、相机追踪、动态物体捕捉统一。

技术实现上,D4RT首先使用ViT-g编码器(10亿参数)将整段视频压缩成全局场景表征F,形成AI对视频的"长期记忆"。然后通过查询机制,向解码器发送包含时间、坐标、视角等信息的查询,即可获得对应点的3D坐标。

性能表现

D4RT在动态场景处理上表现惊艳。传统算法处理天鹅游动或花朵绽放时会产生"重影",而D4RT能精准还原3D形态,完美分离相机运动和物体运动。

最令人印象深刻的是全像素追踪能力。可追踪视频中任意像素的完整3D轨迹,即使中间被遮挡也能根据上下文"脑补"去向。吞吐量比同类技术高300倍,处理一分钟视频仅需5秒。

关键设计

查询机制是D4RT的天才设计。每个查询包含时间戳、像素坐标和相机视角等参数,通过公式q=(t, x, y, c)向解码器请求特定信息。

另一个关键技巧是9x9 Patch设计。研究发现仅提供坐标会让模型"脸盲",因此查询时附带目标像素周围9x9的RGB图像块,极大提升了重建锐度和细节。消融实验验证了这一设计的有效性。

应用前景

在具身智能领域,D4RT提供的实时4D感知让机器人能预判动态环境,理解"那个东西现在在那里,下一秒会出现在我左边"。这对自动驾驶安全性提升至关重要。

AR领域也将受益。谷歌从Google Glass到Project Astra一直在AR布局,D4RT的低延迟场景理解让"实时把虚拟怪兽藏在真实沙发后面"变得工程可行。

用户体验

对普通用户而言,D4RT最快落地可能是视频编辑。想象拍了一段孩子踢球视频,可以像《黑客帝国》里随意旋转视角(尽管拍摄时未移动),或轻易删除复杂背景中的路人,甚至改变视频光源方向。

这种"魔法化"的编辑体验正是4D重建技术成熟后的典型应用场景,将极大改变用户的视频创作方式。

D4RT展示了AI理解世界的新维度——从2D图像识别跨越到4D时空洞察。看清流动世界不在于逐帧仔细,而在于建立随时回应的全局记忆。在AI眼中,过去和未来只是四维坐标系里等待查询的不同参数,这种范式转变预示着计算机视觉的新纪元。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐