张大妈

【AI】谷歌4D世界模型来了,比SOTA快300倍!

源自公众号:人工智能产业链union

01-31 19:01

谷歌DeepMind推出的D4RT模型,彻底颠覆了动态4D重建领域。它将复杂的传统流程统一为单一的“时空查询”接口,不仅精度顶尖,推理速度更是比现有技术快18到300倍。这项突破让AI能够实时、全像素地理解动态世界,为具身智能、自动驾驶和AR技术的发展奠定了坚实基础,预示着计算机视觉从静态分析迈向动态洞察的新纪元。

【AI】谷歌4D世界模型来了,比SOTA快300倍!智能速览

  • D4RT将全像素追踪、深度估计和相机位姿统一为单一查询接口。

  • 其吞吐量比SOTA快300倍,可实时追踪超过1500条3D轨迹。

  • 核心技术是构建全局场景表征,并将问题转为大规模并行查询。

  • 能精准处理花朵绽放等动态场景,生成干净无重影的4D重建。

  • 该技术有望成为具身智能、自动驾驶及AR领域的核心感知引擎。

【AI】谷歌4D世界模型来了,比SOTA快300倍!精华内容

D4RT的出现并非偶然,它针对传统4D重建流程的固有痛点,从架构层面进行了革命性重塑。它如何用一个查询接口,搞定过去需要多个模型协作才能完成的复杂任务,并实现惊人的速度飞跃?

速度的革命

谷歌宣称D4RT比SOTA快300倍,这并非文字游戏,而是体现在关键性能指标上。该数据指的是在保持24FPS标准帧率下的轨迹追踪吞吐量。此前SOTA模型SpatialTrackerV2最多只能同时追踪84条轨迹,而D4RT能轻松处理1570条。这意味着AI的感知能力从只能关注画面主角,跃升至全像素级,可以同时捕捉背景中的行人、树叶和车流,处理一分钟的视频仅需5秒。

统一的架构

现有4D重建技术主要有两类:“拼装派”如MegaSaM,串联多个独立模型,流程慢且易因单点失败而崩溃;“多头派”如VGGT,虽为单一模型,但为输出不同任务需挂载多个臃肿的解码头。D4RT的突破在于实现了架构层面的统一,它用同一个解码器处理所有任务,避免了上述弊端。但其代价是训练阶段仍需庞大算力,一个10亿参数的编码器需在64块TPU上训练两天。

查询的艺术

D4RT的核心原理可概括为“先全局记忆,再按需查询”。首先,它用一个巨大的Transformer编码器将整段视频压缩成一个全局场景表征F,相当于AI对视频形成了“长期记忆”。

随后,其天才的查询机制登场。AI通过发送形如q=(t, x, c)的查询来获取信息,即“在t时刻、x坐标点、从c相机视角看,这个点的3D坐标在哪?”。改变参数即可完成深度估计、轨迹追踪或点云重建。

由于每个查询独立,模型能利用GPU进行大规模并行计算,从根本上解决了速度瓶颈。此外,查询时附加上目标像素周围的9x9图像块,能显著提升重建的锐度与细节。

未来的基石

D4RT的出现,为多个前沿领域提供了关键性的技术储备。在具身智能与自动驾驶领域,它提供的实时、密集的动态4D感知,能让机器人和车辆预判移动物体的轨迹,极大提升安全性与智能水平。对于AR,它所展示的高效推理能力,使在眼镜等移动设备上实现低延迟、高真实感的虚拟交互成为可能。

对普通用户而言,该技术将催生“魔法化”的视频编辑工具,未来可能像在《黑客帝国》中一样随意旋转视频视角,或轻松移除复杂背景中的物体。

D4RT的意义远不止于速度提升,它展示了一种AI理解世界的新范式:从逐帧分析到构建全局时空记忆。这使得AI能够像人类一样,直觉地把握动态世界的连续性与变化性。当AI能够实时查询过去与未来,我们离真正的具身智能还有多远?这项技术,或许就是答案的序章。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章