张大妈

从 2D 到 4D :DeepMind 想让 AI 会这件事

源自小红薯:数海Horizon

01-29 20:11

当前AI虽能识别图像,却难以像人一样从视频中理解连续变化的三维世界。Google DeepMind的新技术D4RT正试图攻克这一难题,它致力于让AI从2D视频流中构建出稳定、动态的4D(3D空间+时间)世界模型,这是迈向更通用人工智能的关键一步。

从 2D 到 4D :DeepMind 想让 AI 会这件事智能速览

  • DeepMind推出D4RT技术,旨在让AI从视频中理解动态三维世界。

  • 该技术关注世界状态及变化,而非孤立的单帧画面识别。

  • 目标是赋予AI类似人类的、稳定且连续的“四维”空间认知能力。

  • D4RT试图解决AI在理解物理世界动态变化方面的根本性挑战。

  • 这一突破对机器人、自动驾驶等领域具有深远应用潜力。

从 2D 到 4D :DeepMind 想让 AI 会这件事精华内容

人类能轻易从2D视频脑补出3D世界,但对AI而言,这仍是巨大鸿沟。DeepMind的D4RT技术,正试图教会机器这种至关重要的“常识”能力。

AI感知的瓶颈

目前,大多数AI模型在处理视频时,本质上仍是逐帧分析,将其识别为一连串独立的二维图片。它们可以认出某一帧里有“桌子”和“杯子”,却无法形成一个关于“桌上放着一个杯子”的稳定、连续的认知。

这种理解的割裂,使得AI难以理解物体之间的空间关系、运动轨迹以及遮挡后的持续存在。这正是机器感知与人类直觉之间最核心的差异,也是AI在复杂现实环境中行动受限的根本原因之一。

四维世界的构建

D4RT的核心突破在于,它不再满足于“这一帧有什么”,而是转向追问“世界是什么样”以及“它正在如何变化”。它将视频视为一个整体,试图从连续的二维画面中,重建出三维空间的结构,并加入时间维度,形成一个“四维”模型。

在这个模型中,物体拥有确定的位置和体积,运动轨迹被完整追踪,即使被短暂遮挡,AI也能推断出其依然存在。这是一种从识别到理解、从静态到动态的范式转变,让AI真正开始“看见”一个连贯的世界。

超越画面识别

传统视频分析技术可以标记出每一帧的内容,但这与真正的理解相去甚远。例如,在一段有人踢球的视频中,传统AI可能只会报告“第1帧有人,第5帧有球,第10帧球在空中”。

而基于D4RT思路的AI,则能构建一个包含“人”、“球”、“地面”等元素的动态场景模型,理解“人”这个施动者通过“踢”这个动作,改变了“球”的运动状态。这种对物理世界基本规律的初步掌握,是其超越简单画面识别的关键。

未来的应用场景

一旦AI能够有效构建动态四维世界模型,其应用前景将极为广阔。在机器人领域,机器人可以更精准地在杂乱环境中导航、操作物体。

对于自动驾驶,车辆能更好地预测行人和其他车辆的意图与轨迹,做出更安全的决策。甚至在虚拟现实与增强现实中,这项技术也能创造出更逼真、更具互动性的数字世界,为用户提供前所未有的沉浸式体验。

DeepMind的D4RT项目,不仅仅是算法层面的进步,更是赋予AI基础“世界模型”的关键探索。它让我们看到,机器与物理世界的交互方式或将被重新定义。当AI真正能理解动态变化的世界时,离实现更通用、更强大的智能还远吗?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐