谷歌 DeepMind 发布的 Project Genie,一项能根据文本描述实时生成可交互 3D 世界的技术,正重新定义人机交互的边界。这项“世界模型”不仅是技术奇观,更因其对物理因果的初步理解,被视为通往通用人工智能(AGI)的关键拼图,展现了 AI 理解世界运行规则的巨大潜力。
智能速览
谷歌Genie模型能通过文本生成可实时探索的3D世界
世界在用户探索时被实时生成,因此被称为无限世界
当前原型存在60秒时长和地区访问等限制
理解物理因果的世界模型被视为通往AGI的关键拼图
精华内容
与ChatGPT预测下一个文字不同,Genie的核心在于预测“你走过去会看到什么”。这一转变让AI开始尝试理解物理世界的空间与因果,是技术实现上的巨大飞跃。
何为世界模型
Project Genie 是谷歌 DeepMind 提出的“世界模型”,其核心功能是根据用户输入的一段文字描述,即时生成一个可供实时探索的 3D 互动环境。如果说 ChatGPT 致力于预测下一个词,Sora 理解视频帧的连续性,那么 Genie 则在尝试预测行为与结果之间的关系,即“你走过去会看到什么”的物理因果。
用户可以使用键盘的 WASD 键控制角色移动,用鼠标调整视角,选择第一人称或第三人称沉浸式地体验这个由 AI 创造的世界。整个世界并非一次性渲染完成,而是在用户探索的过程中“边走边生成”,从而实现“无限世界”的概念。
如何创造世界
生成世界的精准度与 Prompt 的详细程度直接相关。一个优质的 Prompt 通常包含两个核心部分:环境描述和角色描述。
例如,要实现“佐助开着带翅膀的跑车在未来纽约飞行”的场景,Prompt 可以这样构建:环境描述为“未来纽约 + 赛博城市 + 会飞的汽车,帝国大厦在正前方,蜘蛛侠站在帝国大厦上,远处有 SpaceX 火箭发射塔”;角色描述则为“佐助(火影忍者,小队时期),穿白色帅气衣服,坐在陨石黑色的飞行跑车上,汽车有大型银色羽翼”。描述越具体、元素越丰富,AI 生成的世界就越贴近想象。
当前的限制
作为一项前沿的研究原型,Genie 目前仍存在诸多限制。首先,每次生成的世界体验时长上限仅为 60 秒,无法进行长时间探索。其次,在运行过程中偶尔会出现画面卡顿的情况,影响了交互的流畅性。
此外,该技术的开放范围非常有限,目前仅对美国地区用户开放,并且需要订阅 Google One AI Premium 计划才能访问。这些限制表明,Genie 距离成为一个成熟的、面向大众的产品还有很长的路要走,但其作为技术验证的价值已经非常显著。
通往AGI的拼图
Genie 的出现引发了一个深刻的思考:世界模型可能是通往通用人工智能(AGI)的关键拼图。人类的智能核心不仅在于理解和运用语言,更在于对物理世界运行规律的掌握,包括空间、时间、因果关系等。
当 AI 模型开始能够预测“我往前走一步会看到什么”,它就真正开始理解物理世界的动态变化。未来的 AGI 可能不再是一个单一的超级大模型,而是一个融合了语言模型(如 ChatGPT)、视觉模型(如 Sora)和世界模型(如 Genie)的复杂系统,分别负责理解语言、视觉和物理规律。
Project Genie 不仅是炫酷的技术演示,它更揭示了 AI 发展的新路径——让机器理解世界的动态规律。虽然目前只是原型,但其展现的潜力已足够令人兴奋。当语言、视觉与世界模型真正融合,一个更智能的时代或许就将到来,这会带来怎样的变革?