DeepMind 发布 Genie 2:生成一致性 3D 虚拟游戏世界的新里程碑
谷歌旗下的人工智能公司DeepMind近日推出了第二代基础世界模型Genie 2。该模型可以基于单张图片或文字描述生成长达一分钟的一致性3D虚拟游戏世界,用户通过键盘和鼠标进行交互。Genie 2具备生成多样化3D世界的能力,适用于多种场景的智能体训练。研究人员相信,Genie 2将开启AI虚拟世界创作的新篇章,为智能体解锁更强大的能力。

与前代产品Genie 1仅能生成二维世界不同,Genie 2在生成三维世界、模拟虚拟世界动态等方面有了显著提升。基于大规模视频数据集进行训练,该模型展示了卓越的涌现能力,包括物体交互、复杂角色动画、物理效应等。此外,Genie 2能够智能响应用户通过键盘输入的动作,确保角色动作的连贯性和环境的完整性,从而提高虚拟场景的真实感。

Genie 2支持生成广泛的虚拟环境,从第一人称的真实场景到第三人称的驾驶环境,适用场景多样。研究者展示了其在一张图片的提示下生成的各种互动场景,如测试具身智能体在不同语境下的表现,以及创建多种视角的虚拟世界。该模型不仅能处理复杂的光照、反射和烟雾效果,还能生成可互动的虚拟角色(NPC),创造出高度真实的虚拟世界。

另外,Genie 2在训练过程中能够生成反事实情境和保持长时间记忆,这意味着它可以从相同的起始画面生成多个不同的发展场景,并且能够在场景重新进入视野时精确还原。该模型为艺术家和设计师快速验证创意提供了便利,使得交互式体验原型设计的新型流程成为可能。
值得注意的是,Genie 2在性能上尽管已经展现出了较高的水准,但仍有改进空间。目前画面的连贯性和一致性已超出预期,但画质较为模糊,生成速度较慢。在未来,Genie 2有望在游戏、影视等多个领域进一步应用,推动相关技术的发展与创新。
当前,Genie 2凭借其多样性和扩展性,已成为虚拟世界生成领域的一个里程碑,预示着AI技术在生成、评估和训练智能体方面的广阔前景。通过这种全新的生成方式,研究人员和开发者可以利用海量互联网视频数据进行训练,提升模型的泛化能力和多样性,从而进一步推动人工智能技术的进步。
