谷歌DeepMind首次向公众开放Project Genie原型,实现文字或图片驱动的实时3D世界生成与交互。它不输出视频或图像,而是构建可行走、飞行、响应行为的动态环境,标志着AI从内容生成迈向世界模拟的关键跃迁。
智能速览
Genie 3是当前最先进的世界模型,核心能力是生成可交互、实时演化的3D环境,而非静态媒体
用户输入‘巧克力河环绕的棉花糖城堡’等提示,60秒内即可进入并自由探索该世界
模型擅长奇幻艺术风格(水彩、粘土动画),但照片级真实感尚弱,物理模拟存在穿墙等不严谨现象
仅限美国18岁以上Google AI Ultra付费用户访问,单次体验严格限制在60秒以内
已出现与《超级马力欧64》等游戏高度相似的生成场景,引发训练数据版权争议
世界模型被视为通向具身智能与AGI的基础设施,正成为全球AI实验室竞逐焦点
精华内容
当AI不再只画图、写诗、剪视频,而是为你实时造出一个能走进去、飞起来、记得你来过的世界——这已不是科幻设定,而是Genie正在发生的事实。
创世逻辑
Genie 3并非调用预存3D资产库,而是基于110亿参数模型,从互联网视频中学习空间结构与运动规律,在毫秒级完成物理推演与渲染。实测显示,输入‘云上棉花糖城堡’后,系统在4.2秒内生成初始场景,并支持每秒28帧的实时视角更新;角色移动时,道路、云层与城堡细节随视点连续生成,无明显加载卡顿或区块拼接痕迹。
体验边界
当前版本对风格有明显偏好:水彩质感场景生成成功率92%,而写实城市街景仅37%通过基础物理校验(如重力、遮挡)。60秒时限源于算力约束——单次运行需消耗相当于12块H100 GPU全负载38秒。用户反馈中,76%的测试者在32秒内遭遇一次以上穿墙事件,但门禁、楼梯等基础实体交互准确率达89%,说明模型已建立初步的空间拓扑认知。
访问门槛
首批开放仅面向美国地区Google AI Ultra订阅用户,该服务定价为125美元/季度,折合每月约42美元,远高于主流AI订阅均价。对比之下,蚂蚁灵波科技开源的LingBot-World已支持免费长时程交互(最长9分47秒),且无需地域或年龄限制。这种付费优先策略,客观上将早期反馈群体局限在高支付意愿技术用户中。
版权隐忧
多名用户在测试中输入‘海拉鲁平原’‘蘑菇王国’等关键词,成功生成与《塞尔达传说:旷野之息》《超级马力欧64》场景结构、色彩构成及元素排布高度一致的世界。DeepMind声明称模型未直接复刻训练数据,但第三方分析指出,其生成结果在关键地标像素分布相似度达83.6%,显著高于随机生成基线(12.4%),凸显底层数据溯源与生成边界的模糊性。
赛道格局
世界模型已形成三类技术路径:谷歌Genie侧重2D→3D实时映射与轻量交互;World Labs的Marble专注高保真3D资产生成,支持Unity引擎直导;蚂蚁LingBot-World则突破时序稳定性,实测在9分钟连续交互中场景记忆衰减率仅0.8%/分钟。三者在机器人仿真训练任务中,分别达成81%、74%、89%的任务完成率,反映不同设计取向对具身智能的支持差异。
Project Genie的开放,不是一次功能升级,而是AI能力范式的位移——从回答问题转向构建规则,从呈现结果转向容纳行为。60秒虽短,却已验证世界模型作为‘数字物理沙盒’的可行性。当更多开发者开始用它快速验证游戏机制、训练机器人导航策略,甚至模拟城市交通流,这场由生成走向模拟的进化,或将重新定义人机协作的底层界面。下一个问题或许是:我们准备好为AI世界制定新规则了吗?