在接连发布Gemini等重磅模型后,谷歌将目光投向了更深远的领域——世界模型。这不仅是AI技术的下一个前沿,更被视为通往通用人工智能的关键路径,旨在让机器真正“看懂”并理解物理世界。
智能速览
DeepMind CEO直言世界模型是实现AGI的关键组件。
谷歌Genie 3已能实时生成交互式3D环境。
高昂成本与长时一致性是世界模型爆发的瓶颈。
杨立昆、李飞飞等AI领军人物纷纷布局世界模型。
世界模型与语言模型之争,本质是AI如何理解世界的分歧。
精华内容
从文字到像素,AI正在尝试用一种全新的方式理解物理世界。这条道路虽然充满挑战,却可能引领我们走向真正的智能。
谷歌的重注
谷歌DeepMind已将世界模型作为核心方向,其CEO哈萨比斯认为这是实现AGI的关键部分。旗下代表作Genie在短短一年半内从2D升级至能实时生成交互式3D环境的Genie 3。该模型仅需一句话,即可在720p分辨率下创造一个可探索的动态世界,且场景细节能在长达一分钟内保持连贯。
目前,谷歌内部已将该技术用于训练其他智能体及机器人,显示出其广阔的内部应用前景。
硅谷的共识
对世界模型的追求正成为硅谷的共识。Meta首席AI科学家杨立昆宣布将于年底离职,并计划创立专注于世界模型技术的初创公司。AI教母李飞飞的WorldLabs也推出了首款产品Marble,旨在构建空间智能。
此外,英伟达也已推出世界基础模型开发平台Cosmos,为自动驾驶和机器人研究生成合成训练数据,巨头们的纷纷入局印证了该赛道的重要性。
理解世界的分歧
世界模型热潮的背后,触及了AI发展的核心分歧:AI应该通过文字“读懂”世界,还是通过视觉“看懂”世界?以OpenAI为代表的“读懂派”相信,海量数据堆砌能涌现智能;而“看懂派”则认为,大语言模型只是文本数据库,无法理解背后的物理规律。
李飞飞指出,世界模型能让“看见”晋升为“推理”,让“感知”转化为“行动”,这是两者理念的根本差异。
未来的挑战
尽管前景光明,但世界模型的发展仍面临巨大挑战。哈萨比斯坦言,高昂的推理/服务成本和实现长时间一致性的能力是当前的主要瓶颈。与已经诞生ChatGPT、Sora等爆款的“读懂派”相比,世界模型领域还缺乏现象级的消费产品。
这使得该技术面临“雷声大,雨点小”的质疑。但构建能理解并推演物理规律的模型,其底层挑战远超文本处理,需要行业给予更多耐心与时间。
世界模型代表了AI发展的一个更深层次的思考方向,它试图让智能扎根于物理现实。尽管前路挑战重重,但其潜力巨大。当AI不仅能言说,更能与真实世界互动时,我们将迎来怎样的未来?