张大妈

“王者归来”之后 谷歌再下重注:世界模型将迎来“ChatGPT时刻”

源自今日头条:科创板日报

02-21 13:43

在接连发布Gemini等重磅模型后,谷歌将目光投向了更深远的领域——世界模型。这不仅是AI技术的下一个前沿,更被视为通往通用人工智能的关键路径,旨在让机器真正“看懂”并理解物理世界。

“王者归来”之后 谷歌再下重注:世界模型将迎来“ChatGPT时刻”智能速览

  • DeepMind CEO直言世界模型是实现AGI的关键组件。

  • 谷歌Genie 3已能实时生成交互式3D环境。

  • 高昂成本与长时一致性是世界模型爆发的瓶颈。

  • 杨立昆、李飞飞等AI领军人物纷纷布局世界模型。

  • 世界模型与语言模型之争,本质是AI如何理解世界的分歧。

“王者归来”之后 谷歌再下重注:世界模型将迎来“ChatGPT时刻”精华内容

从文字到像素,AI正在尝试用一种全新的方式理解物理世界。这条道路虽然充满挑战,却可能引领我们走向真正的智能。

谷歌的重注

谷歌DeepMind已将世界模型作为核心方向,其CEO哈萨比斯认为这是实现AGI的关键部分。旗下代表作Genie在短短一年半内从2D升级至能实时生成交互式3D环境的Genie 3。该模型仅需一句话,即可在720p分辨率下创造一个可探索的动态世界,且场景细节能在长达一分钟内保持连贯。

目前,谷歌内部已将该技术用于训练其他智能体及机器人,显示出其广阔的内部应用前景。

硅谷的共识

对世界模型的追求正成为硅谷的共识。Meta首席AI科学家杨立昆宣布将于年底离职,并计划创立专注于世界模型技术的初创公司。AI教母李飞飞的WorldLabs也推出了首款产品Marble,旨在构建空间智能。

此外,英伟达也已推出世界基础模型开发平台Cosmos,为自动驾驶和机器人研究生成合成训练数据,巨头们的纷纷入局印证了该赛道的重要性。

理解世界的分歧

世界模型热潮的背后,触及了AI发展的核心分歧:AI应该通过文字“读懂”世界,还是通过视觉“看懂”世界?以OpenAI为代表的“读懂派”相信,海量数据堆砌能涌现智能;而“看懂派”则认为,大语言模型只是文本数据库,无法理解背后的物理规律。

李飞飞指出,世界模型能让“看见”晋升为“推理”,让“感知”转化为“行动”,这是两者理念的根本差异。

未来的挑战

尽管前景光明,但世界模型的发展仍面临巨大挑战。哈萨比斯坦言,高昂的推理/服务成本和实现长时间一致性的能力是当前的主要瓶颈。与已经诞生ChatGPT、Sora等爆款的“读懂派”相比,世界模型领域还缺乏现象级的消费产品。

这使得该技术面临“雷声大,雨点小”的质疑。但构建能理解并推演物理规律的模型,其底层挑战远超文本处理,需要行业给予更多耐心与时间。

世界模型代表了AI发展的一个更深层次的思考方向,它试图让智能扎根于物理现实。尽管前路挑战重重,但其潜力巨大。当AI不仅能言说,更能与真实世界互动时,我们将迎来怎样的未来?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章