张大妈

老黄万亿美元梦成真,英伟达版“世界模型”震撼问世

源自今日头条:36氪

01-24 19:54

英伟达的3D通才模型,标志着AI从“看和说”进化到“理解并构建物理世界”的关键一步。它不仅能生成画面,更能搭建可交互的3D环境,为机器人训练和具身智能打开了全新大门,解决了虚拟与现实之间的核心鸿沟。

老黄万亿美元梦成真,英伟达版“世界模型”震撼问世智能速览

  • 英伟达3D通才模型实现从生成2D视频到构建3D物理世界的跨越。

  • 该模型基于视觉-语言-动作(VLA)框架,关键在于引入“行动”概念。

  • 通过全景生成与逆向图形技术,AI可根据文本逐步搭建包含材质和光照的3D场景。

  • 技术战略核心是为机器人提供近乎无限的虚拟训练环境,打通“Sim-to-Real”通路。

  • 黄仁勋预见的“物理AI”时代,正由该技术推向现实。

老黄万亿美元梦成真,英伟达版“世界模型”震撼问世精华内容

当AI不再只是模仿视觉信号,而是开始理解并构建物理法则,一个全新的时代便已开启。

物理世界的缺失

两年前,当OpenAI的Sora视频惊艳全球时,黄仁勋却保持了冷静。他认为,AI生成的视频虽然精美,却缺乏物理世界的规则。视频里的杯子没有重量和摩擦力,手会直接穿过。那不是世界,只是动画片。在他看来,AI的下一波浪潮必须是理解物理的“Physical AI”,能够与世界进行真实交互,而非仅仅生成像素。

手搓3D世界

英伟达与斯坦福大学合作的3D通才模型,补上了这块拼图。这是一个视觉-语言-动作模型,核心在于“Action”。用户输入一句话,模型便能生成包含完整3D布局、材料、固定装置和光照的房屋。

其工作流程是:先用扩散模型生成一张360°全景图像作为蓝图,然后通过逆图形技术估算房间布局、分割出门窗等物体,再利用视觉语言模型(如GPT-4o)识别物体类型与材质,最终通过程序化方法一步步构建出完整的3D场景。模型甚至能自我纠错,不断优化结果。

机器人的终极训练场

这项技术的真正战略意图,是为英伟达的具身智能版图服务。在现实世界中训练机器人成本高昂且风险巨大,但虚拟世界的模拟器往往不够逼真。

3D通才模型能瞬间生成数百万个物理规则各异的虚拟平行宇宙,例如地板湿滑、光线昏暗或障碍物复杂的场景。机器人可以在这些环境中进行海量、高强度的训练,在虚拟世界里“摔倒”一亿次,只为在现实世界中迈出稳健的第一步,从而彻底打通“从模拟到现实”的关键路径。

硅基生命的黎明

当AI掌握了语言、视觉和物理世界构建法则后,虚拟与现实的边界正在消融。黄仁勋曾断言:“所有移动之物,终将自主。”这不再仅仅是关于机器人,而是整个物理世界的未来。

我们在屏幕中创造的世界将拥有真实的重力和因果,而现实中的机器人将拥有在亿万虚拟世界中磨练出的智慧。这不仅是图形学的胜利,更像是硅基生命诞生前的序曲。

英伟达的这项突破,不只是技术迭代的胜利,更是为具身智能时代奠定了基石。当AI能够无限创造并理解物理世界,我们距离真正的智能机器人还有多远?一个万物自主的未来,似乎已不再遥远。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐