巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

2026-06-14 23:56:18 1点赞 2收藏 0评论

你有没有发现,现在的AI有时候聪明得吓人,有时候又蠢得离谱?

你让它写一首诗、编一段代码,它能给你整得挺像那么回事。但你问它一个特别简单的问题:比如“我手里拿着一杯水,松开手,会发生什么?”它可能给你分析半天,然后说“水会洒出来”,但完全说不清楚水是怎么洒的、杯子会不会碎、水洒出来之后往哪个方向流。为什么?因为它的底层逻辑一直是猜下一个字、猜下一个像素。它看过无数关于“水杯”的文字和图片,但它从来没有真正“理解”过重力、惯性、碰撞这些物理常识。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

我再说个更具体的例子。你让传统大模型看一段视频:一个人把足球踢向窗户。它能识别出“人”“足球”“窗户”这些物体,但它不知道足球撞到玻璃之后会发生什么——玻璃会不会碎?碎片往哪飞?球会不会反弹?它只能靠蒙。因为它的世界是二维的,是文字和像素拼出来的,没有物理规则。

这个巨大的短板,前两天在北京智源大会上,终于被人给补上了。

6月12号,第八届北京智源大会在中关村国际创新中心开幕。我去不了现场,但看报道说,线下报名人数已经超过了1万人。智源研究院院长王仲远在开幕前一天跟记者感叹:“今年的大会更火爆了。”按王仲远的说法,人工智能正沿着从大语言模型向多模态大模型、再向世界模型的方向演进,正在加速从数字世界迈向物理世界。这句话是整场大会的主基调,也是整篇文章的核心。

大会现场来了不少人。有2015年图灵奖得主Whitfield Diffie、2024年图灵奖得主Andrew Barto这种计算机科学奠基人,也有王坚、黄铁军、王仲远这些中国科技界代表人物。小米MiMo负责人罗福莉、清华大学教授朱军和刘知远这些一线技术掌舵人也都在。一个很有意思的细节是,参会的不只是资深专家,还有大批90后、00后——30余位30岁以下青年科学家,甚至还有初中生。智源大会确实在兑现“青年人才”这个口号。

智源研究院在大会上扔出来一个大家伙——叫“悟界·Physis-v0.1”,名字有点绕,你就记着“悟界”俩字就行。这是全球首个通用世界基座模型。

说到这个名字,王仲远自己说得特别实在。他在接受央视采访时说:“世界模型必须是全模态的,以预测下一个物理状态为核心,能够感知时间空间、物理规律、物理常识,能够具备主动交付的能力。同时具备这些要素的世界模型应该还没有诞生,所以您可以看到我们命名上也非常谨慎和保守,我们将其命名为悟界Physis-v0.1。这0.1就代表着我们仅仅迈出了一小步。”

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

王仲远在接受中国证券报采访时也说了类似的话。他指出,当前的瓶颈主要体现在真实物理数据匮乏、技术路线尚未收敛、评测体系不完善等。对于世界模型的未来演进,他持谨慎乐观态度:“至少未来三到五年,都会是世界模型持续演进迭代的阶段。科研探索这件事说不准,可能卡在一个难点三五年也没突破,但也可能突然迎来技术爆发。”在他看来,世界模型是下一代人工智能的基座模型。他还呼吁行业共建评测体系,围绕“预测下一个物理状态”构建统一的评测基准,共同推动世界模型技术的实质性进步。

这跟以前所有AI模型最大的不同是什么?以前的AI是“文字学霸”,熟读唐诗三百首但不会走路;这个新家伙是“物理观察者”,它学着去理解真实世界是怎么运转的。王仲远的说法是:“早年大语言模型处理的是文字,多模态模型开始引入图像、音频、脑信号,接下来会解决的就是真实物理空间的时间、空间、物理规律、物理常识。”

他之前跟新浪科技聊的时候还提到,过去半年间世界模型突然异常火热,但“1943年Kenneth提出的‘心智模型’便被广泛认为是世界模型的理论源头”。最近几年大语言模型能解决数字世界的很多问题,但物理世界依然有很多问题无法被AI解决,这才是世界模型被重新提及的根源。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

世界模型这概念现在炒得很热,王仲远反倒一直在泼冷水。他告诉北京商报记者,目前行业对世界模型的定义还没有达成共识,“很多人把视频生成模型等同于世界模型,这是被误用的源头”。

他还专门举了个例子:视频生成模型可以生成“一群猪在天上跟飞机一起飞”的画面,因为它的训练数据包含大量科幻电影。视频模型能生成天上飞的猪,这在数字世界是趣味,但在物理世界就是灾难。

王仲远把当前的主流技术路径分成了四类:第一类是以语言为中心,包括大语言模型、VLM、VLA;第二类是以像素为中心,像Sora、Seedance等视频生成模型;第三类是以三维结构为中心;第四类是以视觉表征为中心。

但这四类距离真正面向物理世界的基座模型都还有距离。视频生成模型只是预测画面,不是理解物理;大语言模型能答对高考物理题,不代表真的懂物理交互。智源正在探索的可能被称为“第五类”的路径——也就是“统一潜空间表征”。王仲远认为,“将来统一的潜空间建模不仅仅是视觉空间,而是全模态潜空间,很有可能是世界模型真正下一个可能的路径。”

那这个模型到底有什么本事?我简单跟你说说。

物理一致性,模型生成的内容不会违反物理常识。王仲远自己也强调过,世界模型必须做到“物理正确、动作因果可溯、长程一致和通用泛化”。动作因果推演,你给我一个动作,我能预判后续连锁反应。长时序场景预判,不是只看下一秒,而是能连续看未来几秒钟甚至十几秒钟的变化。跨场景通用泛化,在A场景里学到的东西,能直接迁移到B场景。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

智源大会的现场演示人员也做了个很形象的解释:有了世界基座模型和具身大脑的支撑,机器人不仅能自主识别“杯子在桌子边缘”,更能预判“杯子掉下去会摔碎”,还能分辨“盖好盖子”与“没盖好盖子”的水杯跌落带来的不同后果。这套通用基座能力最终要达到的是全垂类场景应用——从端茶倒水到自动驾驶,从工厂装配到新药研发,一个模型通吃。

《科技日报》的报道说,悟界·Physis-v0.1打破了传统AI垂类场景专用的技术瓶颈,从根源上提升AI物理推理的真实性与可靠性。

除了这个通用基座,智源还发布了几个配套模型,我简单提一嘴,让你知道这波不是单点突破,而是整套体系。

悟界·Brainμ1.0是全球首个理解与生成统一的多模态神经科学大模型,能把脑信号直接转成文字、图像、音频,它支撑的脑科学研究成果已经发在了《Science》上。这是智源联合清华团队搞出来的。

悟界·OpenComplex2.5是下一代AI药物发现模型,能以单一模型覆盖制药四大关键步骤,很多指标超过了传统的物理计算方案,也就是说新药研发会更快、更便宜。

悟界·RoboBrain Orca正在研发中,专门给机器人当“大脑”。它融合了大量以自我为中心的交互数据,强化了世界模型的具身表征,能够同时生成语言思考、视觉预测与动作决策,实现“想、看、动”三位一体。

说到机器人,智源研究院理事长黄铁军在接受北京商报采访时聊得挺透。被问到为什么智源坚持世界模型才是具身智能的终极方向,黄铁军的回答是:“企业用成熟技术解决明确问题,在制造或搬运等特定场景下完成任务,是可行的。但从研究机构角度,我们希望具身智能通用化,像人类一样在任何场景解决问题。机器人需要观察和用力,必须对世界有自己的模型——可以称之为世界模型。就像人脑小宇宙中,每个人都对世界有一个模型,做事时才有基本判断依据。”

他还谈了数据采集的问题:“数据来源要推广理解为‘生物与环境交互过程中获得的信息’。计算机互联网时期,我们能把通过各种传感手段采集到的信号转化为数据,但这种数据是对环境的不完整表达,过于静态。对于世界模型来说,离线静态数据集不够,需要更多在线实时交互的数据。在世界模型和具身阶段,需要的实时性和交互性数据会越来越多。”更好的方式不是建数据工厂,而是边工作边采集数据。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

除了黄铁军,大会上还有其他专家学者的观点。图灵奖得主Andrew Barto表示,强化学习与神经网络的计算研究从一开始便紧密交织,而深度强化学习的计算能力与大脑奖励系统的最新成果相结合,指明了下一轮进展的方向。

在“重构世界——中国大模型巅峰对话”圆桌环节,清华大学计算机系教授、生数科技创始人朱军,小米集团MiMo负责人罗福莉,清华大学计算机系教授、面壁智能联合创始人兼首席科学家刘知远等人,围绕超级模型能力演进、AI自进化、多模态与世界模型等核心议题深入交流。嘉宾们认为,超级模型与智能体系统正进一步释放更大势能,自进化有望成为驱动智能跃迁的新引擎,多模态与世界模型的加速成熟有望推动AI真正从数字空间走向物理世界。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

朱军说得更具体:物理世界本身是开放的,很多场景还没有被充分数字化,所以要进入物理世界,必须花很多功夫采集数据、构建环境。他判断,视频模型和世界模型目前仍在持续扩展且潜力非常大。

智源研究院行为世界模型中心负责人陈博远也做了个很形象的说明,他在央视的报道里说:“在我们真实的物理世界里边不同的场景,它都遵循着同一套物理规律。这样一个基座模型,它学习的其实是物理本身,最后也是会应用到像我们所展示的,无论是一些交互的世界,具身的控制,包括作为具身的大脑,甚至是作为一些科学的预测,来服务于我们任何需要物理的一些下游的应用场景之中。”

智源从2023年就开始布局世界模型,2024年出了悟界Emu3——全球首个原生多模态世界模型,2025年迭代了悟界Emu3.5,把时空关系、因果逻辑与物理世界演化规律的建模能力内置了进去。这个成果于2026年1月刊发于《Nature》正刊,创造了国产多模态大模型的多项纪录。

这套技术是100%自研开源的。截至目前,智源累计开源的模型已经超过200个,全球下载量突破10亿次。同时孵化了一系列在大模型领域和具身智能领域非常有代表性的创新创业企业。

关于智源的历史角色,新京报的报道写得很到位:“回顾国内AI的早期发展历程,一定离不开北京智源研究院。2021年3月,智源发布的悟道1.0开启了中国的大模型时代,杨植麟、唐杰等后来的国内大模型翘楚均曾在此工作,也正因如此,智源研究院一度被视为国内大模型的‘黄埔军校’。”

现在智源转向世界模型,理由很简单。王仲远告诉新京报:“作为新型研发机构,智源主要做高校、企业不愿意做的人工智能方向重大科研创新,我们一直都在人工智能大模型的最前沿。”他还强调,“技术先行,早于产品,早于系统”,就像深度学习2006年提出理念、Transformer2017年出现,但大语言模型直到2022年底才爆发。现在就需要对技术路径进行各种探索,才能引领和促进世界模型的爆发。

央广网报道说,智源研究院是国内最早布局世界模型研究的科研机构。早在2023年大语言模型热度最高时,智源大会便引入了世界模型的前沿观点;2024年明确提出了“大语言模型—多模态大模型—世界模型”的技术演进路径;随着悟界·Emu3、Emu3.5相继发布,多模态世界模型的技术路径逐步落地。到2026年,智源明确提出,世界模型有望成为下一代人工智能的基座模型。

王仲远在接受中国证券报采访时说,大语言模型时代智源是跟随者,但到多模态时代智源已经开始提出自己独立的技术路径。“世界模型开始,我们有了自己对于这个问题的定义,技术路线上也有我们自己的信仰,某种程度上也证明了中国人工智能力量在努力探索前沿方向,希望能够最终引领。”

我跟你讲几个明确的落地方向,你就知道这不是画饼了。

自动驾驶。现在的自动驾驶事故,很多是因为AI遇到了没见过的场景。比如路上突然滚出一个轮胎,AI不知道该刹车还是避让。悟界模型可以实时预判运动轨迹和碰撞后果,给出最优决策。如果每辆智能汽车都装了一个“懂物理”的大脑,交通事故率能降多少?

人形机器人。现在的人形机器人演示都很牛,一到真实环境就卡壳。因为真实环境太乱了——桌子上的东西随便放、光照不一样、地面有坡度。悟界能让机器人自己去适应,不用每换一个环境就重新编程。黄铁军在大会上展示的闭幕演讲题目是《智能之路——吾道一以贯之》,这几个字贯穿了智源从大语言模型到多模态再到世界模型的完整技术路线。

工业仿真和数字孪生。以前工厂要测试一条新流水线,得建物理模型或者跑复杂的有限元分析。现在可以用悟界直接在虚拟环境里模拟,而且模拟的物理规则和真实世界几乎一样,省下的时间和成本非常可观。

智源研究院院长王仲远做了个总结:“世界模型,是面向物理世界的基座模型。”要让AI真正进入物理世界,解决制造业、医疗、物流、养老等实体经济的痛点。世界模型必须能让AI理解时间、空间、物理规律,并且具备主动交互的能力。

巨变!全球首个通用世界基座模型发布,AI终于学会看懂物理世界

我觉得这次发布的意义怎么强调都不过分。AI从“会聊天”到“看懂世界”,就像是从一个只会读书的学生,变成了一个能在现实中动手干活的人。以后你家里的扫地机器人不会再把拖鞋推下楼梯了,自动驾驶不会在暴雨天突然傻了,工厂里的机器人能自己学会组装零件。

但王仲远也说了大实话:“世界模型现在仍处于早期,需要开展大量的科研探索工作。”他甚至提醒行业,一个杯子从桌边掉下来会发生什么,人类一眼就能判断,但对现在的AI来说,要完成感知、理解、交互、决策的完整链路,还没法完全做到。数据是核心瓶颈之一,真实物理世界的多模态交互数据极度稀缺。仿真数据有用,但“各种物理仿真工具、游戏引擎都可以对世界进行模拟,但因为人类掌握的真实物理知识、引擎规则和算法还不够完备,仿真始终不能达到真正的100%”。

所以这次发布的是一款“0.1版本”的基座模型——智源自己都说是“仅仅迈出了一小步”。但重要的是方向选对了。AI的下一个十年,战场在物理世界。而目前来看,中国这次没有缺席。

你觉得最先普及的会是家用机器人,还是自动驾驶?评论区聊聊你的看法。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
相关兴趣推荐
2
扫一下,分享更方便,购买更轻松