尽管大型AI模型在语言和图像识别上表现卓越,但一项来自滑铁卢大学的突破性研究揭示了其致命短板:它们并不真正理解物理世界。通过创新的代码生成测试框架VisPhyWorld,研究团队发现这些顶尖模型在模拟基础物理现象时错误百出,暴露出当前AI从“背诵知识”到“真正理解”之间仍存在巨大鸿沟。
智能速览
AI模型能用专业术语描述物理,但无法准确预测实验结果。
全新测试框架VisPhyWorld要求AI编写可执行的物理模拟程序,而非选择题。
顶尖AI模型GPT-5的物理合理性评分仅为3.5分(满分10分),表现不佳。
AI的物理理解依赖于统计模式匹配,而非对动量、摩擦力等原理的真正掌握。
测试中AI频繁出现物体相互穿透、违反重力等明显物理错误。
精华内容
为了揭开AI物理理解的真实水平,研究者设计了一场别开生面的“实践考试”,其结果彻底颠覆了人们对当前AI能力的认知。
新测试框架
研究团队开发了名为VisPhyWorld的创新框架,彻底改变了测试方式。它不再让AI做选择题,而是向其展示物理事件前后两个视频帧,要求AI先用自然语言描述观察到的物理现象,然后编写出能够重现这一过程的可执行计算机程序。
这种方法将“纸上谈兵”变成了“动手实践”。程序能否成功运行并产生符合物理定律的结果,成为检验AI是否真正理解物理的试金石。研究还发现,当AI使用集成了物理引擎的编程环境(如Three.js)时,表现明显优于无物理引擎支持的环境。
惊人测试结果
在包含209个物理场景的VisPhyBench测试平台上,GPT-5、Gemini-3-Pro等五个顶尖AI模型的表现令人大跌眼镜。尽管它们在场景识别和视觉相似度上得分较高,但在核心的物理合理性上全军覆没。
表现最好的GPT-5,综合物理合理性评分也仅有3.50分(满分10分)。更有甚者,如Qwen3-VL-Plus模型在某些测试中生成了物体静止悬浮、完全无视重力的画面。这表明,AI生成的视频可能看起来像模像样,但其背后的物理过程却严重违反基本定律。
根本性问题剖析
深入分析AI生成的代码和模拟结果,研究者发现了其物理理解缺陷的具体表现。首先是参数设置不合理,例如设置过高的弹性系数导致物体永动式弹跳。
更深层的问题在于对因果关系的理解模糊。AI知道“球撞积木会倒”,但不理解撞击角度、速度如何具体影响倒塌过程。在处理多物体碰撞、摩擦力计算和三维空间运动时,AI的局限性尤为突出,频繁出现物体穿透、运动轨迹不符合逻辑等错误。这种“虚假自信”——用专业术语描述却执行错误——暴露了其依赖模式匹配而非原理理解的本质。
传统测试的缺陷
为何AI的物理盲点至今才被发现?关键在于传统测试方法的“放水”。视觉问答(VQA)和违背期望测试等旧方法,更像是在考察AI的记忆和模式识别能力,而非真正的物理推理。
在多选题中,AI有概率蒙对答案;在开放式问题中,AI能用模糊的表述掩盖理解缺陷。VisPhyWorld则杜绝了这种可能性,生成的程序代码就是AI“思考过程”的直接体现,研究者可以逐行检查,精确定位其理解误区,这是传统方法无法提供的可解释性和透明度。
未来方向与局限
目前的研究仍有局限,例如测试场景主要限于简单的刚体物理,且基于合成数据。未来的研究将向流体动力学等更复杂的物理现象扩展,并逐步应用于真实世界视频。
更重要的是,这项研究为提升AI的物理推理能力指明了方向。它不仅仅是一个评测工具,更是一个诊断平台,帮助开发者有针对性地改进模型。长远来看,推动AI从统计学习走向概念理解,将是实现其在机器人、自动驾驶等领域可靠应用的关键一步。
这项研究为AI发展敲响了警钟,揭示了表面能力下的深层认知缺陷。VisPhyWorld不仅是一个评测工具,更是一个推动AI走向真实物理理解的平台。未来,我们能否见证AI从“纸上谈兵”到“动手实践”的关键一跃,将直接影响其在机器人、自动驾驶等关键领域的应用前景。