传统AI在真实世界的几何与物理证明上长期受限。MMFormalizer框架的出现,首次将多模态自动形式化扩展至物理场景,通过递归机制和维度约束,让AI能够理解并验证复杂的物理定理。这项技术为AI在科学发现领域的应用开辟了新路径。
智能速览
MMFormalizer框架首次实现真实物理场景的自动形式化。
引入递归式Grounding与终止机制,防止推理深度爆炸。
将物理维度纳入类型系统,确保量纲一致性。
提出全新基准PHYX-AF,强制模型进行视觉-物理推理。
实验显示GPT-5在物理推理上领先,Gemini擅长几何。
该框架已在Lean中实现,支持定理检索与代码验证。
精华内容
如何让AI从理解抽象公式进化到验证真实物理世界?MMFormalizer通过一套创新的形式化框架,给出了系统的答案,其核心在于如何将视觉与物理概念精准落地。
物理世界的落地
MMFormalizer的核心突破在于将自动形式化从纯文本数学扩展至真实的物理世界。传统模型因缺乏物理与视觉约束,在处理力、能量、时间等物理量时会失效。该框架则能将图像和文本中的物理概念,递归地转化为可在Lean中验证的形式化定理,系统性覆盖了从经典力学到量子力学等多个领域,解决了仅靠逻辑无法推出物理量关系的根本难题。
递归 grounding
框架提出了递归式Grounding机制,将复杂的图像或文本拆解为逐层依赖的形式化命题。为避免无限分解导致系统崩溃,设计了终止机制,通过维度闭包或公理闭包自动判断何时停止递归。实验证明,无终止条件会导致依赖图节点数激增至684个,而引入该机制后,推理深度与成功率均得到显著提升。
维度与类型系统
MMFormalizer创新地将物理维度(如质量M、长度L、时间T)纳入Lean的类型系统。这一设计使所有推导过程天然满足量纲一致性,从底层保证了物理逻辑的正确性。同时,它通过从场景图到命题链再到公理链的层级结构,统一了几何与物理的依赖图建模,构建出可组合、可验证的形式化体系。
基准与模型表现
为验证其有效性,团队构建了全新基准PHYX-AF,包含115个刻意设计的多模态问题,强制模型必须结合视觉和物理信息进行推理。评测结果显示,GPT-5在物理推理任务,尤其是现代物理方面表现最强;而Gemini-3-Pro则在几何与解析几何上整体领先。这表明几何仍是当前AI推理的难点,同时也验证了MMFormalizer框架的评测价值。
MMFormalizer不仅是一个技术框架,更是AI走向严谨科学推理的重要一步。它打通了视觉感知与形式逻辑的壁垒,为AI辅助科学发现提供了可能。未来,AI能否直接从观测数据中发现新的物理定律?