张大妈

北理工新模型让多模态大模型学会想象式推理

源自小红薯:每日ComputerScience

01-14 20:11

现有多模态大模型在面对不完整视觉信息时,其溯因推理能力与人类存在差距。北理工提出的AbductiveMLLM模型,通过模拟人类‘先假设、再想象、再验证’的认知过程,首次引入语言溯因与视觉想象的协同机制,显著提升了模型在视频场景下的推理表现,为因果驱动的人工智能研究提供了新思路。

北理工新模型让多模态大模型学会想象式推理智能速览

  • 多模态大模型在视觉溯因推理上存在短板

  • AbductiveMLLM提出“语言溯因+视觉想象”协同机制

  • 通过因果感知筛选假设,并将想象作为推理信号

  • 在两大基准测试上全面超越GPT-4o-mini等主流模型

  • 相比Qwen2VL-7BFT,CIDEr指标提升超过6个点

北理工新模型让多模态大模型学会想象式推理精华内容

为了让AI像人类一样进行因果推理,北理工的研究团队构建了一个包含‘语言溯因’与‘视觉想象’的统一框架。这一设计并非简单地生成图像,而是将视觉想象作为一种独特的推理信号,引导模型探索更深层次的因果逻辑。

双模态溯因机制

AbductiveMLLM的核心是一个由REASONER(语言溯因)和IMAGINER(视觉想象)组成的统一框架。这个框架的设计初衷是模拟人类在进行复杂推理时,语言和图像思维相互交织、相互印证的过程。REASONER负责生成和筛选基于文本的假设,而IMAGINER则将这些假设转化为视觉层面的可能性,二者协同工作,实现了超越单纯语言或视觉模式的推理深度。

因果感知的假设

模型的创新之处在于其因果感知的假设生成与筛选(CHG)机制。首先,利用大语言模型(LLM)基于视频字幕生成多样化的候选假设。与传统方法不同,筛选标准并非表层语义的相似度,而是通过跨模态因果对比学习,从视觉因果一致性角度进行评估。这意味着模型能更准确地识别出那些真正符合事物发展逻辑的假设,从而为后续推理提供高质量的先验知识。

想象作为推理信号

该研究中‘视觉想象’的定位尤为关键。它并非为了生成逼真的图像供人观看,而是作为一种内在的推理信号。IMAGINER模块基于Stable Diffusion,通过轻量级适配器进行视频级条件扩散。其核心目标是通过计算潜在空间的去噪损失(latent denoising loss),反向约束和优化模型的推理表示。这种方法巧妙地将生成模型的能力转化为一种评估和验证因果假设的工具,显著提升了推理的准确性。

性能显著超越

在VAR与YouCookII两大视频溯因基准测试中,AbductiveMLLM展现了全面的性能优势。它不仅超越了传统的专用小模型,也显著优于零样本与微调状态下的主流多模态大模型,如GPT-4o-mini和Qwen2VL-7BFT。

具体数据显示,在更具挑战性的VAR测试集上,AbductiveMLLM相比Qwen2VL-7BFT,CIDEr指标提升了6.22个点,ROUGE-L指标提升了0.84个点。消融实验进一步证明,语言假设筛选与视觉想象两个模块对性能提升都不可或缺,且视觉想象对语义相关指标的增益尤为明显。

AbductiveMLLM的成功,标志着多模态大模型在因果推理能力上迈出了重要一步。它不仅提升了模型在视频理解等任务上的表现,更重要的是为构建更具人类思维模式的AI提供了可借鉴的技术路径。未来,这种‘想象式推理’能否在更广泛的领域中发挥作用,值得关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章