张大妈

浙江大学:让模型真正用上视觉信息

源自小红薯:每日ComputerScience

01-16 17:06

当前多模态大模型普遍存在“看对但推错”的推理漂移问题,即视觉感知与逻辑推理严重脱节。浙江大学提出的COGFLOW框架,从认知科学出发,通过构建“感知-内化-推理”三阶段模型,系统性解决了这一核心难题,让模型的视觉信息真正服务于严谨的数学与逻辑推理,是一次关键的范式级改进。

浙江大学:让模型真正用上视觉信息智能速览

  • COGFLOW提出“感知-内化-推理”三阶段框架,显式建模知识内化过程。

  • 通过协同视觉奖励机制,同时在参数与语义空间监督视觉感知。

  • 设计知识内化奖励,强制推理过程依赖已内化的视觉事实。

  • 构建了包含12万+样本的MATHCOG数据集,用于模型训练与评估。

  • 在多个权威基准上,7B模型性能超越部分闭源大模型。

浙江大学:让模型真正用上视觉信息精华内容

COGFLOW的突破不在于单一技术点,而在于构建了一套完整的认知闭环。它如何确保视觉信息被忠实、准确地用于推理?核心在于对感知与推理之间断裂地带的系统性修复。

三阶段认知框架

传统模型将感知与推理割裂,导致“reasoning drift”。COGFLOW借鉴认知科学,将流程明确拆分为Perception(感知)、Internalization(内化)、Reasoning(推理)三个阶段。其中,最关键的“知识内化”环节被显式建模,确保模型看到的视觉信息能被正确理解并转化为推理可用的事实,避免了两者各自为政的根本性问题。

协同视觉奖励

为保证感知阶段的质量,COGFLOW设计了协同视觉奖励。该机制同时在参数空间与语义空间进行监督:前者确保几何原语等局部细节的精确性,后者保证整体布局等宏观关系的稳定性。这种“局部准+全局稳”的双重约束,为后续推理提供了高质量的视觉输入,大幅降低了源头错误的产生概率。

知识内化机制

为防止推理过程偏离事实,COGFLOW引入了知识内化奖励。该机制通过对五类典型推理漂移错误进行对比学习,强制模型在推理时必须严格依赖已经感知并内化的视觉事实。此外,视觉门控策略优化(VGPO)在强化学习中加入筛选环节,优先采用高质量的感知轨迹来生成推理链,有效避免了“一步错,步步错”的问题。

实验结果验证

为支撑上述方法,研究团队还构建了MATHCOG数据集,新增12万+高质量样本,并明确区分Watching/Thinking/Answer阶段。在FlowVerse、MathVerse等权威基准测试中,COGFLOW显著超越了现有开源模型。其7B量级的模型即可对标甚至超过部分闭源大模型,在几何与数学推理任务上,准确率和推理链质量均实现大幅提升。

COGFLOW为多模态大模型的视觉推理能力带来了实质性飞跃,其受认知科学启发的框架设计,为解决“感知与推理脱节”这一根本性难题提供了新范式。随着这类研究的深入,未来的AI模型将更接近人类般严谨的思考能力,真正实现“看懂”世界。这是否预示着通用人工智能的一大步?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章