当前多模态大模型普遍存在“看对但推错”的推理漂移问题,即视觉感知与逻辑推理严重脱节。浙江大学提出的COGFLOW框架,从认知科学出发,通过构建“感知-内化-推理”三阶段模型,系统性解决了这一核心难题,让模型的视觉信息真正服务于严谨的数学与逻辑推理,是一次关键的范式级改进。
智能速览
COGFLOW提出“感知-内化-推理”三阶段框架,显式建模知识内化过程。
通过协同视觉奖励机制,同时在参数与语义空间监督视觉感知。
设计知识内化奖励,强制推理过程依赖已内化的视觉事实。
构建了包含12万+样本的MATHCOG数据集,用于模型训练与评估。
在多个权威基准上,7B模型性能超越部分闭源大模型。
精华内容
COGFLOW的突破不在于单一技术点,而在于构建了一套完整的认知闭环。它如何确保视觉信息被忠实、准确地用于推理?核心在于对感知与推理之间断裂地带的系统性修复。
三阶段认知框架
传统模型将感知与推理割裂,导致“reasoning drift”。COGFLOW借鉴认知科学,将流程明确拆分为Perception(感知)、Internalization(内化)、Reasoning(推理)三个阶段。其中,最关键的“知识内化”环节被显式建模,确保模型看到的视觉信息能被正确理解并转化为推理可用的事实,避免了两者各自为政的根本性问题。
协同视觉奖励
为保证感知阶段的质量,COGFLOW设计了协同视觉奖励。该机制同时在参数空间与语义空间进行监督:前者确保几何原语等局部细节的精确性,后者保证整体布局等宏观关系的稳定性。这种“局部准+全局稳”的双重约束,为后续推理提供了高质量的视觉输入,大幅降低了源头错误的产生概率。
知识内化机制
为防止推理过程偏离事实,COGFLOW引入了知识内化奖励。该机制通过对五类典型推理漂移错误进行对比学习,强制模型在推理时必须严格依赖已经感知并内化的视觉事实。此外,视觉门控策略优化(VGPO)在强化学习中加入筛选环节,优先采用高质量的感知轨迹来生成推理链,有效避免了“一步错,步步错”的问题。
实验结果验证
为支撑上述方法,研究团队还构建了MATHCOG数据集,新增12万+高质量样本,并明确区分Watching/Thinking/Answer阶段。在FlowVerse、MathVerse等权威基准测试中,COGFLOW显著超越了现有开源模型。其7B量级的模型即可对标甚至超过部分闭源大模型,在几何与数学推理任务上,准确率和推理链质量均实现大幅提升。
COGFLOW为多模态大模型的视觉推理能力带来了实质性飞跃,其受认知科学启发的框架设计,为解决“感知与推理脱节”这一根本性难题提供了新范式。随着这类研究的深入,未来的AI模型将更接近人类般严谨的思考能力,真正实现“看懂”世界。这是否预示着通用人工智能的一大步?