这项研究聚焦多模态深度推理,通过创新方法显著提升事实性VQA性能。新框架实现了数十轮推理和数百次搜索引擎交互,超越主流闭源模型,并推出全新基准测试VDR-Bench。
智能速览
提出多轮、多实体、多尺度的视觉/文本搜索框架
通过VQA合成+轨迹合成+冷启动+强化学习内化deep-research能力
8B/30B-A3B模型在6个主流VQA基准上超越GPT-5等闭源模型
推出Vision-DeepResearch Benchmark解决现有基准缺陷
开源冷启动训练代码和强化学习训练代码
VDR-Bench包含2000道人工校验可解性题目
精华内容
这项研究的核心创新在于将深度研究能力成功内化到多模态大模型中,通过精巧的训练方法实现了推理性能的重大突破。
多轮推理架构
研究团队构建了首个长轮多模态deep-research MLLM,将推理轮数拓展到数十轮,搜索引擎交互次数达到数百次。这种多轮、多实体、多尺度的视觉/文本搜索框架,让模型能够进行更深层次的推理和更全面的信息整合。
相比传统单轮问答系统,新架构通过持续的搜索和验证过程,显著提升了事实性VQA任务的准确性和可靠性。
训练方法创新
研究采用VQA合成、轨迹合成、冷启动和强化学习相结合的训练策略。首先通过合成数据构建基础能力,再利用冷启动技术快速适配任务,最后通过异步高性能agentic reasoning强化学习进行精细调优。
这种递进式训练方法成功将deep-research能力内化到MLLM中,使模型具备自主进行深度研究的本领,而不需要外部工具的辅助。
性能突破数据
在6个主流事实性VQA benchmark上,8B/30B-A3B大小的模型取得了超越GPT-5、Gemini-2.5-Pro、Claude-4-Sonnet等强大闭源模型构成系统的性能。数据显示,新方法在平均指标和最大指标上均领先。
这一成果证明,通过精心设计的训练方法,相对较小的开源模型也能在复杂推理任务中击败大型闭源系统。
基准测试革新
针对当前multimodal deep-research benchmarks的缺陷,团队提出VDR-Bench。解决了两大关键问题:一是现有基准不以视觉搜索为中心,二是验证环境过于理想化。
VDR-Bench包含2000道全人工参与的完全校验可解性题目,模拟充满噪音的真实世界搜索引擎环境,为多模态深度研究能力提供更准确的评估标准。
开源生态贡献
研究团队已开源冷启动训练代码、异步高性能agentic reasoning强化学习训练代码和VDR-Bench。数据和权重正在逐步更新中,为研究社区提供完整的技术栈。
GitHub仓库、项目页面和HF论文均已公开,方便其他研究者复现结果和在此基础上进行改进,推动整个领域的技术进步。
这项研究为多模态大模型的深度推理能力提供了全新思路,通过创新的训练方法和评估基准,实现了开源模型对闭源系统的超越。开源的数据集和代码将促进该领域快速发展,未来能否在更多实际应用场景中验证其价值,值得持续关注。
关键评论
有用户对首个长轮多模态模型的定位提出质疑,认为相关工作可能已有先例
不少网友对这项工作的创新性和工作量表示赞赏,认为解决了想做但难以实现的技术难题
有人关心训练成本问题,询问裁剪后搜索是否会导致时间和金钱开销过大
技术细节讨论关注训练过程中的图像处理,特别是强化学习阶段是否会丢失早期轮次的图像信息