多模态AI在处理现实世界复杂问题时,常因视觉搜索命中率低、推理链路短而受限。一项名为Vision-DeepResearch的新技术,通过将检索升级为多轮试探-反馈的长期交互过程,显著提升了模型在噪声环境中的搜证能力。该方法在多个权威基准上,让小参数模型实现了对GPT-4等顶级闭源模型的超越,为AI的深度研究能力带来了实质性突破。
智能速览
多模态深度研究将AI的认知能力从文本扩展至图文结合。
现有技术存在视觉搜索命中率低和推理深度不足两大瓶颈。
新方法通过多尺度裁剪和上百次引擎交互实现精准定位与验证。
一个8B参数规模的模型在6项基准测试中表现超越GPT-4等闭源模型。
研究团队还构建了更贴近现实的评测基准VDR-Bench。
精华内容
传统的AI搜索往往是浅尝辄止,而真正的深度研究需要像人类研究员一样,在信息海洋中不断试错、验证和整合。Vision-DeepResearch正是模仿了这种能力,让AI的视觉搜索不再是一次性的简单匹配。
突破两大瓶颈
当前多模态深度研究面临两大核心挑战,导致其在真实环境中难以应用。首先是视觉搜索的“命中率”问题,即直接使用整图或单一实体进行检索时,极易被背景噪声干扰,且对同一实体不同尺度的裁剪会返回截然不同的结果,导致检索极不稳定。
其次是“推理深度与检索广度”不足,多数方法的搜索轨迹短、与搜索引擎交互次数少,无法完成需要多跳证据聚合和“试错式搜证”的复杂问题。这两个瓶颈限制了模型从视觉内容中获取可靠信息的能力。
多轮交互新范式
为解决上述问题,Vision-DeepResearch提出了一种新的多模态深度研究范式,将检索从“一次性操作”升级为多轮试探—反馈—再检索的长期交互过程,支持几十步推理和上百次引擎交互。
其方法核心是多实体/多尺度视觉裁剪检索(CIS),模型先定位关键区域,生成不同尺度的裁剪图并行搜索,显著提升命中率。同时,构建了“视觉→网页→摘要→验证”的证据管线,过滤噪声并提炼证据。训练上,先通过约30K长轨迹数据进行监督微调(SFT),再利用在线强化学习在真实环境中优化策略,将深研行为内化为模型能力。
小模型超越GPT
这套新范式带来了性能上的巨大飞跃。在VDR、FVQA、MMSearch等6个主流基准测试中,Vision-DeepResearch-8B模型相比同体量的Qwen3-VL-8B模型平均性能提升了约10.4%。
参数量更大的Vision-DeepResearch-30B-A3B模型则将平均提升幅度扩大至约16.0%。更重要的是,在统一的agentic推理设置下,这些模型甚至在多项基准上超越了由GPT-5、Gemini-2.5-Pro、Claude-4-Sonnet等强大闭源模型构成的深度研究系统,证明了小模型也能通过优化的方法论实现顶尖性能。
构建真实评测
为了更准确地评估视觉深度研究能力,研究团队还发布了新的评测基准VDR-Bench,旨在解决现有评测“不对题”的问题。VDR-Bench包含2000条必须通过视觉搜索才能解答的难题,强制模型通过局部实体发现、迭代裁剪和多跳推理来作答,从源头杜绝了文本线索泄露和“完美检索”等捷径。
研究发现,模型存在“懒搜索”现象,即基础能力越强的模型越可能依赖先验知识,反而懒得调用视觉检索。为此,团队提出了Multi-turn Visual Forcing(MVF)策略,强制多轮视觉搜索,显著提升了模型在深度研究任务上的表现。
Vision-DeepResearch的意义在于,它证明了AI的深度研究能力可以被有效训练和内化,而非简单的外部工具调用。随着VDR-Bench这类更贴近现实的评测基准出现,未来多模态AI的研究方向是否会从单纯追求模型规模,转向更注重在噪声环境下的长视野推理与试错能力?