港中大MM Lab提出一种名为Vision-DeepResearch的新范式,旨在赋予多模态大模型深度研究能力。该方法通过模拟人类的多轮、多实体搜索过程,让AI能够解决复杂的视觉问答问题。研究声称其性能已超越GPT-5、Gemini等顶尖模型,为视觉AI的推理能力带来了新的突破,值得高度关注。
智能速览
提出多模态深度研究新范式,支持多轮多尺度搜索。
通过冷启动监督与强化学习训练模型内化研究能力。
实验数据显示其性能超越GPT-5、Gemini等闭源模型。
该方法专为解决真实世界中的复杂视觉问答而设计。
精华内容
这项研究的核心在于,它不再是简单的单轮问答,而是教会AI如何像一个真正的专家那样,通过多轮搜索和推理,层层深入地挖掘视觉信息背后的复杂答案。
研究新范式
Vision-DeepResearch的核心是一种全新的研究范式。它超越了传统的单轮问答模式,转而模拟人类专家进行深度研究的过程。该范式支持多轮交互,模型可以根据初步发现,动态调整后续搜索策略。
同时,它能够处理多实体信息,在一次研究中关联多个对象,并进行多尺度的视觉文本搜索,从宏观到微观全面分析问题。这使得模型在面对需要数十步推理的真实世界复杂场景时,依然能够保持高效和准确。
能力内化训练
为了让模型掌握这种复杂的深度研究能力,研究者设计了一套精巧的训练方案。初期采用冷启动监督学习,为模型提供基础的研究范式示范。
随后,引入强化学习(RL)进行优化,通过奖励机制鼓励模型进行更深入、更准确的推理和搜索。这种结合方式不仅让模型学会了如何搜索,更重要的是将深度研究的“能力”内化到了模型参数中,使其无需外部持续指导也能自主进行高质量的研究。
性能与影响
该项研究最引人注目的成果是其宣称的卓越性能。在多项评测中,Vision-DeepResearch reportedly surpassed closed-source giants like GPT-5, Gemini-2.5-pro, and Claude-4-Sonnet。
这一成果意义重大,它标志着在多模态深度研究领域,开源模型有望追平甚至超越顶尖闭源模型。这不仅为学术界和开发者提供了强大的工具,也为解决现实中如医疗影像分析、科研文献解读等复杂视觉任务开辟了新的道路,展现了巨大的应用潜力。
Vision-DeepResearch为多模态AI的深度推理能力树立了新的标杆。它证明了通过模拟人类研究流程和巧妙的训练,AI可以解决更复杂的视觉问题。未来,这种范式能否催生出更智能的AI助手,帮助人类探索未知世界?这无疑值得期待。