传统多模态RAG在视觉问答中常因定位不准和缺乏检索决策能力而表现不佳。一项名为PixSearch的新技术,通过将像素级感知与检索推理统一,显著提升了模型的精准度与事实一致性,为处理第一视角和长尾实体等复杂场景提供了新思路。
智能速览
模型直接生成分割mask,实现像素级精准检索。
通过
token内生化决策,自主判断何时需要检索。 支持区域、整图、文本三种查询方式的灵活路由。
采用搜索与推理交错解码,支持多跳事实推理。
两阶段微调和信息Token Masking技术确保模型能力平衡。
精华内容
PixSearch的核心在于将感知、检索与推理融为一体,其创新架构如何具体实现这一目标,并解决传统方法的痛点呢?
像素级精准定位
传统RAG方法依赖整图或文本描述,容易引入噪声和歧义。PixSearch创新性地让模型直接生成分割mask,精准圈选出目标实体区域。
这个裁剪出的区域被作为检索查询,从源头上避免了无关背景的干扰,也绕开了文本描述可能带来的抽象误差,实现了真正的像素级检索。
智能化的检索决策
模型并非盲目检索,而是通过生成一个特殊的
只有在模型自身判断需要外部知识支持时,才会触发检索流程,大幅提升了运行效率和响应速度。
多模态查询与推理
PixSearch统一支持三种查询模式:基于的整图查询和
检索到的信息以
创新的训练策略
为防止新技能导致旧能力遗忘,PixSearch采用两阶段监督微调。第一阶段专注保持分割能力,第二阶段再学习检索时机与查询构造。
此外,通过信息Token Masking技术,在训练中屏蔽检索证据的反向梯度,迫使模型专注于“利用”证据进行推理,而非“记忆”检索内容,确保了模型的泛化能力。
PixSearch为多模态RAG领域带来了像素级感知与智能决策的新范式,显著提升了事实一致性。这项技术未来能否在机器人、第一视角设备等领域发挥更大价值,值得期待。