张大妈

Meta:像素级检索驱动的多模态RAG

源自小红薯:每日ComputerScience

02-08 15:15

传统多模态RAG在视觉问答中常因定位不准和缺乏检索决策能力而表现不佳。一项名为PixSearch的新技术,通过将像素级感知与检索推理统一,显著提升了模型的精准度与事实一致性,为处理第一视角和长尾实体等复杂场景提供了新思路。

Meta:像素级检索驱动的多模态RAG智能速览

  • 模型直接生成分割mask,实现像素级精准检索。

  • 通过 token内生化决策,自主判断何时需要检索。

  • 支持区域、整图、文本三种查询方式的灵活路由。

  • 采用搜索与推理交错解码,支持多跳事实推理。

  • 两阶段微调和信息Token Masking技术确保模型能力平衡。

Meta:像素级检索驱动的多模态RAG精华内容

PixSearch的核心在于将感知、检索与推理融为一体,其创新架构如何具体实现这一目标,并解决传统方法的痛点呢?

像素级精准定位

传统RAG方法依赖整图或文本描述,容易引入噪声和歧义。PixSearch创新性地让模型直接生成分割mask,精准圈选出目标实体区域。

这个裁剪出的区域被作为检索查询,从源头上避免了无关背景的干扰,也绕开了文本描述可能带来的抽象误差,实现了真正的像素级检索。

智能化的检索决策

模型并非盲目检索,而是通过生成一个特殊的

token来决定“何时”启动检索。这种内生决策机制有效减少了不必要的检索调用,降低了系统延迟和资源消耗。

只有在模型自身判断需要外部知识支持时,才会触发检索流程,大幅提升了运行效率和响应速度。

多模态查询与推理

PixSearch统一支持三种查询模式:基于的像素区域查询、的整图查询和的文本查询,并可在解码过程中交替使用。

检索到的信息以块的形式注入上下文,模型可以基于新证据继续推理,甚至进行多跳事实查找,极大地增强了复杂问题的解答能力。

创新的训练策略

为防止新技能导致旧能力遗忘,PixSearch采用两阶段监督微调。第一阶段专注保持分割能力,第二阶段再学习检索时机与查询构造。

此外,通过信息Token Masking技术,在训练中屏蔽检索证据的反向梯度,迫使模型专注于“利用”证据进行推理,而非“记忆”检索内容,确保了模型的泛化能力。

PixSearch为多模态RAG领域带来了像素级感知与智能决策的新范式,显著提升了事实一致性。这项技术未来能否在机器人、第一视角设备等领域发挥更大价值,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐