张大妈

文本指路,英伟达新招抑制多模态幻觉

源自小红薯:每日ComputerScience

01-15 20:15

多模态大模型常因过度依赖高层视觉特征而产生“幻觉”,事实准确性堪忧。TGIF方案另辟蹊径,通过文本提示动态融合视觉编码器的多层信息,在不增加训练成本的前提下,显著提升了模型的细节感知与OCR能力,为解决多模态幻觉问题提供了兼具效率与效果的新思路。

文本指路,英伟达新招抑制多模态幻觉智能速览

  • TGIF方案通过文本动态融合多层视觉特征,而非固定使用单层。

  • 该方案冻结视觉编码器,仅增加轻量级路由器,训练成本极低。

  • 通过在投影前融合特征,有效避免了Token数量的膨胀问题。

  • 实验显示,模型幻觉抑制、OCR识别和通用问答能力三线全面提升。

  • 在幻觉抑制任务上,其表现甚至超越了部分13B规模的模型。

文本指路,英伟达新招抑制多模态幻觉精华内容

TGIF方案的精妙之处在于,它巧妙地绕开了重新训练庞大视觉编码器的成本难题,通过引入一个轻量级的“路由器”,实现了对视觉信息的深度挖掘与智能利用,其核心机制与实现细节值得深入探究。

动态特征融合

传统方法多固定使用CLIP ViT的倒数第二层特征,忽略了中浅层蕴含的细节信息。TGIF则将每一层视为一位“专家”,通过一个轻量级的MLP路由器,依据当前的文本提示动态预测各层特征的权重,实现按需融合。

例如,在识别文字时,模型会自动赋予中浅层(关注笔画与结构)更高的权重;而在回答开放性问题时,则会综合运用多层信息。

为防止路由器“偷懒”只选用少数安全层,方案还引入了熵正则化负载均衡机制,确保所有层专家都能被有效激活。

低成本与高兼容

TGIF方案的一个显著优势是其极低的训练成本。它完全冻结了庞大的视觉编码器(CLIP),所有新增的训练参数仅限于多模态投影器内部的轻量级MLP路由器,参数与计算开销都可控。

此外,其“直接外部融合”机制在视觉特征输入语言模型之前就完成了融合处理,巧妙地避免了视觉Token数量的膨胀问题,使其能够无缝适配主流的LLaVA架构,易于部署和集成。

性能全面超越

实验数据充分证明了TGIF的有效性。在幻觉抑制上,POPE准确率从86.85%提升至87.91%,HallusionBench得分从46.90%提升至49.94%,超越了多种后处理方法,甚至优于部分13B模型。

在OCR与细粒度感知方面,OCRBench总分由297提升至313(+16分),TextVQA表现也稳步提升。

更重要的是,在ScienceQA、GQA等通用推理基准测试上,模型性能不降反升,证明了该方案在增强细节感知的同时,并未牺牲高层语义理解能力,实现了真正的全方位提升。

TGIF方案以其轻量、高效且兼容性强的特性,为解决多模态大模型固有的视觉幻觉问题提供了极具吸引力的路径。它证明了在不增加巨大成本的前提下,通过对现有架构的精巧改造也能实现性能的显著突破。这种“文本指路”的思路,未来能否启发更多模态间的智能对齐方法?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章