张大妈

上交&腾讯:让MLLM零训练学会图像质量打分

源自小红薯:每日ComputerScience

01-18 13:53

当前大模型进行图像质量评估虽有一定零样本能力,但达到顶尖水平往往需要高昂的微调成本。IQARAG框架另辟蹊径,提出一种完全免训练的检索增强生成方法,通过引入质量各异的参考图像作为视觉锚点,显著提升了模型的评估性能,为低成本、高质量的图像质量评估开辟了新路径。

上交&腾讯:让MLLM零训练学会图像质量打分智能速览

  • IQARAG是一个免训练的图像质量评估(IQA)增强框架。

  • 通过检索“语义相似但质量不同”的图像作为“质量对照组”锚点。

  • 将参考图像与分数以结构化文本注入提示,联合引导模型校准评分。

  • 基于质量词的logits进行softmax加权求和,输出连续的质量分数。

  • 设计模型无关,可直接集成到Qwen3-VL、InternVL3.5等主流多模态大模型。

上交&腾讯:让MLLM零训练学会图像质量打分精华内容

IQARAG框架如何在不改变模型参数的前提下,巧妙利用参考图像,让大模型学会精准打分?其核心在于一种创新的检索与提示机制。

问题根源

传统图像质量评估(IQA)模型要达到SOTA性能,通常依赖于对预训练大模型进行昂贵的微调或强化学习。这一过程不仅需要大量标注数据,还对算力和时间有极高要求,限制了其在资源有限场景下的应用。IQARAG的出现,正是为了打破这一瓶颈,探索无需参数训练即可提升模型IQA能力的可能性。

锚点检索

IQARAG的核心创新之一是其质量感知的图像检索机制。当输入一张待评估图像时,系统会从一个预设的参考库中,检索出与输入图像在语义内容上高度相似,但图像质量却覆盖从Excellent到Bad等多个区间的图像集。这些图像构成了一个直观的“质量对照组”,为模型后续的判断提供了关键视觉锚点。

提示构造

检索到参考图像后,IQARAG采用视觉锚点与文本引导的联合提示策略。它将这些参考图像及其对应的主观评分(MOS)信息,转化为结构化的文本描述,并与原始问题一同注入到模型的提示中。这种方式相当于给模型“喂”了一套现成的评分标准和范例,引导其更加关注图像质量相关的特征,并对输出token的分布进行校准。

评分机制

为了得到一个精确的连续分数,IQARAG设计了一套统一的token-softmax评分方式。模型在生成回答时,会针对{excellent, good, fair, poor, bad}这五个质量词分别输出一个logit值。框架通过对这些logit值进行softmax归一化处理,再根据预设的权重(如excellent=5, good=4…)进行加权求和,最终计算出0-100范围内的连续质量分数,实现了从定性描述到定量评估的转化。

即插即用

IQARAG框架具有优秀的普适性和模型无关性。它不依赖于任何特定的模型架构,而是作为一种外挂式的增强模块存在。这意味着无论是Qwen3-VL、InternVL3.5还是Kimi-VL等主流多模态大模型,都可以无需任何内部改动,直接集成IQARAG来提升其图像质量评估能力,这种可插拔的设计极大地增强了其应用价值和推广潜力。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章