当前大模型进行图像质量评估虽有一定零样本能力,但达到顶尖水平往往需要高昂的微调成本。IQARAG框架另辟蹊径,提出一种完全免训练的检索增强生成方法,通过引入质量各异的参考图像作为视觉锚点,显著提升了模型的评估性能,为低成本、高质量的图像质量评估开辟了新路径。
智能速览
IQARAG是一个免训练的图像质量评估(IQA)增强框架。
通过检索“语义相似但质量不同”的图像作为“质量对照组”锚点。
将参考图像与分数以结构化文本注入提示,联合引导模型校准评分。
基于质量词的logits进行softmax加权求和,输出连续的质量分数。
设计模型无关,可直接集成到Qwen3-VL、InternVL3.5等主流多模态大模型。
精华内容
IQARAG框架如何在不改变模型参数的前提下,巧妙利用参考图像,让大模型学会精准打分?其核心在于一种创新的检索与提示机制。
问题根源
传统图像质量评估(IQA)模型要达到SOTA性能,通常依赖于对预训练大模型进行昂贵的微调或强化学习。这一过程不仅需要大量标注数据,还对算力和时间有极高要求,限制了其在资源有限场景下的应用。IQARAG的出现,正是为了打破这一瓶颈,探索无需参数训练即可提升模型IQA能力的可能性。
锚点检索
IQARAG的核心创新之一是其质量感知的图像检索机制。当输入一张待评估图像时,系统会从一个预设的参考库中,检索出与输入图像在语义内容上高度相似,但图像质量却覆盖从Excellent到Bad等多个区间的图像集。这些图像构成了一个直观的“质量对照组”,为模型后续的判断提供了关键视觉锚点。
提示构造
检索到参考图像后,IQARAG采用视觉锚点与文本引导的联合提示策略。它将这些参考图像及其对应的主观评分(MOS)信息,转化为结构化的文本描述,并与原始问题一同注入到模型的提示中。这种方式相当于给模型“喂”了一套现成的评分标准和范例,引导其更加关注图像质量相关的特征,并对输出token的分布进行校准。
评分机制
为了得到一个精确的连续分数,IQARAG设计了一套统一的token-softmax评分方式。模型在生成回答时,会针对{excellent, good, fair, poor, bad}这五个质量词分别输出一个logit值。框架通过对这些logit值进行softmax归一化处理,再根据预设的权重(如excellent=5, good=4…)进行加权求和,最终计算出0-100范围内的连续质量分数,实现了从定性描述到定量评估的转化。
即插即用
IQARAG框架具有优秀的普适性和模型无关性。它不依赖于任何特定的模型架构,而是作为一种外挂式的增强模块存在。这意味着无论是Qwen3-VL、InternVL3.5还是Kimi-VL等主流多模态大模型,都可以无需任何内部改动,直接集成IQARAG来提升其图像质量评估能力,这种可插拔的设计极大地增强了其应用价值和推广潜力。