LEAF框架致力于解决图像质量评估中依赖海量人工标注和计算成本高昂的痛点。它创新性地将质量感知与评分校准解耦,通过将多模态大语言模型的知识蒸馏到轻量级学生模型中,实现了在极少量标签数据下依然保持高性能的评估效果,为实际应用提供了可能。
智能速览
LEAF框架通过解耦感知知识与MOS校准,提升图像质量评估的标签效率。
它利用多模态大语言模型作为教师,将质量感知模式转移给学生模型。
该框架分为教师引导蒸馏和校准微调两个阶段。
实验显示,即使不使用MOS标签,LEAF也能取得良好性能。
仅使用10%的MOS标签,LEAF的性能就能大幅提升。
该框架为轻量级IQA模型在有限标注预算下的实际应用提供了可能。
精华内容
LEAF框架如何巧妙地将庞大模型的智慧浓缩于轻量级模型中,并精准对齐人类评分标准?其核心在于一个两阶段的训练策略。
核心思想
LEAF框架提出,可以将质量感知与评分校准两个环节分开处理。其核心思想是利用强大的多模态大语言模型(MLLM)作为教师模型,专注于学习感知质量的细微模式。然后,将这些知识转移到一个计算成本更低的轻量级学生模型中。最后,仅需少量的人类评分数据(MOS)对模型进行校准,使其预测结果与人类主观判断对齐。这个思路解决了传统方法中模型计算量大、依赖海量标注的两大痛点。
两阶段训练
训练过程分为两个阶段。第一阶段是教师引导的蒸馏(TGD)。教师模型会对单张图片给出连续质量评分,并对两张图片进行偏好比较,学生模型通过学习模仿这些密集的监督信号,掌握教师的质量感知模式。第二阶段是校准微调(CFT)。在学生模型基本具备质量判断能力后,仅需在少量带有MOS标签的数据集上进行微调。这一步的目的不是从零学习,而是将模型的评分尺度校准到与人类评分标准一致。
性能表现
实验数据证明了LEAF框架的高效性。在AGIQA-3K数据集上,不使用任何MOS标签时,模型性能已达到SRCC为0.749、PLCC为0.811的基准线。当引入10%的MOS标签进行校准后,性能显著跃升至SRCC为0.841、PLCC为0.899。当MOS标签增加到30%时,性能进一步提升至SRCC为0.868、PLCC为0.914。在AIGIQA-20K数据集上,使用30%MOS标签也取得了SRCC为0.860、PLCC为0.905的优异表现,证实了其在有限标注下的强大能力。
LEAF框架为图像质量评估领域提供了一种全新的、高效的解决方案。它成功地将强大的多模态大模型的知识迁移至轻量级应用中,极大地降低了对人工标注的依赖。未来,这种解耦思路是否可以应用于更多需要密集标注的AI任务中?