Learning Where to Look and How to Judge: Resolution-agnostic Image Quality Assessment with Quality-aware Saliency
作者: Hakan Emre Gedik, Shashank Gupta, Alan Bovik
分类: cs.CV
发布日期: 2026-08-03
备注: Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
💡 一句话要点
提出ReLIQS以解决无参考图像质量评估中的分辨率依赖问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 无参考图像质量评估 深度学习 多模态模型 分辨率无关 图像处理
📋 核心要点
- 现有的无参考图像质量评估方法存在分辨率依赖性,无法有效利用不同分辨率下的质量线索。
- ReLIQS模型通过多尺度补丁采样和CLIP视觉骨干网络,学习如何选择重要补丁并评估图像质量。
- 在真实、合成和AIGC基准测试中,ReLIQS在计算成本相当或降低的情况下,表现优于多种强基线模型。
📝 摘要(中文)
无参考图像质量评估(NR IQA)近年来受益于深度学习和多模态模型,但许多现有系统仍存在基本缺陷,如通过激进的缩放丢失重要质量线索、无法跨分辨率泛化、无法在异构IQA数据集上联合训练等。本文提出了ReLIQS模型,旨在实现分辨率无关的图像质量学习,保留原始分辨率的质量线索,能够从多个主观研究中学习,并保持计算效率。ReLIQS基于CLIP的多尺度补丁驱动架构,学习“看哪里”和“如何判断”质量,能够在多种分辨率和失真下表现出色。
🔬 方法详解
问题定义:本文旨在解决无参考图像质量评估中的分辨率依赖性问题。现有方法往往通过缩放丢失重要的质量线索,导致评估效果不佳。
核心思路:ReLIQS模型设计为分辨率无关,能够保留原始分辨率的质量信息,并从多个主观研究中学习,确保模型的泛化能力和计算效率。
技术框架:ReLIQS采用CLIP基础的多尺度补丁驱动架构,首先在多个分辨率下采样固定大小的补丁,然后通过CLIP视觉骨干进行编码。接着,使用轻量级的感知重要性估计器预测特定于IQA的重要性图,选择一小部分信息丰富的补丁,最后通过潜在质量轴模块将其嵌入聚合为单一的图像级评分。
关键创新:ReLIQS的主要创新在于其分辨率无关的设计和多尺度补丁学习策略,能够有效整合来自不同分辨率的质量线索,与传统方法相比,显著提高了评估的准确性和效率。
关键设计:模型采用了固定大小的补丁采样策略,并结合了CLIP的视觉编码能力,确保了信息的有效提取。同时,设计了感知重要性估计器和潜在质量轴模块,以优化补丁选择和评分过程。
🖼️ 关键图片
📊 实验亮点
在多种真实、合成和AIGC基准测试中,ReLIQS模型表现出色,超越了多种强基线模型,包括CNN、CLIP和MLLM,且在计算成本上保持相当或降低,展示了其优越的泛化能力和效率。
🎯 应用场景
ReLIQS模型在图像质量评估领域具有广泛的应用潜力,尤其适用于需要高效且准确的图像质量分析的场景,如图像压缩、传输和生成等。其分辨率无关的特性使其能够在多种设备和环境中应用,提升用户体验和图像处理效果。
📄 摘要(原文)
No-reference image quality assessment (NR IQA) has recently benefited from deep and multimodal models, yet many SOTA systems still violate at least one basic requirement: they either discard critical quality cues via aggressive resizing, fail to generalize across resolutions, cannot be jointly trained on heterogeneous IQA datasets with mismatched MOS scales, or require prohibitive computation. We present \textbf{ReLIQS}, a model for \textbf{Re}solution-agnostic \textbf{L}earning for \textbf{I}mage \textbf{Q}uality with \textbf{S}aliency, which is resolution-agnostic, preserves original-resolution quality cues, learns from multiple subjective studies, and remains computationally efficient and budget-adaptive. ReLIQS is a CLIP-based multiscale patch-driven architecture that learns both \emph{where to look} and \emph{how to judge} quality. Fixed-size patches are sampled across multiple resolutions, including the original resolution, and encoded with a CLIP vision backbone. A lightweight Perceptual Importance Estimator then predicts IQA-specific importance maps to select a small set of informative patches, and a Latent Quality Axis Module aggregates their embeddings into a single image-level score. Across authentic, synthetic, and AIGC benchmarks spanning diverse resolutions and distortions, ReLIQS generalizes better than strong CNN-, CLIP-, and MLLM-based baselines with matching or reduced computational cost.