SciQNet: Two-Stage Multimodal Adaptation for Scientific Image Quality Assessment

📄 arXiv: 2608.05691v1 📥 PDF

作者: Yin-Loon Khor, Yi-Jie Wong, Jing Jie Tan, Ming Jie Lee

分类: cs.CV

发布日期: 2026-08-06


💡 一句话要点

提出SciQNet以解决科学图像质量评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 科学图像 质量评估 多模态适应 领域自适应 任务特定微调 视觉问答 Huber损失

📋 核心要点

  1. 科学图像质量评估面临的挑战在于其质量受视觉清晰度和科学信息量的双重影响,现有方法难以全面评估。
  2. SciQNet框架通过两阶段的多模态适应,首先进行领域自适应预训练,然后进行任务特定微调,结合评分和理解监督。
  3. 实验结果显示,使用40%相关的预训练数据集可获得最佳性能,最终模型在多个评分指标上表现优异,排名第二。

📝 摘要(中文)

科学图像在传达实验观察、定量证据和概念知识方面至关重要。与自然图像不同,科学图像的质量不仅依赖于视觉清晰度,还依赖于科学信息的丰富性,这使得质量评估变得复杂。本文提出了SciQNet,一个两阶段的多模态适应框架,用于科学图像质量评估。第一阶段在科学文档图像上进行领域自适应预训练,第二阶段则通过联合评分和理解监督进行任务特定的微调。实验表明,使用40%的分层子集进行预训练能获得最佳性能,最终模型在SIQA-S、SIQA-U和综合评分上分别达到92.21、47.38和69.80,展示了该方法的有效性。

🔬 方法详解

问题定义:本文旨在解决科学图像质量评估中的复杂性,现有方法往往无法同时考虑视觉清晰度与科学信息的丰富性,导致评估结果不准确。

核心思路:SciQNet框架的核心在于通过两阶段的多模态适应,首先进行领域自适应预训练,以适应科学图像的特性,然后通过任务特定的微调来提升评估的准确性。

技术框架:该框架分为两个主要阶段:第一阶段是领域自适应预训练,针对科学文档图像进行;第二阶段是任务特定的微调,结合评分和理解监督进行优化。

关键创新:最重要的创新在于将评分导向的监督与理解导向的监督相结合,利用指令调优和基于Huber损失的评分方法,显著提升了评估的准确性。

关键设计:在损失函数设计上,采用Huber损失以处理评分词的逻辑回归,同时理解导向的监督采用多选视觉问答的形式,确保模型能够同时理解和评分。实验中发现,使用40%的相关预训练数据集能获得最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SciQNet在SIQA-S、SIQA-U和综合评分上分别达到了92.21、47.38和69.80,表现优于其他基线方法,尤其是在使用40%相关预训练数据集时,性能提升显著,排名第二。

🎯 应用场景

该研究的潜在应用领域包括科学研究、医学影像分析和教育等,能够帮助研究人员更准确地评估和理解科学图像的质量,提升科学交流的有效性。未来,该方法可能会扩展到其他类型的图像质量评估任务中,具有广泛的实际价值。

📄 摘要(原文)

Scientific images are essential for communicating experimental observations, quantitative evidence and conceptual knowledge. Unlike natural images, their quality depends on both visual clarity and scientific informativeness, making assessment challenging. In this work, we present SciQNet, a two-stage multimodal adaptation framework for scientific image quality assessment. The first stage performs domain-adaptive pretraining on scientific document images and the second stage conducts task-specific fine-tuning with joint scoring and understanding supervision. For scoring-oriented supervision, we combine instruction tuning with a Huber loss derived from rating-word logits, while understanding-oriented supervision is formulated as multiple-choice visual question answering. Experiments show that using a 40% stratified subset of the domain-adaptive data gives the best performance among the evaluated pretraining fractions, suggesting that pretraining-data relevance may be as important as pretraining-data scale. The final model achieves an SIQA-S score of 92.21, an SIQA-U score of 47.38 and a combined score of 69.80. This work presents our solution to the ICME 2026 Scientific Image Quality Assessment Challenge, which ranked 2nd in the scoring track.