SciMIF: Understanding Multimodal Instruction Following in Scientific Domains

📄 arXiv: 2608.25973v1 📥 PDF

作者: Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai

分类: cs.AI, cs.LG

发布日期: 2026-08-26

备注: 21pages, 9 figures, 16 tables

🔗 代码/项目: GITHUB


💡 一句话要点

提出SciMIF以评估科学领域中的多模态指令遵循能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大型语言模型 指令遵循 科学领域 数据集增强 性能评估 分类法 约束组 实验结果

📋 核心要点

  1. 现有方法在科学领域的多模态指令遵循能力评估上存在显著不足,尤其是在处理复杂指令时表现不佳。
  2. 论文提出SciMIF基准,通过分析多种科学任务,构建了一个综合分类法来系统评估MLLMs的指令遵循能力。
  3. 实验结果表明,不同学科的性能差异显著,尤其是化学领域的挑战更大,模型规模的增加未能有效提升约束遵循能力。

📝 摘要(中文)

理解科学领域中的指令遵循能力对于有效利用多模态大型语言模型(MLLMs)推动科学发展至关重要。本文介绍了SciMIF,一个新颖的基准,旨在评估MLLMs在遵循复杂科学指令方面的能力。基于对22个不同任务的广泛分析,涵盖5个代表性科学学科,提出了一个包含10个约束组的综合分类法,捕捉一般功能需求和学科特定特征。通过该分类法,开发了高保真指令注入管道,以系统性增强现有科学数据集。实验结果显示,不同科学学科之间的性能差异显著,化学领域对当前MLLMs提出了更大挑战。此外,模型规模的增加并未带来约束遵循的相应改善,当前模型在细粒度约束和需要深厚学科知识的指令上仍面临严重困难。SciMIF填补了科学领域中多模态指令遵循评估的空白,为未来MLLMs在严格科学应用中的改进奠定了重要基础。

🔬 方法详解

问题定义:本文旨在解决当前多模态大型语言模型在科学领域遵循复杂指令的能力不足的问题。现有方法在处理细粒度约束和深厚学科知识应用时表现不佳,导致科学任务的执行效果不理想。

核心思路:论文提出的SciMIF基准通过构建一个包含10个约束组的分类法,系统性地评估MLLMs在科学领域的指令遵循能力。这一方法不仅考虑了通用功能需求,还涵盖了学科特定特征,从而提供了更全面的评估框架。

技术框架:SciMIF的整体架构包括数据集增强、指令注入管道和性能评估模块。首先,通过高保真指令注入管道增强现有科学数据集,然后在多个闭源和开源MLLMs上进行实验,最后通过分类法评估模型的指令遵循能力。

关键创新:SciMIF的主要创新在于其综合分类法和高保真指令注入管道的设计。这一方法与现有评估方法的本质区别在于其系统性和针对性,能够更好地捕捉科学领域的复杂性。

关键设计:在设计过程中,论文设置了多个关键参数,包括约束组的定义、指令的复杂性以及数据集的选择。此外,损失函数的设计也考虑了不同约束的权重,以确保模型在训练过程中能够有效学习各类指令的遵循能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,当前MLLMs在不同科学学科的性能差异显著,尤其是在化学领域表现不佳。尽管模型规模增加,但约束遵循能力并未得到相应提升,表明现有模型在处理复杂科学指令时仍存在显著挑战。

🎯 应用场景

该研究的潜在应用领域包括科学研究、教育和技术开发等。通过提升多模态大型语言模型在科学领域的指令遵循能力,SciMIF能够促进科学数据分析、实验设计和教育培训等方面的进步,具有重要的实际价值和未来影响。

📄 摘要(原文)

Understanding instruction-following capabilities in scientific domains is essential for effectively leveraging Multimodal Large Language Models (MLLMs) to advance the development of scientific fields. In this work, we introduce SciMIF, a novel benchmark designed to evaluate the capability of MLLMs in following complex scientific instructions. Specifically, based on an extensive analysis of 22 distinct tasks across 5 representative scientific disciplines, we propose a comprehensive taxonomy comprising 10 constraint groups that captures both general functional requirements and discipline-specific characteristics. Guided by this taxonomy, we develop a high-fidelity instruction injection pipeline to systematically augment existing scientific datasets. We conduct comprehensive experiments on multiple state-of-the-art closed-source and open-source MLLMs. Our findings reveal significant performance disparities across different scientific disciplines, with chemistry posing greater challenges for current MLLMs. Furthermore, we observe that increasing the model scale does not yield corresponding improvements in constraint adherence, and current models still struggle severely with fine-grained constraints and instructions requiring the deep application of disciplinary knowledge. SciMIF fills the current void in evaluating multimodal instruction adherence within scientific domains, laying a crucial foundation for future enhancements of MLLMs in rigorous scientific applications. Data and code will be released at https://github.com/shenye7436/SciMIF .