GUIDE: Guiding Internal Evidence with Language Instructions

📄 arXiv: 2608.30712v1 📥 PDF

作者: Soyeon Caren Han, Hyunsuk Chung, Jinwoo Kim, Seungyeon Ji, Kyungreem Han

分类: cs.CL

发布日期: 2026-08-31

期刊: EMNLP 2026


💡 一句话要点

提出GUIDE框架以调控多模态模型的内部证据使用

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态模型 证据调控 语言指令 参数高效适应 门控机制 推理任务 鲁棒性提升

📋 核心要点

  1. 现有多模态模型在遵循生成指令时,往往仍依赖于捷径线索,导致证据使用不当。
  2. GUIDE框架通过语言指令调控内部证据使用,结合参数高效适应与指令条件门控。
  3. 实验表明,GUIDE在多个数据集上提升了模型在目标证据扰动下的鲁棒性,且支持多样化的证据调节。

📝 摘要(中文)

大型多模态模型通常遵循生成指令,但并不一定依赖于指令所建议的证据。因此,模型可能在指令提示下仍依赖于捷径相关的线索。本文提出了GUIDE框架,通过语言指令控制内部证据的使用。GUIDE结合了分组的参数高效适应和指令条件门控,调节推理和生成过程中的多模态证据路径。我们还引入了一种路径级评估框架,通过依赖敏感性、受控扰动分析、路径调制和自回归解码动态来表征指令条件下的证据调制。实验结果表明,GUIDE在多模态推理、分类和生成任务中,能够在保持任务行为的同时,结构化和指令对齐地重新分配证据依赖。

🔬 方法详解

问题定义:本文旨在解决多模态模型在生成任务中对证据使用的控制问题。现有方法往往依赖于捷径线索,导致模型在遵循指令时无法有效调节证据来源的使用。

核心思路:GUIDE框架通过语言指令引导模型调节内部证据的使用,结合了参数高效适应和指令条件门控,以实现对多模态证据路径的调控。

技术框架:GUIDE的整体架构包括两个主要模块:参数高效适应模块和指令条件门控模块。前者负责对模型参数进行分组适应,后者则通过门控机制调节证据的使用路径。

关键创新:GUIDE的核心创新在于通过语言指令实现对内部证据使用的调控,这一设计使得模型能够在遵循指令的同时,灵活调整不同证据来源的贡献。

关键设计:在参数设置上,GUIDE采用了分组参数适应策略,损失函数设计上则考虑了证据依赖的敏感性分析,网络结构上引入了门控机制以实现动态调节。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在GQA、TextVQA等多个数据集上的实验结果显示,GUIDE框架在目标证据扰动下的鲁棒性显著提升,且在多模态设置中实现了可控的证据调节,表现出优于基线模型的性能。

🎯 应用场景

GUIDE框架在多模态推理、分类和生成等任务中具有广泛的应用潜力。其能够有效调节证据使用的能力,使得模型在处理复杂任务时更加灵活和鲁棒,未来可应用于智能问答、图像理解等领域,提升多模态系统的智能水平。

📄 摘要(原文)

Large multimodal models follow instructions about what to generate, but not necessarily about what evidence to rely on. Hence, models may continue to depend on shortcut-associated cues even when instructions suggest otherwise. We introduce GUIDE, a framework for controlling internal evidence usage through language instructions. GUIDE combines grouped parameter-efficient adaptation with instruction-conditioned gating to modulate multimodal evidence pathways during reasoning and generation. We further introduce a pathway-level evaluation framework that characterizes instruction-conditioned evidence modulation through reliance sensitivity, controlled perturbation analysis, pathway modulation, and autoregressive decoding dynamics. Across multimodal reasoning, classification, and generation, GUIDE induces structured and instruction-aligned redistribution of evidence reliance while largely preserving task behavior. Experiments on GQA, TextVQA, MM-IMDb, CREMA-D, RAVDESS, and Flickr30K show that GUIDE improves robustness under targeted evidence perturbations and enables controllable modulation across diverse multimodal settings. This suggests that multimodal instruction following can extend beyond output control toward regulating how different evidence sources contribute to model predictions.