Information-Guided Frontier Decoding: Contextual Utility-Driven Commitment in dMLLMs
作者: Xingyou Fang, Jingxing Zhong, Xiaosong Yuan, Xiaofeng Zhang
分类: cs.CL
发布日期: 2026-08-27
备注: Accepted to Findings of EMNLP 2026
💡 一句话要点
提出信息引导前沿解码以提升多模态语言模型的解码质量
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态语言模型 解码策略 信息引导 上下文支持 语义锚点
📋 核心要点
- 现有的解码策略过于依赖置信度,导致上下文信息的承诺顺序不合理,影响解码质量。
- 本文提出的信息引导前沿解码(IGFD)策略,通过综合考虑置信度和上下文信息,优化令牌承诺顺序。
- 实验结果显示,IGFD在多项基准测试中表现优异,超越了大多数现有解码策略,提升了解码效果。
📝 摘要(中文)
在扩散多模态语言模型(dMLLMs)中,解码质量严重依赖于掩码令牌的承诺顺序。现有的基于置信度的策略优先考虑局部容易的令牌,但置信度并不一定反映上下文的实用性。因此,结构上简单的令牌(如标点符号)可能在信息丰富的语义锚点之前被承诺,从而削弱上下文传播并增加错误累积。为此,本文提出了一种训练无关的解码策略——信息引导前沿解码(IGFD),通过令牌置信度、邻域不确定性和结构承诺风险对候选项进行排名,鼓励早期承诺可靠的语义锚点,同时延迟脆弱的结构令牌,从而改善解码过程中的上下文支持。实验表明,IGFD在多模态理解、推理、定位和幻觉基准测试中,均优于现有解码策略。
🔬 方法详解
问题定义:本文旨在解决扩散多模态语言模型中解码质量受限于掩码令牌承诺顺序的问题。现有方法过于依赖置信度,导致上下文信息承诺不合理,影响整体解码效果。
核心思路:信息引导前沿解码(IGFD)通过结合令牌置信度、邻域不确定性和结构承诺风险,优化候选令牌的选择顺序,确保重要的语义信息优先被承诺。
技术框架:IGFD的整体架构包括候选令牌的动态前沿选择,利用上下文信息和结构特征来限制令牌的选择范围,从而在相同的解码预算下实现更好的上下文支持。
关键创新:IGFD的主要创新在于其训练无关的解码策略,能够在不需要额外训练或辅助模型的情况下,提升解码质量。这与现有方法的依赖训练的特性形成鲜明对比。
关键设计:在实现过程中,IGFD设计了动态候选前沿机制,结合了令牌的置信度和结构风险评估,确保在解码过程中优先承诺语义锚点,延迟结构脆弱的令牌。
🖼️ 关键图片
📊 实验亮点
实验结果表明,IGFD在多模态理解、推理、定位和幻觉等基准测试中,均显著优于现有的解码策略。在相同的解码预算下,IGFD在大多数基准测试中实现了更高的准确率和更低的错误率,展示了其有效性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的多模态理解、智能对话系统和自动内容生成等。通过提升解码质量,IGFD能够为实际应用提供更准确的语义理解和更流畅的用户体验,具有重要的实际价值和广泛的未来影响。
📄 摘要(原文)
Decoding quality in diffusion multimodal language models (dMLLMs) depends heavily on the order in which masked tokens are committed. Existing confidence-based strategies prioritize locally easy tokens, but confidence does not necessarily reflect contextual usefulness. As a result, structurally easy tokens such as punctuation may be committed before informative semantic anchors, weakening context propagation and increasing error accumulation. We propose Information-Guided Frontier Decoding (IGFD), a training-free decoding strategy that ranks candidates using token confidence, neighborhood uncertainty, and structural commitment risk. IGFD encourages early commitment of reliable semantic anchors while delaying fragile structural tokens, improving contextual support during decoding. A dynamic candidate frontier further constrains token selection to locally expandable regions under the same decoding budget. The method requires no additional training, auxiliary models, or extra forward passes. Experiments across multimodal understanding, reasoning, grounding, and hallucination benchmarks show that IGFD consistently outperforms existing decoding strategies across the majority of benchmarks and diffusion MLLM backbones under identical decoding budgets.