Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference
作者: Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim
分类: cs.CL
发布日期: 2026-08-27
💡 一句话要点
提出依赖感知可撤销解码以提升扩散大语言模型推理效率
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 扩散大语言模型 可撤销解码 自然语言处理 多模态生成 生成质量提升
📋 核心要点
- 现有的可撤销解码方法未能有效处理不可靠标记对验证上下文的影响,导致生成质量下降。
- 本文提出的DARD框架通过将标记分为不同状态,利用选择性上下文来验证候选标记,从而提高解码质量。
- 在Flickr30K等多个基准测试中,DARD实现了2.71倍的速度提升和4.35点的CIDEr得分增益,表现优于现有方法。
📝 摘要(中文)
扩散大语言模型(dLLMs)通过迭代去噪实现多标记并行解码,成为自回归生成的有力替代方案。然而,过度的解码并行性可能降低生成质量,因为早期错误会污染后续上下文。可撤销解码通过重新评估已解码标记并重新掩蔽不可靠的标记来缓解此问题,但现有方法忽视了不可靠标记可能会破坏验证上下文。本文提出依赖感知可撤销解码(DARD),该框架无需训练,将标记分为掩蔽、候选和未掩蔽状态,利用选择性上下文验证候选标记,并自适应调节其对后续解码的影响。实验结果表明,DARD在12个文本和多模态基准上均优于现有方法,达成2.71倍的速度提升和4.35点的CIDEr得分增益。
🔬 方法详解
问题定义:本文解决的是现有可撤销解码方法在处理不可靠标记时的不足,特别是这些标记对验证上下文的污染问题。
核心思路:DARD框架的核心思想是将标记分为掩蔽、候选和未掩蔽状态,利用选择性上下文来验证候选标记,从而减少不可靠标记对后续解码的影响。
技术框架:DARD的整体架构包括三个主要模块:标记状态分类、选择性上下文验证和自适应影响调节。首先,将标记分类为不同状态,然后使用选择性上下文进行验证,最后调节候选标记对后续解码的影响。
关键创新:DARD的主要创新在于引入了依赖感知机制,通过选择性上下文来验证候选标记,显著提高了解码的质量和效率。这一方法与传统的可撤销解码方法相比,能够更有效地处理不可靠标记。
关键设计:在DARD中,关键设计包括标记状态的动态分类机制、选择性上下文的构建方法,以及自适应调节策略,这些设计确保了候选标记的有效性和对后续解码的正面影响。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DARD在12个文本和多模态基准上均优于现有的可撤销解码方法,达成了2.71倍的速度提升和4.35点的CIDEr得分增益,显著改善了生成质量与效率的平衡。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和多模态生成任务。通过提升扩散大语言模型的推理效率,DARD能够在实时生成和交互式应用中发挥重要作用,推动智能助手和内容生成工具的发展。
📄 摘要(原文)
Diffusion large language models (dLLMs) offer a promising alternative to autoregressive generation by decoding multiple tokens in parallel through iterative denoising. However, increasing decoding parallelism often degrades generation quality, as early errors can contaminate later contexts. Revocable decoding mitigates this issue by re-evaluating decoded tokens and remasking unreliable ones, but existing methods overlook that unreliable tokens may also corrupt the verification context itself. We identify this failure mode and propose Dependency-Aware Revocable Decoding (DARD), a training-free framework that separates tokens into masked, candidate, and unmasked states. DARD verifies candidate tokens using a selective context that excludes less reliable tokens and adaptively regulates their influence on subsequent decoding. Experiments across 12 textual and multimodal benchmarks on 3 open-source dLLMs show that DARD consistently improves the speed-quality Pareto frontier over recent revocable decoding methods, achieving a 2.71$\times$ speedup and a 4.35-point CIDEr score gain over Saber on Flickr30K.