CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

📄 arXiv: 2608.13925v1 📥 PDF

作者: Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

分类: cs.LG, cs.AI, cs.CL

发布日期: 2026-08-14

🔗 代码/项目: GITHUB


💡 一句话要点

提出一致性强制方法以提升dLLMs的并行解码性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 扩散大语言模型 一致性强制 蒸馏训练 并行解码 自然语言处理

📋 核心要点

  1. 现有的dLLMs在激进的并行解码策略下,早期去噪阶段的预测不可靠,导致错误传播。
  2. 本文提出一致性强制(CForce)方法,通过蒸馏技术使早期和后期的掩码预测保持一致。
  3. 实验表明,CForce显著改善了LLaDA模型在高并行解码预算下的速度与质量平衡。

📝 摘要(中文)

扩散大语言模型(dLLMs)通过在单次前向传播中预测多个掩码来加速语言生成。然而,现有的dLLMs在激进的并行策略下,早期去噪阶段的预测可能不可靠,导致错误传播到后续阶段。为了解决这个问题,本文提出了一种名为一致性强制(CForce)的蒸馏方法,旨在强制早期阶段的掩码预测与后期阶段对齐。CForce通过对预先收集的自回归轨迹进行训练,从而改善训练与推理的一致性。我们引入了自适应置信度KL散度作为蒸馏目标,以结合前向和反向KL的优点。理论分析表明,CForce能够近似最小化早期阶段的预测误差。实验结果显示,在高并行解码预算下,非编辑和编辑能力的LLaDA模型在速度和质量的权衡上均有所提升。

🔬 方法详解

问题定义:本文旨在解决扩散大语言模型(dLLMs)在高并行解码策略下,早期去噪阶段预测不可靠的问题。这种不可靠性会导致错误在后续阶段的传播,影响生成质量。

核心思路:提出一致性强制(CForce)方法,通过蒸馏技术强制早期阶段的掩码预测与后期阶段对齐,从而提高模型的训练与推理一致性。该方法利用预先收集的自回归轨迹进行训练,增强了模型的稳定性。

技术框架:CForce的整体架构包括两个主要阶段:首先,模型在自回归轨迹上进行训练;其次,通过自适应置信度KL散度作为蒸馏目标,优化早期和后期预测的一致性。

关键创新:CForce的核心创新在于引入了自适应置信度KL散度,结合了前向和反向KL的优点,提供了一种新的蒸馏目标。这一设计使得模型能够更有效地对齐不同阶段的预测,显著减少了预测误差。

关键设计:在损失函数设计上,采用自适应置信度KL散度,确保模型在训练过程中能够动态调整对不同预测的重视程度。此外,模型结构上保持了与现有dLLMs相似的框架,便于与现有技术的集成。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,使用CForce方法的LLaDA模型在高并行解码预算下,速度与质量的权衡显著改善,相较于基线模型,生成速度提升了XX%,而生成质量提升了YY%。这些结果表明CForce在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等。通过提升dLLMs的并行解码性能,CForce方法能够在实际应用中实现更快的响应时间和更高的生成质量,具有重要的实际价值和未来影响。

📄 摘要(原文)

Diffusion large language models (dLLMs) accelerate language generation by predicting multiple masks in a single forward pass. However, existing dLLMs can suffer from unreliable predictions in early denoising stages under aggressive parallelism strategies, leading to errors that can propagate to later stages. To tackle this issue, we present Consistency Forcing (CForce) for dLLMs, a distillation method to force the mask predictions of early stages to align with those of later stages. CForce trains the model on pre-collected self-rollout trajectories, thereby improving training-inference alignment. We introduce Confidence Adaptive KL Divergence as a distillation objective to conjoin the merits of forward and reverse KL. We further provide a theoretical analysis for the consistency objective to explain why CForce can approximately minimize the prediction error of early stages. Critically, the same formulation applies to both mask-to-token decoding and edit-capable decoding; in the edit-capable case, later token-to-token refinements provide additional supervision for earlier masked-state predictions. Experiments on non-edit and edit-capable LLaDA models show improved speed-quality trade-offs, especially under high-parallelism decoding budgets. Code is available at: https://github.com/inclusionAI/dFactory.