DCGC: Draft-Conditioned Global Correction for Complex Reasoning with Masked Diffusion Models

📄 arXiv: 2608.25428v1 📥 PDF

作者: Minhae Oh, Nakyung Lee, Jungwoo Lee

分类: cs.CL, cs.AI

发布日期: 2026-08-26

备注: 21 pages, 3 figures, 12 tables


💡 一句话要点

提出DCGC以解决大型语言模型推理错误问题

🎯 匹配领域: 支柱四:生成式动作 (Generative Motion) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 推理修正 掩蔽扩散模型 动态双CFG 监督微调 全局修正 复杂推理

📋 核心要点

  1. 现有大型语言模型在推理过程中容易传播早期错误,导致最终结果不准确,修正这些错误仍然是一个挑战。
  2. DCGC框架利用上游求解器生成的不完美草稿作为辅助上下文,结合监督微调和动态双CFG机制进行全局修正。
  3. 在多个推理基准测试中,DCGC显著提高了准确性,尤其是在缺乏真实标签的情况下,能够有效修正低共识的输出。

📝 摘要(中文)

修正大型语言模型(LLMs)中的推理错误仍然是一个重大挑战,因为其自回归生成可能将早期错误传播到后续推理中。本文提出了DCGC,一种基于掩蔽扩散模型(MDM)的全局修正框架,利用来自上游求解器的不完美解决方案草稿作为辅助上下文。DCGC结合了特定任务的监督微调(SFT)和一种称为动态双CFG的新推理机制。该机制将问题仅分支与联合问题-草稿分支分开,并使用相对置信度差距来缩放草稿条件的残差。在数学、代码和知识推理基准测试中,DCGC超越了标准采样和更简单的CFG变体,额外结果表明其可以迁移到不同的扩散骨干网络。在缺乏真实失败标签的测试环境中,DCGC通过修正低共识的上游输出,提高了完整测试集的准确性,突显了其作为困难推理实例的无验证全局修正模块的实用性。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在推理过程中传播错误的问题,现有方法往往无法有效修正这些错误,导致最终推理结果不准确。

核心思路:DCGC通过引入来自上游求解器的不完美草稿,作为辅助上下文来进行全局修正,结合动态双CFG机制,有效区分问题和草稿信息,从而提高推理的准确性。

技术框架:DCGC框架包括两个主要模块:任务特定的监督微调(SFT)和动态双CFG推理机制。动态双CFG将问题分支与草稿分支分开,利用相对置信度差距来调整草稿条件的残差。

关键创新:DCGC的核心创新在于动态双CFG机制的引入,它能够有效地处理问题和草稿信息的交互,显著提升了推理的准确性和鲁棒性。与传统方法相比,DCGC在处理复杂推理任务时表现出更好的性能。

关键设计:在模型设计中,DCGC采用了特定的损失函数来优化草稿条件的残差,并通过相对置信度差距来动态调整模型的输出。此外,模型结构经过精心设计,以确保在推理过程中能够有效利用草稿信息。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在多个推理基准测试中,DCGC显著超越了标准采样和简单CFG变体,尤其在缺乏真实标签的测试环境中,准确性提高了显著的幅度,展示了其在复杂推理任务中的有效性和实用性。

🎯 应用场景

DCGC的研究成果具有广泛的应用潜力,尤其在需要高准确性推理的领域,如自动化编程、数学问题求解和知识推理等。其作为无验证的全局修正模块,可以在实际应用中显著提升大型语言模型的推理能力,推动智能系统的进一步发展。

📄 摘要(原文)

Correcting flawed reasoning traces remains a significant challenge for Large Language Models (LLMs), whose autoregressive generation can propagate early mistakes into subsequent reasoning. We introduce DCGC, a Masked Diffusion Model (MDM) framework for global correction that uses an imperfect solution draft from an upstream solver as auxiliary context. DCGC combines task-specific Supervised Fine-Tuning (SFT) with a novel inference-time mechanism called Dynamic Dual-CFG. This mechanism separates problem-only and joint problem-draft branches and scales the draft-conditioned residual using a relative confidence gap. Across math, code, and knowledge reasoning benchmarks, DCGC outperforms standard sampling and simpler CFG variants, with additional results suggesting transfer to different diffusion backbones. In test-time setting where ground-truth failure labels are unavailable, DCGC improves full test set accuracy by correcting low-consensus upstream outputs, highlighting its utility as a verifier-free global correction module for difficult reasoning instances.