Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models
作者: Artem Sergievskii, Artyom Turevich, Sergey Kastryulin
分类: cs.CV
发布日期: 2026-08-17
💡 一句话要点
重新审视无分类器引导方法在潜在扩散模型中的应用
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion)
关键词: 无分类器引导 扩散模型 图像生成 质量增强 组合对齐
📋 核心要点
- 现有的无分类器引导方法在生成图像与文本提示之间的语义对应性和组合对齐方面存在不足。
- 本文重新评估了基于无分类器引导的多种无训练技术,旨在提高扩散模型的推理质量。
- 实验结果表明,尽管APG方法在某些指标上表现良好,但整体上没有方法在所有标准上超越CFG。
📝 摘要(中文)
在推理时质量增强方法是提升扩散模型效果的有效手段,且无需昂贵的重新训练。本文研究了一系列无训练技术,主要基于无分类器引导(CFG),这些方法最初在旧版U-Net扩散模型上提出,并使用孤立的图像质量评估指标进行验证,而未考虑生成图像与其文本提示之间的组合对齐或语义对应关系。我们在两个开放权重的修正流变换器上重新评估了八种此类方法,采用固定的模型协议和三个组合对齐基准。结果显示,没有任何方法在测量标准上持续优于CFG。APG获得了若干名义最佳分数,但相应的提升往往在评估不确定性范围内。注意力扰动方法在SD3.5 Medium上提供了孤立的增益,但在FLUX.2 4B Base上则更频繁地出现降级,而CFG仍然是一个具有竞争力的低成本基线。
🔬 方法详解
问题定义:本文旨在解决现有无分类器引导方法在生成图像与文本提示之间缺乏语义对应性和组合对齐的问题。现有方法主要依赖孤立的图像质量评估,未能全面反映生成效果。
核心思路:论文通过重新评估多种无训练的质量增强技术,探讨其在新型变换器架构中的有效性,旨在找到更优的推理质量提升方案。
技术框架:研究采用固定的模型协议和多个组合对齐基准,评估八种无分类器引导方法在两个开放权重的修正流变换器上的表现。
关键创新:最重要的创新在于对现有无分类器引导方法的全面重新评估,发现没有方法在所有标准上持续超越CFG,强调了CFG作为低成本基线的竞争力。
关键设计:实验中采用了固定的评估协议,结合多个组合对齐基准,确保评估的全面性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,APG方法在某些指标上获得了名义最佳分数,但整体提升幅度通常在评估不确定性范围内,未能显著超越CFG。注意力扰动方法在SD3.5 Medium上表现出孤立增益,但在FLUX.2 4B Base上则出现了更频繁的性能下降,表明CFG仍是一个有效的低成本基线。
🎯 应用场景
该研究的潜在应用领域包括计算机视觉中的图像生成、文本到图像的生成任务以及其他需要高质量图像合成的场景。通过提升扩散模型的推理质量,能够在艺术创作、虚拟现实和游戏开发等领域产生实际价值,推动相关技术的进步与应用。
📄 摘要(原文)
Inference-time quality-enhancement methods are an effective and widely adopted means of improving diffusion models without expensive retraining. We study a family of training-free techniques conceptually rooted in Classifier-Free Guidance (CFG), most of which were originally proposed on older U-Net diffusion models and validated using metrics that assess image quality in isolation, without accounting for compositional alignment or semantic correspondence between the generated image and its associated text prompt. We re-evaluate eight such methods on two open-weight rectified-flow transformers under a fixed per-model protocol and three compositional-alignment benchmarks. No method consistently improves on CFG across the measured criteria. APG obtains several nominal best scores, but the corresponding gains often remain within the estimated evaluation uncertainty. Attention-perturbation methods provide isolated gains on SD3.5 Medium and more frequent degradations on FLUX.2 [klein] 4B Base, while CFG remains a competitive lower-cost baseline.