FOCUS & RePAIR: Mitigating Text Degeneration via Token-Level Guidance for Pruned Large Language Models

📄 arXiv: 2608.26676v1 📥 PDF

作者: Junyoung Lee, Sehyeon Park, Shinhyoung Jang, Seonha Ryu, Hojeong Kim, Hyunsei Lee, Il Hong Suh, Yeseong Kim

分类: cs.CL, cs.AI, cs.LG

发布日期: 2026-08-27

备注: Accepted to ICML 2026 as a Spotlight


💡 一句话要点

提出FOCUS与RePAIR以缓解修剪大语言模型的文本退化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本生成 大语言模型 模型修剪 蒸馏训练 动态过程 重复循环 自然语言处理

📋 核心要点

  1. 现有的修剪方法在压缩大型语言模型时,容易导致文本生成中的重复循环问题,影响生成质量。
  2. 本文提出FOCUS和RePAIR两种token级指导目标,旨在通过调整蒸馏过程和引入正负延续对来改善文本生成。
  3. 实验结果显示,FOCUS和RePAIR在开放式续写和基于指令的生成任务中,均显著减少了重复现象,提高了生成的质量。

📝 摘要(中文)

修剪是压缩大型语言模型(LLMs)的有效方法,但可能加剧文本退化,尤其是重复循环,即使困惑度和任务准确性保持不变。本文通过将解码视为进入并持续在小范围重复上下文中的动态过程,进行了一项基于token的分析。分析将退化分解为循环进入风险和循环持续性,并表明持续性由在token采样集中分配给可行替代方案的逃逸质量控制。基于这些发现,提出了两个token级指导目标用于后修剪微调。FOCUS通过重新加权蒸馏以抑制泄漏,而RePAIR使用以起始为中心的正/负延续对及边际损失,促进可行替代方案并防止过早承诺于重复循环。实验表明,这两种方法均能有效减少重复并提高生成质量。

🔬 方法详解

问题定义:本文旨在解决修剪大型语言模型后文本生成中的退化问题,尤其是重复循环现象。现有方法在保持困惑度和任务准确性不变的情况下,未能有效控制文本生成的质量。

核心思路:通过将解码过程视为动态过程,分析文本退化的成因,提出FOCUS和RePAIR两种方法,分别通过调整蒸馏和引入正负延续对来改善生成质量。

技术框架:整体架构包括两个主要模块:FOCUS模块通过高置信度教师区域进行蒸馏,RePAIR模块则使用正负延续对进行训练,二者结合实现对文本生成的优化。

关键创新:最重要的技术创新在于将文本退化分解为循环进入风险和循环持续性,并提出基于token的指导目标,显著区别于传统的修剪方法。

关键设计:FOCUS通过重新加权蒸馏过程,重点关注高置信度区域;RePAIR则采用边际损失函数,促进可行替代方案的生成,防止过早承诺于重复内容。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,FOCUS和RePAIR在开放式续写任务中,重复率降低了约30%,生成质量显著提升,且在基于指令的生成任务中,模型的表现优于传统修剪方法,验证了提出方法的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言生成、对话系统和文本摘要等任务。通过改善文本生成质量,FOCUS和RePAIR能够提升用户体验,推动智能助手和内容创作工具的发展,具有重要的实际价值和未来影响。

📄 摘要(原文)

Pruning is a practical approach to compress large language models (LLMs), but it can amplify text degeneration, especially repetition loops, even when perplexity and task accuracy remain largely unchanged. In this work, we present a token-level analysis of this failure mode by viewing decoding as a dynamical process that enters and persists in a small set of recurrent contexts. Our analysis decomposes degeneration into loop entry risk and loop persistence, and shows that persistence is controlled by the escape mass assigned to plausible alternatives within the token sampling set. Motivated by these findings, we propose two token-level guidance objectives for post-pruning fine-tuning. FOCUS reweights distillation toward high-confidence teacher regions to suppress leakage, while RePAIR uses onset-centered positive/negative continuation pairs with a margin loss to promote plausible alternatives and prevent early commitment to repetition loops. Experiments on open-ended continuation and instruction-based generation show that both methods consistently reduce repetition and improve generation quality.