CPR for LLMs: Critical-Point Routing against Catastrophic Forgetting in Domain Adaptation

📄 arXiv: 2608.30158v1 📥 PDF

作者: Kwangmin Ki, Yunhun Nam, Jongheon Jeong, Jaehyung Kim

分类: cs.CL, cs.AI

发布日期: 2026-08-31


💡 一句话要点

提出CPR以解决大语言模型领域适应中的灾难性遗忘问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 领域适应 灾难性遗忘 监督微调 关键点路由 模型优化 自然语言处理

📋 核心要点

  1. 现有的监督微调方法在领域适应中容易导致模型的灾难性遗忘,影响其通用能力。
  2. 本文提出的CPR框架通过关键点路由解耦了领域特定知识与通用能力的调用,优化了模型性能。
  3. CPR在多种配置下实现了领域性能的显著提升,同时有效减少了通用能力的下降,具有较小的计算开销。

📝 摘要(中文)

监督微调(SFT)是将大型语言模型(LLMs)适应于目标领域的标准方法,但常常导致模型通用能力的下降,这种现象被称为灾难性遗忘。现有方法通常通过修改SFT损失来减轻遗忘,但不可避免地在领域通用性与特定性之间存在权衡。本文提出了CPR(关键点路由)框架,通过在模型层面解耦这两种能力,仅在需要领域特定知识时选择性调用SFT专家。具体而言,CPR基于关键令牌实现了基础模型与专家模型之间的令牌级路由,训练了一个轻量级的层次路由器来估计每个令牌的专家调用概率,并结合动量平滑和阈值门控的推理过程。实验结果表明,CPR在多种模型-领域配置中均实现了最先进的性能,领域表现比SFT专家提高了1.4-5.5%,同时将通用能力的下降从3.4-14.5%恢复至最多0.5%。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在领域适应中面临的灾难性遗忘问题,现有方法通过修改损失函数来减轻遗忘,但往往导致领域通用性与特定性之间的权衡。

核心思路:提出CPR框架,通过在模型层面解耦通用能力与领域特定知识的调用,仅在必要时调用SFT专家,从而避免了传统方法的局限性。

技术框架:CPR框架包括基础模型和专家模型之间的令牌级路由,使用轻量级的层次路由器来估计每个令牌的专家调用概率,并结合动量平滑与阈值门控的推理过程。

关键创新:CPR的核心创新在于关键点路由机制,通过识别基础模型失效而专家模型成功的关键令牌,实现了高效的模型调用,显著提升了领域适应性能。

关键设计:在设计中,采用了轻量级的层次路由器,设置了适当的损失函数,并优化了网络结构以支持动态的专家调用,确保了在调用专家时的计算开销最小化。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CPR在所有设置中均实现了最先进的性能,领域表现比传统SFT专家提高了1.4-5.5%,而通用能力的下降从3.4-14.5%降低至最多0.5%。此外,专家的调用仅在三分之一的令牌上进行,确保了计算效率。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等,能够有效提升模型在特定领域的表现,同时保持其通用能力。未来,CPR框架可能在多模态学习和跨领域迁移学习中发挥重要作用,推动更智能的AI系统发展。

📄 摘要(原文)

Supervised fine-tuning (SFT) is the de facto standard for adapting large language models (LLMs) to target domains, but it often degrades the model's general capabilities, a phenomenon known as catastrophic forgetting. Existing approaches typically modify the SFT loss to mitigate forgetting, but they inevitably operate along a domain-generality trade-off. In this work, we step outside this trade-off by decoupling the two capabilities at the model level: we keep the original base model for general capability, and selectively invoke the SFT expert only when domain-specific knowledge is required. Specifically, we propose CPR (Critical-Point Routing), a token-level routing framework between a base model and its expert derivative, based on critical tokens where the base model fails but the expert succeeds. We train a lightweight hierarchical router that estimates the expert-call probability per token, and pair it with a tailored inference procedure that combines momentum smoothing and threshold gating. Across diverse model-domain configurations, CPR achieves state-of-the-art across all settings, surpassing SFT expert by 1.4-5.5% in domain performance while recovering its general-capability drop from 3.4-14.5% to at most 0.5%, with minimal overhead from invoking the expert on only one-third of tokens.