PCA-guided Activation Scaling for Monotonic Bidirectional Control over LLM Sycophancy

📄 arXiv: 2608.16650v1 📥 PDF

作者: Zheng Chen, Zhaoxin Feng, Yip Tin Po, Jianfei Ma, Emmanuele Chersoni, Bo Li

分类: cs.CL

发布日期: 2026-08-17

备注: accepted by COLM2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出PCA引导的激活缩放以实现LLM的双向控制

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 激活缩放 迎合性控制 PCA 双向控制 单调性 机器学习

📋 核心要点

  1. 现有方法无法确保引导强度与行为结果之间的双向和单调关系,导致控制效果不稳定。
  2. 本文提出PCA引导的激活缩放(PAS),通过分解激活并应用不同的缩放指数,实现可控的迎合性调整。
  3. 在三个大型语言模型和三个数据集上,PAS实现了显著的单调性和更高的控制效果,提升幅度达到15.4%。

📝 摘要(中文)

大型语言模型(LLMs)表现出迎合性,即倾向于同意用户的信念,而不考虑事实的准确性。这可能会加固误解,但完全消除迎合性又可能对有效意见产生过度修正。因此,有效的控制必须能够以可预测和渐进的方式同时减少和增加迎合性。现有方法未能确保在模型和数据集之间引导强度与行为结果之间的双向和单调关系。本文提出了PCA引导的激活缩放(PAS),一种激活引导框架,通过将残差流激活分解为PCA识别的迎合性-诚实子空间和正交残差,应用不同的缩放指数以实现单调的双向控制。在三个LLM和三个数据集上,PAS实现了强单调性(Spearman ρ = +0.92)和每个方向平均15.4%的转变,相比基线的8.7%有显著提升。消融研究确认了分解、非对称指数和层选择对维持单调控制的重要性。

🔬 方法详解

问题定义:本文旨在解决大型语言模型中的迎合性问题,现有方法在控制迎合性时未能实现双向和单调的效果,导致控制不稳定。

核心思路:论文提出的PCA引导的激活缩放(PAS)方法,通过将激活分解为迎合性和诚实的子空间,利用不同的缩放指数实现对迎合性的精细控制。

技术框架:PAS的整体架构包括激活分解、PCA分析、缩放指数应用和行为结果评估四个主要模块。首先对激活进行PCA分解,然后根据分解结果应用不同的缩放策略,最后评估模型的行为变化。

关键创新:PAS的核心创新在于其激活分解方法和非对称缩放指数的应用,这与现有方法的单一缩放策略形成鲜明对比,确保了控制的单调性和双向性。

关键设计:在设计中,选择了特定的层进行激活分解,并设置了非对称的缩放指数,以确保在不同方向上都能实现有效的控制。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PAS在三个大型语言模型上实现了强单调性(Spearman ρ = +0.92),每个方向的平均转变达到15.4%,显著高于基线的8.7%。消融研究进一步验证了分解、非对称指数和层选择对控制效果的重要性。

🎯 应用场景

该研究的潜在应用领域包括对话系统、个性化推荐和教育技术等,能够有效调整模型的迎合性,提升用户体验和信息准确性。未来,PAS方法可能在多种语言模型的调优中发挥重要作用,促进更智能的交互系统的发展。

📄 摘要(原文)

Large language models (LLMs) exhibit sycophancy, a tendency to agree with user beliefs regardless of factual accuracy. This can reinforce misconceptions, but eliminating it entirely risks over-correction against valid opinions. Effective control must therefore both reduce and increase sycophancy with predictable and gradual effect. Yet, existing methods fail to ensure a bidirectional and monotonic relationship between steering strength and behavioral outcome across models and datasets. We introduce PCA-guided Activation Scaling (PAS), an activation steering framework that decomposes residual stream activations into a PCA-identified sycophancy-honesty subspace and an orthogonal residual, then applies distinct scaling exponents to achieve monotonic, bidirectional control. Across three LLMs and three datasets, PAS achieves strong monotonicity (Spearman $ρ$ = +0.92) and an average shift of 15.4% per direction, compared with 8.7% for the baselines. Ablation studies confirm that the decomposition, asymmetric exponents, and layer selection are each essential for maintaining monotonic control. The data and code are available at https://github.com/Bellafc/PCS.