Subliminal Learning as Trait-Direction Drift: A Mechanism and Targeted Control under SFT Distillation

📄 arXiv: 2609.01091v1 📥 PDF

作者: Zhixuan Liu, Zhichen Dong, Yuyu Fan, Xiangtian Li, Chao Yang

分类: cs.LG

发布日期: 2026-09-01

备注: 36 pages, 8 figures


💡 一句话要点

提出特征方向漂移机制以控制隐性学习问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 隐性学习 特征方向漂移 模型蒸馏 走廊正则化 行为转移 偏好控制

📋 核心要点

  1. 现有模型蒸馏方法在隐性学习过程中存在信号积累不明确的问题,导致难以进行针对性控制。
  2. 本文提出特征方向漂移机制,利用偏置生成的可测量偏好差距引导学生模型更新,从而实现行为转移的控制。
  3. 实验结果显示,采用走廊正则化后,恶意响应转移从29.55%降低至6.45%,且在主要任务上保持了较高的准确性。

📝 摘要(中文)

模型蒸馏不仅能传递预期能力,还可能转移教师模型的隐性特征。教师模型在系统提示的影响下生成的训练数据,虽然语义上干净,但仍会导致学生模型继承隐性偏好,这一现象称为隐性学习。本文提出并验证了特征方向漂移作为隐性学习的机制,揭示了训练过程中信号的积累如何导致行为转移。基于此机制,提出了探测空间走廊正则化作为针对性防御,能够在蒸馏过程中有效约束漂移,显著降低隐性特征转移,同时保持任务性能。实验结果表明,该方法在降低恶意响应转移方面表现优异,且在主要任务准确性损失较小的情况下,持续抑制动物偏好转移。

🔬 方法详解

问题定义:本文旨在解决模型蒸馏过程中隐性学习导致的特征转移问题。现有方法未能有效识别和控制信号积累过程,导致隐性偏好难以抑制。

核心思路:提出特征方向漂移作为隐性学习的机制,认为偏置生成的训练数据会在教师模型中产生可测量的偏好差距,进而影响学生模型的更新。通过这种方式,可以实现对隐性学习的针对性控制。

技术框架:整体框架包括教师模型生成偏置数据、学生模型在监督微调阶段识别偏好差距、以及通过走廊正则化约束漂移方向。主要模块包括数据生成、模型训练和正则化控制。

关键创新:最重要的创新在于将特征方向漂移作为隐性学习的核心机制,明确了信号积累与行为转移之间的关系,并提出了走廊正则化作为有效的防御手段。

关键设计:在实验中,采用了特定的损失函数来量化偏好差距,并设计了走廊正则化的参数设置,以确保在蒸馏过程中有效约束漂移,同时保持学生模型的任务性能。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,采用走廊正则化后,恶意响应转移显著降低,从29.55%降至6.45%,且在主要任务上保持了较高的准确性,展示了该方法在控制隐性学习方面的有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、计算机视觉等多个领域,尤其是在需要模型蒸馏的场景中。通过有效控制隐性学习,能够提升模型的安全性和可靠性,减少不必要的偏见和错误响应,具有重要的实际价值和未来影响。

📄 摘要(原文)

Beyond intended capabilities, model distillation can transfer hidden traits from a teacher. A teacher biased by a system prompt can generate semantically clean training data, such as numeric sequences, that still causes a downstream student to inherit the hidden preference, a phenomenon known as subliminal learning. Prior work has identified several parts of this process. How the signal builds up during training and produces behavioral transfer remains unclear, making targeted mitigation difficult. We propose and validate trait-direction drift as a mechanism for subliminal learning: biased generation creates measurable preference gaps in teacher data, and student-recognizable gaps induce trait-aligned updates during supervised fine-tuning that accumulate into behavioral transfer. Guided by this mechanism, we propose probe-space corridor regularization, a targeted defense that constrains drift along a calibrated trait direction during distillation. The method substantially reduces hidden-trait transfer, preserving task performance: for example, it lowers malicious-response transfer from 29.55% to 6.45% with low main-task accuracy cost, and consistently suppresses animal-preference transfer across the main Qwen setting. The preference-gap, training-trajectory, and intervention evidence links subliminal learning to trait-direction drift and motivates corridor regularization as a targeted control during distillation.