SAEVerbalizer: Generating Explanations for Sparse Autoencoder Features via Representation Verbalization
作者: Weihan Meng, Hongzhu Guo, Yi Jing, Dewen Liu, Zijun Yao, Xiaozhi Wang, Lei Hou, Juanzi Li
分类: cs.CL
发布日期: 2026-08-13
💡 一句话要点
提出SAEVerbalizer以解决稀疏自编码器特征解释问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 稀疏自编码器 特征解释 自然语言生成 大型语言模型 模型透明性 深度学习
📋 核心要点
- 现有方法主要依赖外部观察来解释稀疏自编码器特征,导致解释肤浅且计算效率低下。
- SAEVerbalizer框架通过将SAE解码器方向注入LLM表示,并微调下游层,生成自然语言解释。
- 实验结果显示,SAEVerbalizer的语言化能力能够推广到未见特征,并在不同LLM间有效迁移。
📝 摘要(中文)
稀疏自编码器(SAEs)被提出用于从大型语言模型(LLM)表示中提取众多特征,但对这些特征的解释主要依赖外部观察。这种依赖导致了从观察到的模型行为中推断出的肤浅解释,以及在大规模收集此类行为证据时的计算效率低下。我们引入了SAEVerbalizer框架,将SAE解码器方向注入LLM的表示中,并微调LLM的下游层,以生成对注入特征的自然语言解释。经过训练后,生成的解释器能够直接从解码器方向解释SAE特征,解决了上述两大局限。实验表明,学习到的语言化能力能够推广到未见特征,并在单独训练的SAE字典之间迁移,且通过轻量适配器扩展到不同LLM的SAE特征。
🔬 方法详解
问题定义:本论文旨在解决稀疏自编码器特征的解释问题,现有方法依赖外部观察,导致解释不够深入且计算效率低下。
核心思路:论文提出的SAEVerbalizer框架通过将SAE解码器方向直接注入到LLM的表示中,并对下游层进行微调,从而生成自然语言解释。这种设计能够直接从解码器方向生成解释,避免了对外部观察的依赖。
技术框架:SAEVerbalizer的整体架构包括三个主要模块:首先是SAE特征的提取,其次是解码器方向的注入,最后是LLM下游层的微调。通过这些模块的协同工作,SAE特征能够被有效解释。
关键创新:最重要的技术创新在于将解码器方向直接与LLM表示结合,形成一种新的解释机制。这与现有方法的本质区别在于不再依赖外部观察,而是通过模型内部机制生成解释。
关键设计:在设计中,采用了轻量适配器以便于扩展到不同LLM的SAE特征,同时在损失函数和网络结构上进行了优化,以确保生成的解释具有高质量和可读性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,SAEVerbalizer在未见特征上的语言化能力表现优异,能够有效迁移至不同的SAE字典,并通过轻量适配器扩展到不同LLM的SAE特征。具体而言,注入多个方向的实验表明,生成的解释能够结合多重含义,且反转单个方向时,解释的含义也会相应变化。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理中的特征解释、模型透明性提升以及人机交互等。通过提供更深入的特征解释,SAEVerbalizer能够帮助研究人员和开发者更好地理解和优化大型语言模型的行为,进而推动相关技术的实际应用和发展。
📄 摘要(原文)
Sparse autoencoders (SAEs) are proposed to extract numerous features from large language model (LLM) representations, yet explaining these features still relies primarily on external observation. This reliance leads to superficial explanations inferred from observed model behavior and computational inefficiency from collecting such behavioral evidence at scale. We introduce SAEVerbalizer, a framework that injects SAE decoder directions into an LLM's representations and fine-tunes the LLM's downstream layers to generate natural-language explanations of the injected features. Once trained, the resulting verbalizer explains SAE features directly from decoder directions, addressing both limitations. Our experiments show that the learned verbalization capability generalizes to unseen features, transfers across separately trained SAE dictionaries, and, with a lightweight adapter, extends to SAE features from different LLMs. Intervention experiments show that injecting multiple directions yields an explanation combining their meanings, while reversing individual directions produces corresponding meaning shifts.