Locating and Controlling Implicit Personalization in Large Language Models
作者: Yueru Yan, Siqi Wu, Thai Le
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-08-12
💡 一句话要点
提出隐式个性化控制方法以提升大语言模型的输出一致性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 隐式个性化 内部激活信号 推荐系统 模型控制 用户体验 社交媒体
📋 核心要点
- 现有研究未能明确大语言模型如何根据隐式人口统计线索调整输出,缺乏对内部激活信号的深入理解。
- 论文通过实验揭示了内部激活信号与推荐变化之间的关联,并提出了一种控制隐式个性化的方法。
- 实验结果表明,去除特定线索的内部信号能有效抑制其影响,相关性高达0.87,且性能保持稳定。
📝 摘要(中文)
大语言模型(LLMs)在用户未明确表述人口统计身份时,仍会根据隐式人口统计线索调整输出。尽管已有研究记录了这种行为,但其与模型内部激活之间的关系尚不明确。通过对五个LLMs进行匹配的提示和中性对话实验,我们发现局部内部激活信号能够追踪推荐变化,相关性高达r=0.87。当多个线索同时出现时,其内部信号大多结合,但输出变化并非简单叠加。我们进一步展示,去除与某一线索相关的内部信号可以有效抑制其影响,通常比通过提示让模型忽略人口统计信息更有效,同时大致保持一般基准性能。然而,选择性去除某一维度影响的能力在模型和属性上高度特定。这些结果将隐式个性化行为与可分析和因果控制的内部信号联系起来。
🔬 方法详解
问题定义:本论文旨在解决大语言模型在未明确人口统计信息时,如何根据隐式线索调整输出的问题。现有方法未能有效控制这种隐式个性化行为,导致输出不一致性。
核心思路:论文提出通过分析模型的内部激活信号,来追踪和控制隐式个性化的影响。通过实验验证,去除特定线索的内部信号比简单提示模型忽略人口统计信息更为有效。
技术框架:整体架构包括数据收集、模型训练、内部激活信号分析和影响控制四个主要模块。首先,通过匹配提示和中性对话收集数据,然后训练多个LLMs,接着分析其内部激活信号,最后实施影响控制。
关键创新:最重要的技术创新在于识别和利用内部激活信号来追踪隐式个性化行为。这一方法与现有的基于提示的控制方法本质上不同,提供了更为直接的控制手段。
关键设计:在实验中,采用了特定的损失函数来优化模型的输出,同时设计了多种提示策略以测试不同线索的影响。模型的网络结构经过精心调整,以确保内部激活信号的有效捕捉。
🖼️ 关键图片
📊 实验亮点
实验结果显示,去除特定线索的内部信号能够有效抑制其影响,相关性高达0.87,且在大多数情况下,性能保持在基准水平之上。这一发现为隐式个性化控制提供了新的思路和方法。
🎯 应用场景
该研究的潜在应用领域包括个性化推荐系统、社交媒体内容生成和客户服务自动化等。通过更好地控制隐式个性化行为,能够提升用户体验,减少偏见和误导信息的传播,具有重要的实际价值和社会影响。
📄 摘要(原文)
Large language models (LLMs) often shift their outputs in response to implicit demographic cues even when users never state a demographic identity. Previous work has documented this behavior, but the connection between these behavioral changes and the model's internal activations remains unclear. Using matched cued and neutral conversations across five LLMs, we establish that a localized internal activation signal tracks changes in recommendations, with correlations up to r=0.87. When multiple cues appear together, their internal signals largely combine, but the changes in output do not simply add up. We further show that removing the internal signal associated with one cue can suppress its influence, often more effectively than asking the model to ignore demographics via prompting, while largely preserving general benchmark performance. However, the ability to selectively remove one dimension's influence while leaving co-present dimensions intact remains highly model- and attribute-specific. These results connect implicit personalization behavior to an internal signal that can be analyzed and causally controlled.