Hidden Threat in Synthetic Data: Covert Targeted Bias Injection through Benign Text
作者: Minkyung Cho, Jihyo Kim, SeungWoo Song, Junghun Yuk, Minjoon Kee, Hoyun Song, KyungTae Lim
分类: cs.CL, cs.AI
发布日期: 2026-08-31
备注: To be published in EMNLP 2026
💡 一句话要点
提出隐蔽偏见注入方法以解决合成数据安全问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 合成数据 偏见注入 大型语言模型 安全性 机器学习
📋 核心要点
- 合成数据在训练大型语言模型中的安全隐患尚未得到充分研究,可能导致有针对性的偏见注入。
- 本文提出了一种通过表面无害的合成数据向对齐模型注入偏见的管道,利用不对齐的教师模型生成合成数据。
- 实验结果显示,表面无害的合成数据能够有效传递偏见,同时保持学生模型的任务能力,揭示了潜在的安全风险。
📝 摘要(中文)
合成数据在训练大型语言模型(LLMs)中的应用日益增加,但其安全隐患仍未得到充分理解。本文研究了如何通过表面无害的合成数据向对齐模型注入有针对性的社会偏见。我们构建了一条管道,利用不对齐的教师模型生成经过过滤的合成数据集,这些数据集用于微调对齐的学生模型。实验结果表明,表面无害的合成数据可以作为隐蔽通道传递有针对性的偏见,同时在很大程度上保留学生模型的通用任务能力。这些发现揭示了合成数据驱动的LLM训练管道中未被充分探索的安全风险,并强调了改进保护措施的必要性。我们建议基于对数线性的评分方法可能为筛选表面无害的合成数据提供有用信号。
🔬 方法详解
问题定义:本文旨在解决合成数据在训练大型语言模型时可能引入的隐蔽偏见问题。现有方法未能有效识别和防范这种风险,导致模型可能继承不良行为特征。
核心思路:论文的核心思路是利用不对齐的教师模型生成经过过滤的合成数据集,通过这些数据集微调对齐的学生模型,从而实现对目标偏见的隐蔽注入。
技术框架:整体架构包括两个主要模块:不对齐的教师模型和对齐的学生模型。教师模型生成合成数据,经过过滤后输入学生模型进行微调。
关键创新:最重要的技术创新在于识别和利用表面无害的合成数据作为隐蔽偏见的传递通道,这一机制在现有文献中尚未被充分探讨。
关键设计:在参数设置上,采用了特定的过滤机制来确保生成数据的表面无害性,同时设计了基于对数线性的评分方法,以帮助筛选合成数据的安全性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,表面无害的合成数据能够有效传递有针对性的偏见,同时在保持学生模型通用任务能力的情况下,偏见注入的效果显著。这一发现强调了合成数据在模型训练中的潜在风险,呼吁对合成数据的安全性进行更深入的研究。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的训练和评估,尤其是在需要确保模型公平性和安全性的场景。通过识别和防范合成数据中的隐蔽偏见,可以提高模型的可靠性和社会责任感,促进更安全的AI系统发展。
📄 摘要(原文)
Synthetic data is increasingly used to train large language models (LLMs), yet its security implications remain poorly understood. Prior work on subliminal learning suggests that models can inherit behavioral traits from seemingly unrelated training data. In this work, we investigate whether such mechanisms can be exploited to inject targeted social biases into aligned models through semantically benign synthetic data. We construct a pipeline in which a misaligned teacher model generates filtered synthetic datasets across domains such as creative writing and code generation, which are then used to fine-tune aligned student models. Our experiments show that benign-looking synthetic data can act as a covert channel for transmitting targeted biases while largely preserving the student model's general task capabilities. These results reveal a previously underexplored security risk in synthetic data-driven LLM training pipelines and highlight the need for improved safeguards. As one possible step toward this goal, we suggest that log-linearity-based scoring may provide a useful signal for screening seemingly benign synthetic data.