CIDER: A Dataset of Contextual Disclosure Boundaries for Privacy Preference Alignment

📄 arXiv: 2608.09164v1 📥 PDF

作者: Bingcan Guo, Eryue Xu, Jijie Zhou, Zhiping Zhang, Tianshi Li

分类: cs.AI

发布日期: 2026-08-10

备注: Accepted to COLM 2026


💡 一句话要点

提出CIDER数据集以解决隐私偏好对齐问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 隐私偏好 个性化对齐 披露边界 大型语言模型 数据集构建 上下文理解 社交媒体 用户信任

📋 核心要点

  1. 现有方法在捕捉个体隐私披露边界方面存在不足,难以在现实场景中评估隐私偏好对齐。
  2. 论文提出CIDER数据集,通过14,850条注释和1,650个披露边界集,捕捉用户在多种场景下的隐私决策。
  3. 实验结果显示,使用上下文个性化可将预测准确率提高多达11.41个百分点,且大型模型在理解上下文方面表现更优。

📝 摘要(中文)

对大型语言模型(LLMs)进行隐私偏好对齐需要捕捉个体的披露边界,而不仅仅是一般的隐私规范。然而,如何在现实环境中获取这些细微的偏好仍存在差距。我们引入了CIDER数据集,包含来自169名用户的14,850条人类注释,形成了1,650个上下文披露边界集,涵盖60种涉及违反隐私规范的信息共享的人际沟通场景。每个边界代表用户在特定沟通角色和AI介导条件下的披露决策。我们提出了一项任务,要求模型根据历史边界预测用户的披露决策。实验结果表明,使用仅6个历史示例的上下文个性化可以将预测准确率提高多达11.41个百分点。大型模型如GPT-5.4和Claude Sonnet 4.6在理解用户特定的上下文依赖披露偏好方面表现更佳,而较小模型则依赖于基于披露粒度和可识别性的结构性启发式方法。个性化通常提高预测准确性,但伴随模型间假阳性和假阴性率的不平衡变化,只有Claude Sonnet 4.6在两者上实现了平衡改进。我们的发现揭示了推理时个性化在隐私偏好建模中的潜力与局限性,并将CIDER定位为推动个性化隐私对齐的资源。

🔬 方法详解

问题定义:本论文旨在解决如何有效捕捉个体的隐私披露边界,以便与大型语言模型进行隐私偏好对齐。现有方法未能充分考虑个体在复杂社交场景中的细微偏好,导致对齐效果不佳。

核心思路:论文的核心思路是构建CIDER数据集,通过真实用户的披露决策来训练模型,使其能够在不同上下文中更准确地预测用户的隐私偏好。这样的设计旨在填补现有方法在个性化和上下文理解上的空白。

技术框架:整体架构包括数据收集、模型训练和评估三个主要模块。首先,通过用户注释收集披露边界数据;其次,训练模型以预测用户的披露决策;最后,评估模型在不同上下文下的预测准确性。

关键创新:最重要的技术创新点在于CIDER数据集的构建和使用上下文个性化来提升模型的预测能力。这与现有方法的本质区别在于,前者强调真实用户的决策过程,而后者往往依赖于静态的隐私规范。

关键设计:在模型训练中,采用了多种上下文信息作为输入,设计了适应性损失函数以平衡假阳性和假阴性率。此外,模型架构中引入了对历史披露边界的动态调整机制,以提高预测的准确性和可靠性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,使用上下文个性化后,模型的预测准确率提高了多达11.41个百分点。大型模型如GPT-5.4和Claude Sonnet 4.6在理解用户特定上下文的披露偏好方面表现优异,而Claude Sonnet 4.6在假阳性和假阴性率上实现了平衡改进,展示了个性化的潜力与局限性。

🎯 应用场景

该研究的潜在应用领域包括社交媒体平台、在线服务和智能助手等,能够帮助这些系统更好地理解和尊重用户的隐私偏好。通过个性化的隐私对齐,能够提升用户体验并增强用户对平台的信任。未来,该研究可能推动隐私保护技术的发展,促进更安全的在线互动。

📄 摘要(原文)

Aligning large language models (LLMs) with human privacy preferences requires capturing individuals' disclosure boundaries beyond general privacy norms. However, a gap remains in eliciting such nuanced preferences to evaluate alignment in realistic settings. We introduce CIDER, a dataset of 14,850 human annotations from 169 users, forming 1,650 contextual disclosure boundary sets across 60 interpersonal communication scenarios involving information sharing that violates privacy norms. Each boundary represents a real user's disclosure decisions over 9 sharing variants in a scenario, for a given communication role and AI-mediated condition. We formulate a task in which models predict a user's disclosure decision from historical boundaries, with varying levels of contextual information. Across 12 open and proprietary models, in-context personalization improves prediction accuracy by up to 11.41 percentage points using only 6 historical examples. Larger models such as GPT-5.4 (with medium reasoning effort) and Claude Sonnet 4.6 are better at leveraging semantic context to understand user-specific, context-dependent disclosure preferences for more accurate predictions, while smaller models tend to rely on structured heuristics based on disclosure granularity and identifiability. Personalization generally improves prediction accuracy, but the improvement is often accompanied by imbalanced shifts in false-positive and false-negative rates across models, with only Claude Sonnet 4.6 achieving balanced improvements in both. Our findings reveal both the promise and limitations of inference-time personalization for privacy preference modeling and position CIDER as a resource for advancing personalized privacy alignment.