Social Pressure Breaks Majority Voting in LLM Safety Panels

📄 arXiv: 2608.04415v1 📥 PDF

作者: Yibo Hu, Jiaming Qu

分类: cs.CL

发布日期: 2026-08-05


💡 一句话要点

研究社交压力对大型语言模型安全评估的影响

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 社交压力 安全评估 误报率 内容审核 实验研究 模型判断

📋 核心要点

  1. 现有的安全评估方法在面对误导性信息时表现出脆弱性,导致误报率显著上升。
  2. 论文通过设计两轮实验,探讨社交压力如何影响模型的判断,提出了新的评估方法。
  3. 实验结果表明,错误标签的影响显著,导致小组的误报率达到100%,而无标签时表现更佳。

📝 摘要(中文)

大型语言模型(LLMs)在检测不安全内容方面的应用日益广泛。常见的方法是通过模型小组的判断来纠正个体错误,但当每个模型在投票前都看到相同的误导性上下文时,这种好处可能会消失。我们在一个受控的两轮实验中研究了这一风险。结果显示,错误标签的同伴信息使得平均审查者的误报率从56.5%上升至87.5%,而多数投票使得小组的误报率达到了100%。没有明确标签时,同一小组的表现优于其平均成员。该研究揭示了安全评估小组对共享社交线索的脆弱性,并提供了简单的预部署诊断方法。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在安全评估中因社交压力导致的判断失误问题。现有方法依赖多数投票,但在面对误导性信息时,模型的判断可能受到显著影响。

核心思路:论文的核心思路是通过模拟同伴的反馈来研究社交压力对模型判断的影响。通过两轮实验,模型在独立判断后,再根据同伴的反馈进行第二次判断,从而观察误导性信息的影响。

技术框架:整体实验设计分为两轮,第一轮模型独立判断,第二轮模型在接收到同伴的反馈后再次判断。实验涉及六个开放权重的LLM和六个数据集,结果通过多数投票进行整合。

关键创新:最重要的创新点在于识别了社交线索对安全评估小组的影响,指出了在共享误导性信息时,模型判断的失误率显著上升,这一现象在现有文献中尚未被充分探讨。

关键设计:实验中设置了不同的同伴反馈情境,包括错误标签和弃权,观察其对模型判断的影响。通过对比分析,发现模型在面对错误标签时的表现显著下降,且表现出强烈的非对称性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,错误标签的同伴信息使得平均审查者的误报率从56.5%上升至87.5%,而多数投票使得小组的误报率达到了100%。此外,模型在没有明确标签时的表现优于其平均成员,显示出社交压力对判断的强烈影响。

🎯 应用场景

该研究的潜在应用领域包括内容审核、社交媒体监控和自动化安全评估等。通过识别社交压力对模型判断的影响,开发更为鲁棒的安全评估系统,能够有效降低误报率,提高内容审核的准确性,具有重要的实际价值和未来影响。

📄 摘要(原文)

Large language models (LLMs) are increasingly used to detect unsafe content. A common approach is to combine judgments from a panel of models to correct individual mistakes, but this benefit may disappear when every model sees the same misleading context before voting. We study this risk in a controlled two-round experiment. Each model first judges an item alone, then judges it again after six simulated peers either assert the wrong label or abstain. We combine the final judgments by majority vote. Across six open-weight LLMs and six datasets, we find that the wrong-label peer message raises the average reviewer false-alarm rate from 56.5% under silent peers to 87.5%, and majority voting raises the panel false-alarm rate to 100%. Without an asserted label, the same panel outperforms its average member. The effect is strongly asymmetric: reviewers follow pushes toward "unsafe" far more than pushes toward "safe" (about 75% versus 17%), so the panel's false-alarm rate rises sharply while its harmful-miss rate changes little. The proprietary-model probe shows substantial variation across models. These results identify susceptibility to shared social cues as a failure mode of safety panels and provide a simple pre-deployment diagnostic.