Evaluating Criterion-Conditioned Behaviour of Large Language Models in Content Moderation
作者: Danting Zhang, Bei Peng, Robert Loftin
分类: cs.CL
发布日期: 2026-09-03
备注: Accepted by EMNLP Findings 2026
💡 一句话要点
提出DECO方法以解决LLMs内容审核中的标准化问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 内容审核 大型语言模型 标准条件评估 DECO方法 模型评估 因子分解 内容诊断
📋 核心要点
- 现有内容审核基准将多个审核标准聚合为单一标签,导致模型在标准级别的表现不明确。
- 本文提出DECO方法,通过标准独立的内容因子分解实现控制的标准级评估,增强模型的评估能力。
- 实验结果显示,强基准性能掩盖了模型在标准级别的失败,强调了对标准条件行为的评估需求。
📝 摘要(中文)
大型语言模型(LLMs)在标准内容审核基准上表现出色,但这些基准通常将多个审核标准聚合为单一标签,导致模型是否能够区分并可靠地应用每个标准变得不明确。为研究LLMs是否表现出标准条件行为,本文引入了内容诊断评估(DECO),这是一种标准独立的内容因子分解方法,能够进行控制的标准级评估。我们还引入了成对评估,以比较相同输入在不同标准下的模型输出。通过对四个审核数据集和四个LLMs的研究,我们发现,强大的基准性能可能掩盖了标准级别的重大失败。模型在做出正确决策时,往往依赖于内容的特定方面而非整体有害性。我们的结果突显了当前内容审核基准的一个关键局限性:在聚合标签上表现良好并不能充分证明LLMs能够可靠地评估内容的个别审核标准。这些发现呼吁开发明确测量标准条件行为的评估方法。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在内容审核中无法有效区分和应用不同审核标准的问题。现有方法的痛点在于,聚合标签无法反映模型在标准级别的真实表现。
核心思路:论文的核心思路是引入DECO方法,通过标准独立的内容因子分解,允许对模型在不同审核标准下的表现进行细致评估。这种设计使得评估过程不再依赖于聚合标签,而是关注每个标准的具体要求。
技术框架:整体架构包括内容因子分解模块、标准条件评估模块和成对评估模块。内容因子分解模块负责将输入内容分解为不同的审核标准,标准条件评估模块则对每个标准进行独立评估,成对评估模块用于比较不同标准下的模型输出。
关键创新:最重要的技术创新点是DECO方法的引入,它允许对内容进行标准独立的因子分解,从而实现更为细致的标准级评估。这与现有方法的本质区别在于,后者通常依赖于聚合标签,无法揭示模型在标准级别的真实能力。
关键设计:在关键设计上,论文采用了特定的损失函数以优化模型在标准级别的表现,并设计了适应不同审核标准的网络结构,以确保模型能够有效处理多样化的内容审核任务。具体参数设置和网络结构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,尽管在标准基准上表现良好,但模型在标准级别的评估中存在显著失败,尤其是在需要评估内容特定方面时。具体而言,某些模型在特定审核标准下的表现下降幅度达到30%以上,强调了当前评估方法的局限性。
🎯 应用场景
该研究的潜在应用领域包括社交媒体平台、在线社区和内容发布网站等,能够帮助这些平台更有效地进行内容审核,确保遵循各类社区标准和法律法规。未来,该方法可能推动内容审核技术的进一步发展,提高模型在复杂审核场景下的可靠性和准确性。
📄 摘要(原文)
Large language models (LLMs) demonstrate strong performance on standard content moderation benchmarks. However, these benchmarks often aggregate multiple moderation criteria into a single label, making it unclear whether models can disentangle them and reliably apply each criterion when making decisions. To study whether LLMs exhibit criterion-conditioned behaviour, we introduce Diagnostic Evaluation of COntent (DECO), a criterion-independent factorisation of content that enables controlled, criterion-level evaluation. We also introduce pairwise evaluation to compare model outputs across different criteria for the same input. Across four moderation datasets and four LLMs, we find that strong benchmark performance can hide substantial failures at the criterion level. Models struggle most when correct decisions depend not on overall harmfulness, but on the specific aspect of the content that the criterion requires them to assess. Our results highlight a key limitation of current content moderation benchmarks: strong performance on aggregated labels does not provide sufficient evidence that LLMs can reliably evaluate content with respect to individual moderation criteria. These findings call for the development of evaluation methods that explicitly measure criterion-conditioned behaviour.