Language-Specific Gaps in AI Safety Training Datasets
作者: Chialuka Prisca-Mary Onuoha, Bright Etornam Sunu, Rashidat Sikiru
分类: cs.CY, cs.LG
发布日期: 2026-08-13
🔗 代码/项目: HUGGINGFACE
💡 一句话要点
提出多语言安全数据集审计方法以解决语言特定差距问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多语言模型 数据集审计 安全性评估 语言特定差距 人工智能伦理
📋 核心要点
- 现有多语言安全数据集在个别语言层面存在显著差距,影响模型的安全性和可靠性。
- 论文提出了一种切片级审计方法,通过对不同语言的数据集进行系统审计,揭示了数据质量和覆盖的不足。
- 实验结果表明,某些语言切片的翻译质量低于接受阈值,且特定类别在非洲语言中完全缺失,强调了数据集的可改进性。
📝 摘要(中文)
大型语言模型提供者常引用多语言安全基准作为其模型对非英语用户安全性的证据。然而,我们发现这些覆盖声明在个别语言层面上经不起检验。通过审计21个资源和25个语言切片,我们发现数据来源、注释可靠性、访问权限、伤害分类覆盖和数据重用等方面存在差距。这些差距在不同语言资源中呈现出部分一致的模式。我们进一步展示了自我伤害和性内容类别在研究的非洲语言层面上没有本土语言覆盖,提出了一种可重用的切片级审计方法,并为数据集创建者和模型提供者提供了具体建议。
🔬 方法详解
问题定义:本论文旨在解决多语言安全数据集在不同语言层面上存在的覆盖差距问题。现有方法未能充分考虑个别语言的安全性,导致模型在非英语用户中的表现不佳。
核心思路:论文的核心思路是通过切片级审计方法,系统性地评估和比较不同语言的数据集,识别出数据质量和覆盖的不足之处,从而为改进提供依据。
技术框架:整体架构包括数据集审计、质量评估和比较分析三个主要模块。首先,对21个资源进行审计,然后在不同语言切片中进行质量评估,最后进行跨语言的比较分析。
关键创新:最重要的技术创新点在于提出了一种可重用的切片级审计方法,能够量化和识别多语言数据集中的具体差距,与现有方法相比,提供了更细致的分析视角。
关键设计:在审计过程中,采用了特定的质量评估标准,包括数据来源的可靠性、注释的一致性和伤害分类的覆盖范围等,确保了审计结果的准确性和可操作性。具体参数设置和损失函数的设计在论文中详细阐述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,某些语言切片的翻译质量低于接受阈值,而其他语言的输出则显著高于该阈值。此外,自我伤害和性内容类别在研究的非洲语言层面上完全缺失,这一发现强调了数据集的改进需求。
🎯 应用场景
该研究的潜在应用领域包括多语言模型的安全性评估、数据集创建和优化,以及人工智能系统在非英语环境中的应用。通过改进数据集的质量和覆盖,能够提升模型在多语言场景下的安全性和可靠性,具有重要的实际价值和社会影响。
📄 摘要(原文)
Large language model providers routinely cite multilingual safety benchmarks spanning a dozen or more languages as evidence that their models are safe for non-English-speaking users. We show that these collection-level coverage claims frequently do not survive inspection at the level of an individual language. Auditing 21 resources across 25 language slices, of which 20 count as datasets under our counting rules, spanning three languages chosen to represent low- (Hausa), mid- (Swahili), and high-resource (French) tiers, we find that gaps in provenance, annotation reliability, access, harm-taxonomy coverage, and data reuse recur in patterns that partially, but not fully, track resource level. Using a controlled within-pipeline comparison, we show a Hausa-language slice falling below its own paper's translation-quality acceptance threshold while the same pipeline's Swahili output clears the same bar comfortably; this is evidence that these gaps are measurable and addressable, not inherent. We further show that self-harm and sexual-content categories have no native-language coverage in either African-language tier we studied, a total rather than gradated gap that a purely resource-level account does not predict. We connect these findings to a documented, persistent asymmetry in multilingual jailbreak robustness (single-turn attacks largely mitigated, multi-turn attacks still effective), arguing that this asymmetry is structurally consistent with where our audit finds training and evaluation data thinnest. We contribute a reusable slice-level audit methodology, a cross-tier empirical comparison, and concrete recommendations for dataset creators, model providers, and venues aiming to make ``multilingual coverage'' claims verifiable rather than merely stated. Dataset: https://huggingface.co/datasets/ChialukaOnuoha/safety-slice-audit