Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili
作者: Ruolei Zhang, Teddy Njuguna, Yue Feng
分类: cs.CL
发布日期: 2026-08-04
💡 一句话要点
分析大型语言模型中的跨语言偏见以提升多语言安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨语言偏见 大型语言模型 多语言环境 偏见评估 社会偏见
📋 核心要点
- 现有的语言模型偏见评估主要集中在英语,缺乏对其他语言的全面分析,导致多语言环境中的安全性问题。
- 论文通过对比分析英语和斯瓦希里语的提示对,探讨社会偏见在不同语言间的表现和转变,提出了新的评估框架。
- 实验结果显示,偏见在不同语言间的表现存在显著差异,提示对的语义相似度低于55%,强调了多语言偏见审计的重要性。
📝 摘要(中文)
大型语言模型在多语言环境中的应用日益增多,但安全对齐和偏见评估仍然以英语为中心。本文通过向GPT-5.2和Gemini 2.5 Flash提交4900对对称的英语-斯瓦希里提示,研究社会偏见是否跨语言普遍存在。结果显示,偏见在不同语言间转变而非转移,具体表现为在某些偏见维度上,刻板印象率变化高达12个百分点,Gemini在斯瓦希里语中的中性情感率翻倍,而GPT-5.2在英语中拒绝了169个提示,在斯瓦希里语中则为零。这些结果表明,仅依赖英语的偏见审计无法充分覆盖多语言部署的需求。
🔬 方法详解
问题定义:本研究旨在解决大型语言模型在多语言环境中偏见评估的不足,尤其是现有方法对非英语语言的覆盖不足。
核心思路:通过提交对称的英语-斯瓦希里提示对,评估偏见在不同语言中的表现,探索偏见的转变而非转移现象。
技术框架:研究设计包括4900对提示的生成与评估,涉及刻板印象率、情感分析、拒绝行为和跨语言语义相似度的分析。
关键创新:本研究的创新在于揭示了偏见在不同语言间的转变特性,强调了英语为中心的偏见审计不足以反映多语言环境的真实情况。
关键设计:实验中使用了多种偏见评估维度,设置了不同的提示对,并通过两种大型语言模型进行对比分析,确保结果的可靠性与有效性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,特定偏见维度上刻板印象率变化高达12个百分点,Gemini在斯瓦希里语中的中性情感率翻倍,而GPT-5.2在英语中拒绝了169个提示,在斯瓦希里语中则为零,表明偏见在不同语言中的表现存在显著差异。
🎯 应用场景
该研究的结果对多语言模型的开发和应用具有重要意义,尤其是在需要考虑文化和语言差异的场景中,如全球化产品的设计、跨文化交流平台等。未来,研究成果可为多语言模型的偏见审计提供指导,促进更公平的人工智能应用。
📄 摘要(原文)
Large language models are increasingly deployed in multilingual contexts, yet safety alignment and bias evaluation remain overwhelmingly English-centric. We investigate whether social biases generalise across languages by submitting 4,900 symmetric English--Swahili prompt pairs to GPT-5.2 and Gemini 2.5 Flash across nine demographic bias axes, yielding 19,600 completions evaluated for stereotype prevalence, sentiment, refusal behaviour, and cross-lingual semantic similarity. Our findings show that bias transforms rather than transfers: stereotype rates shifted by up to 12 percentage points on specific axes, Gemini's neutral-sentiment rate doubled in Swahili, and GPT-5.2 refused 169 prompts in English and zero in Swahili, consistent with refusal behaviour anchored to English-language surface forms at the behavioural level. Over 55% of prompt pairs produced semantically dissimilar completions across both models. These reinforce the idea that English-only bias audits do not produce adequate coverage for multilingual deployment.