Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

📄 arXiv: 2608.03532v1 📥 PDF

作者: Ruolei Zhang, Teddy Njuguna, Yue Feng

分类: cs.CL

发布日期: 2026-08-04


💡 一句话要点

分析大型语言模型中的跨语言偏见以提升多语言安全性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨语言偏见 大型语言模型 多语言环境 偏见评估 社会偏见

📋 核心要点

  1. 现有的语言模型偏见评估主要集中在英语,缺乏对其他语言的全面分析,导致多语言环境中的安全性问题。
  2. 论文通过对比分析英语和斯瓦希里语的提示对,探讨社会偏见在不同语言间的表现和转变,提出了新的评估框架。
  3. 实验结果显示,偏见在不同语言间的表现存在显著差异,提示对的语义相似度低于55%,强调了多语言偏见审计的重要性。

📝 摘要(中文)

大型语言模型在多语言环境中的应用日益增多,但安全对齐和偏见评估仍然以英语为中心。本文通过向GPT-5.2和Gemini 2.5 Flash提交4900对对称的英语-斯瓦希里提示,研究社会偏见是否跨语言普遍存在。结果显示,偏见在不同语言间转变而非转移,具体表现为在某些偏见维度上,刻板印象率变化高达12个百分点,Gemini在斯瓦希里语中的中性情感率翻倍,而GPT-5.2在英语中拒绝了169个提示,在斯瓦希里语中则为零。这些结果表明,仅依赖英语的偏见审计无法充分覆盖多语言部署的需求。

🔬 方法详解

问题定义:本研究旨在解决大型语言模型在多语言环境中偏见评估的不足,尤其是现有方法对非英语语言的覆盖不足。

核心思路:通过提交对称的英语-斯瓦希里提示对,评估偏见在不同语言中的表现,探索偏见的转变而非转移现象。

技术框架:研究设计包括4900对提示的生成与评估,涉及刻板印象率、情感分析、拒绝行为和跨语言语义相似度的分析。

关键创新:本研究的创新在于揭示了偏见在不同语言间的转变特性,强调了英语为中心的偏见审计不足以反映多语言环境的真实情况。

关键设计:实验中使用了多种偏见评估维度,设置了不同的提示对,并通过两种大型语言模型进行对比分析,确保结果的可靠性与有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,特定偏见维度上刻板印象率变化高达12个百分点,Gemini在斯瓦希里语中的中性情感率翻倍,而GPT-5.2在英语中拒绝了169个提示,在斯瓦希里语中则为零,表明偏见在不同语言中的表现存在显著差异。

🎯 应用场景

该研究的结果对多语言模型的开发和应用具有重要意义,尤其是在需要考虑文化和语言差异的场景中,如全球化产品的设计、跨文化交流平台等。未来,研究成果可为多语言模型的偏见审计提供指导,促进更公平的人工智能应用。

📄 摘要(原文)

Large language models are increasingly deployed in multilingual contexts, yet safety alignment and bias evaluation remain overwhelmingly English-centric. We investigate whether social biases generalise across languages by submitting 4,900 symmetric English--Swahili prompt pairs to GPT-5.2 and Gemini 2.5 Flash across nine demographic bias axes, yielding 19,600 completions evaluated for stereotype prevalence, sentiment, refusal behaviour, and cross-lingual semantic similarity. Our findings show that bias transforms rather than transfers: stereotype rates shifted by up to 12 percentage points on specific axes, Gemini's neutral-sentiment rate doubled in Swahili, and GPT-5.2 refused 169 prompts in English and zero in Swahili, consistent with refusal behaviour anchored to English-language surface forms at the behavioural level. Over 55% of prompt pairs produced semantically dissimilar completions across both models. These reinforce the idea that English-only bias audits do not produce adequate coverage for multilingual deployment.