The Illusion of Cross-Lingual Safety in Low-Resource Languages
作者: Abigail Oppong, P Sam Sahil, Tadesse Destaw Belay, Maryam Ibrahim Mukhtar, Esmael Ahmed Abdu, Tassallah Abdullahi, Jessica Oparebea, Saminu Mohammad Aliyu, Idris Abdulmumin, Abubakar Juma Chilala, Nicholaus Dismas Ladislaus, Alfred Malengo Kondoro, Lemofouet Valdini Douglace, Shamsuddeen Hassan Muhammad, Seid Muhie Yimam
分类: cs.CL
发布日期: 2026-08-11
💡 一句话要点
提出LoDNA数据集以解决低资源语言的跨语言安全问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨语言安全 低资源语言 大型语言模型 安全对齐 数据集构建 潜在几何框架 有害提示
📋 核心要点
- 现有的安全对齐方法主要基于英语,假设其在多语言环境中有效,但在低资源语言中存在显著不足。
- 论文提出了LoDNA数据集,并使用潜在几何框架探测LLMs中的隐藏状态拒绝表示,以评估跨语言安全性。
- 实验结果显示,跨语言安全转移效果不佳,有害提示的拒绝信号在大多数模型对中保留率不足10%。
📝 摘要(中文)
在大型语言模型(LLMs)的安全性对齐研究中,主要集中于英语,假设这些安全措施可以在多语言环境中普遍适用。然而,这一假设在低资源语言中尚未得到充分探讨,暴露出潜在的脆弱性。本文研究了四种非洲语言(Twi、Hausa、Amharic和Swahili)中的跨语言安全转移,使用了新的安全数据集LoDNA,该数据集将字面翻译与文化本地化提示相结合。我们提出了一种潜在几何框架,探测LLMs中的隐藏状态拒绝表示。实验结果表明,跨语言安全转移严重受限;在大多数语言模型对中,有害提示的拒绝信号保留率不足10%。
🔬 方法详解
问题定义:本文旨在解决当前大型语言模型在低资源语言中的安全性对齐问题,现有方法假设的跨语言安全性转移缺乏实证支持。
核心思路:通过构建LoDNA数据集,结合字面翻译与文化本地化提示,论文提出了一种新的评估框架,旨在深入探讨LLMs的拒绝机制。
技术框架:研究采用潜在几何框架,分析LLMs的隐藏状态,评估其对有害提示的拒绝能力,主要模块包括数据集构建、模型训练与评估。
关键创新:最重要的创新在于提出了潜在几何框架,能够有效探测和分析隐藏状态拒绝表示,与传统的生成评估方法相比,提供了更深入的理解。
关键设计:在实验中,使用了高语义相似度的提示(余弦相似度0.95-0.996),并分析了不同层次的信号漂移,揭示了模型在编码概念时未能有效路由至安全机制。
🖼️ 关键图片
📊 实验亮点
实验结果显示,跨语言安全转移的效果极为有限,在大多数语言模型对中,有害提示的拒绝信号保留率不足10%。此外,尽管字面和本地化提示在语义上高度一致,但在模型的不同层次中信号漂移显著,表明当前的多语言安全对齐方法存在表面化的问题。
🎯 应用场景
该研究的潜在应用领域包括多语言聊天机器人、跨语言内容审核和低资源语言的自然语言处理系统。通过提高低资源语言的安全性对齐,能够增强这些系统在实际应用中的可靠性和用户信任度,具有重要的社会价值和影响。
📄 摘要(原文)
Safety alignment in large language models (LLMs) is largely developed in English, assuming these safeguards generalize across multilingual settings. However, this assumption remains underexplored and exposes a vulnerability in low-resource languages. We investigate cross-lingual safety transfer in four African languages, Twi, Hausa, Amharic, and Swahili, using LoDNA, a new safety dataset that pairs literal translations with culturally localized prompts. To move beyond generation-based evaluation, we propose a latent geometric framework that probes hidden-state refusal representations in LLMs. Our experimental results show that cross-lingual safety transfer is severely limited; harmful prompts retain less than 10% of the English refusal signal across most language-model pairs. Literal and localized prompts are semantically aligned (cosine 0.95-0.996) but drift across layers, suggesting models encode the concepts without routing them to safety mechanisms. These findings demonstrate that current multilingual safety alignment is superficial, providing strong evidence against the assumption of a universal, language-agnostic harm manifold within the specific low-resource languages studied. Warning: This paper contains example data that may be offensive or harmful.