IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks
作者: Saikat Mondal, Mamta, Deeksha Varshney, Oana Cocarascu, Asif Ekbal
分类: cs.CL, cs.AI
发布日期: 2026-09-03
备注: 38 pages, 7 figures, 33 tables. Accepted to Findings of EMNLP 2026. Contains examples of harmful model outputs
🔗 代码/项目: GITHUB
💡 一句话要点
提出IndicSafeEval框架以评估多语言环境下LLM的安全性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 安全性评估 多语言处理 对抗性攻击 说服策略 低资源语言 评估框架
📋 核心要点
- 现有的安全性评估主要集中在英语,导致对低资源语言的对齐失败理解不足。
- 提出IndicSafeEval框架,通过结合安全关键内容和说服策略,评估多种印度语言的LLM安全性。
- 实验结果显示,模型在不同语言和提示风格下的安全表现差异显著,某些有害内容对说服越狱的脆弱性更高。
📝 摘要(中文)
大型语言模型(LLMs)在多语言环境中的应用日益增加,但其安全性评估主要集中在英语上,这限制了我们对低资源和文化多样性语言中对齐失败的理解。本文提出了IndicSafeEval,一个针对印度语言的基于说服的越狱评估框架。该基准结合了十个安全关键内容类别和六种类人说服策略,涵盖四种不同的印度语言(如印地语、孟加拉语、马拉地语和旁遮普语),生成7200个对抗性提示。通过对多个开源LLM进行系统的黑箱评估,研究发现模型在不同语言和提示风格下的安全行为表现不一,安全性能强烈依赖于所用语言和请求的措辞方式。不同风险类别的脆弱性也存在显著差异,这些发现揭示了当前安全评估的局限性,并强调了多语言和说服意识基准框架的必要性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在多语言环境下的安全性评估不足,尤其是对低资源语言的评估缺乏系统性和全面性。现有方法主要集中在英语,无法反映多样化文化背景下的对齐失败情况。
核心思路:提出IndicSafeEval框架,结合多种安全关键内容类别和人类说服策略,以评估不同印度语言的LLM安全性。通过系统的黑箱评估,分析模型在不同语言和提示下的安全表现。
技术框架:IndicSafeEval框架包括数据生成模块、评估模块和分析模块。数据生成模块创建7200个对抗性提示,评估模块对多个开源LLM进行安全性测试,分析模块则对结果进行深入分析,揭示不同语言和风险类别的表现差异。
关键创新:该研究的主要创新在于引入了多语言和说服意识的评估框架,填补了现有评估方法的空白,特别是在低资源语言的安全性评估方面。
关键设计:在参数设置上,框架结合了十个安全关键内容类别和六种说服策略,确保评估的全面性和有效性。损失函数和网络结构的设计则侧重于捕捉模型在不同语言和提示下的安全行为差异。
🖼️ 关键图片
📊 实验亮点
实验结果表明,模型在不同语言和提示风格下的安全表现存在显著差异,某些类型的有害内容对说服越狱的脆弱性更高。具体而言,某些语言的安全性表现显著低于其他语言,提示的措辞方式对模型的安全性影响深远。这些发现强调了多语言和说服意识评估的重要性。
🎯 应用场景
该研究具有广泛的应用潜力,尤其是在多语言环境下的人工智能系统安全性评估。IndicSafeEval框架可为开发者提供更全面的安全性评估工具,帮助识别和缓解潜在的安全风险,确保LLM在多样化文化背景下的可靠性和安全性。未来,该框架还可以扩展到其他语言和文化背景的评估中,推动全球范围内的安全标准化。
📄 摘要(原文)
Large language models (LLMs) are increasingly used in multilingual settings, yet their safety is still evaluated primarily in English. This limits our understanding of how alignment failures manifest in low-resource and culturally diverse languages. We introduce IndicSafeEval, a persuasion-based jailbreak evaluation framework for Indian languages. Our benchmark combines ten safety critical content categories with six human-like persuasive strategies across four different Indian languages, such as Hindi, Bengali, Marathi and Punjabi, resulting in 7,200 adversarial prompts. We conduct a systematic black-box evaluation of several open-source LLMs to examine how their safety behaviour varies across languages, persuasion strategies, and risk categories. Our analysis shows that the model does not behave equally safely across all languages and prompt styles. Instead, safety performance depends strongly on both the languages used and the way a request is phrased using persuasive cues. We further observe that different risk categories exhibit different levels of vulnerability, with some types of harmful content being significantly more susceptible to persuasion-based jailbreaks than others. These findings reveal important limitations of current safety evaluations, which are largely English-centric, and underscore the need for multilingual and persuasion-aware benchmarking frameworks to more accurately assess real-world LLM safety. Our implementation is available at https://github.com/MonSaikat/IndicSafeEval. Warning: this paper contains example data that may be offensive or harmful.