Poli-Bias: Understanding and Measuring Large Language Model Biases in International Political Conflicts

📄 arXiv: 2608.06123v1 📥 PDF

作者: Massi-Nissa Abboud, Aladin Djuhera, Elena Cabrio, Holger Boche

分类: cs.AI, cs.CL

发布日期: 2026-08-06


💡 一句话要点

提出Poli-Bias框架以测量大型语言模型中的政治偏见

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 政治偏见 反事实分析 法律推理 地缘政治 模型审计 多维度评估

📋 核心要点

  1. 现有方法难以全面捕捉大型语言模型中的政治偏见,尤其是在法律和地缘政治背景下的微妙差异。
  2. 本文提出的Poli-Bias框架通过反事实分析,系统性地比较不同国家身份下的模型响应,提供了多维度的偏见测量。
  3. 实验结果显示,13个不同的LLMs在处理法律等价的冲突场景时,国家身份和用户背景显著影响模型的响应,揭示了潜在的偏见。

📝 摘要(中文)

在大型语言模型(LLMs)中测量政治偏见仍然具有挑战性,因为这种偏见可能通过微妙的框架、论证和法律推理差异表现出来,难以用单一指标捕捉。本文提出了Poli-Bias,一个反事实框架,用于测量LLMs在处理法律上等同的冲突场景时,是否因涉及的国家不同而表现出不同的处理方式。Poli-Bias比较了国家身份在不同地缘政治关系、法律违规和推理任务中的响应差异。我们的框架将响应差异分解为五个可解释的维度,揭示不平等待遇的表现形式。通过对13个当代LLMs的研究,我们发现国家身份和用户隶属关系会系统性地影响对等价行为的描述、评估和辩护。我们的结果确立了Poli-Bias作为审计LLMs政治公正性和谄媚性的细致框架。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在处理国际政治冲突时的偏见测量问题。现有方法往往无法捕捉到微妙的法律和地缘政治差异,导致偏见评估不全面。

核心思路:Poli-Bias框架通过反事实方法,比较在不同国家身份下的模型响应,旨在揭示法律上等价的冲突场景中潜在的偏见表现。这样的设计使得偏见的测量不仅限于单一判断,而是通过多维度分析提供更深入的理解。

技术框架:Poli-Bias的整体架构包括数据准备、反事实生成、模型响应比较和偏见分析四个主要模块。首先,生成不同国家身份的对比提示;其次,收集模型的响应并进行系统性比较;最后,分析响应差异并将其分解为五个可解释的维度。

关键创新:Poli-Bias的主要创新在于其多维度的偏见测量方法,能够将响应差异细分为多个维度,从而揭示不平等待遇的具体表现。这与现有方法的单一指标评估形成鲜明对比。

关键设计:在关键设计上,Poli-Bias采用了系统性的提示生成策略,确保对比的公平性和有效性。同时,响应分析中引入了五个维度的评估标准,使得偏见的表现形式更加清晰可辨。通过这些设计,Poli-Bias能够提供更为细致和全面的偏见审计。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,在13个不同的LLMs中,国家身份和用户隶属关系显著影响模型对等价行为的描述和评估。具体而言,某些模型在处理特定国家的法律冲突时表现出明显的偏见,揭示了模型在国际法应用中的不平等性。这一发现为模型的审计和改进提供了重要依据。

🎯 应用场景

该研究的潜在应用领域包括国际关系、法律审计和大型语言模型的伦理评估。Poli-Bias框架能够帮助政策制定者和研究人员识别和理解模型中的潜在偏见,从而促进更公正的AI系统设计和应用。未来,随着LLMs在社会各领域的广泛应用,Poli-Bias的影响将愈加显著。

📄 摘要(原文)

Measuring political bias in large language models (LLMs) remains challenging as it can manifest through subtle differences in framing, argumentation, and legal reasoning that are difficult to capture with a single metric. In this work, we introduce Poli-Bias, a counterfactual framework for measuring whether LLMs treat legally equivalent conflict scenarios differently depending on the countries involved. Poli-Bias compares responses to paired prompts in which country identities are systematically swapped across diverse geopolitical relationships, legal violations, and reasoning tasks. Rather than reducing bias to a single judgment, our framework decomposes response disparities into five interpretable dimensions, revealing how and where unequal treatment manifests. Across 13 contemporary LLMs spanning diverse model families and sizes, we find that country identities and user affiliations can systematically affect how equivalent actions are described, evaluated, and defended under international law. Our results thus establish Poli-Bias as a fine-grained framework for auditing political even-handedness and sycophancy in LLMs.