Accuracy and Order Sensitivity Diverge Under Label-Free Strategies

📄 arXiv: 2608.11947v1 📥 PDF

作者: Karl Hanna, Chen Feng

分类: cs.CL, cs.AI

发布日期: 2026-08-12

备注: 20 pages. Code available at https://github.com/cotenthusiast/choicebench


💡 一句话要点

提出无标签策略以解决多选题模型评估中的偏差问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多选题评估 模型偏差 自然语言处理 顺序敏感性 无标签策略

📋 核心要点

  1. 现有多选题评估方法将知识与选项顺序敏感性混淆,导致评估结果不可靠。
  2. 本文提出两种策略来减轻模型对选项顺序的偏差,分别为生成后匹配和孤立评分。
  3. 实验结果表明,虽然未能提高准确性,但循环排列方法在某些情况下能改善模型表现。

📝 摘要(中文)

多选题基准广泛用于评估大型语言模型,但其得分将知识与选项顺序的敏感性混淆,使得评估结果不可靠。本文测试了在模型作答时不显示选项标签是否能消除位置影响并提高性能。我们评估了两种减轻偏差的策略:第一种是生成后匹配的方法,第二种是孤立评分选项的方法。结果显示,两者均未能可靠地提高准确性。完整的分解分析表明,瓶颈在于抑制选项,而非匹配步骤。唯一能持续匹配基线的配置是向模型展示所有选项并配合LLM匹配器。然而,完全消除位置影响仍未能可靠地提高准确性,而循环排列通常能改善结果。对于两阶段提示,召回不平衡的聚合度量和每题的顺序敏感性直接度量均未显示出可靠的去偏效果。

🔬 方法详解

问题定义:本文旨在解决多选题评估中,模型对选项顺序敏感性导致的知识评估不可靠的问题。现有方法未能有效消除这种偏差,影响了评估结果的准确性。

核心思路:论文提出通过不显示选项标签的方式来消除位置影响,进而提高模型的性能。通过两种不同的策略来评估这一思路的有效性。

技术框架:整体架构包括两个主要阶段:第一阶段为生成后匹配,第二阶段为孤立评分选项。每种策略都旨在减少模型对选项顺序的依赖。

关键创新:最重要的创新在于提出了不显示选项标签的策略,并通过完整的分解分析确认了瓶颈在于抑制选项而非匹配步骤。这与现有方法的本质区别在于更关注选项的呈现方式。

关键设计:在实验中,采用了循环排列的方法来评估模型表现,并对两阶段提示的召回不平衡和顺序敏感性进行了直接度量。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,尽管未能通过无标签策略提高准确性,但循环排列方法在某些情况下显著改善了模型的表现。与基线相比,某些配置的性能提升幅度值得关注,尤其是在消除顺序偏差方面。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理中的模型评估和优化,尤其是在多选题和问答系统中。通过改进评估方法,可以更准确地反映模型的知识水平,从而推动更高效的模型训练和应用。

📄 摘要(原文)

Multiple-choice benchmarks are widely used to evaluate large language models, but MCQ scores conflate knowledge with sensitivity to option order, which makes them unreliable measures of model knowledge. In this paper, we test whether preventing a model from seeing option labels while committing to an answer removes positional influence and, in turn, improves performance. We evaluate two different strategies for mitigating bias. The first uses a generation-then-matching approach, and the second scores options in isolation, which is positionally unbiased by construction. Neither reliably improves accuracy. A complete decomposition shows that the bottleneck is withholding options, not the matching step. The only configuration that consistently matches the baseline is the one that shows the model all options paired with an LLM matcher. However, eliminating positional influence entirely still does not reliably yield accuracy gains, while cyclic permutation often improves them. For two-stage prompting, an aggregate measure of recall imbalance and a direct per-question measure of order sensitivity both fail to show reliable debiasing.