Load-Bearing Context: The Question Damage Score for Evaluating Context Reliance in Linguistic Reasoning

📄 arXiv: 2608.27756v1 📥 PDF

作者: Neh Majmudar, Elena Filatova

分类: cs.CL

发布日期: 2026-08-27

备注: 21 pages


💡 一句话要点

提出问题损伤评分以评估语言推理中的上下文依赖性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 上下文依赖 推理能力 问题损伤评分 语言学奥林匹克

📋 核心要点

  1. 核心问题:现有方法难以判断大型语言模型是否依赖上下文信息,导致对其推理能力的理解不足。
  2. 方法要点:论文提出通过删除上下文示例来分析模型的上下文依赖性,并引入问题损伤评分进行评估。
  3. 实验或效果:研究发现,尽管去除了负载上下文,模型仍能正确回答问题,显示出其对上下文的依赖性较低。

📝 摘要(中文)

确定大型语言模型是否从上下文或先前知识中得出答案仍然是一个基本挑战。自包含的语言奥林匹克难题提供了一个受控环境,所有答案均来自专家设计的上下文示例,而不依赖外部知识。通过删除单个上下文示例,我们引入了一种诊断框架来分析个别上下文示例的影响。使用53个英国语言学奥林匹克难题,我们生成了两种修改变体:均匀随机删除和有针对性的删除。我们通过问题损伤评分来分类难题的脆弱性或稳健性。评估三种前沿的LLM时发现,它们在信息不足时很少选择放弃,通常在去除负载上下文后仍能产生正确答案。这些发现激励了对基于上下文的推理、先前知识、记忆和语言推理的进一步研究。

🔬 方法详解

问题定义:论文要解决的问题是如何评估大型语言模型在回答问题时对上下文的依赖性。现有方法未能有效区分模型是否依赖上下文信息或先前知识,导致对其推理能力的理解存在盲点。

核心思路:论文的核心解决思路是通过删除特定的上下文示例来观察模型的表现,从而分析其对上下文的依赖程度。通过引入问题损伤评分,能够量化上下文示例对模型回答的影响。

技术框架:整体架构包括两个主要阶段:首先,使用53个语言学奥林匹克难题生成修改变体;其次,评估模型在不同上下文删除策略下的表现。主要模块包括均匀随机删除和有针对性的删除。

关键创新:最重要的技术创新点在于引入了问题损伤评分这一量化指标,能够有效分类难题的脆弱性与稳健性。这与现有方法的本质区别在于,前者关注上下文的具体贡献,而后者往往忽视了这一点。

关键设计:关键设计包括选择删除的上下文示例,采用均匀随机删除和有针对性删除策略,后者灵感来源于纠错编码,确保删除的示例是承载必要信息的结构性示例。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,在去除负载上下文后,三种前沿的LLM仍能正确回答问题,表明模型对上下文的依赖性较低。这一发现促使对上下文推理和先前知识的进一步研究,具有重要的理论和实践意义。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、教育评估和智能问答系统。通过更好地理解模型的上下文依赖性,可以优化模型设计,提高其在特定任务中的表现,进而推动智能系统的实际应用与发展。

📄 摘要(原文)

Determining whether large language models derive answers from context or prior knowledge remains a fundamental challenge. Self-contained linguistic olympiad puzzles provide a controlled setting where all answers derive solely from expert-designed context examples without external knowledge. Removing individual context examples can eliminate information needed for specific questions while leaving the rest of the puzzle unchanged. We leverage this to introduce a diagnostic framework for analyzing individual context examples. Using 53 UK Linguistics Olympiad puzzles, we generate two modified variants by deleting a single context example: (1) uniform random deletion, and (2) targeted deletion (inspired by error-correcting codes) to remove a structurally load-bearing example uniquely carrying necessary information. We formalize this impact using a Question Damage Score to classify puzzles as fragile or robust. Evaluating three frontier LLMs under instructions to abstain when information is insufficient, we find they rarely abstain, often continuing to produce correct answers after load-bearing context is removed. These findings motivate further investigation into context-based reasoning, prior knowledge, memorization, and linguistic inference. Beyond abstention, the framework enables fine-grained analyses of context reliance, including causal interventions, stopping-set analysis, targeted contamination studies, and mechanistic interpretability.