Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores
作者: Qiyao Yan, Chenpeng Wang, Liangming Pan
分类: cs.AI
发布日期: 2026-08-31
备注: 20 pages, 4 figures, and 43 appendix tables. Research paper on language-model interpretability, reasoning evaluation, output-scoring bottlenecks, and label-free calibration. The paper evaluates controlled three-way logical reasoning tasks, ProofWriter, ANLI, and FOLIO using Qwen3.5, OLMo-2-1B, Llama-3.1-8B, and Pythia checkpoints
💡 一句话要点
提出一种新方法以恢复大语言模型的推理能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 推理能力 隐藏状态探测 加法修正 模型评估
📋 核心要点
- 现有方法常常将推理失败归因于模型能力不足,忽视了潜在的输出瓶颈问题。
- 论文提出了一种新的诊断协议,通过最小的加法修正来恢复模型的推理能力,验证实例特定逻辑的存活性。
- 实验结果显示,使用该方法可以显著提升模型的准确率,尤其在处理困难实例时表现优异。
📝 摘要(中文)
当大型语言模型在推理任务中失败时,通常认为其缺乏基本能力。然而,这种看法混淆了真正的推理缺失与输出瓶颈。我们观察到,在多种推理基准中存在一致的读取差距:隐藏状态探测器能够成功解码正确答案,即使原生序列评分因结构偏差完全崩溃。为测试实例特定的逻辑是否在崩溃中存活,我们引入了一种诊断协议,使用最小的、无目标标签的加法修正。仅在25个未标记示例上拟合两个参数,便能为Qwen3.5模型恢复9至34个准确率点,并成功迁移至OLMo-2-1B和Llama-3.1-8B。重要的是,这些恢复的决策在简单的词汇重叠无法解决的困难实例上依然有效,且显著超过了计数保持的置换基线。我们的结果表明,许多表面上的零-shot推理缺陷实际上是表达失败,掩盖了内部逻辑的完整性,促使我们对基准评估的解释更加狭窄。
🔬 方法详解
问题定义:本论文旨在解决大型语言模型在推理任务中表现不佳的问题,现有方法往往将失败归因于模型能力的缺失,而忽视了可能的输出瓶颈。
核心思路:论文的核心思路是通过引入一种无目标标签的加法修正,来恢复模型在推理任务中的表现,验证模型内部逻辑是否依然存在。
技术框架:整体架构包括两个主要模块:首先是隐藏状态探测器用于解码正确答案,其次是通过最小的参数调整来实现加法修正。
关键创新:最重要的技术创新在于提出了一种新的诊断协议,能够在模型输出崩溃的情况下,恢复其推理能力,这与现有方法的根本区别在于不依赖于目标标签。
关键设计:在实验中,仅需在25个未标记的示例上拟合两个参数,便能显著提升模型的准确率,具体的参数设置和损失函数设计在论文中有详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用新方法后,Qwen3.5模型的准确率提升了9至34个点,并成功迁移至其他模型,如OLMo-2-1B和Llama-3.1-8B。这些恢复的决策在处理困难实例时表现优异,显著超过了计数保持的置换基线。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能问答系统和教育技术等。通过恢复模型的推理能力,可以提升这些系统在复杂任务中的表现,具有重要的实际价值和未来影响。
📄 摘要(原文)
When a large language model fails a reasoning task, it is often assumed to lack the underlying capability. However, this conflates a genuine absence of reasoning with a late-stage output bottleneck. We observe a consistent readout gap across diverse reasoning benchmarks: hidden-state probes successfully decode correct answers even when native sequence scoring completely collapses due to structural biases. To test whether instance-specific logic survives this collapse, we introduce a diagnostic protocol using a minimal, target-label-free additive correction. Fitting just two parameters on as few as 25 unlabeled examples recovers 9--34 accuracy points for Qwen3.5 models, transferring successfully to OLMo-2-1B and Llama-3.1-8B. Crucially, these recovered decisions persist on hard instances unresolved by simple lexical overlap and significantly exceed count-preserving permutation baselines. Our results show that many apparent zero-shot reasoning deficits are expression failures masking intact internal logic, urging a narrower interpretation of benchmark evaluations.