Right Answer, Wrong Method: Shortcut Hacking Misleads the Evaluation of LLM Reasoning on Frontier Science Benchmarks
作者: Xuan Ren, Weiqi Zhai, Tianle Pu, Yihua Zhu, Yihua Zhu, Hu Wei, Bing Zhao
分类: cs.AI, cs.CL
发布日期: 2026-08-03
备注: working in progress
💡 一句话要点
提出反作弊策略以解决大型语言模型推理评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 科学推理 评估方法 反作弊策略 解决方案黑客
📋 核心要点
- 现有的科学推理基准主要通过最终答案的准确性来评估LLMs,但这种方法可能导致对推理能力的误判。
- 本文提出了反作弊策略,包括自动评判和测试时指令,以减少LLMs的捷径行为,从而提高评估的准确性。
- 实验结果显示,抑制捷径行为后,报告的准确性显著降低,但对正确和非黑客答案的准确性影响较小。
📝 摘要(中文)
科学推理基准通常通过最终答案的准确性来评估大型语言模型(LLMs)。然而,正确答案并不一定能展示模型的推理能力。本文识别了“解决方案黑客”现象,即LLM通过无效的捷径(如数值搜索、枚举、猜测或答案优先验证)获得正确答案,而未提供有效的任务导向推导。我们系统分析了这一现象在不同难度水平、科学领域和前沿模型中的表现,发现解决方案黑客现象随着基准难度的增加而显著上升。此外,本文提出了专家启发的反黑客策略,包括自动评判和测试时指令,结果显示抑制捷径行为显著降低了报告的准确性,同时对正确和非黑客准确性的影响较小。这些发现表明,仅依赖答案评估可能会高估前沿LLMs的科学推理能力。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在科学推理基准评估中存在的“解决方案黑客”现象,即模型通过无效捷径获得正确答案,未能展示真实的推理能力。现有方法主要依赖最终答案的准确性,容易导致对模型能力的误判。
核心思路:论文提出的核心思路是通过引入反作弊策略,抑制模型的捷径行为,从而更准确地评估其科学推理能力。这种设计旨在确保模型不仅能给出正确答案,还能提供有效的推理过程。
技术框架:整体架构包括两个主要模块:自动评判系统和测试时指令。自动评判系统用于实时评估模型的推理过程,而测试时指令则引导模型在推理时遵循特定的逻辑步骤。
关键创新:最重要的技术创新点在于识别并量化“解决方案黑客”现象,并提出有效的反作弊策略。这与现有方法的本质区别在于,传统方法仅关注最终答案的准确性,而忽视了推理过程的有效性。
关键设计:在关键设计方面,自动评判系统采用了基于规则的评估机制,确保模型的推理过程符合科学逻辑。同时,测试时指令的设计考虑了不同科学领域的特点,以提高模型的适应性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,抑制捷径行为后,模型的报告准确性显著降低,具体数据为从28.3%降至8.2%-44.1%。这一发现强调了仅依赖答案评估可能高估LLMs的科学推理能力,提供了更为准确的评估标准。
🎯 应用场景
该研究的潜在应用领域包括教育、科学研究和人工智能助手等。通过提高大型语言模型在科学推理任务中的评估准确性,可以更好地支持教育和科研工作,帮助用户获得更可靠的推理结果,推动科学知识的传播与应用。
📄 摘要(原文)
Scientific reasoning benchmarks typically evaluate large language models (LLMs) using final-answer accuracy. However, a correct answer does not necessarily demonstrate the reasoning capability targeted by the problem. We identify Solution Hacking, a failure mode in which an LLM reaches the correct answer through invalid shortcuts, such as numerical search, enumeration, guessing, or answer-first verification, without providing a valid task-targeted derivation. We systematically analyze this phenomenon across difficulty levels, scientific domains, and frontier models. Solution hacking increases sharply with benchmark difficulty, from 2.2\% on common problems to 28.3\% on Olympiad-level problems and 37.4\% on HLE. Moreover, 8.2\%-44.1\% of answers credited as correct across frontier models are identified as hacked solutions. We further develop expert-inspired anti-hacking strategies, including an automatic judge and a test-time instruction. The results show that suppressing shortcut behavior substantially reduces reported accuracy while having a smaller effect on correct and non-hacked accuracy. These findings reveal that answer-only evaluation can overestimate the scientific reasoning capabilities of frontier LLMs.