Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation
作者: Rodrigo Guedes de Souza, Alison R. Panisson
分类: cs.AI, cs.CL
发布日期: 2026-08-12
备注: 19 pages, 11 figures, 7 tables
💡 一句话要点
提出预算依赖的评估方法以优化大型语言模型排名
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 评估方法 生成预算 模型排名 互补性 预算感知路由器 自然语言处理
📋 核心要点
- 现有的大型语言模型评估方法假设模型排名在不同的推理条件下是稳定的,但实际情况并非如此。
- 本文通过引入预算依赖的评估方法,探索不同生成预算对模型表现的影响,提出了预算感知路由器。
- 实验结果显示,模型排名在不同预算下会逆转,且预算感知路由器能够有效缩小模型间的表现差距。
📝 摘要(中文)
标准的大型语言模型评估假设模型排名在不同推理条件下是稳定的。本文通过在七个生成预算水平(64到4096个标记)上评估四个模型在三个推理基准上的表现,挑战了这一假设。研究发现,3%至19%的项目表现出非单调行为,模型排名在所有基准上随着预算的变化而逆转。通过分析,发现模型之间的互补性在预算受限时最为明显。此外,提出的预算感知路由器在跨领域捕获了14.1%的oracle差距,显示出预算特征在领域内的有效性,但在领域间转移时会造成损失。这些结果为预算条件的评估协议提供了有力的支持。
🔬 方法详解
问题定义:本文旨在解决现有大型语言模型评估方法中模型排名不稳定的问题,尤其是在不同生成预算下的表现差异。现有方法未考虑生成预算对模型表现的影响,导致评估结果可能不准确。
核心思路:论文提出了一种预算依赖的评估方法,通过在不同的生成预算下评估模型,揭示模型表现的非单调性和排名的变化。设计预算感知路由器以优化模型选择,旨在提高评估的准确性和实用性。
技术框架:整体架构包括生成预算的设定、模型评估的实施和预算感知路由器的设计。首先在七个不同的生成预算水平上进行模型推理,然后分析模型表现的变化,最后通过路由器优化模型选择。
关键创新:最重要的技术创新点在于提出了预算感知的评估协议,挑战了传统的模型排名稳定性假设,揭示了模型在不同预算下的互补性和表现差异。
关键设计:在实验中,设置了七个生成预算水平,采用了多种推理基准进行评估。损失函数和网络结构的设计考虑了预算对模型表现的影响,确保了评估的全面性和准确性。通过oracle分析,进一步验证了模型的互补性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在不同的生成预算下,模型排名出现逆转,且3%至19%的项目表现出非单调行为。预算感知路由器在跨领域捕获了14.1%的oracle差距,显示出其在优化模型选择方面的有效性。整体提升幅度在领域内达到1.6至5.7个百分点,但在领域间转移时出现了1.2个百分点的损失。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、对话系统和智能问答等。通过优化大型语言模型的评估方法,可以提升模型在实际应用中的表现,帮助开发更高效的AI系统。未来,该方法可能影响模型选择和评估标准的制定,推动相关领域的研究进展。
📄 摘要(原文)
Standard evaluation of large language models assumes stable model rankings across inference conditions. We challenge this assumption by varying the token generation budget, i.e., the maximum tokens a model may produce, across seven levels (64--4,096), evaluating four models on three reasoning benchmarks (56,476 inferences). We report four findings: (i) 3--19% of items exhibit non-monotone behavior (accuracy decreasing with more budget), even after controlling for truncation, and this phenomenon is model-specific (cross-model overlap: 6--14%). (ii) Model rankings reverse across budgets on all benchmarks ($p {<} 0.01$, McNemar). (iii) Oracle analysis reveals model complementarity up to $+27.8$pp, most pronounced at constrained budgets. (iv) A budget-aware router captures 14.1% of the oracle gap cross-domain; budget features help within-domain ($+1.6$ to $+5.7$pp) but are domain-specific and hurt transfer ($-1.2$pp). These results argue for budget-conditioned evaluation protocols.