RepBench: Compiling Benchmarks into Capability Representations for Large Language Models
作者: Yanshi Li, Xueru Bai, Shuman Liu, Long Zhang
分类: cs.CL, cs.AI
发布日期: 2026-07-30
备注: 22 pages, 8 figures, with appendices. Yanshi Li and Xueru Bai contributed equally
💡 一句话要点
提出RepBench以解决大语言模型能力评估不一致问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大语言模型 能力评估 基准数据集 表示探测 能力聚类 机器学习 自然语言处理
📋 核心要点
- 现有方法在评估大语言模型能力时,通常依赖于特定文献的合成数据,导致结果难以比较和重现。
- 本文提出RepBench,通过构建基于基准的数据层,提供能力对齐的表示探测,增强评估的可靠性和一致性。
- 实验表明,基于多基准的设计在能力向量聚类上表现优异,且不同评估方法之间存在显著差异,提示评估维度的重要性。
📝 摘要(中文)
表示工程在大语言模型中读取和引导能力方向,但现有方法通常在特定文献的合成数据上进行评估,导致测量结果难以比较或重现,且可能反映表面模式而非真实能力。本文提出RepBench,这是一个基于基准的能力对齐表示探测的数据层。通过爬取13,427篇基准论文,构建了182个能力集群的分类法,并收集了353个公共基准数据集,涵盖94种能力,确保每种能力至少有两个独立基准支持。多基准设计减少了对单一来源的依赖,实验结果显示,在12个评估模型中,基准聚合的能力向量展现出较小数量集群的内部聚类最优解,且与人类分类法的低一致性。
🔬 方法详解
问题定义:本文旨在解决现有大语言模型能力评估方法的局限性,特别是依赖于特定文献的合成数据导致的结果不一致和难以重现的问题。
核心思路:提出RepBench作为一个基于基准的能力对齐表示探测的数据层,通过整合多个基准数据集,提供更可靠的能力评估。
技术框架:整体架构包括数据爬取、能力集群分类、基准数据集整合和能力向量聚类等主要模块,形成一个闭环工作流。
关键创新:最重要的创新在于构建了一个包含182个能力集群的分类法,并通过353个公共基准数据集支持94种能力,减少了对单一数据源的依赖。
关键设计:在能力向量聚类中,采用了多基准设计,确保每种能力至少有两个独立基准支持,且在12个模型中展现出较小数量集群的内部聚类最优解。实验中使用的评估方法和聚合标准也被认为是重要的评估维度。
🖼️ 关键图片
📊 实验亮点
实验结果显示,在12个评估模型中,基准聚合的能力向量展现出较小数量集群的内部聚类最优解,且在十个模型中,均值差异法达到了最高的模型级均值,而逻辑回归在能力-模型单元中获胜最多,表明评估方法和聚合标准的选择对结果有显著影响。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、机器学习模型评估和人工智能系统的能力分析。通过提供可靠的能力评估框架,RepBench可以帮助研究人员和开发者更好地理解和优化大语言模型的性能,推动相关技术的进步和应用。
📄 摘要(原文)
Representation engineering reads and steers capability directions in large language models, yet methods are typically evaluated on paper-specific synthetic data. The resulting measurements are difficult to compare or reproduce and may reflect surface patterns rather than capabilities. We present RepBench, a benchmark-grounded data layer for capability-aligned representation probing. Crawling 13,427 benchmark papers yields a taxonomy of 182 capability clusters in 13 families; harvesting 353 public benchmark datasets yields 46,149 audited probe texts covering 94 capabilities, each supported by at least two independent benchmarks. This multi-benchmark design reduces dependence on any single source: raw per-text vectors exhibit no natural cluster granularity, whereas benchmark-pooled capability vectors show an interior clustering optimum at a small number of clusters on all 12 evaluated models, with low agreement to the human taxonomy. Under cross-benchmark transfer evaluation across twelve models completed by all four readouts, difference-in-means attains the highest model-level mean on ten models, while logistic regression wins the most capability-model cells. This disagreement shows that the readout method and aggregation criterion are meaningful evaluation dimensions. The pipeline, corpus, and evaluation code are released as a reusable closed-loop workflow.