Beyond Accuracy: A Multidimensional Evaluation of Statistical Reasoning in Large Language Models

📄 arXiv: 2608.03038v1 📥 PDF

作者: Monnie McGee, Mateo Langston Smith, Julian Cabrera

分类: cs.CL, stat.AP

发布日期: 2026-08-04

备注: 15 pages, 5 tables, 2 figures, presented at JSM 2026 and submitted for publication


💡 一句话要点

提出多维评估框架以提升大型语言模型的统计推理能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 统计推理 大型语言模型 多维评估 结构主题建模 词汇相似性分析 教育技术 智能辅导系统

📋 核心要点

  1. 现有评估方法主要关注大型语言模型的响应准确性,忽视了模型在统计推理中的解释能力和行为特征。
  2. 论文提出了一种多维评估框架,结合了响应准确性、响应行为分析、结构主题建模和词汇相似性分析,以全面评估LLMs的统计推理能力。
  3. 实验结果显示,15个模型的准确性差异显著,结构主题建模揭示了共同的统计推理概念,而词汇相似性分析显示了供应商间的解释风格差异。

📝 摘要(中文)

统计推理是多维的,但对大型语言模型(LLMs)的评估通常只关注响应准确性,而忽视了模型如何构建和传达统计解释。该研究通过结合响应准确性、响应行为、结构主题建模和词汇相似性分析,展示了多维评估的价值。研究应用于15个当前一代LLMs对90个来自高中、本科和研究生水平的统计考试问题的回答。结果显示,模型的准确性差异显著,范围从55%到78%。结构主题建模揭示了所有模型在统计推理上的共同概念组织,而词汇相似性分析则识别出供应商特定的解释风格差异。这些发现表明,现代LLMs的统计推理不能仅通过准确性来表征,并展示了对响应行为和模型生成解释的互补分析如何提供更全面的评估。

🔬 方法详解

问题定义:本研究旨在解决现有对大型语言模型(LLMs)评估方法的单一性,特别是仅关注响应准确性而忽略模型解释能力的问题。

核心思路:论文提出的核心思路是通过多维度的评估框架,综合考虑模型的响应准确性、行为特征及其生成的统计解释,从而提供更全面的评估视角。

技术框架:整体架构包括四个主要模块:响应准确性评估、响应行为分析、结构主题建模和词汇相似性分析。每个模块分别评估模型在统计推理中的不同维度表现。

关键创新:最重要的技术创新在于结合多种评估方法,尤其是结构主题建模和词汇相似性分析,提供了对模型生成解释的深入理解,这与传统的单一准确性评估方法本质上不同。

关键设计:在实验中,使用了90个来自不同教育阶段的统计问题,评估了15个当前一代LLMs的表现,采用了标准化的准确性计算方法和主题建模技术,以确保结果的可靠性和可比性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,15个大型语言模型的响应准确性在55%到78%之间,结构主题建模揭示了所有模型在统计推理上的共同概念组织,而词汇相似性分析则表明同一供应商的模型在解释风格上有更高的相似性。这些发现强调了多维评估的重要性。

🎯 应用场景

该研究的潜在应用领域包括教育技术、智能辅导系统和数据分析工具。通过更全面的评估框架,教育工作者和开发者可以更好地理解和利用大型语言模型在统计推理中的能力,从而提升教学效果和学习体验。未来,该框架也可能推动更广泛的AI模型评估标准的建立。

📄 摘要(原文)

Statistical reasoning is multidimensional, yet evaluations of large language models (LLMs) typically emphasize response accuracy while overlooking how models construct and communicate statistical explanations. This study demonstrates the value of a multidimensional evaluation by combining response accuracy, response behavior, structural topic modeling, and lexical similarity analysis. The framework is applied to explanations generated by 15 current-generation LLMs responding to 90 questions drawn from four statistics examinations spanning high school, undergraduate, and graduate levels. Accuracy varied substantially across models, ranging from 55\% to 78\%. In contrast, structural topic modeling revealed a common conceptual organization of statistical reasoning across all models, while lexical similarity analysis identified modest but consistent vendor-specific differences in explanatory style. Models developed by the same vendor (e.g. Anthropic, OpenAI) produced explanations that were slightly more similar than models from different vendors. These findings demonstrate that statistical reasoning in contemporary LLMs cannot be characterized by accuracy alone and illustrate how complementary analyses of response behavior and model-generated explanations provide a more comprehensive evaluation of statistical reasoning in generative AI.