Benchmarking Language Models for Statistical Problem Formulation
作者: Chen Wang, Junzhe Zhao, Xin Cong, Wanlu Deng, Ke Deng
分类: cs.AI
发布日期: 2026-09-02
🔗 代码/项目: GITHUB | HUGGINGFACE
💡 一句话要点
提出StatFormBench以解决统计问题表述的挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 统计问题表述 大型语言模型 数据科学 模型评估 StatFormBench 变量识别 问题分类
📋 核心要点
- 现有方法假设用户已经明确统计分析目标,忽视了用户的非正式目标和异构数据的情况。
- 论文提出将统计问题表述形式化为两个子任务,并构建StatFormBench基准以评估模型性能。
- 实验结果显示,最佳模型在细粒度分类准确率和变量集重叠率上表现有限,提示策略的提升效果不明显。
📝 摘要(中文)
大型语言模型(LLMs)在统计和数据科学工作中越来越多地被用作助手,但现有评估大多假设分析目标已被明确指定。实际上,用户通常带着非正式的目标和异构数据,模型需要决定隐含的统计任务及相关数据。本文首次将这一上游步骤形式化为统计问题表述,并将其分解为两个子任务:统计问题分类和变量识别与角色分配。我们引入了StatFormBench,这是一个基于五本跨领域统计教材和一个数据科学案例库构建的基准,涵盖多种问题类型、数据表示和场景风格,共包含1,013个样本,涵盖20个粗粒度和85个细粒度的统计问题类别。在14个开源和闭源的LLMs中,最佳的零-shot模型仅达到72.0的细粒度分类准确率和63.2的变量集重叠率。没有模型在两个子任务中表现一致最佳,而增强的提示策略仅带来了有限或不一致的提升。我们在Hugging Face上发布了基准数据,并在GitHub上发布了评估代码。
🔬 方法详解
问题定义:本文旨在解决统计问题表述的挑战,现有方法未能有效处理用户的非正式目标和异构数据,导致模型难以确定隐含的统计任务和相关数据。
核心思路:论文的核心思路是将统计问题表述分解为统计问题分类和变量识别与角色分配两个子任务,从而为模型提供清晰的指导。这样的设计使得模型能够更好地理解用户的需求并选择合适的数据。
技术框架:整体架构包括数据收集、问题分类和变量识别三个主要模块。首先,从五本统计教材和数据科学案例库中收集数据,然后对问题进行分类,最后识别变量及其角色。
关键创新:最重要的技术创新点在于首次将统计问题表述形式化,并构建了StatFormBench基准,提供了丰富的样本和多样的统计问题类型,填补了现有评估的空白。
关键设计:在模型评估中,采用了细粒度和粗粒度的分类标准,设置了不同的提示策略以探索其对模型性能的影响,同时确保了数据集的多样性和代表性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,最佳的零-shot模型在细粒度分类准确率上仅达到72.0,变量集重叠率为63.2,显示出当前模型在处理统计问题表述时的局限性。同时,增强的提示策略未能显著提升模型性能,表明该领域仍需进一步研究与改进。
🎯 应用场景
该研究的潜在应用领域包括统计分析、数据科学教育和智能数据处理工具的开发。通过提供更准确的统计问题表述,能够帮助用户更高效地进行数据分析,提升决策支持系统的智能化水平。未来,该方法有望在更广泛的领域中推广应用,促进统计学与人工智能的结合。
📄 摘要(原文)
Large language models (LLMs) are increasingly used as assistants for statistical and data science work, yet existing evaluations largely assume the analysis target is already specified. In practice, users arrive with informal goals and heterogeneous data, leaving the model to decide what statistical task is implied and which data are relevant. We first formalize this upstream step as Statistical Problem Formulation and decompose it into two subtasks: (1) Statistical Problem Classification and (2) Variable Identification & Role Assignment. We then introduce StatFormBench, a benchmark built from five cross-domain statistics textbooks and a data science case library, covering diverse problem types, data representations, and scenario styles. It contains 1,013 samples spanning 20 coarse-grained and 85 fine-grained statistical problem categories. Across 14 open- and closed-source LLMs, the best zero-shot models reach only 72.0 fine-grained classification accuracy and 63.2 variable set overlap. No model performs consistently best across the two subtasks, while enhanced prompting strategies yield only limited or inconsistent gains. We release the benchmark data on Hugging Face at https://huggingface.co/datasets/THU-CongLab/StatFormBench and the evaluation code on GitHub at https://github.com/THU-CongLab/StatFormBench.