DataClawEval: A Benchmark for Data Engineering Agents in Real Industrial Harness

📄 arXiv: 2607.28033v1 📥 PDF

作者: Debin Meng, Jiaming Yang, Zefang Zong, Tengyue Xu, Haining Xie, Yang Li, Peng Chen

分类: cs.AI

发布日期: 2026-07-30

🔗 代码/项目: GITHUB


💡 一句话要点

提出DataClawEval基准以评估工业数据工程代理的能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数据工程 基准测试 大型语言模型 自动化工作流 执行引擎 确定性评估 工业应用

📋 核心要点

  1. 现有基准主要集中于简化的文本到SQL转换,未能有效评估复杂的端到端数据工程任务。
  2. 提出DataClawEval基准,专门设计用于评估自主代理在真实数据工程场景中的任务完成能力。
  3. 通过评估16个前沿代理,发现最强模型仅获得74.9的评分,显示出领域专业化的局限性。

📝 摘要(中文)

大型语言模型(LLMs)及基于LLM的代理在自动化复杂工作流方面的应用日益增多,预示着数据管理和处理的革命。然而,现有基准主要集中在简化的文本到SQL转换或数据分析上,未能充分探讨端到端数据工程的复杂领域。为此,我们推出了DataClawEval,这是第一个专门设计用于评估自主代理在真实数据工程场景中端到端任务完成能力的综合基准。该基准基于专业企业数据工程师编写的生产级代码,涵盖100个严格的端到端任务,涉及五种执行引擎:PySpark、MySQL、HiveSQL、PrestoSQL/Trino和FlinkSQL。通过在特定案例的隔离沙箱中执行每个任务并使用确定性规则脚本评分,我们评估了16个前沿代理,揭示了关键的局限性:最强模型仅获得74.9的整体评分,且没有单一模型占据主导地位,显示出严格的领域专业化而非全能的能力。因此,自主数据工程仍然是一个艰巨且未解决的挑战。我们在https://github.com/Dicemy/DataClawEval/tree/master发布了数据集、容器化环境和确定性评估脚本。

🔬 方法详解

问题定义:本论文旨在解决现有基准在评估端到端数据工程任务时的不足,尤其是缺乏对复杂真实场景的考量。现有方法多集中于简化的任务,未能反映实际应用中的挑战。

核心思路:论文提出DataClawEval基准,专注于真实工业环境中的数据工程任务,利用专业工程师编写的生产级代码,确保任务的真实性和复杂性。

技术框架:整体架构包括任务设计、执行引擎选择、隔离沙箱执行和确定性评分四个主要模块。每个任务在特定环境中执行,确保结果的可靠性和可重复性。

关键创新:最重要的创新在于采用确定性规则脚本进行评分,而非依赖于非确定性的LLM评分。这种设计确保了评估的客观性和一致性。

关键设计:在任务设计中,涵盖了多种执行引擎,确保了任务的多样性和复杂性。评分系统采用规则基础的脚本,确保每个任务的执行和评估都是可控和可验证的。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,评估的16个前沿代理中,最强模型仅获得74.9的整体评分,且没有单一模型在所有执行引擎上表现优异,揭示了领域专业化的现象。这一发现强调了自主数据工程的复杂性和挑战性。

🎯 应用场景

该研究的潜在应用领域包括企业数据管理、数据分析自动化和智能决策支持等。通过提供一个全面的评估基准,DataClawEval能够帮助研究人员和工程师更好地理解和提升自主数据工程代理的能力,推动相关技术的发展和应用。

📄 摘要(原文)

Large language models (LLMs) and LLM-based agents are increasingly being deployed to automate complex workflows, promising to revolutionize data management and processing. However, existing benchmarks predominantly focus on simplified Text-to-SQL translation or data analysis, leaving the critical and complex domain of end-to-end data engineering largely unexplored. To bridge this gap, we introduce DataClawEval, the first comprehensive benchmark designed specifically to evaluate the end-to-end task completion capabilities of autonomous agents in real-world data engineering scenarios. Built upon production-grade code authored by professional enterprise data engineers, it comprises 100 rigorous, end-to-end tasks spanning five execution engines: PySpark, MySQL, HiveSQL, PrestoSQL/Trino, and FlinkSQL. Rather than non-deterministic LLM-as-a-judge scoring, each task is executed within a case-specific, isolated sandbox and graded by deterministic, rule-based scripts. Evaluating 16 frontier agents exposes critical limitations: The strongest model attains only 74.9 overall, and no single model dominates, as each excels on a different engine, revealing strict domain specialization rather than omnipotent proficiency. Thus, autonomous data engineering remains a formidable, unresolved challenge. We release our dataset, containerized environments, and deterministic evaluation scripts at https://github.com/Dicemy/DataClawEval/tree/master