BC-Bench: Evaluating Agentic Engineering in a Domain-Specific Language for ERP

📄 arXiv: 2608.20851v1 📥 PDF

作者: Haoran Sun, Klaus Marius Hansen

分类: cs.SE, cs.AI

发布日期: 2026-08-21


💡 一句话要点

提出BC-Bench以评估ERP领域特定语言中的代理工程

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 代理工程 企业资源规划 领域特定语言 基准测试 多模态问题 代码生成 测试生成

📋 核心要点

  1. 现有的代理工程系统在通用基准测试中表现良好,但在ERP领域特定语言中的有效性尚未得到充分验证。
  2. 本文提出BC-Bench基准测试,专门用于评估在Microsoft Dynamics 365 Business Central的DSL中进行的代理工程任务。
  3. 实验结果显示,在Bug修复任务中,不同模型的解决率差异显著,表明通用基准的改进未必适用于特定领域。

📝 摘要(中文)

代理工程系统在通用基准测试中表现出色,但在企业资源规划(ERP)领域特定语言(DSL)中的有效性尚未得到充分探索。本文介绍了BC-Bench,一个旨在评估代理工程在Microsoft Dynamics 365 Business Central的DSL中应用的基准测试。BC-Bench包含101个手动策划的任务,反映真实的ERP开发工作流程。我们采用SWE-Bench方法,解决AL生态系统的独特约束,包括有限的公共资源和复杂的环境配置。BC-Bench不仅生成功能代码,还评估测试生成,并支持常见的多模态问题陈述。我们在两个代理框架中评估多个前沿模型,利用多次运行指标来考虑非确定性。在Bug修复类别中,我们的评估设置下,不同模型之间的解决率差异大于两个代理框架之间的差异,且在通用基准上报告的改进并未一致转移到AL。这些结果突显了领域特定评估的必要性。

🔬 方法详解

问题定义:本文旨在解决代理工程在ERP领域特定语言中的评估问题,现有方法在特定领域的有效性尚未得到充分验证。

核心思路:提出BC-Bench基准测试,专注于真实世界的ERP开发任务,适应AL生态系统的独特约束,提供更具针对性的评估。

技术框架:BC-Bench由101个手动策划的任务组成,涵盖功能代码生成、测试生成以及多模态问题陈述,采用SWE-Bench方法进行评估。

关键创新:BC-Bench的设计考虑了AL生态系统的限制,强调领域特定评估的重要性,尤其是在Bug修复任务中展示了不同模型的性能差异。

关键设计:在实验中,采用多次运行指标来处理非确定性,评估不同代理框架下的模型表现,确保评估结果的可靠性和有效性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,在Bug修复任务中,不同模型之间的解决率差异显著,且在我们的评估设置下,模型间的差异大于代理框架间的差异。这表明通用基准的改进未必适用于AL,强调了领域特定评估的必要性。

🎯 应用场景

该研究的潜在应用领域包括企业资源规划系统的开发与优化,能够为ERP开发者提供有效的工具和评估标准,提升开发效率和代码质量。未来,BC-Bench可能推动更多领域特定语言的评估研究,促进代理工程技术的广泛应用。

📄 摘要(原文)

Agentic engineering systems have shown strong performance on general-purpose benchmarks, yet their effectiveness in enterprise resource planning (ERP) domain-specific languages (DSLs) remains underexplored. We introduce BC-Bench, a benchmark designed to evaluate agentic engineering on real-world tasks in AL, the DSL for Microsoft Dynamics 365 Business Central. BC-Bench comprises 101 manually curated tasks extracted from two Microsoft-owned production repositories, reflecting authentic ERP development workflows. Adapting the SWE-Bench methodology, we address the unique constraints of the AL ecosystem---including limited public resources and complex environment provisioning. Beyond generating functional code, BC-Bench evaluates test generation and supports multimodal problem statements where visual context is commonly present. We evaluate multiple frontier models across two agent harnesses, utilizing multi-run metrics to account for nondeterminism. In the Bug Fixing category, under our evaluated settings, between-model differences in resolution rate are larger than differences between the two evaluated agent harnesses, and improvements reported on general-purpose benchmarks do not consistently transfer to AL. These results highlight the need for domain-specific evaluation.