Active-SWE: Benchmarking Coding Agents for Proactive Bug Fixing without Issue Reports

📄 arXiv: 2608.04682v1 📥 PDF

作者: Haobin Li, Ping Deng, Weizhong Qian, Liang Jiang, Zhenyu Huang, Mouxing Yang, Xi Peng

分类: cs.SE, cs.AI

发布日期: 2026-08-05

备注: 24 pages, 17 figures


💡 一句话要点

提出Active-SWE以解决缺乏问题报告的主动修复挑战

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 主动修复 编码代理 软件工程 大型语言模型 性能评估 bug发现 任务构建 双轨评估

📋 核心要点

  1. 现有的编码代理评估方法依赖于高质量的问题报告,限制了其在实际应用中的有效性。
  2. Active-SWE基准通过不依赖问题报告,评估编码代理在主动发现和修复多个bug的能力,创新性地扩展了评估范围。
  3. 实验结果显示,大多数现有编码代理在主动修复任务中表现不佳,尤其是在定位和处理多个bug方面。

📝 摘要(中文)

随着大型语言模型(LLMs)在软件工程(SWE)场景中的广泛应用,编码代理能够在大规模代码库中修复特定的bug。然而,现有的SWE基准通常假设高质量的问题报告总是可用,这在实际中因报告获取和整理的复杂性而受到挑战。为此,我们提出了Active-SWE,一个用于评估编码代理在没有报告指导下主动发现和修复多个bug的基准,涵盖了1,663个任务,涉及六个bug类别和八种编程语言。Active-SWE不仅将重点从被动修复转向主动修复,还通过扩展修复范围,提供了更深入的评估。我们提出了一种新颖的难度感知任务构建管道和双轨评估框架,全面评估主动修复能力。实验表明,大多数先进的编码代理在主动修复任务中表现不佳,定位和解决记录的bug、处理多个bug修复场景以及发现有效潜在bug的能力有限。

🔬 方法详解

问题定义:本论文旨在解决现有编码代理在缺乏高质量问题报告时,无法有效进行主动bug修复的问题。现有方法通常假设问题报告是可用的,这在实际中并不成立。

核心思路:论文提出Active-SWE基准,通过不依赖问题报告,评估编码代理的主动bug发现与修复能力,强调从被动修复转向主动修复的必要性。

技术框架:Active-SWE的构建包括一个难度感知的任务构建管道和双轨评估框架。任务构建管道负责生成多样化的bug修复任务,而双轨评估框架则用于全面评估编码代理的表现。

关键创新:最重要的创新在于提出了一个新的评估框架,能够在没有问题报告的情况下,评估编码代理在主动bug修复和潜在bug发现方面的能力,这与现有方法的被动修复评估形成鲜明对比。

关键设计:在任务构建过程中,采用了难度感知的策略,以确保生成的任务具有适当的挑战性。同时,评估过程中使用了多种性能指标,以全面反映编码代理的修复能力。实验中还考虑了多个bug修复场景的复杂性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,大多数先进的编码代理在主动bug修复任务中表现不佳,尤其是在定位和解决记录的bug方面,性能提升幅度有限。这一发现强调了当前技术在主动修复能力上的不足,为未来的研究指明了方向。

🎯 应用场景

该研究的潜在应用领域包括软件开发、维护和质量保证等。通过提升编码代理在缺乏问题报告情况下的修复能力,能够显著提高软件工程的效率和可靠性,减少人工干预的需求,推动自动化软件开发的进程。

📄 摘要(原文)

Coding agents powered by large language models (LLMs) are increasingly adopted in software engineering (SWE) scenarios, capable of fixing a specific bug in large-scale codebase. However, existing SWE benchmarks typically assume that high-quality issue reports with detailed information are always available, which is easily violated in practice due to the complexity of report acquisition and curation. To address this, we introduce Active-SWE, a benchmark for evaluating coding agents on proactively discovering and fixing multiple bugs without report guidance, covering 1,663 tasks across six bug categories and eight languages. Beyond shifting the focus from existing reactive bug fixing to proactive bug fixing, Active-SWE enables a more in-depth evaluation by expanding the scope from fixing a specific recorded bug to multiple-bug fixing and potential bug discovery scenarios. To construct Active-SWE, we propose a novel difficulty-aware task formulation pipeline with a dual-track evaluation framework, facilitating comprehensive evaluation of proactive bug-fixing capability. Extensive experiments reveal that most state-of-the-art coding agents struggle with proactive bug-fixing tasks, demonstrating limited performance in locating and resolving recorded bugs, handling multiple bug fixing scenarios, and discovering valid potential bugs.