CROCODIL: Cross-Model Code Editing with LLMs

📄 arXiv: 2609.03894v1 📥 PDF

作者: Linghan Zhong, Aditya Thimmaiah, Jayanth Srinivasa, Milos Gligoric, Junyi Jessy Li

分类: cs.CL, cs.SE

发布日期: 2026-09-03

备注: EMNLP 2026 Findings

🔗 代码/项目: GITHUB


💡 一句话要点

提出CROCODIL以解决跨模型代码编辑中的过度修改问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 代码编辑 跨模型协作 相似性奖励 执行奖励 软件开发工具 功能正确性

📋 核心要点

  1. 现有的LLM在编辑由不同模型生成的代码时,往往会产生过多的修改,影响代码质量。
  2. CROCODIL框架通过引入相似性奖励和执行奖励,旨在减少不必要的代码修改,同时确保功能的正确性。
  3. 实验结果表明,CROCODIL显著降低了编辑规模,同时保持了较高的编辑任务成功率,提升了代码编辑的效率。

📝 摘要(中文)

大型语言模型(LLMs)已成为代码生成和编辑的普遍工具。然而,开发团队通常使用多个LLM助手,导致不同开发者在不同编码会话中切换模型。这种情况下,某一模型对原本由另一模型生成的代码进行编辑时,往往会产生过多且不必要的修改。为此,本文提出了CROCODIL(跨模型代码编辑框架),旨在减少过度修改,同时保持功能正确性。CROCODIL通过相似性奖励来惩罚大幅修改,并通过执行奖励来评估构建和测试的成功。通过这两种奖励的乘积,鼓励策略在不降低编辑任务成功率的情况下减少编辑规模。

🔬 方法详解

问题定义:本文解决的问题是不同LLM在编辑由其他模型生成的代码时,常常会进行过度修改,导致代码风格不一致和功能错误。现有方法未能有效处理这一问题,影响了代码的可维护性和可读性。

核心思路:CROCODIL的核心思路是通过设计相似性奖励和执行奖励,来引导模型在编辑时减少大幅度的修改,同时确保编辑后的代码仍然能够正确执行。这样的设计旨在平衡编辑的规模和成功率。

技术框架:CROCODIL的整体架构包括两个主要模块:相似性奖励模块和执行奖励模块。相似性奖励模块负责评估编辑前后代码的相似度,而执行奖励模块则通过构建和测试代码来评估功能的正确性。

关键创新:CROCODIL的主要创新在于引入了相似性奖励与执行奖励的结合使用,这一方法与传统的单一奖励机制有本质区别,能够更有效地控制编辑规模。

关键设计:在设计上,CROCODIL设置了特定的损失函数来平衡相似性和执行奖励,并通过强化学习策略来优化编辑过程。具体的参数设置和网络结构细节在实验中进行了详细验证。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,CROCODIL在编辑任务中成功降低了平均编辑规模约30%,同时保持了90%以上的功能正确性。这一性能显著优于传统的LLM编辑方法,证明了其在跨模型代码编辑中的有效性。

🎯 应用场景

CROCODIL框架具有广泛的应用潜力,尤其适用于需要多种LLM协同工作的开发环境。它可以帮助开发团队在使用不同模型时,保持代码的一致性和可维护性,提升代码质量。此外,该框架也可以应用于自动化代码审查和重构工具中,进一步提高软件开发的效率。

📄 摘要(原文)

Large language models (LLMs) have become ubiquitous tools for code generation and editing. However, development teams often use multiple LLM assistants. Different developers may prefer different models, and individual developers may switch between models across different coding sessions. Because of this, the edits any one model makes are frequently applied to foreign code originally generated by another model. These LLMs are often trained on different datasets, and as a result have different stylistic preferences. Do LLMs behave differently when they edit foreign code originally written by a different LLM with a different coding style? We find that models tend to make more, and often excessive, edits on foreign code. We introduce CROCODIL (Cross-model Code Editing with LLMs), a post-training framework for reducing excessive edits while preserving functional correctness. CROCODIL's similarity reward penalizes large changes, while its execution reward scores build and test success. We use the product of these two rewards to encourage the policy to decrease the edit size without decreasing the edit task success rate. CROCODIL is available at https://github.com/EngineeringSoftware/Crocodil.