Bootstrapping Niche Multilingual Code Translation via Reinforcement Learning with Execution-Based Verifiable Supervision

📄 arXiv: 2608.13854v1 📥 PDF

作者: Kouki Yuki, Jie Zeng, Kyoko Ogawa, Ryunosuke Ikeda, Yohei Kobashi, Takeshi Kojima, Ikuya Yamada, Yusuke Iwasawa, Yutaka Matsuo

分类: cs.CL

发布日期: 2026-08-14

备注: 11 pages, 3 figures, 5 tables. Preprint under review


💡 一句话要点

通过执行验证监督的强化学习实现多语言代码翻译的自举

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 代码翻译 强化学习 多语言处理 执行验证 奖励模型 程序合成 自然语言处理

📋 核心要点

  1. 现有的神经代码翻译方法主要集中在少数流行语言,导致在多语言翻译中监督稀疏,生成的翻译往往不可执行。
  2. 本研究提出了一种基于执行验证的偏好强化学习方法,通过扩展可验证的Python程序生成多语言代码池,从而提高翻译质量。
  3. 实验结果表明,使用Qwen-3.5模型在HumanEval-X++基准上,翻译性能平均提升13%,在中等语言上提升21%。

📝 摘要(中文)

代码翻译必须在多种编程语言中保持可执行行为,但神经代码翻译主要集中在少数流行语言上,如C++、Java和Python。这使得在稀疏的平行监督下,许多对多的设置产生了看似合理但不可执行的翻译。我们通过基于偏好的强化学习和执行验证的监督来解决这一问题。我们的流程首先将可验证的种子Python程序扩展为多语言的执行验证代码池。利用该池,基础大型语言模型生成跨语言对的翻译候选,并根据其执行结果进行标记。最终,我们使用奖励模型优化基础大型语言模型,评估多语言翻译能力的HumanEval-X++基准显示出显著的性能提升。

🔬 方法详解

问题定义:本论文旨在解决多语言代码翻译中的可执行性问题,现有方法在多语言设置下缺乏有效的监督,导致生成的翻译往往不可执行。

核心思路:我们提出了一种基于执行验证的偏好强化学习方法,通过生成可验证的多语言代码池,利用执行结果来指导翻译质量的提升。

技术框架:整体流程包括三个主要阶段:首先,扩展可验证的Python程序生成多语言代码池;其次,利用基础大型语言模型生成翻译候选并标记执行结果;最后,使用奖励模型优化翻译质量。

关键创新:本研究的创新在于结合执行验证的监督与偏好强化学习,建立了一种新的多语言代码翻译框架,显著提高了翻译的可执行性和质量。

关键设计:在模型训练中,我们设置了奖励模型以评分跨语言翻译质量,并采用GRPO方法优化600个语言对的翻译,确保了模型的有效性和可扩展性。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果显示,使用Qwen-3.5 4B模型在HumanEval-X++基准上,平均提升了13%的翻译性能,尤其在中等语言上提升达21%。这些结果表明该方法在多语言代码翻译中的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括软件开发、自动化测试和教育等,能够为多语言编程环境中的代码翻译提供可靠的解决方案。未来,随着更多语言的支持,该方法有望在跨语言编程和多语言协作中发挥重要作用。

📄 摘要(原文)

Code translation must preserve executable behavior across many programming languages, yet neural code translation has largely focused on a few popular languages such as C++, Java, and Python. This leaves a niche, many-to-many setting where parallel supervision is sparse, producing plausible but non-executable translations. We address this setting with preference-based reinforcement learning driven by execution-based supervision. Our pipeline firstly expands verifiable seed Python programs into a multilingual pool of execution-validated codes. Using the pool, a base LLM generates translation candidates across language pairs, which we label by their execution outcomes. The resulting preferences are used to train a reward model that scores cross-language translation quality. Finally, we optimize our base LLMs with GRPO over 600 directed language pairs (25 x 24) using the reward model as a signal. To evaluate the niche translation capability, we introduce HumanEval-X++, an execution-based benchmark that extends HumanEval-X to a broad many-to-many language space. We evaluate our approach using Qwen-3.5 4B and 9B models. On HumanEval-X++ and existing benchmarks, it yields consistent gains over the untrained baselines. In particular, the 4B model achieves an average improvement of 13% across all languages on HumanEval-X++, with a gain of 21% on mid-tier languages. Our study establishes a reliable approach of data generation, training, and benchmarking, paving the way toward further bootstrapping the quality of many-to-many translation for programming languages.