Reference-Free Post-Training of Open Large Language Models for Multilingual Machine Translation

📄 arXiv: 2608.10812v1 📥 PDF

作者: Chris Han, Pengzhi Gao, Pei Fu, Jian Luan

分类: cs.CL, cs.AI

发布日期: 2026-08-11


💡 一句话要点

提出无参考后训练方法以提升多语言机器翻译质量

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多语言机器翻译 无参考后训练 群体相对策略优化 质量评估模型 线性插值 强化学习 开放大型语言模型

📋 核心要点

  1. 现有的多语言机器翻译方法在翻译质量和灵活性方面存在不足,尤其是在缺乏参考翻译的情况下。
  2. 论文提出了一种基于群体相对策略优化的无参考后训练方法,通过结合质量评估模型和语言识别来优化翻译效果。
  3. 实验结果表明,所提出的MiLMMT-46-v1.0模型在46种语言上均显著提升了翻译质量,超越了多个强基线模型。

📝 摘要(中文)

本研究探讨了使用开放大型语言模型进行多语言机器翻译的无参考后训练。基于监督微调的MiLMMT-46-v0.1模型,采用了群体相对策略优化(GRPO),其奖励机制结合了两个无参考质量评估模型,并通过语言识别进行调控。通过线性插值监督微调(SFT)和强化学习(RL)模型检查点,得到了MiLMMT-46-v1.0。该模型在46种语言上均表现出优于SFT模型的翻译质量,超越了Seed-X、HY-MT2和TranslateGemma等强基线,并在评估的专有系统(如Google Translate、Gemini 3 Pro和GPT-5)中取得领先的无参考得分。我们还研究了在线蒸馏,发现其质量达到但未超越RL与检查点插值所实现的质量前沿。我们发布了模型和代码以促进未来研究。

🔬 方法详解

问题定义:本论文旨在解决多语言机器翻译中缺乏参考翻译时的质量提升问题。现有方法在无参考情况下的翻译效果往往不理想,限制了其应用场景。

核心思路:论文提出了一种无参考后训练的方法,利用群体相对策略优化(GRPO)结合两个无参考质量评估模型的奖励机制,并通过语言识别进行调控,以优化翻译质量。

技术框架:整体流程包括从监督微调的MiLMMT-46-v0.1模型出发,应用GRPO进行后训练,并通过线性插值结合监督微调和强化学习的模型检查点,最终得到MiLMMT-46-v1.0模型。

关键创新:最重要的技术创新在于引入了无参考质量评估模型的奖励机制,并通过语言识别进行动态调控,这与传统的依赖参考翻译的方法有本质区别。

关键设计:在模型设计中,采用了线性插值技术来结合不同训练阶段的模型检查点,确保了模型在多语言翻译任务中的适应性和灵活性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,MiLMMT-46-v1.0模型在46种语言上的翻译质量显著提升,超越了Seed-X、HY-MT2和TranslateGemma等多个强基线,并在无参考得分上领先于Google Translate、Gemini 3 Pro和GPT-5等专有系统,展现出强大的翻译能力。

🎯 应用场景

该研究的潜在应用领域包括多语言翻译系统、跨语言信息检索和国际化软件开发等。通过提升无参考翻译的质量,能够在缺乏高质量参考翻译的情况下,依然提供可靠的翻译服务,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

We study reference-free post-training for multilingual machine translation with open large language models. Starting from the supervised-finetuned MiLMMT-46-v0.1 models, we apply Group Relative Policy Optimization (GRPO) with a reward that averages two reference-free quality estimation models and is gated by language identification. We then linearly interpolate the supervised fine-tuning (SFT) and reinforcement learning (RL) model checkpoints to obtain MiLMMT-46-v1.0. Across 46 languages, the resulting models consistently improve translation quality over their SFT counterparts, outperform strong recent open baselines, including Seed-X, HY-MT2, and TranslateGemma, and achieve leading reference-free scores against evaluated proprietary systems such as Google Translate, Gemini 3 Pro, and GPT-5. We further investigate on-policy distillation and find that it reaches, but does not surpass, the quality frontier achieved by RL with checkpoint interpolation. We release the models and code to facilitate future research.