Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
作者: Siye Wu, Kai Yang, Yuchen Cai, Xin Xu, Peng-Yuan Wang, Jiaxuan Wang, Jiashun Liu, Jiafei Lyu, Yangkun Chen, Saiyong Yang, Yanghua Xiao
分类: cs.CL
发布日期: 2026-08-27
💡 一句话要点
提出三种融合范式以优化多领域强化学习能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化学习 可验证奖励 多领域学习 知识蒸馏 模型融合 性能比较 任务向量
📋 核心要点
- 现有的RLVR方法在多领域能力覆盖上存在挑战,通常需要独立训练领域专家并进行整合。
- 论文提出了三种融合范式:Merge、Mix RL和MOPD,旨在比较它们的性能和适用场景。
- 实验结果显示,尽管平均性能差异不大,但在特定基准上存在显著差距,且所有方法均提高了单样本准确性。
📝 摘要(中文)
强化学习与可验证奖励(RLVR)提升了大语言模型的特定能力,但在多个能力覆盖时,通常需要训练独立的领域专家并随后进行整合。本文组织了三种融合范式:Merge、Mix RL和多教师在线蒸馏(MOPD),并通过共享专家和数据在多领域基准套件上进行比较。尽管它们的平均性能差异最多为1.4分,但在单一基准上差距可达8.6分。训练动态揭示了不同的约束条件,所有三种方法均提高了单样本准确性,而在解决方案覆盖率和保留能力上没有可测量的增益。这些结果提供了实用指南,以选择合适的融合方法。
🔬 方法详解
问题定义:本文旨在解决在多个领域中整合强化学习与可验证奖励(RLVR)能力的挑战,现有方法往往需要独立训练多个领域专家,导致整合复杂且效率低下。
核心思路:提出三种融合范式:Merge通过结合专家任务向量,Mix RL通过混合数据集,MOPD则结合两者。这些方法的设计旨在提高多领域模型的性能和适应性。
技术框架:整体架构包括三个主要模块:Merge用于整合已有专家的知识,Mix RL用于在没有专家的情况下训练统一模型,MOPD则通过教师模型进行知识蒸馏。
关键创新:本文的创新在于系统性地比较这三种融合方法,揭示了它们在性能和训练动态上的差异,提供了选择合适方法的实用指南。
关键设计:在参数设置上,Mix RL依赖于领域混合比例,MOPD受限于教师模型的能力,而Merge则将所有专家更新压缩为一个更新。
🖼️ 关键图片
📊 实验亮点
实验结果表明,三种融合方法在单样本准确性上均有显著提升,尽管在解决方案覆盖率上没有明显增益。其中,Merge方法在已有专家的情况下表现最佳,而Mix RL和MOPD则在不同场景下各有优势。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、机器人控制和多模态学习等,能够帮助提升模型在复杂任务中的表现,具有重要的实际价值和未来影响,尤其是在需要跨领域知识整合的场景中。
📄 摘要(原文)
Reinforcement learning with verifiable rewards (RLVR) improves specific capabilities of large language models, but covering multiple capabilities often involves training separate domain experts and subsequently consolidating them. We organize three fusion paradigms by the artefacts they reuse: Merge combines expert task vectors, Mix RL pools their datasets, and multi-teacher on-policy distillation (MOPD) uses both. Because they have largely been studied in isolation, how they compare and how to choose among them remain unclear. We compare all three using shared experts and data across model scales and a multi-domain benchmark suite. Although their average performance differs by at most 1.4 points, the gap reaches 8.6 points on a single benchmark, with domain-level variation tracking cross-domain relations visible in task-vector geometry. Training dynamics expose distinct constraints: Mix RL depends on domain mixture proportions, MOPD remains bounded by its teachers, and Merge compresses all expert updates into one. All three improve single-sample accuracy without measurable gains in solution coverage or losses in held-out capabilities. These results yield a practical guideline: use Merge when experts already exist and cheap fusion is paramount; Mix RL when training a unified model without experts, with domain proportions adjusted for cross-domain transfer; and MOPD when preserving domain-specific gains matters more than surpassing teachers or minimizing end-to-end cost.