Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
作者: Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu
分类: cs.AI
发布日期: 2026-08-04
💡 一句话要点
提出风险感知策略优化以解决多模态强化微调中的遗忘问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 强化微调 多模态学习 风险管理 策略优化 持续学习
📋 核心要点
- 现有的强化微调方法在面对任务分布变化时,遗忘现象显著加剧,无法有效管理优化风险。
- 本文提出风险感知策略优化(RAPO),通过双通道框架实现显式风险管理,增强了微调过程的稳定性。
- 在MLLM-CL基准测试中,RAPO相较于基线模型减少了79.8%的遗忘,同时保持了对新任务的竞争力。
📝 摘要(中文)
强化微调(RFT)被广泛认为能够抵抗多模态大语言模型的灾难性遗忘。然而,在任务分布发生显著变化时,现有RFT算法的遗忘现象显著加剧。这主要源于RFT内在的隐式奖励方差正则化,无法有效抑制优化风险。为此,本文提出了风险感知策略优化(RAPO),这是首个用于强化微调的双通道显式风险管理框架。该框架在策略通道上,通过回滚可靠性和Fisher启发的局部预测敏感性自适应调整每个样本的更新幅度;在数据通道上,通过动态风险分层重新组织训练批次,引导优化朝向信息丰富且稳定的样本。RAPO作为一种即插即用的策略,无需跨任务记忆,能够无缝适配任何RFT算法。在公共MLLM-CL基准上,RAPO相较于其RLOO基础模型减少了79.8%的最终遗忘,同时保持了新任务的竞争力。
🔬 方法详解
问题定义:本文旨在解决多模态强化微调中的灾难性遗忘问题,现有方法在任务分布变化时表现出显著的遗忘现象,无法有效管理优化风险。
核心思路:论文提出的风险感知策略优化(RAPO)通过双通道框架实现显式风险管理,分别在策略通道和数据通道上进行优化,以提高微调的稳定性和有效性。
技术框架:RAPO的整体架构包括两个主要模块:策略通道和数据通道。在策略通道中,采用风险感知策略缩放自适应调整每个样本的更新幅度;在数据通道中,使用风险感知动态桶采样重新组织训练批次。
关键创新:RAPO的核心创新在于其双通道框架,首次实现了显式的风险管理,显著区别于现有的隐式奖励方差正则化方法,能够有效抑制优化风险。
关键设计:在策略通道中,更新幅度的调整基于回滚可靠性和局部预测敏感性;在数据通道中,动态风险分层用于重新组织训练样本,确保优化过程朝向信息丰富且稳定的样本进行。
🖼️ 关键图片
📊 实验亮点
在实验中,RAPO在公共MLLM-CL基准上相较于RLOO基础模型减少了79.8%的最终遗忘,显示出显著的性能提升,同时保持了对新任务的竞争力,证明了其有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括多模态大语言模型的持续学习、智能助手、自动化内容生成等。通过有效管理优化风险,RAPO能够提高模型在动态环境中的适应能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Reinforcement fine-tuning (RFT) is widely believed to inherently resist catastrophic forgetting in continual post-training of multimodal large language models. Under pronounced task distributional shifts, however, forgetting across representative RFT algorithms escalates sharply. This stems from the implicit reward-variance regularization inherent to RFT, which proves incapable of suppressing uncontrolled optimization risk. We propose Risk-Aware Policy Optimization (RAPO), the first dual-channel framework for explicit risk governance in continual RFT. On the policy channel, Risk-Aware Policy Scaling adaptively calibrates per-sample update magnitude via rollout reliability and Fisher-inspired local predictive sensitivity; on the data channel, Risk-Aware Dynamic Bucket Sampling reorganizes training batches through dynamic risk stratification, steering optimization toward informative yet stable samples. As a plug-and-play strategy requiring no cross-task memory, RAPO generalizes to any RFT algorithm without modification. On the public MLLM-CL benchmark, RAPO reduces final forgetting by 79.8% relative to its RLOO backbone while retaining new-task competitiveness.