Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

📄 arXiv: 2608.03660v1 📥 PDF

作者: Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu

分类: cs.AI

发布日期: 2026-08-04


💡 一句话要点

提出风险感知策略优化以解决多模态强化微调中的遗忘问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 强化微调 多模态学习 风险管理 策略优化 持续学习

📋 核心要点

  1. 现有的强化微调方法在面对任务分布变化时,遗忘现象显著加剧,无法有效管理优化风险。
  2. 本文提出风险感知策略优化(RAPO),通过双通道框架实现显式风险管理,增强了微调过程的稳定性。
  3. 在MLLM-CL基准测试中,RAPO相较于基线模型减少了79.8%的遗忘,同时保持了对新任务的竞争力。

📝 摘要(中文)

强化微调(RFT)被广泛认为能够抵抗多模态大语言模型的灾难性遗忘。然而,在任务分布发生显著变化时,现有RFT算法的遗忘现象显著加剧。这主要源于RFT内在的隐式奖励方差正则化,无法有效抑制优化风险。为此,本文提出了风险感知策略优化(RAPO),这是首个用于强化微调的双通道显式风险管理框架。该框架在策略通道上,通过回滚可靠性和Fisher启发的局部预测敏感性自适应调整每个样本的更新幅度;在数据通道上,通过动态风险分层重新组织训练批次,引导优化朝向信息丰富且稳定的样本。RAPO作为一种即插即用的策略,无需跨任务记忆,能够无缝适配任何RFT算法。在公共MLLM-CL基准上,RAPO相较于其RLOO基础模型减少了79.8%的最终遗忘,同时保持了新任务的竞争力。

🔬 方法详解

问题定义:本文旨在解决多模态强化微调中的灾难性遗忘问题,现有方法在任务分布变化时表现出显著的遗忘现象,无法有效管理优化风险。

核心思路:论文提出的风险感知策略优化(RAPO)通过双通道框架实现显式风险管理,分别在策略通道和数据通道上进行优化,以提高微调的稳定性和有效性。

技术框架:RAPO的整体架构包括两个主要模块:策略通道和数据通道。在策略通道中,采用风险感知策略缩放自适应调整每个样本的更新幅度;在数据通道中,使用风险感知动态桶采样重新组织训练批次。

关键创新:RAPO的核心创新在于其双通道框架,首次实现了显式的风险管理,显著区别于现有的隐式奖励方差正则化方法,能够有效抑制优化风险。

关键设计:在策略通道中,更新幅度的调整基于回滚可靠性和局部预测敏感性;在数据通道中,动态风险分层用于重新组织训练样本,确保优化过程朝向信息丰富且稳定的样本进行。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,RAPO在公共MLLM-CL基准上相较于RLOO基础模型减少了79.8%的最终遗忘,显示出显著的性能提升,同时保持了对新任务的竞争力,证明了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括多模态大语言模型的持续学习、智能助手、自动化内容生成等。通过有效管理优化风险,RAPO能够提高模型在动态环境中的适应能力,具有重要的实际价值和未来影响。

📄 摘要(原文)

Reinforcement fine-tuning (RFT) is widely believed to inherently resist catastrophic forgetting in continual post-training of multimodal large language models. Under pronounced task distributional shifts, however, forgetting across representative RFT algorithms escalates sharply. This stems from the implicit reward-variance regularization inherent to RFT, which proves incapable of suppressing uncontrolled optimization risk. We propose Risk-Aware Policy Optimization (RAPO), the first dual-channel framework for explicit risk governance in continual RFT. On the policy channel, Risk-Aware Policy Scaling adaptively calibrates per-sample update magnitude via rollout reliability and Fisher-inspired local predictive sensitivity; on the data channel, Risk-Aware Dynamic Bucket Sampling reorganizes training batches through dynamic risk stratification, steering optimization toward informative yet stable samples. As a plug-and-play strategy requiring no cross-task memory, RAPO generalizes to any RFT algorithm without modification. On the public MLLM-CL benchmark, RAPO reduces final forgetting by 79.8% relative to its RLOO backbone while retaining new-task competitiveness.