Progressive Multimodal Alignment for Continual Instruction Tuning

📄 arXiv: 2607.26947v1 📥 PDF

作者: Duzhen Zhang, Yahan Yu, Qiaoyi Su, Jiahua Dong, Tielin Zhang

分类: cs.CV, cs.AI

发布日期: 2026-07-29

备注: Accepted by ACM MM2026


💡 一句话要点

提出渐进式多模态对齐以解决持续指令调优中的遗忘问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 持续学习 指令调优 投影器对齐 模型适应性 专家模块 分布变化检测

📋 核心要点

  1. 现有方法主要关注大型语言模型的主干,忽视了投影器级遗忘问题,导致多模态对齐效果下降。
  2. 本文提出渐进式多模态对齐(PMA),通过轻量级描述符检测分布变化,并在需要时扩展投影器专家。
  3. 在两个MCIT基准上进行的实验表明,结合PMA后,模型性能显著提升,超越了现有最先进的方法。

📝 摘要(中文)

多模态大型语言模型(MLLMs)依赖于投影器将视觉表示与语言嵌入空间对齐,这对跨模态理解至关重要。然而,在多模态持续指令调优(MCIT)中,视觉分布的变化和指令语义的演变导致共享投影器的漂移,从而引发投影器级遗忘。为此,本文提出了渐进式多模态对齐(PMA)框架,使投影器能够持续适应,同时保留先前学习的对齐。PMA通过轻量级表示描述符检测多模态分布变化,并仅在需要时逐步扩展投影器专家。一个可扩展的路由器基于多模态特征整合专家输出,同时保留原始预训练投影器作为稳定的对齐锚点。大量实验表明,减轻投影器级遗忘在结合PMA时能显著提升性能。

🔬 方法详解

问题定义:本文旨在解决多模态持续指令调优中的投影器级遗忘问题。现有方法未能有效应对视觉分布变化和指令语义演变,导致对齐效果下降。

核心思路:提出渐进式多模态对齐(PMA)框架,使投影器能够在保持先前学习成果的同时,适应新的多模态分布。通过轻量级描述符检测变化,并在必要时扩展专家模块。

技术框架:PMA框架包括三个主要模块:轻量级表示描述符用于检测分布变化、可扩展的专家模块用于动态调整投影器、以及集成路由器用于整合不同专家的输出。原始投影器作为稳定的对齐锚点,确保模型的稳定性。

关键创新:PMA的核心创新在于其渐进式的对齐机制,能够在保持稳定性的同时实现参数的次线性增长。这一设计与传统方法的静态对齐方式形成鲜明对比。

关键设计:在参数设置上,PMA采用轻量级描述符来实时监测多模态分布的变化,损失函数设计上注重对齐精度与模型稳定性的平衡,网络结构则通过专家模块的动态扩展来实现灵活性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在两个MCIT基准上进行的实验表明,结合PMA后,模型在性能上显著优于现有最先进的方法,具体提升幅度达到X%(具体数据待补充),展示了PMA在减轻投影器级遗忘方面的有效性和广泛适用性。

🎯 应用场景

该研究在多模态学习和持续学习领域具有广泛的应用潜力,特别是在需要实时适应新信息的任务中,如智能助手、自动驾驶和人机交互等。PMA框架的设计理念可以为未来的多模态系统提供更好的对齐和适应能力,提升其智能化水平。

📄 摘要(原文)

Multimodal Large Language Models (MLLMs) rely on a projector to align visual representations with the language embedding space, making it central to cross-modal understanding. In Multimodal Continual Instruction Tuning (MCIT), however, shifting visual distributions and evolving instruction semantics cause this shared projector to drift, leading to projector-level forgetting, an issue largely overlooked by methods that focus primarily on the LLM backbone. We introduce Progressive Multimodal Alignment (PMA), a framework that enables the projector to adapt continually while preserving previously learned alignment. PMA detects multimodal distribution shifts via a lightweight representation descriptor and progressively expands projector experts only when needed. An expandable router integrates expert outputs based on multimodal features, while the original pretrained projector is retained as a stable alignment anchor. This progressive mechanism balances stability and plasticity with sub-linear parameter growth and serves as a method-agnostic add-on to existing MCIT approaches. Extensive experiments on two recent MCIT benchmarks demonstrate that mitigating projector-level forgetting yields consistent gains over prior state-of-the-art methods when combined with PMA. Moreover, PMA scales across diverse MLLM backbones, demonstrating robust and broadly applicable MCIT performance.