Projector Is All You Train
作者: Nyx Iskandar, Saathvik Selvan, Slater Victoroff
分类: cs.CL, cs.CV, cs.LG
发布日期: 2026-08-20
💡 一句话要点
提出仅训练投影器以提升多模态大语言模型性能
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态大语言模型 投影器训练 模型微调 3D分类 自动描述生成 训练效率 语言与视觉融合
📋 核心要点
- 现有的多模态大语言模型训练通常需要同时调整语言模型主干和投影器,导致训练复杂且效率低下。
- 本文提出仅通过训练投影器来适应新的模态,避免了对主干的微调,从而简化了训练过程。
- 实验结果表明,仅训练投影器在多模态性能上优于现有基线模型,且训练效率显著提升,样本吞吐量是联合训练的两倍。
📝 摘要(中文)
本文探讨了多模态大语言模型(MLLM)训练过程中是否需要对语言模型主干进行微调。通过对3D MLLM的实验,发现仅训练投影器即可实现强大的多模态性能,优于现有基线模型及联合训练的MLLM。此外,联合训练会导致语言模型现有能力的漂移,而仅训练投影器则避免了这一问题。投影器训练的样本吞吐量约为联合训练的两倍,验证了在3D分类、描述基准以及语言、视觉和空间推理能力的标准基准上的有效性。
🔬 方法详解
问题定义:本文旨在解决多模态大语言模型(MLLM)训练中对语言模型主干微调的必要性问题。现有方法在训练过程中需要同时调整主干和投影器,导致训练复杂且效率低下。
核心思路:论文提出仅通过训练投影器来适应新的模态,认为这种方法能够有效提升多模态性能,同时避免对主干的微调,从而保持语言模型的原有能力。
技术框架:整体架构包括一个语言模型主干和一个模态特定的投影器。训练过程中,投影器负责将语言模型的输出映射到特定模态的特征空间,而主干保持不变。
关键创新:最重要的技术创新在于提出了仅训练投影器的策略,这与传统的联合训练方法本质上不同,后者需要同时调整主干和投影器,可能导致模型能力的漂移。
关键设计:在训练过程中,采用了标准的损失函数和优化算法,确保投影器能够有效地学习到模态特征,同时保持语言模型的稳定性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,仅训练投影器的模型在多模态任务中表现优于现有基线模型,且在3D分类和描述任务中,样本吞吐量约为联合训练的两倍,验证了该方法的有效性和高效性。
🎯 应用场景
该研究的潜在应用领域包括多模态信息检索、智能助手、自动图像描述生成等。通过简化训练过程,能够加速模型的开发与部署,提升多模态系统的实际应用价值,未来可能对人机交互和智能系统的智能化发展产生深远影响。
📄 摘要(原文)
The typical training process of a multimodal large language model (MLLM) involves adapting both the language model backbone and the projector between the backbone and a modality-specific encoder. We ask whether fine-tuning the backbone of an MLLM is necessary to adapt it to a new modality. Through experiments on 3D MLLMs, we find that training only the projector is sufficient to achieve strong multimodal performance relative to existing baseline models and our jointly trained MLLMs with the same encoder and backbone. We also show that joint training leads to undesirable drift in existing capabilities of the language model, which projector-only training avoids by definition. Furthermore, projector-only training has approximately twice the training sample throughput of joint training. We validate our findings across different language model backbones via 3D classification and captioning benchmarks as well as standard benchmarks evaluating language, vision, and spatial reasoning capabilities.