MLLMCLIP: Feature-Level Distillation of MLLM for Robust Vision-Language Representations
作者: Jongsuk Kim, Qiyu Wu, Zhuoyuan Mao, Hiromi Wakaki, Junmo Kim, Yuki Mitsufuji
分类: cs.CV, cs.AI
发布日期: 2026-08-26
备注: EMNLP 2026 Main Conference
💡 一句话要点
提出MLLMCLIP以解决视觉语言模型的组合性问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 视觉语言模型 知识蒸馏 组合性 图像检索
📋 核心要点
- 现有的视觉语言模型在组合性方面存在显著不足,尤其是在处理属性-对象和关系结构时表现不佳。
- 本文提出了MLLMCLIP框架,通过直接从多模态大语言模型蒸馏知识,避免了合成数据的使用。
- 实验结果表明,MLLMCLIP在组合准确性上达到了最先进水平,并在零样本分类和图像-文本检索中表现出一致的性能提升。
📝 摘要(中文)
预训练的视觉语言模型如CLIP在零样本识别中表现优异,但在组合性,尤其是属性-对象和关系结构方面常常失败。近期研究通过合成困难负样本来缓解这一问题,但这会带来显著的管道开销。本文提出了MLLMCLIP,一个异构蒸馏框架,直接从生成的多模态大语言模型(MLLM)教师向判别的CLIP学生转移多模态知识,完全绕过合成数据。为了解决两种范式之间的架构不匹配,本文引入了基于注意力的逐层令牌选择和基于CKA的蒸馏损失。与之前的CLIP增强方法相比,MLLMCLIP在组合准确性上达到了最先进的水平,同时在标准的零样本分类和图像-文本检索上也取得了一致的提升,表明特征级蒸馏增强了组合性和一般视觉语言表示能力。
🔬 方法详解
问题定义:本文旨在解决现有视觉语言模型在组合性方面的不足,尤其是属性-对象和关系结构的处理能力。现有方法依赖于合成困难负样本,导致额外的计算开销和复杂性。
核心思路:MLLMCLIP通过异构蒸馏框架,直接将多模态知识从生成的多模态大语言模型(MLLM)教师转移到判别的CLIP学生,避免了合成数据的使用。这种设计旨在提升模型的组合性和通用性。
技术框架:该框架包括两个主要模块:首先是基于注意力的逐层令牌选择,用于选择最相关的特征;其次是CKA(Centered Kernel Alignment)损失,用于优化蒸馏过程。整个流程通过这两个模块实现知识的有效转移。
关键创新:本文的主要创新在于引入了基于注意力的逐层令牌选择和CKA损失,这与传统的蒸馏方法有本质区别,后者通常依赖于全局特征对齐。
关键设计:在参数设置上,模型采用了多层次的特征选择机制,损失函数则结合了CKA以增强特征间的相似性。此外,网络结构设计上,确保了教师模型与学生模型之间的有效对接。通过这些设计,MLLMCLIP在组合性和通用性上均有显著提升。
🖼️ 关键图片
📊 实验亮点
实验结果显示,MLLMCLIP在组合准确性上达到了最先进的水平,相较于基线方法,零样本分类和图像-文本检索的性能均有显著提升,具体提升幅度未知,表明该方法在视觉语言表示能力方面的有效性。
🎯 应用场景
该研究的潜在应用领域包括智能图像检索、自动图像标注和多模态交互系统。通过提升视觉语言模型的组合性,MLLMCLIP能够在更复杂的场景中实现更准确的理解和交互,具有广泛的实际价值和未来影响。
📄 摘要(原文)
Pretrained vision-language models such as CLIP excel at zero-shot recognition but often fail at compositionality, particularly attribute-object and relational structures. Recent studies mitigate this issue by augmenting training with synthetic hard negatives generated by a cascade of large language models and text-to-image models, which incurs substantial pipeline overhead. We instead propose MLLMCLIP, a heterogeneous distillation framework that transfers multimodal knowledge directly from a generative Multimodal Large Language Model (MLLM) teacher into a discriminative CLIP student, bypassing synthetic data entirely. To bridge the architectural mismatch between the two paradigms, we introduce an attention-based per-layer token selection and a CKA-based distillation loss. Compared to prior CLIP-enhancement methods, MLLMCLIP achieves state-of-the-art compositional accuracy while delivering consistent gains on standard zero-shot classification and image-text retrieval, showing that feature-level distillation strengthens both compositional and general vision-language representation capability.