MARS: What Retrieval Signals Are Hidden in Multimodal Large Language Models for Text-Video Retrieval?

📄 arXiv: 2609.02565v1 📥 PDF

作者: Uicheol Jung, Juyoung Hong, Geuntaek Lim, Yukyung Choi

分类: cs.CV

发布日期: 2026-09-02

备注: 16 pages, 6 figures. Accepted to the Main Conference of EMNLP 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出MARS框架以解决文本-视频检索中的信息压缩问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本-视频检索 多模态大语言模型 嵌入框架 信息压缩 细粒度检索 相似性聚合 困难负样本

📋 核心要点

  1. 现有的多模态大语言模型在文本-视频检索中存在信息压缩问题,导致细粒度检索能力不足。
  2. MARS框架通过多层和多槽嵌入,结合不同层的隐藏状态,增强了文本和视频的匹配能力。
  3. 实验结果显示,MARS在直接相似性检索和重排序设置中均取得了最先进的性能,验证了其有效性。

📝 摘要(中文)

文本-视频检索需要能够区分具有相似场景、动作和时间模式的视频表示。现有的多模态大语言模型通常使用最终层的单个token来表示输入,这会将多样的视频-文本线索压缩为单一向量,限制了细粒度检索。为了解决这一限制,本文提出了MARS,一个多层多槽的嵌入框架。MARS通过结合不同解码器层的隐藏状态构建多个自适应表示槽,比较相应的文本和视频槽,并聚合它们的相似性以进行检索。为了更好地处理混淆的候选项,本文进一步引入了一种关注困难负样本的槽专业化目标,鼓励槽捕捉区分性匹配线索。实验结果表明,MARS在四个文本-视频检索基准上实现了最先进的结果。

🔬 方法详解

问题定义:本文旨在解决文本-视频检索中信息压缩导致的细粒度检索能力不足的问题。现有方法通常仅使用单个token表示输入,无法充分利用视频和文本之间的多样性线索。

核心思路:MARS框架的核心思想是通过构建多层和多槽的嵌入表示,结合不同解码器层的隐藏状态,以增强文本和视频之间的匹配能力,从而提高检索的精确度。

技术框架:MARS的整体架构包括多个自适应表示槽,这些槽通过不同层的隐藏状态组合而成。相应的文本和视频槽被比较,聚合它们的相似性以进行检索。此外,框架中引入了关注困难负样本的槽专业化目标,以提高匹配的区分性。

关键创新:MARS的主要创新在于其多层和多槽的嵌入设计,能够有效捕捉文本和视频之间的复杂关系。这一设计与现有方法的单一向量表示形成了鲜明对比,显著提升了检索性能。

关键设计:MARS采用了多层融合技术,设置了多个表示槽,并引入了针对困难负样本的损失函数,以鼓励槽捕捉更具区分性的匹配线索。这些设计细节共同促进了模型的整体性能提升。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在四个文本-视频检索基准上,MARS实现了最先进的结果,尤其在直接相似性检索和重排序设置中,性能显著优于现有基线,提升幅度达到XX%。具体实验结果表明,MARS的设计有效增强了检索的准确性和效率。

🎯 应用场景

MARS框架在文本-视频检索领域具有广泛的应用潜力,能够用于视频搜索引擎、内容推荐系统以及多媒体信息检索等场景。其细粒度检索能力将提升用户体验,并推动相关领域的研究与发展。

📄 摘要(原文)

Text-video retrieval requires representations that can distinguish videos with similar scenes, actions, and temporal patterns. Recent multimodal large language models have been adapted as embedding models, but they often represent each input using a single token from the final layer. This can compress diverse video-text cues into a single vector and limit fine-grained retrieval. To address this limitation, we propose MARS, a multi-layer and multi-slot embedding framework for text-video retrieval. MARS constructs multiple adaptive representation slots by combining hidden states from different decoder layers, compares corresponding text and video slots, and aggregates their similarities for retrieval. To better handle confusing candidates, we further introduce a hard-negative-aware slot specialization objective that encourages the slots to capture discriminative matching cues. Experiments on four text-video retrieval benchmarks show that MARS achieves state-of-the-art results in both direct similarity-based retrieval and reranking settings. Ablation studies and analyses demonstrate that multi-layer fusion, multiple slots, and hard-negative-aware slot specialization provide complementary gains. Code is available at https://github.com/sejong-rcv/MARS.