MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge

📄 arXiv: 2608.23234v1 📥 PDF

作者: Liangtao Shi, Jinxia Xie, Xiantao Hu, Ting Liu

分类: cs.CV

发布日期: 2026-08-24

备注: 5 pages


💡 一句话要点

提出无训练框架以解决音频引导的视频目标分割问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音频引导 视频目标分割 多模态大语言模型 无训练框架 SAM模型 目标掩膜生成 LSVOS挑战赛

📋 核心要点

  1. 现有方法在音频引导的视频目标分割中通常需要大量的训练和微调,限制了其应用的灵活性和效率。
  2. 本研究提出了一种无训练框架,通过将多模态大语言模型与基于SAM的分割模型相结合,来实现音频引导的视频目标分割。
  3. 在第八届LSVOS挑战赛的MeViS-Audio Track中,我们的方法表现出色,展示了其在音频引导视频分割任务中的有效性。

📝 摘要(中文)

在本技术报告中,我们提出了一种无训练框架,用于音频引导的视频目标分割,该框架将多模态大语言模型(MLLMs)与基于SAM的分割模型相结合。我们将任务分解为多个阶段,并为每个阶段识别合适的基础模型。在不引入额外模型训练或任务特定微调的情况下,我们的方法利用MLLMs强大的多模态推理能力来建模文本与视觉的对应关系,并采用基于SAM的模型进行准确的目标掩膜生成。所提出的框架展示了利用基础模型进行音频引导视频分割的有效性,并在第八届LSVOS挑战赛的MeViS-Audio Track中取得了竞争力的表现。

🔬 方法详解

问题定义:本论文旨在解决音频引导的视频目标分割问题,现有方法通常依赖于大量的训练和微调,导致灵活性不足和效率低下。

核心思路:我们提出的框架不需要额外的模型训练,而是利用多模态大语言模型(MLLMs)强大的推理能力,结合基于SAM的模型进行目标掩膜生成。

技术框架:整体架构分为多个阶段,每个阶段选择合适的基础模型。首先,利用MLLMs建模文本与视觉的对应关系,然后通过SAM模型生成准确的目标掩膜。

关键创新:本研究的创新点在于提出了一种无训练的音频引导视频分割框架,显著降低了对训练数据的依赖,与传统方法相比具有更高的灵活性和效率。

关键设计:在模型设计上,我们选择了适合各个阶段的基础模型,并确保在不进行任务特定微调的情况下,仍能实现高效的目标分割。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

在第八届LSVOS挑战赛的MeViS-Audio Track中,我们的方法取得了第三名的优异成绩,展示了在音频引导视频目标分割任务中的竞争力,具体性能数据与基线相比有显著提升。

🎯 应用场景

该研究的潜在应用领域包括智能监控、视频编辑和自动化内容生成等。通过提供一种无训练的音频引导视频分割方法,可以在多种场景中实现更高效的目标识别和处理,具有重要的实际价值和未来影响。

📄 摘要(原文)

In this technical report, we present a training-free framework for audio-guided video object segmentation, which integrates Multimodal Large Language Models (MLLMs) with SAM-based segmentation models. We decompose the task into several stages and identify suitable foundation models for each stage. Without introducing additional model training or task-specific fine-tuning, our approach leverages the strong multimodal reasoning capabilities of MLLMs to model text-visual correspondence and employs SAM-based models for accurate object mask generation. The proposed framework demonstrates the effectiveness of leveraging foundation models for audio-guided video segmentation and achieves competitive performance in the MeViS-Audio Track of the 8th LSVOS Challenge.