YesTrack: Referring Multi-Object Tracking via MLLM-based Yes/No Verification

📄 arXiv: 2609.02318v1 📥 PDF

作者: Quansheng Hu, Qin Sun, Qiansen Dai, Jin Ding, Wan Zhang, Xue Zhou, Jianxiao Zou

分类: cs.CV

发布日期: 2026-09-02

备注: Accepted to ECCV 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出YesTrack以解决多目标跟踪中的语言表达匹配问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多目标跟踪 语言表达理解 多模态大语言模型 判别任务 时间一致性约束

📋 核心要点

  1. 现有的多目标跟踪方法在处理语言表达时,通常依赖外部模块进行决策,导致延迟和效率低下。
  2. YesTrack通过将引用任务转化为判别任务,直接利用MLLM进行是/否验证,避免了文本生成的复杂性。
  3. 在Refer-KITTI和Refer-KITTI-V2上的实验表明,YesTrack在性能上显著超越现有最先进的方法,同时保持高效性。

📝 摘要(中文)

引用多目标跟踪(RMOT)旨在跟踪视频中与给定语言表达匹配的每个实例。尽管最近将多模态大语言模型(MLLMs)整合以增强泛化能力,但现有方法主要将其作为字幕生成器,最终决策依赖外部模块。这种范式不仅引入额外延迟,还严重低估了MLLMs固有的视觉-语言对齐能力。为了解决这些局限性,我们提出了YesTrack,这是一种新颖的两阶段RMOT方法,将引用重新表述为判别任务,直接利用MLLMs进行是/否验证,而无需显式文本生成。我们还引入了两个轻量级的时间一致性约束:时间置信先验(TCP)和时间参考传播(TRP),以进一步增强这种基于MLLM的验证的可靠性和效率。

🔬 方法详解

问题定义:论文旨在解决引用多目标跟踪中现有方法对多模态大语言模型的低效利用,尤其是在决策过程中的延迟和复杂性问题。

核心思路:通过将引用任务重新定义为判别任务,YesTrack直接利用MLLM进行是/否验证,简化了处理流程,提升了效率和准确性。

技术框架:YesTrack采用两阶段的结构,第一阶段进行语言表达的理解,第二阶段进行基于MLLM的验证。此外,引入了时间一致性约束以增强结果的稳定性。

关键创新:最重要的创新在于直接利用MLLM进行判别,而非将其作为生成器,从而充分发挥了其视觉-语言对齐能力,显著提升了跟踪的准确性和效率。

关键设计:在设计中引入了时间置信先验(TCP)和时间参考传播(TRP)作为轻量级约束,以确保在时间维度上的一致性,增强了模型的鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在Refer-KITTI和Refer-KITTI-V2数据集上的实验结果显示,YesTrack在性能上显著优于现有的最先进方法,尤其是在使用最小变体的Qwen3-VL时,仍能保持高效性,具体提升幅度未知。

🎯 应用场景

该研究在视频监控、自动驾驶、智能家居等领域具有广泛的应用潜力,能够提高多目标跟踪的准确性和效率,推动智能视觉系统的发展。未来,YesTrack可能会在更复杂的场景中得到应用,如动态环境下的实时跟踪与识别。

📄 摘要(原文)

Referring multi-object tracking (RMOT) aims to track every instance in a video that matches a given language expression. Despite the recent integration of multimodal large language models (MLLMs) to enhance generalization, existing methods predominantly relegate them to the role of caption generators, necessitating external modules for final decision-making. This paradigm not only introduces extra latency but also severely underutilizes the inherent vision-language alignment capabilities of MLLMs. To address these limitations, we propose YesTrack, a novel two-stage RMOT method that reformulates referring as a discriminative task, directly leveraging MLLMs for Yes/No verification without explicit text generation. To further enhance the reliability and efficiency of this MLLM-based verification, we introduce two lightweight temporal consistency constraints: Temporal Confidence Prior (TCP) and Temporal Reference Propagation (TRP). We further validate the generality of this discriminative paradigm by proposing YesTrack-MOT, a straightforward yet highly effective instantiation for generic multi-object tracking (MOT). Experiments on Refer-KITTI and Refer-KITTI-V2 show that YesTrack significantly outperforms existing state-of-the-art methods while maintaining high efficiency, even when implemented with the smallest variant of Qwen3-VL. Code is released at https://github.com/ggbondrighthere24/YesTrack.