Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision

📄 arXiv: 2609.04203v1 📥 PDF

作者: Shravan Venkatraman, Wenshuai Zhao, Mohammad Hassan Vali, Arno Solin

分类: cs.CV

发布日期: 2026-09-03


💡 一句话要点

提出S$^3$T框架以解决无监督视频状态跟踪问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 无监督学习 视频状态跟踪 自监督蒸馏 时间采样 深度学习

📋 核心要点

  1. 现有方法在视频状态跟踪中依赖于标签和教师信号,限制了其应用的灵活性和效率。
  2. S$^3$T框架通过自监督学习,利用时间采样密度作为信息源,实现无监督状态跟踪。
  3. 实验结果表明,S$^3$T在多个基准上显著提升了状态跟踪的准确性,尤其是在真实视频上表现优异。

📝 摘要(中文)

我们提出了S$^3$T(Self-Supervised Self-Distillation over Time),这是首个完全自包含的连续视频状态跟踪框架。该方法将时间采样密度视为特权信息,基于假设更密集的视图能够更准确地恢复运行状态。稀疏视图的学生模型学习匹配其下一个标记的分布,整个训练过程无需标签、独立教师或奖励信号,且不增加推理成本。在LLaVA-OneVision-2-8B上,S$^3$T作为单一模型提高了VSTAT准确率1.74,经过调整后提升至2.70,而之前的自演化方法对状态跟踪几乎没有改变。该方法从无标签的合成片段中学习的能力能够迁移到真实视频上,VSTAT-YouTube状态跟踪问题的性能提升了7.95,MVBench动作计数提升了4.50。

🔬 方法详解

问题定义:本论文旨在解决无监督视频状态跟踪的问题。现有方法通常依赖于标注数据和教师信号,导致其在实际应用中受到限制,尤其是在缺乏标注的情况下。

核心思路:论文提出的S$^3$T框架利用时间采样密度作为特权信息,假设更密集的视图能够更准确地恢复视频的运行状态。通过这种方式,稀疏视图的学生模型能够学习匹配其下一个标记的分布,从而实现无监督学习。

技术框架:S$^3$T框架包括两个主要部分:教师模型和学生模型。教师模型通过密集视图生成目标分布,而学生模型则通过稀疏视图学习匹配该分布。整个过程无需外部标签或奖励信号,且训练和推理过程的计算成本相对较低。

关键创新:S$^3$T的核心创新在于其完全自监督的学习机制,利用时间采样密度作为信息源,避免了对标签和教师信号的依赖。这一设计使得模型能够在无标签数据上进行有效学习,显著提升了状态跟踪的性能。

关键设计:在模型设计中,采用了特定的损失函数来优化学生模型与教师模型之间的匹配度。此外,模型的参数设置经过精心调整,以确保在不同数据集上的泛化能力和准确性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,S$^3$T在VSTAT准确率上提升了1.74,经过模型调整后提升至2.70,且在真实视频数据集上表现优异,VSTAT-YouTube状态跟踪问题的性能提升了7.95,MVBench动作计数提升了4.50,显著优于之前的自演化方法。

🎯 应用场景

该研究的潜在应用领域包括视频监控、自动驾驶、智能家居等场景,能够在无监督条件下实现高效的视频状态跟踪。其实际价值在于降低对标注数据的依赖,提高模型在真实世界应用中的适应性和灵活性,未来可能推动更多自监督学习方法的发展。

📄 摘要(原文)

We introduce S$^3$T (Self-Supervised Self-Distillation over Time), which, to the best of our knowledge, is the first fully self-contained framework for continuous video state tracking. Our method treats temporal sampling density as privileged information, based on the hypothesis that a denser view of the same clip recovers the running state more accurately. This view serves as the teacher, while a sparse-view student with the same weights learns to match its next-token distribution. The model generates its own target, so training requires no labels, separate teacher, or reward signal, and adds no inference cost. On LLaVA-OneVision-2-8B, S$^3$T improves VSTAT accuracy by $+1.74$ as a single model, $+2.38$ with souping, and $+2.70$ with additional vision-encoder adaptation, while prior self-evolving methods leave state tracking largely unchanged. The capability learned from unlabeled synthetic clips transfers to real videos, improving performance by $+7.95$ on VSTAT-YouTube state-tracking questions and $+4.50$ on MVBench Action Count.