TempCloze: Can Video-LLMs Identify the Missing Middle?

📄 arXiv: 2609.01515v1 📥 PDF

作者: Wenqi Pei, Henry Hengyuan Zhao, Yilai Liu, Jiahao Meng, Han Chen, Ziyu Wang, Hongyang Du

分类: cs.CV, cs.AI

发布日期: 2026-09-01

备注: EMNLP 2026 Findings


💡 一句话要点

提出TempCloze以解决视频语言模型的时间推理问题

🎯 匹配领域: 支柱六:视频提取与匹配 (Video Extraction)

关键词: 视频理解 时间推理 多模态学习 视频填空 模型评估

📋 核心要点

  1. 现有的视频语言模型在时间推理方面依赖语言,容易受到语言捷径的影响,导致推理准确性不足。
  2. 论文提出TempCloze基准,通过视频填空任务评估模型的视觉时间推理能力,减少语言干扰。
  3. 实验结果显示,模型在语义内容和局部事件进展上表现良好,但在时间对齐方面存在显著瓶颈。

📝 摘要(中文)

视频语言模型(Video-LLMs)的时间推理基准通常依赖语言,可能导致模型利用语言的捷径。为减少这种情况,本文提出了TempCloze,一个视频填空基准,用于评估Video-LLMs的视觉时间推理能力。给定视频的开头和结尾片段,模型需要从四个候选中识别真实的缺失中间部分。TempCloze包含来自七个来源的1,521个经过仔细筛选的视频,主要为长镜头和自我中心视频。我们构建了同源干扰项,从语义、对齐和进展三个维度进行探测,同时共享场景和物体以减少外观线索。对10个专有和21个开源Video-LLMs的评估表明,对齐是主要瓶颈:模型通常能识别合理的语义内容和局部事件进展,但在时间对齐上存在困难。

🔬 方法详解

问题定义:论文要解决的问题是现有视频语言模型在时间推理中容易受到语言捷径的影响,导致推理结果不准确。现有方法在处理视频内容时,往往依赖于语言提示,而忽视了视觉信息的有效利用。

核心思路:论文的核心解决思路是设计一个视频填空基准TempCloze,要求模型在给定视频的开头和结尾片段的情况下,从多个候选中识别缺失的中间部分,从而更好地评估模型的视觉时间推理能力。

技术框架:TempCloze的整体架构包括视频数据的筛选、干扰项的构建和模型评估三个主要模块。视频数据从多个来源收集,并经过严格筛选以确保质量;干扰项则从语义、对齐和进展三个维度进行设计;最后,通过对比评估不同模型的表现。

关键创新:最重要的技术创新点在于构建了同源干扰项,并从多个维度进行设计,减少了模型在推理时对外观线索的依赖。这种设计使得模型必须依赖于时间推理而非语言提示,从而提高了评估的有效性。

关键设计:在设计中,使用了共享场景和物体来减少外观线索的干扰,同时在干扰项的构建中,确保了语义、对齐和进展的多样性,以全面考察模型的推理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,模型在语义内容和局部事件进展的识别上表现良好,但在时间对齐方面的准确率较低,尤其是在TempCloze-Mixed和TempCloze-Hard的测试中,模型的表现差异显著。通过对比分析,发现对齐是主要瓶颈,提示未来研究应聚焦于提升时间对齐能力。

🎯 应用场景

该研究的潜在应用领域包括视频理解、智能监控和自动视频摘要等。通过提升视频语言模型的时间推理能力,可以在多种实际场景中实现更准确的事件识别和分析,具有重要的实际价值和未来影响。

📄 摘要(原文)

Temporal reasoning benchmarks for Video-LLMs are often mediated by language, leaving room for linguistic shortcuts from option wording, answer correlations, or language priors. To reduce such shortcuts, we introduce TempCloze, a video cloze benchmark for evaluating visual temporal reasoning in Video-LLMs. Given the beginning and ending clips of a video, models must identify the true missing middle from four candidates. TempCloze contains 1,521 carefully filtered videos from seven sources, mainly long-take and egocentric videos. We construct same-source distractors along three dimensions: Semantic asks what event should happen, Alignment probes when it should occur, and Progression tests how it should unfold, while shared scenes and objects reduce appearance cues. Our evaluation of 10 proprietary and 21 open-source Video-LLMs reveals Alignment as the primary bottleneck: models often recognize plausible semantic content and local event progression but struggle with temporal alignment. We further conduct error pattern and behavioral sensitivity analyses on TempCloze-Mixed and TempCloze-Hard with four representative models to examine where errors arise and how candidate order, context direction, visible span, frame density, and test-time scaling influence model choices.