StateTrace: An Object-Centric Framework for Hidden-State Spatiotemporal Reasoning in Long Videos

📄 arXiv: 2608.18532v1 📥 PDF

作者: Yu Han, Wenhao Li, Yichao Cao, Hongyan Xu, Shuo Yang, Shan You, Xiu Su

分类: cs.CV

发布日期: 2026-08-19

备注: 10 pages. Accepted at ACM Multimedia 2026 (ACM MM 2026)


💡 一句话要点

提出StateTrace以解决长视频中的隐状态时空推理问题

🎯 匹配领域: 支柱八:物理动画 (Physics-based Animation)

关键词: 长视频理解 隐状态推理 时空推理 视频语言模型 对象中心框架 状态记忆 视频问答 模型性能提升

📋 核心要点

  1. 现有的视频语言模型在处理长视频时,无法有效推理不可见对象的状态,导致理解能力受限。
  2. 本文提出StateTrace框架,通过构建可重用的时空状态记忆,增强视频语言模型的隐状态推理能力。
  3. 实验结果显示,StateTrace在HSR-Bench上显著提升了VideoLLaMA3的性能,从39.6提升至64.2,验证了其有效性。

📝 摘要(中文)

现有的视频语言模型在视频理解方面表现出色,但在长视频的时空推理中面临挑战,尤其是在目标对象不可见时,常常将“不可见”误解为“未知”。本文定义了这一挑战为隐状态时空推理:在长时间不可见的间隔中,从上下文交互中推断对象状态。为此,本文提出了StateTrace,一个新颖的以对象为中心的框架,赋予视频语言模型显式的隐状态推理机制。StateTrace构建了一个可重用的时空状态记忆,组织对象轨迹、对象间关系和状态转移事件,形成结构化的推理基础。在推理时,它检索与问题相关的状态演变轨迹,并将其转换为紧凑的推理线索,从而使模型能够明确推理对象消失的原因、在不可见状态下的状态演变以及该状态在查询时是否应持续。我们还构建了HSR-Bench,一个用于隐状态推理的诊断基准,包含来自1,384个独特视频的1,427个视频问答样本。大量实验表明,StateTrace在多个视频语言模型上均能显著提升性能。

🔬 方法详解

问题定义:本文旨在解决长视频中的隐状态时空推理问题,现有方法在目标对象不可见时常常无法正确推断其状态,导致理解错误。

核心思路:StateTrace框架通过构建一个可重用的时空状态记忆,组织对象轨迹和状态转移事件,使得模型能够在对象不可见时仍然进行有效推理。

技术框架:StateTrace的整体架构包括状态记忆模块、轨迹检索模块和推理模块。状态记忆模块存储对象的历史状态和交互信息,轨迹检索模块根据问题提取相关的状态演变轨迹,推理模块则基于这些轨迹进行推理。

关键创新:StateTrace的主要创新在于其显式的隐状态推理机制,能够在对象不可见时保持对其状态的推理能力,这与传统方法的隐式推理方式形成鲜明对比。

关键设计:在设计上,StateTrace采用了结构化的状态记忆,利用状态转移事件来捕捉对象间的动态关系,并通过紧凑的推理线索来提高推理效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个视频语言模型的实验中,StateTrace显著提升了模型性能,尤其是在HSR-Bench上,VideoLLaMA3的得分从39.6提升至64.2,显示出其在隐状态推理方面的有效性和优势。

🎯 应用场景

该研究的潜在应用领域包括视频监控、自动驾驶、智能家居等场景,能够提升系统对长视频的理解能力,进而改善人机交互体验和决策支持。未来,该技术有望推动视频分析和理解的进一步发展,尤其是在复杂场景下的应用。

📄 摘要(原文)

Existing VLMs have achieved strong performance in video understanding, yet they struggle with long-video spatiotemporal reasoning when target objects become invisible, often mistaking "invisible" for "unknown". We define this challenge as hidden-state spatiotemporal reasoning: inferring object states during prolonged invisible intervals from context interactions. To address this, we propose StateTrace, a novel object-centric framework that endows VideoLLMs with an explicit mechanism for hidden state reasoning in long videos. StateTrace builds a reusable spatiotemporal state memory that organizes object trajectories, inter-object relations, and state-transition events into a structured reasoning substrate. At inference time, it retrieves question-relevant state-evolution trajectories and converts them into compact reasoning cues, enabling the model to explicitly reason about why an object disappears, how its state evolves while invisible, and whether that state should persist at query time. We further build HSR-Bench, a diagnostic benchmark for hidden-state reasoning, containing 1,427 video-QA samples from 1,384 unique videos. Extensive experiments across multiple VideoLLMs show that StateTrace consistently improves performance on both public benchmarks and HSR-Bench (e.g., improving VideoLLaMA3 from 39.6 to 64.2 on HSR-Bench).