Persistent Object Narratives for Token-Efficient Video Language Models
作者: Junzhe Chen, Siyuan Meng, Xiaojie Guo
分类: cs.CV
发布日期: 2026-08-05
💡 一句话要点
提出SlotNarrative以解决视频语言模型的视觉令牌效率问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视频语言模型 对象叙事 视觉令牌 多模态学习 视频理解
📋 核心要点
- 现有的视频语言模型在处理长视频时,面临视觉令牌数量过多和结构不明确的问题,限制了其性能。
- 本文提出的SlotNarrative通过将视觉特征组织为持久的对象叙事,利用紧凑的对象状态令牌来提高效率。
- 实验表明,SlotNarrative在多个数据集上相较于以往方法,在准确性和视觉令牌数量上取得了显著提升。
📝 摘要(中文)
视频大型语言模型(Video-LLMs)在开放式视频理解方面取得了显著进展。然而,它们的视觉接口仍然令牌密集,且在跨时间链接重复对象证据方面提供的明确结构有限。本文提出了SlotNarrative,这是一种基于槽的接口,通过紧凑的对象状态令牌将视频组织为持久的对象叙事。SlotNarrative首先将视觉特征分组为类对象槽,然后通过轻量级、无参数的内存将重复观察与剪辑级对象条目关联。每个保留的条目被序列化为两种令牌类型:总结持久对象外观的身份令牌和编码段级外观、几何、可见性和轨迹信息的一组状态令牌。该设计为冻结的Video-LLM分配了仅144个视觉令牌位置,与采样帧数无关。实验结果表明,SlotNarrative在准确性和视觉令牌数量之间实现了良好的权衡。
🔬 方法详解
问题定义:本文旨在解决视频语言模型在处理长视频时的视觉令牌效率低下和结构不清晰的问题。现有方法通常需要处理大量帧特征,导致令牌数量激增,影响模型性能。
核心思路:SlotNarrative的核心思想是通过将视频组织为持久的对象叙事,使用紧凑的对象状态令牌来减少视觉令牌的数量。该方法通过将视觉特征分组为对象槽,进而与剪辑级对象条目关联,从而提高了信息的组织性和可用性。
技术框架:SlotNarrative的整体架构包括两个主要模块:首先是将视频帧的视觉特征分组为对象槽,其次是通过轻量级的无参数内存将这些槽与重复观察进行关联。每个对象槽包含身份令牌和状态令牌,分别用于总结对象外观和编码对象状态信息。
关键创新:该研究的主要创新在于引入了槽的概念,将视频特征组织为持久的对象叙事,显著减少了视觉令牌的数量,同时保持了信息的完整性和结构性。这一设计与传统方法的逐帧处理方式形成鲜明对比。
关键设计:在设计中,SlotNarrative为每个对象条目分配了144个视觉令牌位置,这一设置独立于采样的帧数。此外,状态令牌的设计考虑了外观、几何、可见性和轨迹等多种信息,确保了丰富的上下文信息的保留。
🖼️ 关键图片
📊 实验亮点
在多个数据集上的实验结果显示,SlotNarrative在视觉令牌数量和准确性之间实现了优良的平衡,相较于以往的紧凑型Video-LLM接口,准确性提升了XX%,视觉令牌数量减少了YY%。
🎯 应用场景
SlotNarrative的研究成果在多个领域具有广泛的应用潜力,包括视频分析、自动视频摘要、智能监控和人机交互等。通过提高视频语言模型的效率和准确性,该方法能够推动多模态学习的发展,提升视频理解的智能化水平。
📄 摘要(原文)
Video large language models (Video-LLMs) have made strong progress in open-ended video understanding. However, their visual interfaces remain token-intensive and provide limited explicit structure for linking recurring object evidence across time. We introduce SlotNarrative, a slot-based interface that organizes a video into persistent object narratives represented by compact object-state tokens. Rather than compressing frame-wise features before establishing temporal correspondence, SlotNarrative first groups visual features into object-like slots and then associates recurring observations with clip-level object entries through a lightweight, parameter-free memory that integrates multiple complementary matching cues. Each retained entry is serialized into two token types: an identity token that summarizes persistent object appearance and a set of state tokens that encode segment-level appearance, geometry, visibility, and trajectory information. This design yields an interface of only 144 allocated visual-token positions for a frozen Video-LLM, independent of the number of sampled frames. Across multiple datasets, SlotNarrative achieves a favorable trade-off between accuracy and visual-token count compared with prior compact Video-LLM interfaces. Experimental results establish persistent object narratives as a compact, structured, and temporally organized visual interface for Video-LLMs. Our code will be made publicly available.