I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning

📄 arXiv: 2608.07417v1 📥 PDF

作者: Shibo Gao, Chongxiao Wang, Chenglong Huang, Jie Ma, Haolin Shi, Fei Ding, Jing Li, Qiang Lyu, Yangyang Liu, Yang Liu, Jun Liu, Linlin Huang, Peipei Yang

分类: cs.CV, cs.AI

发布日期: 2026-08-07

备注: Accepted to ACM Multimedia 2026 (MM '26). 6 figures, 5 tables


💡 一句话要点

提出身份条件查询以解决视频推理中的身份匹配问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 身份条件查询 视频推理 多模态输入 行为理解 时间推理 数据集构建 模型训练

📋 核心要点

  1. 现有视频推理方法通常假设简化的视频-文本设置,限制了身份匹配和人中心推理的能力。
  2. 本文提出身份条件查询(ICQ)任务,通过联合关联视频和参考图像,解决身份定位和行为理解等问题。
  3. ISYV-Model在ISYV-Bench上表现优异,尤其在跨域身份匹配和长时间跟踪方面超越了多个基线模型。

📝 摘要(中文)

现实世界的视频推理通常涉及多模态和多源输入,而现有的视频推理任务通常假设简化的视频-文本设置,限制了身份匹配和以人为中心的推理。为了解决这一问题,本文提出了身份条件查询(ICQ)任务,要求模型联合关联和解释输入视频与参考图像,并利用这种条件来解决身份定位、行为理解和时间推理等挑战。基于ICQ,本文提出了ISYV(I Seek You in Videos),包括三个组成部分:ISYV-Bench评估基准、ISYV-75K大规模训练集和ISYV-Framework。大量实验表明,主流的闭源和开源多模态语言模型在ISYV-Bench上表现不佳,尤其是在跨域身份匹配和长时间跟踪方面。ISYV-Model在多个方面超越了强基线,接近闭源性能。总体而言,ISYV为以人为中心的视频推理提供了统一的任务定义、可扩展的数据集/基准和建模见解。

🔬 方法详解

问题定义:本文旨在解决视频推理中的身份匹配和人中心推理问题,现有方法在处理多模态输入时存在局限性,无法有效关联视频与人物身份。

核心思路:提出身份条件查询(ICQ)任务,要求模型同时处理视频和参考图像,通过这种条件化的方式来增强身份定位、行为理解和时间推理的能力。

技术框架:ISYV系统由三个主要组件构成:ISYV-Bench评估基准、ISYV-75K训练集和ISYV-Framework。ISYV-Bench包含1377个复杂视频和问题-答案对,ISYV-75K则是一个大规模的高质量样本集,ISYV-Framework则是针对ICQ的模型和训练策略。

关键创新:最重要的创新在于引入了身份条件查询任务,使得模型能够在多模态输入下进行有效的身份匹配和推理,这与传统的视频-文本推理方法有本质区别。

关键设计:在模型设计中,采用了无额外镜头级注释的训练策略,结合自动标注、多阶段验证和人工审核,确保数据集的高质量和多样性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在ISYV-Bench上,ISYV-Model在跨域身份匹配和长时间跟踪任务中表现优异,超越了多个强基线模型,尤其在身份定位和行为理解方面接近闭源模型的性能,显示出显著的提升。

🎯 应用场景

该研究的潜在应用领域包括监控视频分析、社交媒体内容理解和人机交互等。通过提升视频推理的准确性和效率,ISYV有望在安全监控、智能推荐和自动化客服等实际场景中发挥重要作用,推动相关技术的发展与应用。

📄 摘要(原文)

Real-world video reasoning often involves multimodal, multi-source inputs, whereas existing video reasoning tasks typically assume a simplified video-text setting, limiting identity matching and person-centric reasoning. To bridge this gap, we introduce the Identity-conditioned Queries (ICQ) task, in which models are required to jointly associate and interpret an input video and a reference image of a person, and leverage this conditioning to address identity grounding, behavior understanding, and temporal reasoning, among other challenges. Building on ICQ, we present ISYV (I Seek You in Videos), a systematic solution comprising three components: (1) ISYV-Bench, a challenging evaluation benchmark with 1,377 real-world complex videos and 1,377 question-answer pairs, organized into six difficulty levels spanning capabilities from identity recognition to causal reasoning; (2) ISYV-75K, a large-scale training set of 75K high-quality samples constructed via automated annotation, multi-stage verification, and manual review; and (3) ISYV-Framework, containing an ICQ-oriented model and training strategy for learning to exploit informative video shots without additional shot-level annotations. Extensive experiments show that both mainstream closed-source and open-source MLLMs struggle on ISYV-Bench, especially in cross-domain identity matching and long-horizon tracking. ISYV-Model outperforms strong baselines and in some aspects approaches closed-source performance. Overall, ISYV provides a unified task definition, scalable datasets/benchmarks, and modeling insights for person-centric video reasoning.