CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding
作者: Jing Jiang, Yiran Ling, Ruonan Li, Dimitrios Stamoulis, Jie Liu
分类: cs.CV
发布日期: 2026-09-03
💡 一句话要点
提出CoFiE框架以解决流媒体视频理解中的效率问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 流媒体视频理解 视觉语言模型 证据选择 效率优化 新颖性引导 查询特定精炼 多模态学习
📋 核心要点
- 现有方法在视觉编码后进行标记修剪,无法有效降低流媒体视频理解的端到端延迟。
- 提出CoFiE框架,通过粗略过滤和细致精炼两个阶段,优化证据选择过程,提高效率。
- 实验结果显示,CoFiE在多个基准测试中实现了新的准确性和效率的平衡,提升幅度可达3.15%。
📝 摘要(中文)
流媒体视频理解要求视觉语言模型在严格的延迟限制下处理不断增长的视频流并回答用户问题。现有方法主要通过视觉编码后的标记修剪和内存库方案提高效率,但在视觉编码后进行的下游标记修剪无法显著降低端到端延迟。为此,本文提出了CoFiE框架,将证据选择分为粗略的、与查询无关的过滤阶段和细致的、与查询相关的精炼阶段。CoFiE引入了新颖性引导的帧过滤,以保留视觉上独特的候选帧,并在LLM预填充期间进行查询特定的证据精炼。实验表明,CoFiE在多个视频理解基准上建立了新的准确性-效率权衡,准确率达到78.86%和68.72%,并在高达80%的证据帧过滤下,提升了端到端推理延迟。
🔬 方法详解
问题定义:本文旨在解决流媒体视频理解中的效率问题,现有方法在视觉编码后进行标记修剪,导致无法显著降低端到端延迟。
核心思路:CoFiE框架通过将证据选择分为粗略过滤和细致精炼两个阶段,优化了处理流程,减少了不必要的计算。
技术框架:整体架构包括两个主要阶段:第一阶段为粗略的、与查询无关的帧过滤,第二阶段为查询特定的证据精炼,确保在获取语义信息后进行有效选择。
关键创新:引入新颖性引导的帧过滤和查询特定的证据精炼,显著减少了在视觉编码前的冗余计算,与现有方法相比,提升了效率和准确性。
关键设计:在设计中,采用了新颖性引导机制以保留视觉上独特的帧,并在LLM预填充阶段进行查询相关的精炼,确保了高效的处理流程。
🖼️ 关键图片
📊 实验亮点
实验结果表明,CoFiE在StreamingBench和OvO-Bench上分别达到了78.86%和68.72%的准确率,相较于之前的方法提升了3.15%。在高达80%的证据帧过滤下,CoFiE的端到端推理延迟提高了2.54倍,展现出显著的性能优势。
🎯 应用场景
该研究的潜在应用领域包括视频监控、在线教育和实时视频分析等场景,能够有效提升流媒体内容的理解和处理效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Streaming video understanding requires Vision Language Models (VLLMs) to process growing video streams and answer user questions under tight latency constraints. Existing methods improve efficiency through token pruning and memory-bank schemes, but mainly reduce visual tokens after visual encoding. Consequently, downstream token pruning alone cannot substantially reduce end-to-end latency because the expensive frame encoding cost has already been incurred. We propose CoFiE, a Coarse-to-Fine Evidence Selection framework that decouples evidence selection into a coarse, query-agnostic filtering stage before the vision encoder and a fine, query-specific refinement stage during LLM prefill. CoFiE introduces Novelty-Guided Frame Filtering to retain visually distinctive candidate frames and Query-Specific Evidence Refinement to select the frames most relevant to the user query. This design removes substantial redundancy before frame encoding while preserving query-specific refinement once semantic information becomes available. Experiments show that CoFiE establishes a new state-of-the-art accuracy-efficiency trade-off across multiple video understanding benchmarks, reaching 78.86% accuracy on StreamingBench and 68.72% on OvO-Bench, with improvements of up to 3.15% over prior methods. Even with up to 80% evidence-frame filtering, CoFiE outperforms strong open-source multimodal models while improving end-to-end inference latency by up to 2.54 times.