Visual Token Coding for Video Multimodal Large Language Models

📄 arXiv: 2608.28008v1 📥 PDF

作者: Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

分类: cs.CV

发布日期: 2026-08-28

备注: 9 pages, 4 figures

🔗 代码/项目: GITHUB


💡 一句话要点

提出视觉令牌编码以解决视频多模态大语言模型的令牌压缩问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频理解 多模态大语言模型 令牌压缩 动态设计 结构化压缩

📋 核心要点

  1. 现有视频多模态大语言模型在令牌压缩方面存在冗余和性能损失的问题。
  2. 本文提出的视觉令牌编码(VTC)通过预测视频帧并测量残差来实现结构化压缩,提升了令牌利用率。
  3. 实验结果显示,VTC$_{ ext{Dy}}$在多个基准测试中表现优异,显著提高了性能保留率。

📝 摘要(中文)

本文提出了一种新的视频多模态大语言模型令牌压缩范式,称为视觉令牌编码(VTC)。VTC受到经典视频编码原理(如HEVC)的启发,通过预测视频的I/P帧并测量其逐帧残差来估计令牌冗余。在此基础上,本文还通过动态分辨率输入、动态令牌分配和空间覆盖Top-K等新设计增强了VTC,称为$VTC_{Dy}$。实验结果表明,VTC$_{ ext{Dy}}$在Qwen3-VL上以50%的令牌预算实现了100.1%的平均性能保留,且在令牌预算降低至25%时仍保留97.8%的平均性能。此外,VTC作为一种即插即用的设计,无需对多模态大语言模型进行额外调优。代码可在https://github.com/Msr233/VTC获取。

🔬 方法详解

问题定义:本文旨在解决视频多模态大语言模型中令牌冗余和性能损失的问题。现有方法在处理视频数据时,往往无法有效压缩令牌,导致计算资源浪费和性能下降。

核心思路:论文提出的视觉令牌编码(VTC)通过借鉴经典视频编码原理,采用结构化压缩方法,预测视频的I/P帧并测量其残差,从而有效估计和减少令牌冗余。

技术框架:VTC的整体架构包括视频帧预测、残差计算和令牌分配三个主要模块。通过动态调整输入分辨率和令牌分配策略,进一步优化了模型的性能。

关键创新:VTC的核心创新在于其动态设计,包括动态分辨率输入(DyRSO)、动态令牌分配(DyTA)和空间覆盖Top-K(SC-TopK),这些设计使得令牌压缩更加灵活和高效。

关键设计:在参数设置上,VTC采用了自适应的令牌预算分配策略,并通过特定的损失函数来优化模型性能。此外,网络结构上,VTC与现有多模态大语言模型无缝集成,确保了即插即用的特性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,VTC$_{ ext{Dy}}$在Qwen3-VL上以50%的令牌预算实现了100.1%的平均性能保留,且在令牌预算降低至25%时仍保留97.8%的平均性能。这表明VTC在令牌压缩方面的显著优势,能够有效提升模型的性能和效率。

🎯 应用场景

该研究的潜在应用领域包括视频理解、智能监控、自动视频摘要等。通过提高视频多模态大语言模型的效率,VTC可以在资源受限的环境中实现更高效的处理,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

In this paper, we propose a new token compression paradigm for video Multimodal Large Language Models (MLLMs), termed Visual Token Coding (VTC). Inspired by classical video coding principles, e.g., HEVC, VTC performs structured compression by predicting the I/P frames of a video and measuring their frame-wise residuals to estimate token redundancy. Based on this baseline framework, we also enhance VTC with a set of novel dynamic designs, such as Dynamic Resolution Input (DyRSO), Dynamic Token Allocation (DyTA), and Spatial Coverage Top-K (SC-TopK), and term this new approach $VTC_{Dy}$. To validate VTC, we apply it to three MLLMs and conduct experiments on multiple video understanding benchmarks. The experimental results show that VTC$_{\mathrm{Dy}}$ achieves an average performance retention of 100.1% with a 50% token budget for Qwen3-VL, while still retaining 97.8% of the average performance when the token budget is reduced to 25%. Moreover, as a plug-and-play design, VTC requires no additional tuning of MLLMs for token coding. Our code is available at https://github.com/Msr233/VTC.