OmniPack: Unified Token Compression for Efficient Omni-modal Large Language Models

📄 arXiv: 2608.03812v1 📥 PDF

作者: Wanshun Su, Yang Shi, Feihu Liu, Ziwen Yu, Yan Min, Zhuoran Zhang, Qixun Wang, Haotian Wang, Shixuan Liu, Yuanxing Zhang, Peng Wu, Chengfu Huo, Liang Ding

分类: cs.CV

发布日期: 2026-08-04

备注: 16 pages, 5 figures, 15 tables


💡 一句话要点

提出OmniPack以解决多模态大语言模型的高计算开销问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 令牌压缩 音视频理解 结构冗余 语义精炼 计算效率 深度学习

📋 核心要点

  1. 现有的多模态大语言模型在处理冗长音视频令牌序列时,计算开销巨大,且在低令牌预算下性能下降明显。
  2. OmniPack通过在LLM前进行结构压缩和在LLM内进行语义精炼,提出了一种高效的令牌压缩方法,避免了信息丢失。
  3. 在五个基准测试中,OmniPack在不同保留比率下均表现优异,尤其在Qwen2.5-Omni-7B上实现了98.0%的性能保留,同时将FLOPs降低至16.7%。

📝 摘要(中文)

多模态大语言模型(Omni-LLMs)在音视频理解任务中表现出色,但处理冗长且高度冗余的视觉和音频令牌序列会导致显著的计算开销,亟需有效的令牌压缩。现有方法在低令牌预算下往往表现不佳:预处理压缩可能会丢弃结构上重要的全局信息,而内部压缩则未能充分利用查询条件下的音视频协作。为了解决这些问题,本文提出了OmniPack,一个无需训练的框架,协调LLM前的结构压缩与LLM内的任务相关语义精炼。OmniPack通过模态特定的重要性、全局覆盖和相似性感知合并来消除结构冗余,并在充分的多模态交互后,通过文本引导和音视频协作进一步巩固多样化的任务相关表示。大量实验表明,OmniPack在不同保留比率下始终实现最佳的性能效率平衡,超越了所有现有方法。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在处理长音视频令牌序列时的高计算开销问题。现有方法在低令牌预算下往往会丢失重要的结构信息,导致性能下降。

核心思路:OmniPack的核心思路是通过在LLM前进行结构压缩,结合LLM内的任务相关语义精炼,来有效减少冗余信息并保留重要特征。

技术框架:OmniPack的整体架构分为两个主要阶段:首先进行模态特定的重要性评估和相似性感知合并,以消除结构冗余;然后在多模态交互后,通过文本引导和音视频协作进一步精炼表示。

关键创新:OmniPack的关键创新在于其训练自由的设计,能够在不需要额外训练的情况下实现高效的令牌压缩,与现有方法相比,避免了信息丢失和低效利用的问题。

关键设计:在设计中,OmniPack采用了模态特定的重要性评估机制,结合全局覆盖和相似性感知合并策略,确保在压缩过程中保留关键信息,同时优化了多模态交互的效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,OmniPack在Qwen2.5-Omni-7B模型上实现了98.0%的原始性能保留,同时将FLOPs降低至16.7%。在不同保留比率下,OmniPack的性能始终优于所有现有方法,展现了其卓越的效率与效果平衡。

🎯 应用场景

OmniPack的研究成果在音视频理解、智能助手、自动字幕生成等领域具有广泛的应用潜力。通过有效的令牌压缩,能够显著降低计算资源消耗,提高系统的响应速度和用户体验,推动多模态AI技术的实际应用和发展。

📄 摘要(原文)

Omni-modal large language models (Omni-LLMs) have achieved remarkable performance on audio-visual understanding tasks, but processing long and highly redundant visual and audio token sequences incurs substantial computational overhead, demanding aggressive token compression for efficient deployment. Existing methods often degrade at low token budgets: pre-LLM compression may discard structurally important and globally distributed evidence, whereas inner-LLM compression often underexploits query-conditioned audio-visual collaboration. To address these limitations, we propose OmniPack, a training-free framework that coordinates structural compression before the LLM with task-relevant semantic refinement within the LLM. Before the LLM, OmniPack removes structural redundancy through modality-specific importance, global coverage, and similarity-aware merging. After sufficient multimodal interaction, it further consolidates diverse, task-relevant representations through textual guidance and audio-visual collaboration. Extensive experiments on five benchmarks with three Omni-LLM backbones demonstrate that OmniPack consistently achieves the best performance-efficiency trade-off across diverse retention ratios, outperforming all existing methods. Notably, on Qwen2.5-Omni-7B, OmniPack preserves 98.0% of the original performance while reducing FLOPs to 16.7%, and still retains 92.9% of the original performance with only 6.8% of the original FLOPs.