Allocation Before Ranking: Decoupled Token Compression for OmniLLMs

📄 arXiv: 2608.01665v1 📥 PDF

作者: Zhenghui Guo, Yilin Yang, Yuanbin Man, Miao Yin, Weidong Shi, Rabimba Karanjai, Omprakash Gnawali, Chengming Zhang

分类: cs.AI, cs.SD

发布日期: 2026-08-03


💡 一句话要点

提出Macer以解决OmniLLMs中的令牌压缩问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态学习 令牌压缩 资源分配 音频视频融合 深度学习

📋 核心要点

  1. 现有的OmniLLMs令牌压缩方法将问题简化为单一的显著性排名,导致资源分配不均,音频令牌优先于视频令牌。
  2. Macer通过为音频和视频分配明确的预算,先进行分配再进行排名,从而解决了现有方法的不足。
  3. 在多个基准测试中,Macer在25%的保留率下,分别在Qwen2.5-Omni-7B和Qwen2.5-Omni-3B上保持了98.7%和97.3%的性能,且在OmniVinci-9B上提升了12.9个点。

📝 摘要(中文)

在OmniLLMs中,令牌压缩通常被视为单一的显著性排名问题:对每个多模态令牌进行评分,保留前K个。我们认为这种抽象存在误导。相同的注意力评分同时决定了每种模态的保留容量和保留的令牌。共享的前K规则因此倾向于音频,导致音频令牌在视频令牌竞争之前就消耗了保留容量。我们提出Macer,这是一种无训练的压缩器,首先为音频和视频分配明确的预算,然后在每种模态的特定浅层中进行归一化排名。Macer显著降低了令牌成本,同时在多个基准上保持了准确性。

🔬 方法详解

问题定义:论文要解决的具体问题是OmniLLMs中令牌压缩的资源分配不均,现有方法将显著性评分视为单一排名,导致音频优先于视频的资源分配。

核心思路:论文的核心解决思路是Macer压缩器,它首先为音频和视频分配明确的预算,然后在每种模态的特定浅层中进行归一化排名,以确保公平竞争。

技术框架:Macer的整体架构包括两个主要阶段:第一阶段是为每种模态分配预算,第二阶段是在各自的浅层中进行归一化排名,确保每种模态的令牌都能在公平的条件下进行竞争。

关键创新:Macer的最重要技术创新在于其分离的资源分配与排名过程,与现有的共享前K排名方法本质上不同,避免了音频令牌的优先分配。

关键设计:Macer的关键设计包括明确的预算分配策略和在特定浅层中进行的归一化排名,确保了不同模态之间的公平性和有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Macer在25%的令牌保留率下,分别在Qwen2.5-Omni-7B和Qwen2.5-Omni-3B上保持了98.7%和97.3%的性能,且在OmniVinci-9B上相较于共享前K排名提升了12.9个点,展现出显著的性能优势。

🎯 应用场景

该研究的潜在应用领域包括多模态学习、音视频内容分析和智能助手等。Macer的设计可以有效提升多模态模型的性能,降低计算成本,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Token compression in OmniLLMs is typically posed as a single saliency-ranking problem: score each multimodal token, keep the top-K. We argue this abstraction is mis-specified. The same attention score simultaneously decides two things: how much retained capacity each modality receives, and which tokens within a modality are kept. A shared top-K rule therefore inherits this audio-favoring allocation prior, spending retained capacity on audio before video tokens have a chance to compete. We propose Macer, a training-free compressor that first assigns explicit audio and video budgets, then performs allocation-normalized ranking within each modality at modality-specific shallow layers. Macer significantly reduces token cost while preserving accuracy across audio-grounded, audio--video joint, visual-dominant, and video-centric benchmarks. At 25 % retention, Macer preserves 98.7 % of full-token performance on Qwen2.5-Omni-7B and 97.3 % on Qwen2.5-Omni-3B. On Qwen2.5-Omni-7B, this 25 % setting reaches OmniZip-level performance at 45 % retention while using lower FLOPs. On OmniVinci-9B, the same allocation-before-ranking principle improves over shared top-K ranking by up to 12.9 points.