KVAE: Family of Tokenizers for Multimodal Generative Models

📄 arXiv: 2608.05798v1 📥 PDF

作者: Andrey Shutkin, Denis Parkhomenko, Ivan Kirillov, Kirill Chernyshev, Kirill Malakhov, Ilia Vasiliev, Ilia Trushkin, Valeriya Kobenko, David Chikovani, Alexander Ivanov, Azat Saginbaev, Egor Silvestrov, Ivan Mikheev, Konstantin Zakharov

分类: cs.CV, cs.LG, cs.SD

发布日期: 2026-08-06

🔗 代码/项目: GITHUB | GITHUB


💡 一句话要点

提出KVAE系列分词器以提升多模态生成模型性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态生成 潜在扩散建模 音频处理 图像生成 视频生成 分词器设计 生成模型

📋 核心要点

  1. 现有的生成模型在输入信号的压缩表示上存在不足,影响学习速度和生成样本质量。
  2. 论文提出KVAE系列分词器,专为音频、图像和视频设计,以优化生成过程中的信号映射。
  3. 实验结果显示,KVAE分词器在重建和生成质量上超过了多种前沿开源分词器,具有显著提升。

📝 摘要(中文)

潜在扩散建模(LDM)是一种重要的生成模型范式,利用分词器将输入信号映射为压缩表示。本文提出了一系列KVAE分词器,分别针对音频、图像和视频,旨在支持后续的文本条件生成。KVAE-Audio为连续全频带48 kHz分词器,KVAE-3D为两种因果视频分词器,KVAE-2D为图像模型。实验结果表明,重建和生成效果在多个客观和主观指标上超越了现有的开源分词器,且提供了详细的训练信息和模型选择方法,代码已公开。

🔬 方法详解

问题定义:本文旨在解决现有生成模型中分词器对输入信号压缩表示的影响,现有方法在学习速度和生成质量上存在不足。

核心思路:提出KVAE系列分词器,分别针对音频、图像和视频进行优化设计,以提高生成模型的性能和效率。

技术框架:整体架构包括KVAE-Audio、KVAE-3D和KVAE-2D三个模块,分别处理音频、视频和图像数据,采用不同的压缩因子和通道数。

关键创新:最重要的创新在于设计了一系列专用的分词器,能够在不同模态下实现高效的信号压缩和生成,显著提升了生成质量。

关键设计:KVAE-Audio使用48 kHz的全频带,64通道的潜在表示;KVAE-3D包括两种因果视频分词器,分别为4x16x16和4x8x8的压缩;KVAE-2D则以8倍的压缩因子和32通道处理图像数据。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,KVAE系列分词器在重建质量(如PSNR、LPIPS、PESQ等)和生成效果(如Frechet Distance、CLIP score、CLAP score等)上均超过了多个前沿开源分词器,展示了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括音频生成、图像合成和视频创作等多模态生成任务。通过优化分词器的设计,能够在艺术创作、娱乐和教育等多个行业中实现更高质量的生成效果,具有重要的实际价值和未来影响。

📄 摘要(原文)

Latent diffusion modeling (LDM), a prominent paradigm, utilizes tokenizers to map input signal to compressed representation. This dependency positions tokenizer as an integral part of generation process itself, since it affects learning speed, quality of synthesized samples and lay foundation for later applications. This report presents series of KVAE tokenizers for audio, image and video, all designed for subsequent text-conditioned generation: KVAE-Audio, a continuous full-band 48 kHz tokenizer with a 50 Hz latent of 64 channels; KVAE-3D -- two causal video tokenizers for 4x16x16 and 4x8x8 compression; KVAE-2D, an image model, compressing input by factor of 8 with 32 channels. We demonstrate that reconstruction (PSNR, LPIPS, PESQ, etc.) and generation results on objective (Frechet Distance, CLIP score, CLAP score, etc.) and subjective (side-by-side evaluation) metrics matches or surpasses frontier opensource tokenizers, such as VAEs from Wan-2.2, HunyuanVideo-1.5, FLUX.2, MovieGen, StableAudio and MMAudio. Considering difficulty of development, we share with community training details, model selection method and ablation on design choices. The code is publicly available at https://github.com/kandinskylab/kvae and https://github.com/kandinskylab/kvae-audio.