ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression

📄 arXiv: 2607.28020v1 📥 PDF

作者: Shuhan Ye, Hongbin Yu, Chenqi Kong, Pingchuan Ma, Chong Wang, Jun Wan, Qixin Zhang

分类: cs.CV

发布日期: 2026-07-30


💡 一句话要点

提出ENCORE框架以解决学习视频压缩中的运动建模问题

🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 学习视频压缩 运动建模 事件相机 多模态融合 视频质量提升

📋 核心要点

  1. 现有学习视频压缩方法在快速运动和低光照等情况下的运动估计存在脆弱性,影响压缩效果。
  2. ENCORE框架通过引入事件相机的细粒度动态信息,结合RGB帧进行互补运动建模,从而提高运动估计的准确性。
  3. 在BS-ERGB数据集上,ENCORE实现了高达20.80%的PSNR-RGB和22.14%的MS-SSIM-RGB BD率节省,显示出显著的性能提升。

📝 摘要(中文)

学习视频压缩依赖于准确的时间建模以消除相邻帧之间的冗余。然而,现有编码器主要依赖离散采样的RGB帧进行运动推断,导致在快速运动、模糊、遮挡、弱纹理、低光照和突变亮度变化等情况下的估计脆弱。本文提出ENCORE框架,通过事件相机捕捉RGB时间戳之间的细粒度强度变化,提供了互补的帧间动态证据。ENCORE首先采用互补运动表示(CMR)将对齐的RGB-事件特征分解为共同和模态特定的运动表示。接着,空间能量和冗余信息校准(SERIC)识别相对于RGB的事件特定响应,抑制弱或冗余证据,并预测候选流修正。最后,能量感知路由(EAR)决定修正的应用位置及强度。实验结果表明,ENCORE在多个数据集上均取得了一致的性能提升。

🔬 方法详解

问题定义:本文旨在解决现有学习视频压缩方法在快速运动、模糊和低光照等情况下的运动估计不准确的问题。这些问题导致了压缩效果的下降。

核心思路:ENCORE框架的核心思路是利用事件相机捕捉RGB帧之间的细粒度强度变化,提供互补的运动信息,从而增强运动建模的准确性。

技术框架:ENCORE的整体架构包括三个主要模块:互补运动表示(CMR)用于分解运动特征,空间能量和冗余信息校准(SERIC)用于识别和抑制冗余证据,能量感知路由(EAR)用于确定修正的应用位置和强度。

关键创新:ENCORE的创新之处在于将事件相机作为辅助模态进行运动建模,而RGB帧仍然是唯一的编码和重建目标。这种设计使得运动估计更加稳健。

关键设计:在关键设计方面,ENCORE采用了特定的损失函数来优化运动表示,并在网络结构中引入了事件特征的处理模块,以确保有效的信息融合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

ENCORE在BS-ERGB数据集上实现了最高20.80%的PSNR-RGB和22.14%的MS-SSIM-RGB BD率节省,相较于现有基线方法显示出显著的性能提升。此外,在其他两个数据集上也保持了清晰的改进,验证了其广泛适用性。

🎯 应用场景

该研究在视频压缩领域具有广泛的应用潜力,尤其是在需要高效存储和传输视频数据的场景,如流媒体、视频监控和虚拟现实等。通过提高运动建模的准确性,ENCORE能够显著提升视频质量和压缩效率,推动相关技术的发展。

📄 摘要(原文)

Learned video compression relies on accurate temporal modeling to remove redundancy between adjacent frames. However, most existing codecs infer motion solely from discretely sampled RGB frames, making their estimates vulnerable to fast motion, blur, occlusion, weak texture, low illumination, and abrupt brightness changes. Event cameras asynchronously capture fine-grained intensity changes between RGB timestamps and therefore provide complementary evidence about inter-frame dynamics. We propose ENCORE, an Event-Assisted Complementary Motion Refinement framework for learned video compression. ENCORE first employs Complementary Motion Representation (CMR) to decompose aligned RGB-event features into common and modality-specific motion representations. Spatial Energy and Redundancy-Informed Calibration (SERIC) then identifies event-specific responses that are active and novel relative to RGB, suppresses weak or redundant evidence, and predicts a candidate flow correction. Finally, Energy-Aware Routing (EAR) determines where and how strongly the correction should refine the RGB flow. Events serve solely as an auxiliary modality for motion modeling, while RGB remains the only coding and reconstruction target. Experiments on BS-ERGB, HQ-EVFI, and CED demonstrate consistent gains across datasets and GOP lengths. On BS-ERGB, ENCORE achieves up to 20.80% PSNR-RGB and 22.14% MS-SSIM-RGB BD-rate savings, while retaining clear improvements on the other two datasets.