Decoupling semantics from vision: A framework for faithful visual-text compression evaluation

📄 arXiv: 2608.01848v1 📥 PDF

作者: Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

分类: cs.CV

发布日期: 2026-08-03


💡 一句话要点

提出新评估框架以解决视觉文本压缩评估问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉文本压缩 评估框架 多模态大型语言模型 ZeroSense基准 文本保留质量

📋 核心要点

  1. 现有的视觉文本压缩方法在评估时过于依赖下游任务表现,导致无法准确反映文本保留质量。
  2. 本文提出了一种新的评估框架,通过引入ZeroSense基准,消除文本依赖,以真实评估VTC质量。
  3. 实验结果显示,VTC质量与下游任务准确性之间存在显著差异,验证了新评估框架的有效性。

📝 摘要(中文)

近年来,视觉文本压缩(VTC)方法,如DeepSeek-OCR,通过文本到图像的渲染实现了高效的长上下文建模。然而,现有评估协议过于依赖下游任务的表现,无法准确衡量文本保留情况。本文提出了一种新的评估框架,旨在解耦多模态大型语言模型(MLLMs)的能力,以真实评估VTC质量。我们引入了ZeroSense基准,确保测试样本的低语义相关性,从而消除文本依赖,确保评估结果纯粹反映VTC质量。大量实验表明,VTC质量与下游任务准确性显著偏离,强调了我们解耦评估框架的必要性。

🔬 方法详解

问题定义:现有的视觉文本压缩方法在评估过程中,往往依赖下游任务的表现,这使得评估结果受到多模态大型语言模型(MLLMs)固有语言先验的影响,无法真实反映文本保留的质量。

核心思路:本文提出的评估框架旨在解耦MLLMs的能力,从而独立评估视觉文本压缩的质量。通过引入ZeroSense基准,确保测试样本之间的低语义相关性,消除文本依赖。

技术框架:整体架构包括两个主要模块:首先是ZeroSense基准的构建,确保样本之间的语义独立性;其次是基于该基准的VTC质量评估流程,确保评估结果不受下游模型的语义推理能力影响。

关键创新:最重要的技术创新在于引入了ZeroSense基准,确保了评估样本的低语义相关性,从而使得评估结果能够真实反映VTC质量,而不受下游任务的影响。

关键设计:在参数设置上,ZeroSense基准的样本选择策略经过精心设计,以确保样本之间的语义独立性;损失函数和评估指标也经过调整,以适应新的评估框架。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,VTC质量与下游任务准确性之间存在显著差异,具体而言,某些VTC方法在下游任务中的表现并未反映其文本保留的真实质量,强调了新评估框架的重要性和必要性。

🎯 应用场景

该研究的潜在应用领域包括视觉文本压缩技术的评估和优化,尤其是在需要高效文本保留的长上下文建模任务中。通过提供更准确的评估方法,能够推动相关技术的进一步发展,提升多模态系统的性能和可靠性。

📄 摘要(原文)

Recent visual-text compression (VTC) methods, typified by DeepSeek-OCR, report impressive high token compression ratios for long-context modeling tasks by leveraging text-to-image rendering. However, existing evaluation protocols heavily rely on downstream task performance. Such evaluation metrics fail to accurately measure text preservation due to the strong inherent linguistic priors of Multimodal Large Language Models (MLLMs). In this work, we introduce a new evaluation framework that decouples MLLMs' capabilities to faithfully assess VTC quality. Within this framework, we further introduce the ZeroSense Benchmark to ensure low semantic correlation of testing samples. By eliminating textual dependencies, our benchmark guarantees that the evaluation results are purely reflective of VTC quality, unaffected by the semantic inference capabilities of downstream models. Extensive experiments across multiple datasets demonstrate that VTC quality and downstream task accuracy diverge significantly, highlighting the necessity of our decoupled evaluation framework.