Bar-JEPA: Extracting Values from Bar Chart with Joint-Embedding Predictive Architecture

📄 arXiv: 2608.06062v1 📥 PDF

作者: Poonam Poonam, Alexander Epple, Timo Ropinski

分类: cs.CV

发布日期: 2026-08-06

备注: Accepted at ICDAR 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出Bar-JEPA以解决条形图数据提取问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 条形图提取 自监督学习 联合嵌入 数据可视化 机器学习

📋 核心要点

  1. 现有的条形图数据提取方法依赖于大量标注数据,标注过程耗时且数据稀缺,限制了模型的训练效果。
  2. 本文提出了一种基于联合嵌入预测架构(JEPA)的自监督学习方法,旨在高效提取条形图中的数值信息。
  3. 实验结果表明,所提方法在特征提取质量和模型性能上优于传统的端到端监督学习基线,展示了自监督微调的有效性。

📝 摘要(中文)

条形图在数据可视化中被广泛使用,尽管人类易于理解,但计算机提取其底层数据却并不简单。现有的基于机器学习的方法通常需要标注的真实数据进行训练,而标注数据的稀缺性使得这一过程耗时且困难。为此,本文提出了一种联合嵌入预测架构(JEPA),以自监督的方式学习高语义质量的特征。我们设计了一种逐条提取数值的管道,利用JEPA编码器生成语义丰富的潜在特征,简单快速的解码器则输出刻度和条形的坐标,从而恢复条形值。与端到端的监督基线相比,自监督微调的有效性和提取特征的质量得到了验证。

🔬 方法详解

问题定义:本文旨在解决条形图中数值数据的提取问题。现有方法通常依赖于标注数据,导致数据稀缺和训练效率低下。

核心思路:通过引入联合嵌入预测架构(JEPA),实现自监督学习,从而生成高质量的语义特征,进而提取条形图的数值信息。

技术框架:整体架构包括JEPA编码器和简单的解码器。编码器负责生成潜在特征,解码器则根据这些特征输出条形和刻度的坐标。

关键创新:最重要的创新在于采用自监督学习方式来提升特征学习的效率和质量,避免了对大量标注数据的依赖。

关键设计:在模型设计中,采用了适合条形图特征提取的损失函数,并优化了网络结构以提高训练速度和效果。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,所提出的Bar-JEPA模型在特征提取质量上显著优于传统的端到端监督学习基线,具体性能提升幅度达到XX%(具体数据待补充),验证了自监督微调的有效性和模型的实用性。

🎯 应用场景

该研究在数据可视化领域具有广泛的应用潜力,尤其是在自动化数据分析和报告生成中。通过高效提取条形图数据,能够帮助用户快速获取信息,提升数据处理的效率和准确性。未来,该方法还可以扩展到其他类型的图表和数据可视化形式。

📄 摘要(原文)

Bar charts are commonly used in data visualization, and while they are easily understood by humans, it is non-trivial to extract the underlying data computationally. For a machine-learning-based approach, training chart de-rendering models usually requires labeled, real-world data. Labeling data is a time consuming task, which is why annotated data is scarce. Models can learn more efficiently when provided with features of high semantic quality, which a joint-embedding predictive architecture (JEPA) is designed to learn in a self-supervised manner. We present a per-bar, numerical value recovery pipeline for bar charts, where a JEPA encoder is used to produce semantically rich latent features. The decoder model consuming these features is simple and quick to train and outputs the coordinates of ticks and bars, which can be used to recover bar values. The effectiveness of self-supervised finetuning and quality of the extracted features is evident when comparing our model to end-to-end supervised baselines. Code, datasets and checkpoints are available on \href{https://github.com/dralois/Bar-JEPA}{GitHub}.