Chart2SVG: Editable SVG Generation from Raster Chart Images
作者: Jinning Cui, Lu Chen, Haoyan Shi, Yue He, Chenglong Wang, Mengyu Zhou, Weidong Huang, Yunhai Wang
分类: cs.LG
发布日期: 2026-08-27
💡 一句话要点
提出Chart2SVG以解决静态图表转换为可编辑SVG的问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 图表转换 SVG生成 多模态模型 数据可视化 智能工具
📋 核心要点
- 现有方法在将静态光栅图表转换为可编辑格式时,缺乏结构化和语义丰富的表示,限制了后续的编辑和交互能力。
- Chart2SVG通过引入图表特定的语义标记,结合视觉-语言模型,能够有效捕捉图表的几何特征及其功能角色,从而实现高质量的SVG生成。
- 实验结果显示,Chart2SVG在重建保真度和编辑实用性方面显著优于现有基线,展示了其在智能可视化工具中的应用潜力。
📝 摘要(中文)
我们提出了Chart2SVG,这是一种多模态大语言模型,能够将静态光栅图表转换为结构化且语义丰富的SVG,支持程序化编辑。通过将图表特定的语义标记融入视觉-语言模型,Chart2SVG能够捕捉几何原件及其功能角色。为支持稳健的结构恢复,我们引入了Beagle+,一个包含33K个标准化和结构化图表样本的数据集。我们的方法结合了专门的训练目标和渲染感知的后训练阶段,生成的SVG在视觉上准确且结构上一致。为了便于更高层次的操作,我们构建了图表结构图(CSG),揭示了视觉依赖关系,使得交互式探索、图表再利用和布局重用等任务成为可能。实验表明,Chart2SVG在重建保真度和后续编辑实用性方面显著优于基线,推动了智能和交互式可视化工具的发展。
🔬 方法详解
问题定义:本论文旨在解决将静态光栅图表转换为可编辑SVG格式的挑战。现有方法往往无法提供结构化和语义丰富的输出,限制了用户的编辑能力和交互体验。
核心思路:我们提出Chart2SVG,通过将图表特定的语义标记融入视觉-语言模型,捕捉几何原件及其功能角色,从而生成结构化的SVG。此设计旨在提高图表的可编辑性和交互性。
技术框架:Chart2SVG的整体架构包括两个主要阶段:首先是基于Beagle+数据集的训练阶段,随后是渲染感知的后训练阶段。该框架确保生成的SVG在视觉和结构上都保持一致。
关键创新:最重要的技术创新在于引入了图表结构图(CSG),它揭示了视觉依赖关系,支持更高层次的操作,如交互式探索和布局重用。这一创新与现有方法的本质区别在于其对图表内部结构的深刻理解。
关键设计:在模型设计中,我们采用了特定的损失函数以优化结构恢复,并在网络结构中引入了图表特定的语义标记。这些设计细节确保了生成SVG的高保真度和实用性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,Chart2SVG在重建保真度和后续编辑实用性方面显著优于基线,具体表现为重建保真度提升了XX%,编辑实用性提升了YY%。这些结果验证了我们方法的有效性,并展示了其在实际应用中的巨大潜力。
🎯 应用场景
Chart2SVG的研究成果具有广泛的应用潜力,特别是在数据可视化、教育和商业分析等领域。通过将静态图表转换为可编辑的SVG格式,用户可以更方便地进行数据分析、图表再利用和交互式展示,提升了信息传达的效率和效果。未来,该技术可能推动智能可视化工具的进一步发展,促进数据驱动决策的普及。
📄 摘要(原文)
We present Chart2SVG, a multimodal large language model that converts static raster charts into structurally organized, semantically enriched SVGs that support programmatic editing. By incorporating chart-specific semantic tokens into a vision-language model, Chart2SVG captures both geometric primitives and their functional roles. To support robust structural recovery, we introduce Beagle+, a dataset of 33K canonicalized and structurally distilled chart samples. Our approach combines specialized training objectives with a rendering-aware post-training phase, producing SVGs that are both visually accurate and structurally consistent. To facilitate higher-level manipulations, we construct a Chart Structure Graph (CSG) that exposes visual dependencies, enabling tasks such as interactive exploration, chart repurposing, and layout reuse. Experiments show that Chart2SVG substantially outperforms baselines in reconstruction fidelity and downstream editing utility, advancing the development of intelligent and interactive visualization tools.