RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

📄 arXiv: 2607.27699v1 📥 PDF

作者: Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

分类: cs.CV, cs.AI

发布日期: 2026-07-30

备注: 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

🔗 代码/项目: GITHUB


💡 一句话要点

提出RefineSVG以解决图像到SVG生成中的几何漂移问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 图像生成 SVG转换 闭环反馈 多模态学习 强化学习 视觉残差图 语义词汇

📋 核心要点

  1. 现有的MLLM方法在图像到SVG生成中存在几何漂移和错误累积的问题,导致生成结果的质量下降。
  2. RefineSVG通过引入闭环视觉反馈机制,利用外部渲染引擎进行结果验证和修正,从而提升生成质量。
  3. 实验结果显示,RefineSVG在重建保真度和结构准确性方面显著优于传统方法,且代码效率提高超过52%。

📝 摘要(中文)

我们提出了RefineSVG,这是一个单步闭环视觉反馈框架,使多模态大语言模型(MLLMs)能够通过自我修正实现高保真度的图像到SVG生成。现有的基于MLLM的方法依赖于单次开放式推理,模型仅在初始生成阶段接收视觉输入,导致几何漂移、错误累积和复杂图像的视觉幻觉。RefineSVG通过在初始SVG生成后调用外部渲染引擎,将渲染输出与目标图像进行比较,从而克服了这一限制。比较结果生成多维视觉残差图(Diff-Map),作为ReAct风格的修正信号反馈给模型,驱动有针对性的修正步骤。我们还引入了一种面向SVG的语义词汇,压缩了令牌序列超过52%。通过监督微调、拒绝采样冷启动数据构建和端到端的智能强化学习,Align模型与闭环视觉修正。大量实验表明,RefineSVG在重建保真度、结构准确性和代码效率上始终优于现有基线。

🔬 方法详解

问题定义:本论文旨在解决现有图像到SVG生成方法中存在的几何漂移和错误累积问题。现有方法通常依赖单次推理,缺乏中间验证,导致生成结果的质量不稳定。

核心思路:RefineSVG的核心思路是引入闭环视觉反馈机制,通过外部渲染引擎对初始生成的SVG进行验证,并根据差异进行有针对性的修正。这种设计能够有效减少生成过程中的错误和漂移。

技术框架:整体架构包括三个主要模块:初始SVG生成、外部渲染与比较、以及基于Diff-Map的修正反馈。首先生成SVG,然后通过渲染引擎生成图像,与目标图像进行比较,最后根据比较结果进行修正。

关键创新:最重要的技术创新在于引入了Diff-Map作为修正信号,这一方法与传统的单次推理方法本质上不同,能够实现更高的生成精度和质量。

关键设计:在设计中,我们采用了SVG导向的语义词汇,显著压缩了令牌序列。此外,训练过程中结合了监督微调和强化学习策略,以确保模型能够有效地进行闭环修正。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,RefineSVG在重建保真度、结构准确性和代码效率方面均显著优于现有基线,具体提升幅度超过52%。这一成果验证了闭环视觉反馈机制在图像生成中的有效性,为未来的研究提供了新的方向。

🎯 应用场景

RefineSVG的研究成果在多个领域具有潜在应用价值,包括图形设计、动画制作和网页开发等。通过提高图像到SVG的生成质量,能够为设计师和开发者提供更高效的工具,促进创意的实现和生产力的提升。未来,该技术可能会扩展到更多的视觉生成任务中,推动相关领域的发展。

📄 摘要(原文)

We propose RefineSVG, a single-step closed-loop visual feedback framework that enables multimodal large language models (MLLMs) to perform high-fidelity image-to-SVG generation through self-correction. Existing MLLM-based approaches rely on single-pass open-loop inference, where the model receives visual input only once and must generate thousands of SVG code tokens without intermediate verification. This paradigm inevitably leads to geometric drift, error accumulation, and visual hallucination on complex images. RefineSVG overcomes this limitation by invoking an external rendering engine after an initial SVG generation pass to compare the rendered output against the target image. The comparison yields a multi-dimensional visual residual map (Diff-Map) that is fed back to the model as a ReAct-style correction signal, driving a targeted correction step. To support this render-observe-correct interaction, we further introduce an SVG-oriented semantic vocabulary that compresses token sequences by over 52%. A progressive training pipeline spanning supervised fine-tuning, rejection-sampling cold-start data construction, and end-to-end agentic reinforcement learning aligns the model with closed-loop visual correction. Extensive experiments show that RefineSVG consistently outperforms existing baselines in reconstruction fidelity, structural accuracy, and code efficiency.Code is available at https://github.com/liuxiaobo66/RefineSVG.