SVGEval: A Vision-Grounded Framework for Perceptual-Quality Benchmarking and Evaluation in Text-to-SVG Generation
作者: Yiming Wang, Ye Chen, Hanqi Chen, Bingbing Ni
分类: cs.CV
发布日期: 2026-08-03
备注: Accepted by ECCV 2026
💡 一句话要点
提出SVGEval以解决SVG生成评估的可靠性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: SVG生成 多模态评估 视觉渲染 人类感知 质量评估
📋 核心要点
- 现有的SVG生成评估方法往往侧重于代码或光栅图像指标,无法有效反映人类的视觉感知和SVG特有的几何特性。
- 论文提出SVGEval,一个基于视觉的多模态基准,结合视觉渲染与人工标注,旨在提供更可靠的SVG质量评估。
- 系统评估显示,模型在语义和美学方面表现良好,但在几何和布局判断上存在明显不足,SVGEval为此提供了解决方案。
📝 摘要(中文)
多模态大型模型在生成可扩展矢量图形(SVG)方面的应用日益增加,但可靠的评估方法仍然未得到充分探索。现有的评估协议往往以代码为中心,或在渲染SVG后借用光栅图像的指标,无法反映人类的感知,并忽视了SVG特有的几何和空间构成特性。为此,我们提出了SVGEval,一个基于视觉的多模态基准,用于人类对齐的SVG质量评估。SVGEval明确结合视觉渲染,以评估模型是否能够判断渲染结果,而不仅仅是检查SVG代码,并通过多轮人工标注和专家精炼提供高质量的注释。对代表性多模态模型的系统评估揭示了明显的差距:模型在语义对齐和美学方面表现相对良好,但在几何和布局相关判断上存在困难。基于SVGEval,我们训练了一个可解释的SVG质量评分器,输出多方面的评分和文本理由。消融实验表明,显式的视觉基础和推理监督至关重要,尤其是在空间和几何评估方面。SVGEval为评估和改进多模态模型时代的SVG生成提供了可靠的测试平台和实用评分器。
🔬 方法详解
问题定义:本论文旨在解决当前SVG生成评估方法的不足,尤其是无法有效反映人类感知和SVG特有几何特性的痛点。
核心思路:SVGEval通过结合视觉渲染和多轮人工标注,提供了一种新的评估框架,能够更好地反映模型在生成SVG时的实际表现。
技术框架:SVGEval的整体架构包括视觉渲染模块、人工标注模块和评分器,系统性地评估SVG的质量,涵盖语义、几何和布局等多个方面。
关键创新:SVGEval的主要创新在于其视觉基础和推理监督的结合,使得模型能够在空间和几何评估上取得更好的表现,与现有方法相比具有本质的区别。
关键设计:在设计中,SVGEval采用了多轮人工标注以提高注释质量,并引入了可解释的评分机制,输出多方面的评分和文本理由,增强了评估的透明性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用SVGEval进行评估的模型在语义对齐和美学方面的得分较高,但在几何和布局判断上存在明显差距,显示出SVGEval在评估SVG生成质量方面的有效性和必要性。
🎯 应用场景
SVGEval的研究成果可广泛应用于多模态生成模型的评估,特别是在设计软件、游戏开发和教育领域中,能够帮助开发者更好地理解和改进SVG生成的质量。未来,SVGEval还可能推动更高效的SVG生成工具的开发,提升用户体验。
📄 摘要(原文)
Multimodal large models are increasingly used to generate scalable vector graphics (SVG), but reliable evaluation remains underexplored. Existing protocols are often code-centric or borrow raster-image metrics after rendering SVGs, which fail to reflect human perception and overlook SVG-specific qualities such as geometry and spatial composition. We introduce SVGEval, a vision-grounded multimodal benchmark for human-aligned SVG quality assessment. SVGEval explicitly incorporates visual renderings to evaluate whether models can judge the rendered outcome rather than only inspect SVG code, and provides high-quality annotations obtained via multi-round human labeling with expert refinement. Systematic evaluations across representative multimodal models reveal a clear gap: models perform relatively well on semantic alignment and aesthetics, yet struggle on geometry- and layout-related judgments. Building on SVGEval, we train an explainable SVG quality scorer that outputs multi-aspect scores with textual rationales. Ablations show that explicit visual grounding and reasoning supervision are crucial, especially for spatial and geometric assessment. SVGEval offers a reliable testbed and practical scorer for evaluating and improving SVG generation in the era of multimodal models.