MT-Web2Code: Benchmarking Coding Agents on Multi-Turn Regional Reconstruction and Localized Modification

📄 arXiv: 2608.03474v1 📥 PDF

作者: Qiming Li, Shujie Hu, Haohan Liu, Xiaocheng Feng, Songxiang Liu, Guanglu Wan

分类: cs.CV

发布日期: 2026-08-04


💡 一句话要点

提出MT-Web2Code以解决多轮区域重建与局部修改问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态编码 区域重建 局部修改 视觉语言模型 前端开发 迭代工作流程 自动化工具

📋 核心要点

  1. 现有方法主要关注单轮全页面生成,忽视了前端开发中的多轮迭代需求,导致实际应用效果不佳。
  2. 本文提出MT-Web2Code基准,结合反腐蚀轨迹引擎和双轴评估协议,支持多轮区域重建和局部修改。
  3. 实验结果显示,当前编码代理在目标区域重建和内容保留方面表现不佳,且多轮操作中错误累积严重。

📝 摘要(中文)

近年来,大型视觉语言模型(LVLMs)在网页用户界面生成方面取得了显著进展。然而,现有基准主要集中于从头生成单轮完整页面,忽视了真实前端工程中的迭代工作流程。为填补这一空白,本文提出了MT-Web2Code,这是首个针对多轮宏观区域重建和微观局部修改的多模态编码基准,包含102个任务,覆盖16个垂直领域。我们开发了可扩展的反腐蚀轨迹引擎,以在没有昂贵的人工注释的情况下构建确定性的修复轨迹,并提出了双轴评估协议,评估目标区域的保真度和未受影响内容的保留。实验表明,当前编码代理在区域重建和局部修改方面存在显著挑战。

🔬 方法详解

问题定义:本文旨在解决现有编码代理在多轮区域重建和局部修改中的不足,特别是缺乏对未受影响内容的保留和细粒度视觉代码对齐的问题。

核心思路:通过引入MT-Web2Code基准和反腐蚀轨迹引擎,构建可重复的修复轨迹,评估编码代理在多轮任务中的表现,促进更高效的前端开发。

技术框架:整体架构包括反腐蚀轨迹引擎、双轴评估协议和多轮任务执行模块。反腐蚀引擎负责生成带有结构和风格缺陷的页面,而评估协议则用于量化重建和修改的效果。

关键创新:最重要的创新在于反腐蚀轨迹引擎的设计,使得在没有人工注释的情况下,能够生成确定性的修复轨迹,提升了评估的可重复性和准确性。

关键设计:在评估过程中,采用了5维VLM基础的评分标准来评估区域重建,同时使用确定性的像素对齐方法来评估局部修改,确保评估的全面性和细致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前编码代理在目标区域重建的保真度和未受影响内容的保留方面表现不佳,尤其在多轮操作中,错误累积现象明显。具体而言,编码代理在区域重建任务中的准确率低于预期,显示出对细粒度视觉代码对齐的不足。

🎯 应用场景

该研究的潜在应用领域包括前端开发工具、自动化编码助手和UI设计优化等。通过提升编码代理在多轮任务中的表现,能够显著提高开发效率,降低人力成本,推动智能化前端开发的进程。

📄 摘要(原文)

Recent advances in Large Vision-Language Models (LVLMs) have demonstrated impressive capabilities in web UI generation. However, existing benchmarks predominantly focus on single-turn full-page generation from scratch, overlooking the iterative workflow of real-world frontend engineering, where developers repeatedly reconstruct missing regions and modify localized elements within existing codebases. To bridge this gap, we introduce MT-Web2Code, the first multimodal coding benchmark for multi-turn Macro-Level Regional Reconstruction and Micro-Level Localized Modification, which contains 102 tasks spanning 16 vertical domains. To construct deterministic repair trajectories without costly turn-level human annotation, we develop a scalable Reverse-Corruption Trajectory Engine that iteratively injects structural and stylistic defects into golden pages. We further propose a dual-axis evaluation protocol that measures target-region fidelity and the preservation of unaffected content, where regional reconstruction is assessed by a 5-dimensional VLM-based rubric and localized modification by deterministic pixel-grounded alignment. Experiments on 13 frontier coding agents reveal that current agents struggle to faithfully reconstruct target regions while preserving unaffected content, lack fine-grained visual-code alignment for localized edits, and suffer from error snowballing over multiple turns. Beyond benchmarking, our deterministic evaluation metrics provide fine-grained feedback signals that may facilitate future research on training iterative UI coding agents. Our evaluation code and data will soon be released.