WebGrader: Training LLMs for Web Development with Self-Evolving Programmatic Grader

📄 arXiv: 2608.06474v1 📥 PDF

作者: Boshui Chen, Huiping Liu, Shaolei Zhang

分类: cs.AI

发布日期: 2026-08-06

备注: 17 pages, 3 figures. Supplementary material is included in the main PDF


💡 一句话要点

提出WebGrader以解决大语言模型在网页开发中的功能缺口问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大语言模型 网页开发 强化学习 程序化评分 自动化测试 智能编程助手 流契约 自我演化

📋 核心要点

  1. 现有方法在奖励设计上存在瓶颈,手动编写的浏览器脚本成本高,且自动评分器可能提前给出判决,影响训练效果。
  2. WebGrader通过自我演化的程序化评分机制,自动推导交互流程并将其作为强化学习的奖励,提升了训练的灵活性和有效性。
  3. 在WebGen-Bench上,WebGrader训练的8B策略实现了52.01%的功能成功率,比匹配的外观加脚本奖励高出7.88分,显示出显著的性能提升。

📝 摘要(中文)

随着大语言模型能够根据自然语言描述生成完整网站,强化学习成为缩小其功能差距的核心方法。然而,现有的奖励设计存在瓶颈,手动编写的浏览器脚本虽然可执行,但成本高昂,而视觉语言模型和图形用户界面代理评分器虽然可扩展,但可能在观察到决定性状态之前就给出判决。为此,本文提出WebGrader,一种自我演化的程序化评分器,能够自主推导每个网站请求所需的交互流程,并将每个流程表示为可执行的流契约,利用其执行结果作为强化学习奖励。WebGrader在实时浏览器中实现生成的项目,将目标动作与源代码和实时DOM进行对比,并沿同一路径收集视觉、DOM、响应和持久状态证据。通过分离测试规划、动作定位、证据收集和语义判断,WebGrader仅在观察到请求的转变后才发出通过判决。

🔬 方法详解

问题定义:本文要解决的问题是如何有效设计奖励机制以提升大语言模型在网页开发中的功能表现。现有方法如手动编写的浏览器脚本成本高,且自动评分器在未观察到关键状态时可能给出错误判决,导致训练效果不佳。

核心思路:WebGrader的核心思路是通过自我演化的程序化评分机制,自动推导所需的交互流程,并将其执行结果作为强化学习的奖励。这种设计旨在提高训练的灵活性和准确性,确保模型在真实环境中获得有效反馈。

技术框架:WebGrader的整体架构包括多个模块:首先,它从每个网站请求中推导交互流程,并将其表示为可执行的流契约;其次,在实时浏览器中执行这些流程,收集视觉、DOM、响应和持久状态证据;最后,通过离线循环发现可重用的验证技能,并在独立的验证页面上进行筛选,确保技能图的稳定性后再进行策略训练。

关键创新:WebGrader的主要创新在于其自我演化的评分机制和流契约的使用,使得奖励设计不再依赖于手动编写的脚本,而是通过实时执行和反馈自动生成。这一方法与现有的依赖静态脚本的评分机制本质上不同,显著提升了训练的适应性和效率。

关键设计:在技术细节上,WebGrader通过分离测试规划、动作定位、证据收集和语义判断,确保了评分的准确性。它使用的损失函数和网络结构经过精心设计,以支持流契约的执行和反馈收集,确保模型能够在动态环境中有效学习。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

WebGrader在WebGen-Bench上训练的8B策略实现了52.01%的功能成功率,较匹配的外观加脚本奖励提升了7.88分。此外,在WG-core-250上,该策略达到了44.953的满分,超越了Qwen3-Coder-480B,显示出显著的性能优势。

🎯 应用场景

WebGrader的研究成果具有广泛的应用潜力,尤其在网页开发、自动化测试和智能编程助手等领域。通过提升大语言模型的功能表现,WebGrader能够帮助开发者更高效地创建和测试网站,降低开发成本,并推动智能编程工具的进步。未来,WebGrader可能会在教育、软件开发和人机交互等多个领域产生深远影响。

📄 摘要(原文)

Large language models increasingly generate complete websites from natural-language descriptions, and reinforcement learning has become a central approach to closing their remaining functional gap. This training regime is bottlenecked by reward design. Hand-authored browser scripts are executable yet costly to write for open-ended requirements, while VLM and GUI-agent graders scale but may issue verdicts before observing the decisive state. We propose WebGrader, a self-evolving programmatic grader that autonomously derives the required interaction flows from each website request, represents each flow as an executable Flow Contract, and uses its execution outcome as an RL reward. WebGrader materializes the generated project in a live browser, grounds target actions against the source code and live DOM, and collects visual, DOM, response, and persistent-state evidence along the same browser trajectory. A residual-driven offline loop then discovers reusable verifier skills, screens them on disjoint validation pages, and freezes the promoted skill graph before policy training. By separating test planning, action grounding, evidence collection, and semantic judgment, WebGrader issues a Pass verdict only after observing the requested transition. On WebGen-Bench, WebGrader trains an 8B policy to a 52.01% functional success rate, outperforming a matched appearance-plus-script reward by 7.88 points and surpassing o4-mini and DeepSeek-v4-flash. On WG-core-250, the policy reaches a Full Score of 44.953 and surpasses Qwen3-Coder-480B.