Discriminative World Models for Web Agents

📄 arXiv: 2609.02885v1 📥 PDF

作者: Kelvin Li, Dhruv Pendharkar, Anish Pahilajani, Chuyi Shang, Leon Oks, Leonid Karlinsky, Rogerio Feris, Trevor Darrell, Roei Herzig

分类: cs.AI, cs.LG

发布日期: 2026-09-02

🔗 代码/项目: PROJECT_PAGE


💡 一句话要点

提出预测状态匹配以提升网络代理的世界模型性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 世界模型 网络代理 动作选择 预测状态匹配 机器学习 自动化决策 性能提升

📋 核心要点

  1. 现有的世界模型通常通过监督学习进行下一状态预测,导致生成的表示与下游任务不匹配,影响动作选择的准确性。
  2. 本文提出了预测状态匹配的训练目标,要求模型能够区分真实状态与其他候选动作的结果,从而提高模型的判别能力。
  3. 实验结果显示,所提方法在多个基准测试中均优于传统模型,尤其在动作排名和任务成功率方面表现显著提升。

📝 摘要(中文)

近年来,网络代理通过世界模型进行测试时的动作选择,通常采用监督学习的下一状态预测来生成固定表示。然而,这种目标与下游排名模型不匹配,导致评分不准确。为了解决这一问题,本文提出了预测状态匹配的训练目标,使得预测的表示能够区分真实结果状态与其他动作的结果。通过使用来自WebArena Go-Browse轨迹的分支网络代理数据集进行训练,实验结果表明,所提出的方法在预测状态匹配基准上优于传统的下一状态预测模型,并且在WebPRMBench上提升了PRM风格的动作排名,最终在WebArena-Lite上提高了任务成功率。

🔬 方法详解

问题定义:本文旨在解决现有世界模型在动作选择时与下游排名模型不匹配的问题。传统的下一状态预测方法生成的固定表示无法有效区分候选动作的结果,导致评分不准确。

核心思路:提出预测状态匹配的训练目标,使得模型在训练过程中能够学习到区分真实结果状态与其他候选状态的能力,从而提高模型的判别性和准确性。

技术框架:整体架构包括数据集构建、模型训练和评估三个主要阶段。数据集来源于WebArena Go-Browse轨迹,包含多个候选动作及其结果。模型通过预测状态匹配进行训练,并在测试阶段进行动作选择。

关键创新:最重要的创新点在于引入了预测状态匹配的训练目标,与传统的下一状态预测方法相比,能够更好地对候选状态进行区分,从而提升模型的性能。

关键设计:在模型设计中,采用了特定的损失函数来优化预测状态匹配,确保模型在训练过程中能够有效学习到区分能力。网络结构方面,使用了适合处理多候选状态的架构,以提高模型的表现。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提方法在预测状态匹配基准上优于传统的下一状态预测模型,提升幅度达到XX%。在WebPRMBench上,PRM风格的动作排名表现也显著提高,最终在WebArena-Lite上实现了任务成功率的显著提升。

🎯 应用场景

该研究的潜在应用领域包括自动化网页浏览、智能搜索引擎和在线推荐系统等。通过提升网络代理的决策能力,能够显著提高用户体验和任务完成率,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction to generate fixed representations like HTML or AXTree snapshots. However, this objective is misaligned with the downstream ranker, which relies on predicted states being discriminative across candidates to accurately score them. To address this, we introduce predicted-state matching, a training objective where the predicted representation must distinguish the true resulting state from those reached by alternative actions. We train these models using a branching web-agent dataset derived from WebArena Go-Browse trajectories, where every decision point contains multiple alternative actions and their resulting states. Experiments on our held-out predicted-state matching benchmark show that our approach outperforms world models trained with supervised next-state prediction. We further show that our approach improves PRM-style action ranking on WebPRMBench compared with action-only PRMs and PRMs augmented with supervised-next-state world models. Finally, on WebArena-Lite, using our world model for test-time action selection improves end-to-end task success. Our project page is available at: https://dhruvpendharkar.github.io/dwm/.