PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

📄 arXiv: 2608.27345v2 📥 PDF

作者: Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jinbo Xing, Xi Chen

分类: cs.CV, cs.AI

发布日期: 2026-08-27 (更新: 2026-08-28)


💡 一句话要点

提出PAWBench基准以评估视频生成模型的概率对齐能力

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 视频生成 概率对齐 世界模型 评估基准 随机采样 行为分布 机器学习 人工智能

📋 核心要点

  1. 现有视频生成模型在评估时主要关注单个视频的合理性,未能有效测试生成的行为分布是否准确。
  2. 论文提出PAWBench基准,作为评估视频生成器在世界动态中作为随机采样器的能力,并引入PAWEval协议进行经验分布转换。
  3. 实验结果显示,当前模型在恢复有效行为范围和匹配参考概率方面存在显著差距,未能实现一致性。

📝 摘要(中文)

近年来,视频生成模型越来越多地被视为世界模型。许多物理过程可以以多种有效方式展开,因此,世界模型不仅应重现合理的轨迹,还应在相同初始观察和动作下再现可能行为的分布。我们称这种分布级别的要求为概率对齐。然而,现有评估主要评估单个视频的合理性,而未测试重复生成是否恢复正确的分布。为了解决这一问题,我们将概率对齐形式化为世界模型的分布标准,并引入PAWBench基准,评估视频生成器作为世界动态的随机采样器。我们还引入PAWEval协议,将重复视频生成转化为可能物理行为的经验分布。通过50个场景和11个当前系统的测试,发现没有模型能够一致匹配参考概率,同时恢复有效行为的范围。我们相信这项工作可以为未来朝着概率对齐的世界建模努力奠定基础。

🔬 方法详解

问题定义:本论文旨在解决现有视频生成模型在概率对齐方面的不足,尤其是如何评估模型生成的行为分布是否准确。现有方法主要关注单一视频的合理性,未能有效测试生成行为的多样性和分布特征。

核心思路:论文的核心思路是将概率对齐形式化为世界模型的分布标准,并通过引入PAWBench基准和PAWEval协议来评估视频生成器的性能。这种设计旨在提供一个系统化的评估框架,以便更好地理解模型的生成能力。

技术框架:整体架构包括两个主要模块:PAWBench基准用于评估视频生成器的随机采样能力,PAWEval协议用于将重复生成的视频转化为经验分布。通过这两个模块,研究者可以全面评估模型在不同场景下的表现。

关键创新:最重要的技术创新点在于将概率对齐作为评估标准,并通过PAWBench和PAWEval提供了一个新的评估框架。这与现有方法的本质区别在于,现有方法通常只关注单一生成结果的合理性,而忽视了生成行为的分布特征。

关键设计:在实验中,关键设计包括对模型的初始噪声采样、语言提示和训练方法的调整,以测试这些因素对模型预测分布的影响。具体的参数设置和损失函数设计在论文中进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,在50个场景和11个当前系统的测试中,没有模型能够一致匹配参考概率,且在恢复有效行为范围方面存在显著差距。这一发现强调了当前视频生成模型在概率对齐方面的不足,为未来的研究指明了方向。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人控制和虚拟现实等场景。在这些领域,准确的世界模型能够帮助系统更好地理解和预测环境动态,从而提升决策能力和交互体验。未来,该研究可能推动更高效的模型设计和评估方法的发展。

📄 摘要(原文)

Recent video generation models are increasingly framed as world models. Many physical processes can unfold in more than one valid way. Therefore, a world model should reproduce not only a plausible trajectory, but also the distribution of possible behaviors under the same initial observation and action. We call this distribution-level requirement probabilistic alignment. However, existing evaluations largely assess individual-video plausibility and do not test whether repeated generations recover the correct distribution. This raises a central question: how far are current video generators from probabilistically aligned world modeling? To answer it, we formalize probabilistic alignment as a distributional criterion for world models and introduce PAWBench, a benchmark for evaluating video generators as stochastic samplers of world dynamics. We further introduce PAWEval, an outcome-level protocol that converts repeated video rollouts into empirical distributions over possible physical behaviors. Across 50 scenarios and eleven current systems, no model consistently matches the reference probabilities while recovering the range of valid behaviors. Having established this gap, we test whether language prompts, initial noise sampling, or model training can reshape the model's predictive distribution. We believe our work can serve as a foundation for future efforts to move towards probabilistically aligned world modeling.