PAWBench: How Far Are We from Probabilistically Aligned World Modeling?
作者: Yuandong Pu, Le Zhuo, Sayak Paul, Gabriel Jorge Menezes, Avram Đorđević, Shiyang Li, Yifan Zhou, Bin Fu, Wenlong Zhang, Junjun He, Yu Qiao, Yihao Liu, Jingbo Xing, Xi Chen
分类: cs.CV, cs.AI
发布日期: 2026-08-27
💡 一句话要点
提出PAWBench以评估视频生成模型的概率对齐能力
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 视频生成 世界建模 概率对齐 评估基准 物理行为
📋 核心要点
- 核心问题:现有视频生成模型评估主要关注单个视频的合理性,缺乏对生成分布的全面评估。
- 方法要点:论文提出PAWBench基准,形式化概率对齐为世界模型的分布标准,并引入PAWEval协议。
- 实验或效果:在50个场景和11个系统的测试中,未发现模型能够一致匹配参考概率,揭示了当前模型的局限性。
📝 摘要(中文)
近年来,视频生成模型越来越多地被视为世界模型。许多物理过程可以以多种有效方式展开,因此,世界模型不仅应重现合理的轨迹,还应在相同的初始观察和动作下,重现可能行为的分布。我们称这种分布级别的要求为概率对齐。然而,现有评估主要评估单个视频的合理性,而未测试重复生成是否恢复正确的分布。为此,我们将概率对齐形式化为世界模型的分布标准,并引入PAWBench作为评估视频生成器的基准。我们还引入PAWEval,将重复视频生成转化为可能物理行为的经验分布。通过对50个场景和11个当前系统的测试,发现没有模型能够一致地匹配参考概率,同时恢复有效行为的范围。我们认为这项工作可以为未来朝着概率对齐的世界建模努力奠定基础。
🔬 方法详解
问题定义:论文要解决的问题是现有视频生成模型在生成过程中未能有效恢复物理行为的概率分布,导致评估结果不够全面。现有方法主要集中在单个视频的合理性上,忽视了生成结果的多样性和分布特征。
核心思路:论文的核心思路是将概率对齐作为世界模型的分布标准,通过引入PAWBench基准和PAWEval协议,系统性地评估视频生成模型的表现。这种设计旨在确保模型不仅生成合理的轨迹,还能反映出可能行为的真实分布。
技术框架:整体架构包括两个主要模块:PAWBench基准用于评估视频生成器的性能,PAWEval协议用于将重复生成的视频转化为经验分布。通过对比生成结果与参考概率,评估模型的对齐能力。
关键创新:最重要的技术创新点在于将概率对齐形式化为评估标准,并通过引入新的基准和协议,填补了现有评估方法的空白。这种方法与传统的单视频评估方法本质上不同,强调了生成分布的多样性。
关键设计:在设计中,关键参数包括生成模型的初始噪声采样方式、训练策略以及损失函数的选择。这些设计决定了模型在生成过程中如何捕捉和恢复物理行为的分布特征。具体的网络结构和训练细节在论文中进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在50个场景和11个视频生成系统的测试中,没有任何模型能够一致匹配参考概率,同时恢复有效行为的范围。这一发现揭示了当前视频生成模型在概率对齐方面的显著不足,强调了进一步研究的必要性。
🎯 应用场景
该研究的潜在应用领域包括视频生成、虚拟现实和机器人控制等。通过提高视频生成模型的概率对齐能力,可以在模拟和预测复杂物理过程时提供更准确的结果,从而推动相关领域的发展。未来,该方法可能会影响智能系统的决策能力和交互质量。
📄 摘要(原文)
Recent video generation models are increasingly framed as world models. Many physical processes can unfold in more than one valid way. Therefore, a world model should reproduce not only a plausible trajectory, but also the distribution of possible behaviors under the same initial observation and action. We call this distribution-level requirement probabilistic alignment. However, existing evaluations largely assess individual-video plausibility and do not test whether repeated generations recover the correct distribution. This raises a central question: how far are current video generators from probabilistically aligned world modeling? To answer it, we formalize probabilistic alignment as a distributional criterion for world models and introduce PAWBench, a benchmark for evaluating video generators as stochastic samplers of world dynamics. We further introduce PAWEval, an outcome-level protocol that converts repeated video rollouts into empirical distributions over possible physical behaviors. Across 50 scenarios and eleven current systems, no model consistently matches the reference probabilities while recovering the range of valid behaviors. Having established this gap, we test whether language prompts, initial noise sampling, or model training can reshape the model's predictive distribution. We believe our work can serve as a foundation for future efforts to move towards probabilistically aligned world modeling.