World-Coherent Decoding: Self-Verifying Test-Time Planning for World Action Models

📄 arXiv: 2609.02159v1 📥 PDF

作者: Chuhan Zhang, Seiji Ito, Kenta Hoshino, Satoshi Ikehata, Ikuro Sato

分类: cs.CV

发布日期: 2026-09-02


💡 一句话要点

提出世界一致解码以解决机器人决策不确定性问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 世界行动模型 自验证机制 测试时间规划 机器人决策 视觉合理性 动态调整 鲁棒性 在线预测器

📋 核心要点

  1. 现有的世界行动模型在决策时对未来的选择高度依赖,导致结果的不确定性和不稳定性。
  2. 本文提出的世界一致解码框架通过自验证机制提高了决策的可靠性,避免了对模型的实时更新。
  3. 实验结果表明,WCD在多个任务上显著提升了成功率,展示了其在真实场景中的有效性和鲁棒性。

📝 摘要(中文)

世界行动模型(WAMs)旨在通过随机生成视觉未来来控制机器人,但实证观察表明,结果强烈依赖于所选择的未来。本文提出了世界一致解码(WCD),一种自验证的测试时间规划框架,将WAM的展开视为可证伪的未来-行动假设。在每个决策步骤中,WCD从冻结的WAM中采样多个候选,并利用内部生成信号进行排序:基于流的视觉惊讶度用于视觉合理性,行动路径努力用于行动生成稳定性。执行后,实际观察审核所选的想象,产生想象-现实不匹配,从而训练轻量级在线预测器以选择未来候选。WCD在RoboTwin 2.0上将有限随机场景监督下的成功率从55.80%提升至60.90%,在Horizon-3任务上获得+16.43的增益,并在真实Franka视觉偏移测试中显示出定性鲁棒性。

🔬 方法详解

问题定义:本文解决的问题是现有世界行动模型在决策过程中对未来选择的高度依赖性,导致结果的不确定性和不稳定性。现有方法在面对复杂环境时,往往无法有效评估不同未来的可靠性。

核心思路:论文的核心思路是引入自验证机制,通过对WAM展开的候选进行评估,选择更可靠的未来-行动假设,从而提高决策的准确性和稳定性。

技术框架:WCD的整体架构包括多个模块:首先,从冻结的WAM中采样多个候选未来;其次,利用流基视频惊讶度和行动路径努力对候选进行排序;最后,通过实际观察审核所选想象,训练在线预测器以优化未来候选选择。

关键创新:WCD的主要创新在于将自验证机制引入到测试时间规划中,使得决策过程不再依赖于对模型的实时更新,而是通过对已执行结果的反馈进行动态调整。

关键设计:在设计中,WCD使用流基视频惊讶度作为视觉合理性的评估标准,同时引入行动路径努力作为行动生成的稳定性指标。这些设计使得WCD在复杂环境中能够有效选择更可靠的未来候选。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,WCD在RoboTwin 2.0平台上将有限随机场景监督下的成功率从55.80%提升至60.90%,在Horizon-3任务上获得了+16.43的显著增益。此外,WCD在真实Franka视觉偏移测试中表现出良好的鲁棒性,验证了其在实际应用中的有效性。

🎯 应用场景

该研究的潜在应用场景包括机器人自主导航、智能制造和人机交互等领域。通过提高机器人在复杂环境中的决策可靠性,WCD能够显著提升机器人在实际应用中的表现,具有广泛的实际价值和未来影响。

📄 摘要(原文)

World Action Models (WAMs) aim to control robots by stochastically generating visual futures and then decoding actions, but empirical observations indicate that the results can strongly depend on which future is selected. We propose World-Coherent-Decoding (WCD), a self-verifying test-time planning framework that treats WAM rollouts as falsifiable future--action hypotheses. At each decision step, WCD samples multiple candidates from a frozen WAM and ranks them using internal generative signals: flow-based video surprisal for visual plausibility and action path effort for action-generation stability. After execution, the realized observation audits the selected imagination, yielding an imagination--reality mismatch that trains a lightweight online predictor for future candidate selection. Thus, WCD converts delayed self-verification into pre-execution reliability estimation without updating the backbone model. On RoboTwin 2.0, WCD improves Hard success under limited randomized-scene supervision from $55.80\%$ to $60.90\%$, with a $+16.43$ gains on Horizon-3 tasks, and shows qualitative robustness on real Franka visual-shift tests. These results highlight a simple principle: test-time scaling for WAMs depends less on sampling more futures than on selecting reliable ones.