PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning

📄 arXiv: 2608.04575v1 📥 PDF

作者: Chen Yang, Shenxiang Zeng, Haoyang Zhao, Zhouyuan Xu, Youquan He, Haoyu Li, Mingyi Deng, Jiansheng Fan, Chen Wang

分类: cs.CV, cs.AI

发布日期: 2026-08-05

备注: 27 pages, 18 figures. Project page: https://physmind.github.io/


💡 一句话要点

提出PhysMind框架以解决视频中的物理推理问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 物理推理 视频理解 无训练框架 动态场景重建 多模态学习

📋 核心要点

  1. 现有的视觉语言模型在理解视频中的物理动态和推理未来结果方面存在显著不足。
  2. PhysMind框架通过构建可执行的动态世界,利用物体分割和6D姿态跟踪等技术,实现了无训练的物理推理。
  3. 实验结果表明,PhysMind在CLEVRER和Physion++数据集上分别提高了38.23分和8.08分,且在反事实问题上超越了GPT-5.5基线。

📝 摘要(中文)

可靠的视频物理推理需要理解物体的运动、相互作用及对干预的反应。现有的视觉语言模型(VLMs)在解释这些动态和可靠推理未来及反事实结果方面常常存在困难。本文提出PhysMind,一个无训练的代理框架,为每个视频构建一个可重用的、与问题无关的可执行世界。PhysMind通过物体分割、网格重建和6D姿态跟踪恢复时间一致的动态场景,然后拟合解析的连续时间动态和潜在物理参数,而无需展开时间步进模拟器。给定问题后,它检查、继续或编辑世界,并从结果的轨迹和交互中回答。相较于直接的链式思维推理,PhysMind在CLEVRER上提高了38.23分,在Physion++上提高了8.08分。在反事实问题上,其表现超越了最强的VLM基线GPT-5.5,提升了19.25分。

🔬 方法详解

问题定义:本文旨在解决从视频中进行可靠物理推理的挑战,现有方法在动态理解和未来推理方面表现不佳,尤其是在复杂场景中。

核心思路:PhysMind通过构建一个可重用的可执行世界,利用视频中的信息进行物理推理,避免了传统方法的训练需求,提升了推理的灵活性和准确性。

技术框架:PhysMind的整体架构包括物体分割、网格重建和6D姿态跟踪等模块,首先恢复动态场景,然后拟合物理参数,最后根据用户问题进行世界的检查和编辑。

关键创新:PhysMind的最大创新在于其无训练的设计理念,能够在不依赖时间步进模拟器的情况下,直接从视频中提取物理动态信息,显著提高了推理的效率和准确性。

关键设计:在技术细节上,PhysMind采用了先进的物体分割算法和高效的姿态跟踪技术,结合解析的连续时间动态模型,确保了动态场景的准确重建和物理参数的有效拟合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

PhysMind在CLEVRER和Physion++数据集上的实验结果显示,其准确性分别提高了38.23分和8.08分,尤其在反事实问题上超越了GPT-5.5基线,提升幅度达到19.25分,展示了其在物理推理任务中的强大能力。

🎯 应用场景

该研究的潜在应用领域包括机器人导航、自动驾驶、虚拟现实和增强现实等,能够为这些领域提供更为准确的物理推理能力,提升智能系统的决策能力和交互体验。未来,PhysMind可能在教育、娱乐等多个行业中发挥重要作用。

📄 摘要(原文)

Reliable physical reasoning from video requires understanding how objects move, interact, and respond to interventions. Existing vision-language models (VLMs) often struggle to interpret these dynamics and reason reliably about future and counterfactual outcomes. We introduce PhysMind, a training-free agentic framework that constructs one reusable, question-agnostic executable world per video. PhysMind recovers a temporally consistent dynamic scene through object segmentation, mesh reconstruction, and 6D pose tracking, then fits analytic continuous-time dynamics and latent physical parameters without unrolling a time-stepped simulator. Given a question, it inspects, continues, or edits the world and answers from the resulting trajectories and interactions. Relative to direct chain-of-thought (CoT) reasoning with the same VLM, PhysMind improves accuracy by 38.23 points on CLEVRER and 8.08 points on Physion++. On counterfactual questions, it exceeds the strongest evaluated VLM baseline, GPT-5.5, by 19.25 points.