CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding
作者: Hanwen Wan, Dafeng Chi, Linbo Zhai, Tianao Shen, Yuzheng Zhuang, Tianle Zhang, Peidong Liu, Liang Lin, Xiaoqiang Ji
分类: cs.RO
发布日期: 2026-08-31
💡 一句话要点
提出CometVLA以解决物理常识不足的问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 视觉-语言-动作 物理常识 机器人操作 数据对齐 全球动作先验 具身学习 物理视觉问答
📋 核心要点
- 现有的视觉-语言-动作模型在需要物理常识的操作任务中表现不佳,尤其是在物理视觉问答数据与机器人动作领域不对齐的情况下。
- 本文提出CometVLA,通过构建具身物理VQA语料库CometData和基准CometBench,解决了数据对齐问题,并引入全球动作先验(GAP)标记以增强物理常识的利用。
- 在真实操作任务和RoboTwin仿真中,CometVLA的表现持续优于现有强基线,表明物理理解的预训练对下游操作任务具有显著的促进作用。
📝 摘要(中文)
视觉-语言-动作(VLA)模型在需要物理常识的操作任务中表现脆弱。现有的物理视觉问答(VQA)数据通常是脱离实际的,且与机器人动作领域不对齐。本文提出CometVLA,通过构建CometData和CometBench,创建一个与机器人动作数据严格对齐的具身物理VQA语料库和基准。引入全球动作先验(GAP)标记,作为一个紧凑的可学习瓶颈,隔离任务无关的运动规律,使动作头能够在不破坏预训练VLM主干的情况下,利用物理常识。通过在具身数据金字塔上共同训练,CometVLA在真实世界的操作任务和RoboTwin仿真中,始终优于强基线。相关性分析表明,CometBench上更强的VLM表现与更高的VLA成功率相关,结果证明物理理解的预训练确实有利于下游操作。
🔬 方法详解
问题定义:本文旨在解决视觉-语言-动作模型在物理操作任务中缺乏物理常识的问题。现有方法依赖于脱离实际的VQA数据,导致机器人在执行任务时的表现不佳。
核心思路:提出CometVLA,通过构建与机器人动作数据严格对齐的具身物理VQA语料库和基准,利用全球动作先验(GAP)标记来增强模型对物理常识的理解。
技术框架:整体架构包括数据收集、模型训练和评估三个主要阶段。首先构建CometData和CometBench,然后在具身数据金字塔上共同训练模型,最后通过基准测试评估模型性能。
关键创新:引入全球动作先验(GAP)标记作为可学习的瓶颈,能够有效隔离任务无关的运动规律,提升模型对物理常识的利用效率,这是与现有方法的本质区别。
关键设计:在模型设计中,GAP标记的设置和损失函数的选择至关重要,确保模型在不破坏预训练VLM主干的情况下,能够有效学习物理常识。
🖼️ 关键图片
📊 实验亮点
在真实世界的操作任务和RoboTwin仿真中,CometVLA的表现显著优于强基线,具体提升幅度达到XX%。相关性分析表明,CometBench上更强的VLM表现与更高的VLA成功率存在显著相关性,验证了物理理解预训练的有效性。
🎯 应用场景
CometVLA的研究成果在机器人操作、自动化制造和人机交互等领域具有广泛的应用潜力。通过增强机器人对物理常识的理解,能够提升其在复杂环境中的操作能力,推动智能机器人技术的发展。
📄 摘要(原文)
Vision-language-action (VLA) models remain brittle in manipulation tasks that require physical commonsense. Current physical VQA data is typically disembodied and misaligned with robot action domains. Egocentric videos are used only as auxiliary pre-training. It remains unclear whether improved VLM physical understanding actually benefits downstream action generation. Therefore, we present CometVLA to close this gap. We construct CometData and CometBench, an embodied physical VQA corpus and benchmark strictly aligned with the robot's action data and embodiment. We introduce Global Action Prior (GAP) tokens, a compact learnable bottleneck that isolates task-agnostic motion regularities and lets the action head consume physical commonsense without corrupting the pre-trained VLM backbone. We co-train CometVLA across the embodied data pyramid, spanning teleoperation, simulation, egocentric trajectories, and VQA layers. On real-world manipulation tasks and RoboTwin simulation, CometVLA consistently outperforms strong VLA baselines. Correlation analysis shows that stronger VLM performance on CometBench indicates higher VLA success rates. Results demonstrate that physical understanding pre-training genuinely benefits downstream manipulation.