Multi-View Unified Camera Fields: Geometry-Shaped Action-Facing Representations for RGB-Only Multi-Camera VLA Policies

📄 arXiv: 2608.01826v1 📥 PDF

作者: Jiarui Yang, Yehao Lu, Yuning Su, Yufeng Xie, Yu Zhong, Haiyu Lan, Tianjing Hao, Kaixiang Lu, Peiwen Lin, Chuang Wang, Enyu Li, Junwei Liang

分类: cs.RO

发布日期: 2026-08-03


💡 一句话要点

提出多视角统一相机场以解决RGB-only多相机VLA策略问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉-语言-动作 多视角学习 机器人操作 深度恢复 跨视图匹配 动作表示 RGB-only部署

📋 核心要点

  1. 现有的多相机视觉-语言-动作模型在复杂任务中表现不足,特别是在深度和一致性方面存在挑战。
  2. 本文提出的MVUCF框架通过共享动作面向潜在场和坐标查询深度目标,解决了现有方法的不足。
  3. 在六个RoboTwin任务中,MVUCF在LIBERO上达到了98.9%的成功率,相较于LIBERO-Plus提升了22.4个百分点,成功率提高了23.3个百分点。

📝 摘要(中文)

视觉-语言-动作(VLA)模型在机器人操作中表现出强大的泛化能力,但复杂的接触丰富任务通常需要多相机观察,以共同捕捉末端执行器、物体和目标,尤其是在遮挡情况下。现有的多相机VLA通常通过连接视图标记,导致动作表示在度量深度上较弱且在不同相机间不一致。本文提出了多视角统一相机场(MVUCF),这是一个仅用于训练的框架,形成跨视图的共享动作面向潜在场。通过坐标查询深度目标,使度量深度可恢复,同时预处理感知对应目标对齐观察同一物理点的标记。经过几何注入后,深度、相机校准和辅助头被移除,因此部署使用原始的RGB-only图,不增加额外的推理FLOPs。实验结果表明,MVUCF在深度恢复和跨视图匹配方面表现更强。

🔬 方法详解

问题定义:本文旨在解决现有多相机视觉-语言-动作模型在复杂接触任务中的深度和一致性不足的问题。现有方法通常通过简单连接视图标记,导致动作表示在度量深度上较弱。

核心思路:MVUCF框架的核心思想是形成一个跨视图的共享动作面向潜在场,通过坐标查询深度目标和预处理感知对应目标的对齐,增强动作表示的深度和一致性。

技术框架:MVUCF的整体架构包括多个模块,首先是通过多视角数据训练形成共享潜在场,然后通过坐标查询深度目标和预处理感知对应目标对齐来优化动作表示,最后在部署阶段去除深度和相机校准信息,保持RGB-only输入。

关键创新:MVUCF的主要创新在于引入了坐标查询深度目标和预处理感知对应目标对齐机制,这与现有方法的简单视图连接形成了本质区别,显著提升了深度恢复和跨视图匹配能力。

关键设计:在设计中,采用了特定的损失函数来优化深度恢复和对应目标对齐,同时在网络结构上进行了调整,以支持多视角数据的有效处理。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,MVUCF在LIBERO数据集上达到了98.9%的成功率,相较于LIBERO-Plus提升了22.4个百分点,并在六个RoboTwin任务中成功率提高了23.3个百分点,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用场景包括复杂的机器人操作任务,如抓取、移动和放置等,尤其是在需要多相机视角的环境中。通过提高RGB-only部署的有效性,MVUCF有望在实际机器人系统中实现更高的操作成功率,推动机器人技术在工业和服务领域的应用。

📄 摘要(原文)

Vision-Language-Action (VLA) models have shown strong generalization in robotic manipulation, yet complex contact-rich tasks often benefit from multi-camera observations that jointly capture the end effector, objects, and targets under occlusion. Existing multi-camera VLAs usually concatenate view tokens, leaving action representations weak in metric depth and inconsistent across cameras. We introduce Multi-View Unified Camera Fields (MVUCF), a training-only framework that forms a shared action-facing latent field across views. A coordinate-query depth objective makes metric depth recoverable, while a preprocessing-aware correspondence objective aligns tokens observing the same physical point from different cameras. Both directly shape the hidden states consumed by the action module. After geometry injection, depth, camera calibration, and auxiliary heads are removed, so deployment uses the original RGB-only graph with no extra inference FLOPs. Held-out probes confirm stronger depth recovery and cross-view matching. Under matched GR00T-N1.6 settings, MVUCF reaches 98.9% on LIBERO, improves LIBERO-Plus by 22.4 points, and raises success by 23.3 points across six RoboTwin tasks spanning three action families: touch, move-and-place, and contact interaction. Real-world humanoid experiments further provide evidence of its practical effectiveness under RGB-only deployment.