CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

📄 arXiv: 2608.06688v1 📥 PDF

作者: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

分类: cs.RO

发布日期: 2026-08-07


💡 一句话要点

提出CrossTracer以解决跨实体导航中的移动约束问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction) 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 跨实体导航 视觉-语言-动作 自适应轨迹残差 机器人导航 语义推理 物理基础 全景分割 可通行性成本图

📋 核心要点

  1. 现有的视觉-语言-动作模型在机器人导航中未能充分考虑不同机器人之间的移动约束,导致生成的路径在物理上不可行。
  2. CrossTracer通过自适应轨迹残差的方式,提出了一种分层框架,将导航计划与实体特定的移动约束相结合,提升了导航的有效性。
  3. 在NaviTrace基准测试中,CrossTracer的总得分为45.68,超越了最强的通用基线Gemini-2.5-Pro,提升幅度达到28.1%。

📝 摘要(中文)

视觉-语言-动作(VLA)模型为机器人导航提供了强大的语义先验,但往往忽视了特定实体的移动约束。不同机器人可能在语义上可行的路径在物理上却不可行。为此,本文提出了CrossTracer,一个通过自适应轨迹残差实现跨实体导航的分层框架。CrossTracer将导航计划表示为标准化的图像平面航点,形成语义推理与物理基础之间的统一像素空间接口。首先,视觉-语言轨迹提议器(VL-Tracer)适应预训练的VLA模型,从自我中心观察和灵活的目标规格中预测初始导航轨迹。其次,CE-Adapter通过从视觉可通行性线索、机器人身份和初始轨迹中预测实体条件的残差修正来优化该轨迹。CrossTracer在NaviTrace基准上评估,结果显示其在生成符合实体的一致导航轨迹方面表现优异。

🔬 方法详解

问题定义:本文旨在解决跨实体导航中的移动约束问题。现有的VLA模型未能考虑不同机器人在物理环境中的移动能力,导致生成的导航路径在某些情况下不可行。

核心思路:CrossTracer通过引入自适应轨迹残差,结合语义推理与物理基础,提供了一种新的导航框架。该设计旨在确保生成的路径不仅在语义上合理,同时在物理上也可行。

技术框架:CrossTracer的整体架构包括两个主要模块:视觉-语言轨迹提议器(VL-Tracer)和CE-Adapter。VL-Tracer负责从自我中心观察中生成初始轨迹,而CE-Adapter则通过视觉可通行性线索进行轨迹优化。

关键创新:CrossTracer的主要创新在于其自适应轨迹残差机制,能够根据不同机器人的特性进行动态调整。这一机制与传统方法的静态路径生成方式形成鲜明对比。

关键设计:在设计中,CrossTracer利用了全景分割生成机器人条件的可通行性成本图,并通过成本最小化生成像素空间轨迹。此外,模型的训练过程避免了昂贵的手动标注,提升了效率。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CrossTracer在NaviTrace基准测试中取得了45.68的总得分,超越了最强通用基线Gemini-2.5-Pro,提升幅度达到10.01分,表现出28.1%的相对改进。此外,在实际应用中,CrossTracer在轮式和腿式机器人上的导航成功率和执行效率均有显著提升。

🎯 应用场景

CrossTracer的研究成果在多种机器人导航场景中具有广泛的应用潜力,包括服务机器人、无人驾驶车辆和探索机器人等。通过提高导航的成功率和执行效率,该框架能够在复杂环境中实现更高效的自主移动,推动智能机器人技术的发展。

📄 摘要(原文)

Vision-language-action (VLA) models provide strong semantic priors for robot navigation, but they often ignore embodiment-specific mobility constraints. A path that is semantically plausible for one robot may be physically infeasible for another. We propose CrossTracer, a hierarchical framework for cross-embodiment navigation through adaptive trace residuals. CrossTracer represents navigation plans as normalized image-plane waypoints, forming a unified pixel-space interface between semantic reasoning and physical grounding. First, Vision-Language Trace Proposer (VL-Tracer) adapts a pretrained VLA model to predict an initial navigation trace from egocentric observations and flexible goal specifications. Second, CE-Adapter refines this trace by predicting embodiment-conditioned residual corrections from visual traversability cues, robot identity, and the initial trace. To train the refinement module without costly manual annotation, Cross-Embodiment RRT (CE-RRT) converts panoptic segmentation into robot-conditioned traversability cost maps and generates cost-minimizing pixel-space traces. We evaluate CrossTracer on the NaviTrace benchmark, which tests whether a model can generate embodiment-consistent navigation traces from egocentric observations, language instructions, and robot embodiment types. CrossTracer achieves a total score of 45.68, outperforming the strongest evaluated general-purpose baseline, Gemini-2.5-Pro, by 10.01 points, corresponding to a 28.1% relative improvement. Real-world deployment on wheeled and legged robots further shows improved navigation success and execution efficiency.