Route by Kinematics, Act by Observation: Kinematics-Supervised Expert Routing in MoE-Augmented VLA

📄 arXiv: 2607.26807v1 📥 PDF

作者: Tianhang Yang, Yanze Zheng, Junjie Wang, Wei-Bin Kou, Ruotong Li, Yujiu Yang

分类: cs.RO

发布日期: 2026-07-29

备注: 9 pages


💡 一句话要点

提出运动学监督专家路由以解决MoE增强VLA中的专家路由问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 运动学监督 专家路由 多模态学习 机器人操作 视觉-语言架构

📋 核心要点

  1. 现有的MoE增强视觉-语言架构在专家路由中面临运动学异质性和推理时缺乏运动学信号的挑战。
  2. 我们提出运动学监督显式路由(KinRT),通过运动学聚类将专家调度从隐式转为显式,利用运动学引导路由器训练。
  3. 实验结果显示,KinRT在RoboTwin基准测试中提升超过23.26%,在DIYRobot平台上提升超过20.27%,展现出显著的性能优势。

📝 摘要(中文)

在MoE增强的视觉-语言架构中,专家路由因操作任务的运动学异质性而面临挑战,尤其是在推理时缺乏运动学信号。本文首次观察到大多数语义上不同的操作任务可归结为多个运动学原型。基于此,我们提出了运动学监督显式路由(KinRT),将隐式的观察驱动专家路由转变为显式的运动学引导专家调度。通过对动作轨迹进行运动学聚类,生成多个运动学一致的组,并将其ID作为路由器训练的监督信号。在推理时,路由器仅依赖视觉-语言观察进行专家调度,而不依赖于动作运动学。KinRT引入了一种不对称的桥接机制,将训练中的任务运动学从动作空间提炼到推理时的观察空间。此外,我们构建了一个经济实惠的DIY机器人平台,以评估KinRT的跨平台泛化能力。实验表明,KinRT在RoboTwin基准测试和DIYRobot平台上分别优于密集和MoE特征VLA超过23.26%和20.27%。

🔬 方法详解

问题定义:本文旨在解决MoE增强视觉-语言架构中专家路由的低效问题,尤其是由于操作任务的运动学异质性和推理时缺乏运动学信号所带来的挑战。

核心思路:我们提出运动学监督显式路由(KinRT),通过对动作轨迹进行运动学聚类,生成运动学一致的组,并将其ID作为路由器训练的监督信号,从而实现显式的运动学引导专家调度。

技术框架:KinRT的整体架构包括两个主要阶段:训练阶段和推理阶段。在训练阶段,进行运动学聚类以生成运动学组,并利用这些组的ID来监督路由器的训练;在推理阶段,路由器仅依赖视觉-语言观察进行专家调度。

关键创新:KinRT的核心创新在于引入了一种不对称的桥接机制,将训练中的任务运动学从动作空间提炼到推理时的观察空间,这一设计显著提高了专家路由的有效性。

关键设计:在技术细节上,KinRT采用了特定的损失函数来优化路由器的训练过程,并设计了适应性强的网络结构,以便在不同的操作任务中实现高效的运动学聚类和专家调度。通过这些设计,KinRT能够在推理时有效利用视觉-语言信息。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在RoboTwin基准测试中,KinRT的性能提升超过23.26%,在DIYRobot平台上提升超过20.27%。这些结果表明,KinRT在专家路由的有效性上显著优于传统的密集和MoE特征VLA,为多模态学习提供了新的思路。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、自动化制造和人机交互等场景。通过提高专家路由的效率,KinRT能够在多种操作任务中实现更高的灵活性和准确性,未来可能推动智能机器人在复杂环境中的应用。

📄 摘要(原文)

While MoE augments VLA via expert specialization, router suffers from ineffective expert routing owing to the kinematic heterogeneity of actions across manipulation tasks and, even worse, the unavailability of the kinematic signals at inference time. In this work, we first observe that most semantically distinct manipulation tasks reduce to multiple kinematic archetypes. Motivated by this finding, we propose Kinematics-supervised explicit routing (KinRT), a new paradigm that shifts from implicit, observation-driven expert routing to explicit, kinematics-guided expert dispatching. Specifically, we perform kinematic clustering on action trajectories into multiple kinematically coherent groups, whose IDs serve as ground truth to supervise the training of the router; at inference time, the router dispatches experts only using visual-language observations, without any reliance on action kinematics. KinRT actually introduces an asymmetric bridging mechanism that distills the task kinematics from the action space in training into the observation space at inference. In addition, to assess KinRT's cross-platform generalization, we build an economical, Do-It-Yourself robot (DIYRobot) platform from scratch using 3D-print technology ($<$ 2,000USD). Extensive experiments demonstrate KinRT's superiority over both dense and MoE-featured VLAs by more than 23.26% on RoboTwin benchmark and 20.27% on our introduced DIYRobot platform. Our code and DIYRobot platform will be open-sourced.