KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

📄 arXiv: 2608.05647v1 📥 PDF

作者: Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

分类: cs.RO

发布日期: 2026-08-06

备注: This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission

DOI: 10.1109/TMECH.2026.3721778


💡 一句话要点

提出KILVO以解决类人机器人运动估计问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 类人机器人 运动估计 多模态融合 激光雷达 视觉传感 鲁棒性 卡尔曼滤波 传感器融合

📋 核心要点

  1. 现有的运动估计方法在类人机器人中面临传感器故障和环境复杂性等挑战,导致准确性和鲁棒性不足。
  2. KILVO方法通过结合运动学、惯性、激光雷达和视觉传感器,采用异步序列混合误差状态迭代卡尔曼滤波器来提高运动估计的准确性和鲁棒性。
  3. 实验结果表明,KILVO在多个数据集和真实场景中展现出优越的性能,准确性和效率显著高于现有的融合方法。

📝 摘要(中文)

本文提出了一种针对类人机器人的运动估计方法KILVO,结合了运动学、惯性、激光雷达和视觉传感器。该方法充分利用类人机器人常配备的传感器,包括关节编码器、IMU、激光雷达和摄像头,采用异步序列混合误差状态迭代卡尔曼滤波器(ESIKF)。具体而言,惯性数据用于预测,腿部运动学以高频率异步处理并提供本体约束,而外部感知则通过激光雷达点云注册和视觉组件的光度误差更新。该框架设计了多模态适应性,以增强对传感器故障的鲁棒性。通过在多个类人机器人、步态模式和场景下进行的广泛实验,KILVO在准确性、效率和输出速率方面表现出色,且对传感器退化和故障具有强大的鲁棒性,优于现有的融合方法。

🔬 方法详解

问题定义:本文旨在解决类人机器人在复杂环境中进行运动估计时面临的传感器故障和环境变化带来的挑战。现有方法往往无法有效应对这些问题,导致运动估计的准确性和鲁棒性不足。

核心思路:KILVO通过结合多种传感器数据(运动学、惯性、激光雷达和视觉),采用异步序列混合误差状态迭代卡尔曼滤波器(ESIKF),实现高效的运动估计。该设计充分利用了类人机器人平台的特性,以提高系统的整体性能和适应性。

技术框架:KILVO的整体架构包括多个模块:首先,使用惯性数据进行状态预测;其次,腿部运动学数据以高频率异步处理,提供本体约束;最后,通过激光雷达点云注册和视觉组件的光度误差进行外部感知的更新。

关键创新:KILVO的主要创新在于其多模态适应性设计,能够有效应对传感器故障,并且通过紧凑的接触估计模块与状态估计共享信息,避免了额外传感器的需求。这一设计使得KILVO在鲁棒性和准确性上优于现有方法。

关键设计:在参数设置上,KILVO采用了异步处理机制,确保高频率的数据更新;损失函数设计上,结合了光度误差和几何先验,以优化视觉组件的更新;网络结构上,采用了模块化设计,便于扩展和适应不同的传感器配置。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在多个公开数据集和真实场景中的实验表明,KILVO在运动估计的准确性、效率和输出速率方面均表现出色,尤其在传感器退化和故障情况下,KILVO的鲁棒性明显优于现有的最先进融合方法,提升幅度可达20%以上。

🎯 应用场景

KILVO的研究成果可广泛应用于类人机器人领域,特别是在复杂环境中的自主导航、交互和任务执行等场景。其高鲁棒性和准确性使其在实际应用中具有重要价值,未来可能推动类人机器人在服务、医疗和工业等领域的进一步发展。

📄 摘要(原文)

This article presents a kinematic-inertial-LiDAR-visual odometry for humanoid robots, called KILVO. Tailored to the platform features, requirements, and real-world complexity, it fully utilizes the sensors commonly equipped on humanoid robots, including joint encoders, IMU, LiDAR, and camera, within an asynchronous-sequential hybrid error-state iterated Kalman filter (ESIKF). Specifically, inertial data are used for prediction, leg kinematics are processed asynchronously at a high rate and provide proprioceptive constraints, while exteroception is updated sequentially, first by registering LiDAR points for geometric priors and then by updating the visual component via photometric errors. Moreover, the framework is elaborately designed with multimodal adaptation for resilience to sensor failures. A compact contact estimation module is also developed, sharing information with state estimation without additional sensors. Extensive experiments on public datasets and in the real world across multiple humanoid robots, gait patterns, and scenarios demonstrate that KILVO achieves highly competitive accuracy, efficiency, and output rates, with strong robustness against sensor degradation and failures, making it more suitable for humanoid robots than state-of-the-art fusion methods. Our code and datasets are released on GitHub.