KLTNet: Learning Sparse Feature Tracking for Robust and Accurate Monocular Visual-Inertial Odometry
作者: Renbiao Jin, Danping Zou, Wenxian Yu
分类: cs.CV
发布日期: 2026-08-25
💡 一句话要点
提出KLTNet以解决稀疏特征跟踪的鲁棒性与准确性问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视觉惯性里程计 稀疏特征跟踪 深度学习 光流 机器人导航 增强现实
📋 核心要点
- 现有的KLT跟踪器在快速运动或低纹理环境下表现不佳,影响了视觉惯性里程计的准确性和鲁棒性。
- KLTNet通过结合低分辨率稠密光流与三元组图块细化,提供了一种新的稀疏特征跟踪方法,旨在提高跟踪的稳定性和准确性。
- 实验结果显示,KLTNet在多个基准测试中超越传统KLT,跟踪和里程计的准确性显著提升,同时保持实时性能。
📝 摘要(中文)
许多基于特征的视觉惯性里程计(VIO)系统依赖稀疏特征跟踪,其准确性和鲁棒性直接影响状态估计。传统的KLT跟踪器主要依赖局部图像块,在快速运动或低纹理环境下可能变得不可靠。本文提出KLTNet,一个轻量级的基于学习的稀疏特征跟踪器,旨在替代传统KLT跟踪器。KLTNet采用粗到细、密到稀的架构,结合低分辨率的稠密光流进行鲁棒的全局运动初始化,并通过三元组图块细化实现准确且时间一致的跟踪。此外,KLTNet通过可微分的多视图三角测量预测各向异性置信权重,可用于兼容的VIO估计器中的观测权重。实验结果表明,KLTNet在公共基准和自收集的低纹理数据集上,跟踪和里程计准确性均优于传统KLT,同时在嵌入式平台上保持实时性能。
🔬 方法详解
问题定义:本文旨在解决传统KLT跟踪器在快速运动和低纹理环境下的鲁棒性不足问题,这直接影响到视觉惯性里程计的性能。
核心思路:KLTNet采用粗到细、密到稀的架构,首先利用低分辨率的稠密光流进行全局运动初始化,然后通过三元组图块细化实现准确的特征跟踪,以提高跟踪的稳定性和准确性。
技术框架:KLTNet的整体架构包括两个主要阶段:第一阶段是使用稠密光流进行全局运动初始化,第二阶段是通过三元组图块进行特征跟踪和细化。固定的参考图块在整个跟踪过程中提供稳定的锚点,减少了跟踪漂移。
关键创新:KLTNet的主要创新在于引入了可微分的多视图三角测量来预测各向异性置信权重,这些权重可以作为VIO估计器中的观测权重,从而提高了跟踪的准确性和鲁棒性。
关键设计:KLTNet的设计中包括了固定参考图块的使用、低分辨率稠密光流的初始化方法,以及通过三元组图块进行的细化过程,确保了跟踪的时间一致性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,KLTNet在VINS-Mono和OpenVINS的测试中,跟踪和里程计准确性均显著优于传统KLT,具体提升幅度未知,同时在嵌入式平台上保持实时性能,展示了其在实际应用中的可行性。
🎯 应用场景
KLTNet在视觉惯性里程计(VIO)领域具有广泛的应用潜力,特别是在无人驾驶、增强现实和机器人导航等场景中。其提高的跟踪准确性和鲁棒性将有助于提升这些系统的整体性能和可靠性,推动相关技术的进一步发展。
📄 摘要(原文)
Many feature-based visual-inertial odometry (VIO) systems rely on sparse feature tracking, whose accuracy and robustness directly affect state estimation. Classical KLT trackers rely primarily on local image patches and can become unreliable under rapid motion or in low-texture environments. We propose KLTNet, a lightweight learning-based, plug-and-play sparse feature tracker designed to replace classical KLT trackers in KLT-based VIO front ends. KLTNet follows a coarse-to-fine, dense-to-sparse architecture that combines low-resolution dense optical flow for robust global motion initialization with triplet-patch refinement for accurate and temporally consistent tracking. A fixed reference patch provides a stable anchor throughout each feature track and helps reduce accumulated tracking drift. In addition, KLTNet predicts anisotropic confidence weights supervised through differentiable multi-view triangulation, which can be used as observation weights in compatible VIO estimators. Experiments with VINS-Mono and OpenVINS on public benchmarks and a self-collected low-texture dataset demonstrate improved tracking and odometry accuracy over classical KLT, while maintaining real-time performance on an embedded platform.