Geometry-Aware Camera Localization for Bronchoscopy
作者: Lumin Chen, Qingyao Tian, Jinpeng Li, Haoyu Jiang, Huai Liao, Xinyan Huang, Hongbin Liu, Dong Yi
分类: cs.CV, cs.AI
发布日期: 2026-08-07
备注: Accepted by ACM MM2026
🔗 代码/项目: PROJECT_PAGE
💡 一句话要点
提出几何感知框架以解决支气管镜定位问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting)
关键词: 支气管镜定位 几何感知 实时推理 Transformer模型 结构先验 姿态估计 医疗影像
📋 核心要点
- 现有方法未能有效利用术前几何先验,导致支气管镜定位的鲁棒性和准确性不足。
- 提出了一种几何感知的支气管镜定位框架(GABL),通过融合术前结构先验与术中视频来估计相机姿态。
- 实验结果显示,该方法在平移和旋转误差上分别减少了8.37%和31.76%,并实现了33.6 FPS的实时推理速度。
📝 摘要(中文)
支气管镜中的相机定位仍然是一个具有挑战性的问题,主要由于对精度的严格要求、实时性约束和有限的训练数据。与自然场景相比,狭窄的解剖结构需要毫米级的精度,而术中引导则要求低延迟推理。然而,现有方法往往未能有效利用术前几何先验,限制了其鲁棒性和准确性。为了解决这些局限性,我们提出了一种统一的几何感知支气管镜定位框架(GABL),有效融合术前结构先验与配对的术中视频,以估计6自由度相机姿态。具体而言,为了解决复杂气道中的视觉歧义,我们提出了一种图引导的粗到细定位方案,有效利用结构先验进行精确姿态估计。此外,为了减轻姿态抖动并弥合视觉与结构之间的差距,我们将基于Transformer的跟踪模型与新颖的RGB-深度匹配目标相结合,共同强制执行时空和几何一致性。大量实验表明,我们的方法在平移和旋转误差上分别减少了8.37%和31.76%,并实现了4倍的推理加速(33.6 FPS),实现了鲁棒的实时支气管镜定位。
🔬 方法详解
问题定义:本论文旨在解决支气管镜中的相机定位问题,现有方法在精度和实时性方面存在不足,尤其是在复杂的解剖结构中,无法有效利用术前几何信息。
核心思路:提出的GABL框架通过融合术前结构先验与术中视频,利用图引导的粗到细定位方案来提高姿态估计的精度,旨在克服视觉歧义和姿态抖动问题。
技术框架:整体架构包括两个主要模块:首先是图引导的定位模块,通过结构先验进行粗略定位;其次是基于Transformer的跟踪模型,结合RGB-深度匹配目标,确保时空和几何一致性。
关键创新:最重要的创新点在于有效融合术前几何先验与术中视频,采用图引导的定位策略和Transformer模型,显著提高了定位精度和实时性。
关键设计:在模型设计中,采用了新颖的RGB-深度匹配目标作为损失函数,确保了姿态估计的时空一致性,同时优化了网络结构以提高推理速度。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GABL方法在平移和旋转误差上分别减少了8.37%和31.76%,相较于现有最先进方法有显著提升。同时,该方法实现了4倍的推理速度提升,达到33.6 FPS,满足实时定位需求。
🎯 应用场景
该研究的潜在应用领域包括医疗影像引导、支气管镜检查和手术导航等。通过提高支气管镜的定位精度和实时性,能够为临床医生提供更可靠的术中指导,进而提升患者的治疗效果和安全性。未来,该技术有望扩展到其他内窥镜应用和复杂手术场景中。
📄 摘要(原文)
Camera localization in bronchoscopy remains a challenging problem due to stringent accuracy requirements, real-time constraints, and limited training data. Compared to natural scenes, the confined anatomical structures demand millimeter-level precision, while intraoperative guidance necessitates low-latency inference. However, existing methods often fail to effectively exploit preoperative geometric priors, limiting their robustness and accuracy. To address these limitations, we propose a unified geometry-aware bronchoscope localization framework (GABL) that effectively fuses preoperative structural priors with paired intraoperative video to estimate 6-DoF camera poses. Specifically, to address visual ambiguity in complex airways, we propose a graph-guided coarse-to-fine localization scheme that effectively leverages structural priors for precise pose estimation. Furthermore, to mitigate pose jitter and bridge the visual-structural gap, we integrate a Transformer-based tracking model with a novel RGB-depth matching objective, jointly enforcing spatio-temporal and geometric consistency. Extensive experiments demonstrate that our method yields remarkable reductions of 8.37% and 31.76% in translation and rotation errors over the prior state-of-the-art, alongside 4 times inference speedup (33.6 FPS) for robust real-time bronchoscope localization. Project website: https://paulili08.github.io/GABL/.