Endo-NeRF++: Uncertainty-Aware Neural Rendering with Multi-Resolution Hash Encoding for Dynamic Surgical Scene Reconstruction

📄 arXiv: 2607.27825v1 📥 PDF

作者: Gousia Habib, Laura Ruotsalainen

分类: eess.IV, cs.CV

发布日期: 2026-07-30


💡 一句话要点

提出Endo-NeRF++以解决动态外科场景重建中的不确定性问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 动态场景重建 神经渲染 不确定性建模 多分辨率编码 自适应采样 机器人手术 医疗影像处理

📋 核心要点

  1. 动态外科场景重建面临组织变形、遮挡和视角限制等挑战,现有方法难以有效处理这些不确定性。
  2. Endo-NeRF++通过多分辨率哈希网格编码和不确定性驱动的自适应采样,提升了重建精度和时间一致性。
  3. 实验结果显示,Endo-NeRF++在PSNR、SSIM和LPIPS等指标上均显著优于EndoNeRF,验证了其有效性。

📝 摘要(中文)

动态外科场景的重建对于机器人辅助的微创手术至关重要,但由于组织变形、遮挡、镜面反射和视角限制等因素,重建仍然面临挑战。本研究提出了Endo-NeRF++,一个考虑不确定性的神经渲染框架。该方法在EndoNeRF的基础上,结合了多分辨率哈希网格编码、时间特征融合和不确定性驱动的自适应采样,以提高可变形内窥镜场景的重建精度和时间一致性。多分辨率哈希网格表示有效捕捉粗细解剖细节,而时间特征融合确保在组织变形和手术工具遮挡期间的稳定重建。此外,不确定性驱动的自适应采样为不确定区域分配更多样本,从而提升渲染质量和几何一致性。实验结果表明,该方法在机器人手术视频序列中的PSNR提高了1.22 dB(4.3%),SSIM提高了5.3%,LPIPS降低了55.1%,相较于EndoNeRF基线有显著提升。

🔬 方法详解

问题定义:本论文旨在解决动态外科场景重建中的不确定性问题,现有方法在处理组织变形和遮挡时效果不佳,导致重建质量下降。

核心思路:Endo-NeRF++的核心思路是结合多分辨率哈希网格编码与不确定性驱动的自适应采样,以提高重建的准确性和一致性。通过这种设计,能够更好地捕捉细节并处理动态变化。

技术框架:该框架包括多个主要模块:多分辨率哈希网格编码用于捕捉解剖细节,时间特征融合确保在动态场景中的稳定性,而不确定性驱动的自适应采样则优化了样本分配。

关键创新:最重要的技术创新在于引入了不确定性驱动的自适应采样机制,使得在重建过程中能够动态调整样本数量,从而显著提升了渲染质量和几何一致性。

关键设计:在参数设置上,采用了多分辨率哈希网格表示,损失函数设计上考虑了重建误差和不确定性,网络结构则基于深度学习框架进行优化,以适应动态场景的需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Endo-NeRF++在机器人手术视频序列中,PSNR提高了1.22 dB(4.3%),SSIM提高了5.3%,而LPIPS降低了55.1%。这些结果显示出该方法在动态场景重建中的显著优势,验证了其有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括机器人辅助的微创手术、医疗影像处理和动态场景重建等。通过提高动态外科场景的重建精度,Endo-NeRF++能够为外科医生提供更可靠的视觉信息,从而提升手术的安全性和效率。未来,该技术有望在更广泛的医疗和机器人领域中发挥重要作用。

📄 摘要(原文)

Reconstructing dynamic surgical scenes is crucial for robot-assisted minimally invasive surgery; however, it continues to be difficult because of tissue deformation, occlusions, specular reflections, and restricted viewpoints. In this study, we introduce Endo-NeRF++, a neural rendering framework that accounts for uncertainty in the reconstruction of dynamic surgical scenes. Expanding on EndoNeRF, the suggested approach incorporates multi-resolution hash-grid encoding, temporal feature merging, and uncertainty-informed adaptive sampling to enhance reconstruction accuracy and temporal coherence in deformable endoscopic scenes.The multi-resolution hash-grid representation within the framework effectively captures both coarse and fine anatomical details, while temporal feature blending ensures stable reconstruction during tissue deformation and surgical tool occlusions. Additionally, uncertainty-driven adaptive sampling assigns more samples to uncertain areas to enhance rendering quality and geometric coherence. Experiments on robotic surgical video sequences demonstrate that the proposed uncertainty-guided adaptive sampling improves PSNR by up to 1.22\,dB (4.3\%), increases SSIM by up to 5.3\%, and reduces LPIPS by up to 55.1\% compared with the EndoNeRF baseline.