VI3: Grounding Pretrained 3D Foundation Models with Inertial Cues
作者: Ernesto Lozano, Alberto Jaenal, Javier Civera
分类: cs.CV
发布日期: 2026-09-03
💡 一句话要点
提出VI3框架以解决3D基础模型的尺度预测问题
🎯 匹配领域: 支柱七:动作重定向 (Motion Retargeting) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 3D基础模型 惯性测量单元 尺度恢复 模型无关 几何一致性
📋 核心要点
- 现有的3D基础模型在单目图像下无法准确预测绝对尺度,导致其输出的尺度信息不可靠。
- VI3框架通过结合惯性测量单元(IMU)数据,提供了一种模型无关的方法来锚定3DFM的尺度,增强了其输出的准确性。
- 实验结果显示,VI3在合成和真实的航空数据集上表现出色,能够在没有真实标签的情况下恢复尺度,并保持几何一致性。
📝 摘要(中文)
3D基础模型(3DFMs)在从多个视角预测相机姿态和密集深度方面表现优异,展现出强大的零-shot泛化能力。然而,由于单目图像无法观察到度量尺度,其绝对尺度预测通常不准确。惯性测量单元(IMUs)在大多数设备中存在,自然补充了单目相机的功能,通过观察缩放运动来提供信息。我们提出了VI3,这是一个模型无关的框架,仅利用IMU读数对预训练的3DFM进行度量锚定。VI3初始化并预积分IMU,以获得度量运动参考,然后用于恢复3DFM输出的尺度。我们的方案包括针对不同3DFM架构的可适应锚定策略。实验结果表明,VI3在没有真实监督的情况下恢复了度量尺度,同时保持几何一致性,在良好条件下的运动中作为精细调整,在运动信息较少时作为强先验。
🔬 方法详解
问题定义:论文要解决的问题是如何在单目图像的情况下准确预测3D基础模型的尺度。现有方法由于缺乏度量尺度的观察,导致尺度预测不准确,影响了3DFM的实际应用。
核心思路:论文提出的核心思路是利用惯性测量单元(IMU)提供的运动信息来为预训练的3DFM提供度量锚定。通过IMU的读数,VI3能够在没有真实标签的情况下恢复3DFM的尺度。
技术框架:VI3的整体架构包括IMU的初始化和预积分模块,这些模块共同工作以获取度量运动参考。然后,这个参考用于调整3DFM的输出尺度。该框架设计为模型无关,适用于多种3DFM架构。
关键创新:VI3的主要创新在于其模型无关性和适应性锚定策略,使其能够针对不同的3DFM架构进行优化。这一设计与现有方法的本质区别在于不依赖于真实的尺度标签,而是通过IMU数据实现尺度的恢复。
关键设计:在设计中,VI3采用了IMU的预积分技术,以确保运动参考的准确性。此外,框架中还包含了针对不同3DFM的可适应锚定策略,以提高其在多种场景下的适用性和性能。
🖼️ 关键图片
📊 实验亮点
实验结果表明,VI3在合成和真实航空数据集上均能有效恢复尺度,且在没有真实监督的情况下,保持了几何一致性。与基线方法相比,VI3在尺度恢复的准确性上有显著提升,具体性能数据尚未披露。
🎯 应用场景
该研究的潜在应用领域包括无人机导航、增强现实和机器人视觉等。通过结合IMU数据,VI3能够在缺乏真实尺度信息的情况下,提供更为准确的3D场景理解。这一方法的实际价值在于提升了3DFM在复杂环境中的应用能力,未来可能推动相关技术的广泛应用。
📄 摘要(原文)
3D foundation models (3DFMs) excel at predicting camera poses and dense depth from multiple views of a scene, showcasing strong zero-shot generalization. However, as metric scale is not observable from monocular images, their absolute scale predictions are typically inaccurate. Inertial measurement units (IMUs), present in most devices, naturally complement monocular cameras by observing scaled motion. We introduce VI3, a model-agnostic framework that metrically anchors a pretrained 3DFM using only IMU readings. VI3 initializes and preintegrates the IMU to obtain a metric motion reference, which is then used to recover the scale of the 3DFM outputs. Our method includes adaptable anchoring strategies tailored to diverse 3DFM architectures. Experiments on synthetic and real aerial datasets demonstrate that VI3 recovers metric scale without ground-truth supervision while preserving geometric consistency, acting as a fine refinement under well-conditioned motion and as a strong prior when motion is less informative.