OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation
作者: Alperen Avan, Jordi Sanchez-Riera
分类: cs.RO, cs.CV
发布日期: 2026-08-24
🔗 代码/项目: GITHUB
💡 一句话要点
提出OptiSight以解决自主室内导航中的语义理解与几何控制问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自主导航 视觉-语言模型 几何控制 多模态融合 室内场景 障碍物规避 有限状态架构
📋 核心要点
- 现有的自主导航方法往往在语义理解与几何控制之间缺乏有效的结合,导致导航效率低下。
- OptiSight通过结合视觉-语言模型与几何控制,采用有限状态的思维链架构,优化了导航决策过程。
- 在AI Habitat的实验中,OptiSight实现了在多种室内场景下的零-shot导航,表现出良好的障碍物规避能力。
📝 摘要(中文)
自主室内导航需要语义理解和精确的几何控制。本文提出了OptiSight,一个混合框架,结合了视觉-语言模型推理与确定性视觉伺服控制,采用有限状态的思维链架构。Grounded-SAM用于定位开放词汇目标,而相机投影几何将视觉观察转换为导航指令,无需密集映射。视觉-语言模型仅在关键决策点被查询,从而减少计算开销,而几何控制则处理连续导航。在AI Habitat中的实验表明,该方法在多样化的室内场景中实现了可靠的零-shot导航,包括障碍物规避和语义模糊,同时在8GB VRAM预算内运行。源代码可在https://github.com/avanalperen/OptiSight-Python-Multimodal-CoT-for-Visual-Reasoning获取。
🔬 方法详解
问题定义:本文旨在解决自主室内导航中语义理解与几何控制之间的协调问题。现有方法在处理复杂环境时,往往面临计算开销大和导航精度不足的挑战。
核心思路:OptiSight的核心思路是通过结合视觉-语言模型推理与几何控制,利用有限状态的思维链架构来优化导航决策,从而提高导航的效率与准确性。
技术框架:该框架主要包括两个模块:Grounded-SAM用于开放词汇目标的定位,和基于相机投影几何的导航指令生成。视觉-语言模型在关键决策点被调用,几何控制模块则负责连续的导航过程。
关键创新:OptiSight的创新在于其将语义推理与几何控制有效结合,且在不需要密集映射的情况下实现了高效的导航。这一设计使得系统在处理复杂环境时更加灵活和高效。
关键设计:在设计中,OptiSight采用了有限状态的思维链架构,优化了视觉-语言模型的调用频率,确保在关键时刻进行决策,同时保持几何控制的连续性。
🖼️ 关键图片
📊 实验亮点
在AI Habitat的实验中,OptiSight实现了在多样化室内场景下的零-shot导航,表现出良好的障碍物规避能力,且在8GB VRAM预算内运行,展示了其高效性和实用性。
🎯 应用场景
OptiSight的研究成果具有广泛的应用潜力,尤其是在智能家居、机器人导航和增强现实等领域。通过提高自主导航的效率和准确性,该技术可以显著提升用户体验,并推动相关行业的发展。
📄 摘要(原文)
Autonomous indoor navigation requires both semantic understanding and precise geometric control. We propose OptiSight, a hybrid framework that combines Vision-Language Model reasoning with deterministic visual servoing through a finite-state Chain-of-Thought architecture. Grounded-SAM localizes open-vocabulary targets, while camera projection geometry converts visual observations into navigation commands without requiring dense mapping. The VLM is queried only at key decision points, reducing computational overhead while geometric control handles continuous navigation. Experiments in AI Habitat demonstrate reliable zero-shot navigation across diverse indoor scenarios, including obstacle avoidance and semantic ambiguity, while operating within an 8~GB VRAM budget. The source code is available at https://github.com/avanalperen/OptiSight-Python-Multimodal-CoT-for-Visual-Reasoning.