FUSE: Active Functional Affordance Grounding through Adaptive Semantic-Geometric Evidence Acquisition

📄 arXiv: 2608.12683v1 📥 PDF

作者: Zhou Chen, Sathyanarayanan N. Aakur

分类: cs.RO, cs.CV

发布日期: 2026-08-13

备注: Under review. 15 Pages. 9 tables, 3 Figures


💡 一句话要点

提出FUSE以解决主动功能可供性定位问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 功能可供性 主动学习 自适应探索 智能体 深度学习

📋 核心要点

  1. 现有的可供性定位方法通常从固定视角进行,缺乏在功能线索遮挡或不完整时的动态观察决策能力。
  2. 本文提出FUSE框架,通过自适应的语义-几何证据获取,结合不确定性驱动探索与学习规划器,优化视角选择。
  3. 实验结果显示,FUSE在非oracle定位性能上优于其他方法,并且计算效率提高了1.33倍,适用于多种可供性知识源。

📝 摘要(中文)

具身智能体通常需要根据物体的功能而非身份进行识别和交互,这要求它们主动获取揭示功能证据的观察。现有的可供性定位方法通常从固定视角出发,缺乏在功能线索被遮挡或不完整时决定观察位置的机制。本文提出了主动功能可供性定位的新任务,智能体通过探索场景来识别和空间定位满足功能查询的物体。为此,我们提出了FUSE,这是一个自适应语义-几何证据获取框架,结合了显式的不确定性驱动探索与学习的摊销规划器,以高效选择信息丰富的视角。我们还引入了基于Habitat的基准,用于评估主动功能定位。实验表明,FUSE在非oracle定位性能上表现最佳,相较于完全显式探索,计算量减少了1.33倍,并在多种可供性知识源上保持有效。

🔬 方法详解

问题定义:本文旨在解决具身智能体在功能可供性定位中的挑战,现有方法无法动态调整视角以获取完整的功能线索,导致定位效果不佳。

核心思路:FUSE框架通过结合不确定性驱动的探索策略与学习的规划器,动态选择信息丰富的视角,从而提高功能可供性定位的准确性和效率。

技术框架:FUSE的整体架构包括两个主要模块:不确定性驱动探索模块和学习规划器。前者负责评估当前视角的信息价值,后者则根据历史数据优化视角选择策略。

关键创新:FUSE的核心创新在于其自适应的视角选择机制,能够在功能线索不完整的情况下,动态调整探索策略,与传统固定视角方法形成鲜明对比。

关键设计:FUSE采用了基于不确定性的损失函数来评估视角信息价值,并使用深度学习网络来实现规划器的训练,确保其在多种场景下的有效性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,FUSE在非oracle定位性能上达到了最高水平,相较于完全显式探索,计算效率提高了1.33倍,展现了其在多种可供性知识源上的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能机器人、自动驾驶、虚拟现实等,能够帮助智能体更好地理解和交互环境中的物体功能。未来,FUSE框架可能推动更智能的自主系统发展,提高其在复杂环境中的适应能力。

📄 摘要(原文)

Embodied agents must often identify and interact with objects based on their function rather than their identity, requiring them to actively acquire observations that reveal discriminative functional evidence. Existing affordance grounding methods operate from fixed viewpoints and lack mechanisms for deciding where to look when functional cues are occluded or incomplete. We introduce Active Functional Affordance Grounding, a new task in which an agent sequentially explores a scene to identify and spatially ground an object satisfying a functional query. To address this problem, we propose FUSE, an adaptive semantic-geometric evidence acquisition framework that combines explicit uncertainty-driven exploration with a learned amortized planner to efficiently select informative viewpoints. We further introduce a Habitat-based benchmark for evaluating active functional grounding. Experiments show that FUSE achieves the highest observed non-oracle grounding performance while reducing computation by 1.33x relative to fully explicit exploration, and remains effective across multiple affordance knowledge sources.