EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation

📄 arXiv: 2608.04533v1 📥 PDF

作者: Xinyuan Guan, Feifan Chen, Xinyu Zhan, Fu-Cheng Zhang, Cewu Lu, Lixin Yang

分类: cs.CV

发布日期: 2026-08-05


💡 一句话要点

提出EgoAfford以解决复杂任务中的功能区域定位问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics) 支柱六:视频提取与匹配 (Video Extraction) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 可供性定位 多步骤任务 自我中心观察 多模态模型 功能区域分割 智能机器人 人机交互

📋 核心要点

  1. 现有方法在复杂任务中难以有效连接对象的语义角色与视觉观察,导致功能区域定位不准确。
  2. EgoAfford通过引入自我中心观察和高层次任务,提出了一种新的基准,旨在生成多步骤计划并分割功能区域。
  3. EgoLens作为参考模型在生成和手动捕获观察中表现出色,展示了在多步骤桌面任务中感知与规划的联合研究潜力。

📝 摘要(中文)

部分级别的可供性定位已推动与基本动作相关的功能物体区域的定位。将这一能力扩展到复杂任务需要将参与对象的语义角色与任务状态对齐的视觉观察和多步骤规划相连接。我们引入了EgoAfford,一个旨在连接这三方面的基准。给定一个自我中心的观察和一个高层次的桌面任务,模型必须生成剩余的计划并分割下一个动作的三个组成部分的功能区域:直接对象、工具和目的地。EgoAfford包含约15.5k个经过人工验证的图像,来自2000个生成的多步骤场景,并与EgoAfford-Real一起提供,后者包含26个任务的102个手动捕获图像。我们还提出了EgoLens,一个具有角色特定掩码解码器的3B多模态大型语言模型,作为该联合任务的领域内参考模型。

🔬 方法详解

问题定义:论文要解决的具体问题是如何在复杂任务中准确定位功能区域,并有效生成多步骤计划。现有方法在处理多样化任务时,往往无法将对象的语义角色与视觉信息有效结合,导致定位精度不足。

核心思路:论文的核心解决思路是通过引入EgoAfford基准,利用自我中心的观察和高层次的任务描述,促进功能区域的分割和多步骤计划的生成。这种设计旨在增强模型对复杂任务的理解和执行能力。

技术框架:整体架构包括三个主要模块:自我中心观察输入模块、高层次任务解析模块和功能区域分割与计划生成模块。模型通过这些模块协同工作,实现对任务的全面理解和执行。

关键创新:最重要的技术创新点在于EgoAfford基准的提出,它将任务状态与视觉观察紧密结合,允许模型在复杂任务中进行有效的多步骤推理。这与现有方法的本质区别在于其强调任务导向的可供性定位。

关键设计:在模型设计中,采用了角色特定的掩码解码器,并对损失函数进行了优化,以提高功能区域的分割精度。此外,模型的参数设置经过精细调整,以适应多样化的任务场景。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,EgoLens在生成和手动捕获的观察中均表现出色,展示了在多步骤任务中的强大参考性能。与现有的引用分割多模态语言模型和商业视觉语言模型相比,EgoLens在下一步推理和动作角色条件下的部分定位任务中展现了显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括机器人操作、智能家居系统和人机交互等。通过提升对复杂任务的理解与执行能力,EgoAfford和EgoLens能够在实际场景中实现更高效的自动化操作,推动智能系统的发展与应用。

📄 摘要(原文)

Part-level affordance grounding has advanced the localization of functional object regions associated with elemental actions. Extending this capability to complex tasks calls for connecting the semantic roles of participating objects with task-state-aligned visual observations and multi-step planning. We introduce EgoAfford, a benchmark designed to connect these three aspects. Given an egocentric observation and a high-level tabletop task, a model must generate the remaining plan and segment the functional regions of up to three components of the next action: the direct object, instrument, and destination. EgoAfford comprises approximately 15.5k human-verified images from 2,000 generated multi-step scenes, organized as semantically aligned, task-complete image series, together with EgoAfford-Real, 102 manually captured images spanning 26 tasks. We further present EgoLens, a 3B multimodal large language model with role-specific mask decoders, as an in-domain reference model for this joint task. Evaluations of recent referring-segmentation MLLMs, commercial-VLM--SAM2 pipelines, and EgoLens highlight the complementary challenges of next-step inference and action-role-conditioned part grounding. EgoLens establishes strong reference performance on both generated and manually captured observations. Together, EgoAfford and EgoLens provide a foundation for jointly studying perception and planning in multi-step tabletop tasks. Our project page is available at: https://egoafford.github.io