AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning
作者: Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua
分类: cs.CV
发布日期: 2026-08-21
备注: The code and dataset are publicly available. Code: https://github.com/lzlfwow/AffordAny. Dataset: https://modelscope.cn/datasets/lzlfwow/AffordAny
💡 一句话要点
提出AffordAny以解决开放世界3D功能定位问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 开放世界学习 3D功能定位 视觉-语言模型 伪标签自训练 多模态学习
📋 核心要点
- 现有方法依赖于预构建的3D几何体和封闭的功能本体,限制了从原始RGB图像进行开放世界3D功能定位的能力。
- AffordAny框架通过单幅RGB图像构建文本条件的3D部件监督,并利用冻结的视觉-语言模型进行功能定位,提升开放世界泛化能力。
- 在未见物体和未见类别的评估中,经过自训练后,方法的IoU分别达到了0.428和0.315,显示出显著的性能提升。
📝 摘要(中文)
开放世界3D功能定位需要根据自由形式的语言查询在3D空间中定位功能性物体部件。现有方法通常假设预构建的物体中心3D几何体和封闭的功能本体,限制了从原始RGB观察中进行部署。我们提出了AffordAny,一个端到端框架,利用单幅单目RGB图像构建大规模文本条件的3D部件监督,通过冻结的视觉-语言模型(VLM)引导解码器进行功能定位,并通过伪标签自训练提高开放世界泛化能力。我们的自动化管道生成了一个包含5,334个物体和10,633个部件级样本的基准,涵盖473个类别,相较于以往工作在类别多样性上有数量级的提升。经过自训练后,我们的方法在未见物体和未见类别的系统泛化协议下分别达到了0.428的IoU和0.315的IoU,未见类别的mIoU相对提升6.3%(p<0.01),指令敏感性差距仅为0.105,展示了我们方法的有效性和鲁棒性。
🔬 方法详解
问题定义:本论文旨在解决开放世界3D功能定位的问题,现有方法的痛点在于依赖于预构建的物体中心3D几何体和封闭的功能本体,限制了从原始RGB观察中进行有效部署。
核心思路:论文提出的核心思路是利用单幅单目RGB图像构建大规模的文本条件3D部件监督,并通过冻结的视觉-语言模型引导解码器进行功能定位,同时通过伪标签自训练提升开放世界的泛化能力。
技术框架:整体架构包括三个主要模块:首先是通过单幅RGB图像生成3D部件监督;其次是利用冻结的视觉-语言模型进行功能定位;最后是通过伪标签自训练进一步增强模型的泛化能力。
关键创新:最重要的技术创新在于构建了一个自动化的管道,生成了一个包含5,334个物体和10,633个部件级样本的基准,显著提升了类别多样性,并通过伪标签自训练引入新物体而无需人工标注。
关键设计:在技术细节上,解码器通过空间投影、指令条件的语义压缩和双向几何-语义交互逐步融合冻结的Cosmos-2B特征与3D几何体,损失函数和网络结构经过精心设计以确保模型的有效性和鲁棒性。
🖼️ 关键图片
📊 实验亮点
在实验中,AffordAny在未见物体和未见类别的系统泛化协议下分别达到了0.428的IoU和0.315的IoU,未见类别的mIoU相对提升6.3%(p<0.01),指令敏感性差距仅为0.105,显示出该方法的有效性和鲁棒性。
🎯 应用场景
该研究的潜在应用领域包括机器人抓取、智能家居、增强现实等场景,能够帮助系统理解物体的功能性并进行有效的交互。未来,该方法有望在开放世界环境中实现更广泛的应用,推动智能系统的自主学习和适应能力。
📄 摘要(原文)
Open-world 3D affordance grounding requires localizing functional object parts in 3D given free-form language queries. Existing methods typically assume pre-built object-centric 3D geometry and closed affordance ontologies, limiting deployment from raw RGB observations. We present AffordAny, an end-to-end framework that uses one monocular RGB image to construct large-scale text-conditioned 3D part supervision, ground affordances with a frozen vision-language model (VLM) guided decoder, and improve open-world generalization through pseudo-label self-training. Our automated pipeline produces a benchmark of 5,334 objects and 10,633 part-level samples spanning 473 categories, an order-of-magnitude increase in categorical diversity over prior work. The decoder progressively fuses frozen Cosmos-2B features with 3D geometry through spatial projection, instruction-conditioned semantic compression, and bidirectional geometry-semantics interaction. Minimal-perturbation pseudo-label self-training further adds new objects without human annotation. Under a systematic generalization protocol evaluating unseen objects, unseen categories, and unseen instruction paraphrases, our approach achieves 0.428 IoU on unseen objects and 0.315 IoU on unseen categories after self-training, with unseen-category mIoU improving by 6.3% relative (p<0.01) and an instruction sensitivity gap of only 0.105, demonstrating effectiveness and robustness of our method.