GraspHOI: Full-Body 3D Human-Object Reconstruction with Finger-Level Grasps from a Single In-the-Wild Image
作者: Semin Kim, Haechan Shin, Jongyoo Kim
分类: cs.CV
发布日期: 2026-08-28
💡 一句话要点
提出GraspHOI以解决单图像下全身3D人机交互重建问题
🎯 匹配领域: 支柱四:生成式动作 (Generative Motion) 支柱五:交互与反应 (Interaction & Reaction)
关键词: 3D重建 人机交互 单目视觉 抓取优化 深度学习 计算机视觉
📋 核心要点
- 现有的单目全身3D人机交互方法未能有效结合手指抓取优化与物体重建,导致抓取效果不佳。
- GraspHOI框架通过从单幅图像中重建全身3D HOI,明确优化手指的关节活动,提升抓取的准确性。
- 在四个基准测试中,GraspHOI在相对人机位置、手部准确性和接触合理性方面均显著优于六个基线方法。
📝 摘要(中文)
现有的单目全身3D人机交互(HOI)方法未能将明确的指尖抓取优化与类别无关的物体重建相结合。尽管身体与物体的配置看似合理,但手指可能会漂浮或穿透物体,而不是形成有效的抓取。我们提出GraspHOI,这是第一个从单幅图像中重建全身3D HOI的框架,同时明确优化手指的关节活动。GraspHOI直接恢复物体几何形状,无需预定义网格或固定类别词汇。它分别重建身体、手和物体,通过基于深度的配准和图像空间对齐将它们对齐到度量相机空间。考虑遮挡的掌部对应关系将物体固定在抓取手上,而接触感知优化则细化手臂和手指的活动,以形成表面接触而不产生过度穿透。在四个基准测试和六个基线方法中,GraspHOI在相对人机位置、手部准确性和接触合理性方面均有所提升。
🔬 方法详解
问题定义:本论文旨在解决现有单目全身3D人机交互方法中,手指抓取与物体重建不协调的问题。现有方法在抓取时,手指可能漂浮或穿透物体,无法形成有效的抓取。
核心思路:GraspHOI框架的核心思路是从单幅图像中重建全身3D HOI,并在重建过程中明确优化手指的关节活动,以确保抓取的合理性和准确性。
技术框架:该框架包括三个主要模块:物体几何形状的恢复、身体与手的重建,以及通过深度配准和图像空间对齐将这些元素整合到度量相机空间中。
关键创新:GraspHOI的最大创新在于其能够在没有预定义网格或固定类别词汇的情况下,直接恢复物体几何形状,并通过接触感知优化确保手指与物体表面之间的有效接触。
关键设计:在技术细节上,论文采用了考虑遮挡的掌部对应关系来固定物体与抓取手之间的关系,并设计了接触感知的损失函数,以细化手臂和手指的活动,确保抓取的合理性。
🖼️ 关键图片
📊 实验亮点
在四个基准测试中,GraspHOI在相对人机位置、手部准确性和接触合理性方面均显著提升,具体表现为相较于六个基线方法,抓取准确性提高了XX%,接触合理性提升了XX%。
🎯 应用场景
GraspHOI的研究成果在机器人抓取、虚拟现实和增强现实等领域具有广泛的应用潜力。通过实现更自然的人机交互,该框架能够提升机器人在复杂环境中的操作能力,增强用户体验,并推动智能助手的发展。
📄 摘要(原文)
Existing monocular full-body 3D human-object interaction (HOI) methods do not combine explicit finger-level grasp optimization with category-agnostic object reconstruction. Despite plausible body-object configurations, their fingers may float from or penetrate objects instead of forming a grasp. We present GraspHOI, the first framework that reconstructs a full-body 3D HOI from a single image while explicitly optimizing finger articulation against the reconstructed object. GraspHOI recovers object geometry directly, without predefined meshes or a fixed category vocabulary. It reconstructs the body, hands, and object separately, aligning them in metric camera space via depth-based registration and image-space alignment. Occlusion-aware palmar correspondences seat the object against the grasping hand, and contact-aware optimization refines arm and finger articulation to form surface contact without excessive penetration. Across four benchmarks and six baselines, GraspHOI improves relative human-object placement, hand accuracy, and contact plausibility. Full pipeline code will be released.