GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

📄 arXiv: 2608.27079v1 📥 PDF

作者: Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

分类: cs.RO

发布日期: 2026-08-27


💡 一句话要点

提出GRAFT以解决细粒度机器人操作的在线适应问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 在线适应 视觉-语言-动作 生物医学任务 强化学习 视觉锚点 区域级监督

📋 核心要点

  1. 现有的视觉-语言-动作策略在细粒度生物医学任务中的在线适应面临挑战,尤其是对微小视觉线索的依赖。
  2. GRAFT框架通过区域级监督学习视角特定的视觉锚点,聚焦于任务相关的局部线索,提升在线适应效率。
  3. 在四个生物医学操作任务中,GRAFT成功率提高了25个百分点,同时降低了在线策略更新的计算成本。

📝 摘要(中文)

预训练的视觉-语言-动作(VLA)策略为机器人操作提供了强大的先验知识,但在细粒度生物医学任务中进行在线适应仍然具有挑战性。任务的成功往往依赖于微妙的、视角依赖的视觉线索,而任务级奖励对重要区域的指导有限,使得从有限的真实机器人交互中学习任务相关的视觉定位变得困难。在线适应还受到VLA推理和基于重放的更新的计算成本的限制。我们提出了GRAFT(快速任务学习的基础强化适应框架),通过基础感知实现高效的在线VLA适应。GRAFT使用区域级监督学习视角特定的视觉锚点,专注于任务相关的局部线索,而无需在部署时进行区域提议。它进一步结合单步动作生成与缓存的视觉-语言前缀重用,加速在线学习。在四个生物医学操作任务中,GRAFT在匹配的适应预算下提高了成功率25个百分点,同时减少了在线策略更新的计算开销。

🔬 方法详解

问题定义:本论文旨在解决细粒度生物医学任务中,机器人操作的在线适应问题。现有方法在处理微妙的视觉线索时,往往缺乏有效的指导,导致适应效果不佳。

核心思路:GRAFT通过区域级监督学习视角特定的视觉锚点,聚焦于任务相关的局部线索,避免了在部署时对区域提议的需求,从而提高了在线适应的效率和准确性。

技术框架:GRAFT的整体架构包括两个主要模块:区域级视觉锚点学习和单步动作生成。前者通过监督学习获取视角特定的视觉信息,后者结合缓存的视觉-语言前缀重用,加速在线学习过程。

关键创新:GRAFT的主要创新在于引入了区域级监督机制,使得机器人能够在没有区域提议的情况下,专注于任务相关的视觉线索。这一设计显著提高了在线适应的效率和成功率。

关键设计:在技术细节上,GRAFT采用了特定的损失函数来优化视觉锚点的学习,同时在动作生成过程中使用了缓存机制,以减少计算开销。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在四个生物医学操作任务中,GRAFT的成功率提高了25个百分点,且在匹配的适应预算下,显著降低了在线策略更新的计算开销。这一结果表明GRAFT在高效在线学习方面的显著优势。

🎯 应用场景

该研究的潜在应用领域包括医疗机器人、自动化手术以及其他需要高精度操作的生物医学任务。通过提高机器人在复杂环境中的适应能力,GRAFT有望在实际应用中显著提升操作效率和成功率,推动智能机器人技术的发展。

📄 摘要(原文)

Pretrained vision-language-action (VLA) policies provide strong priors for robot manipulation, yet adapting them online to fine-grained biomedical tasks remains challenging. Task success often hinges on subtle, view-dependent visual cues, while task-level rewards provide little guidance about which regions matter, making it difficult to learn task-relevant visual grounding from limited real-robot interaction. Online adaptation is further constrained by the computational cost of VLA inference and replay-based updates. We introduce GRAFT (Grounded Reinforcement Adaptation for Fast Task Learning), a framework for efficient online VLA adaptation through grounded perception. GRAFT uses region-level supervision to learn view-specific visual anchors that focus perception on task-relevant local cues without requiring region proposals at deployment. It further combines single-step action generation with cached visual-language prefix reuse to accelerate online learning. Across four biomedical manipulation tasks, GRAFT improves success rates by 25 percentage points under matched adaptation budgets, while reducing the computational overhead of online policy updates.