GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation

📄 arXiv: 2608.27079v2 📥 PDF

作者: Yibo Qiu, Haoliang Ye, Shu'ang Sun, Zan Huang, Ronald X Xu, Mingzhai Sun

分类: cs.RO

发布日期: 2026-08-27 (更新: 2026-08-28)


💡 一句话要点

提出GRAFT以解决细粒度机器人操作的在线适应问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 机器人操作 在线适应 视觉-语言-动作 生物医学任务 强化学习 区域级监督 高效学习

📋 核心要点

  1. 现有的视觉-语言-动作策略在细粒度生物医学任务中的在线适应面临挑战,特别是对微小视觉线索的依赖。
  2. GRAFT框架通过区域级监督学习视角特定的视觉锚点,聚焦于任务相关的局部线索,提升了在线学习效率。
  3. 在四个生物医学操作任务中,GRAFT成功率提高32.5个百分点,同时降低了在线策略更新的计算成本。

📝 摘要(中文)

预训练的视觉-语言-动作(VLA)策略为机器人操作提供了强大的先验知识,但在细粒度生物医学任务中在线适应仍然具有挑战性。任务成功往往依赖于微妙的、视角依赖的视觉线索,而任务级奖励对重要区域的指导有限,使得从有限的真实机器人交互中学习任务相关的视觉基础变得困难。在线适应还受到VLA推理和基于重放的更新的计算成本限制。我们提出了GRAFT(Grounded Reinforcement Adaptation for Fast Task Learning),一个通过基础感知实现高效在线VLA适应的框架。GRAFT使用区域级监督学习视角特定的视觉锚点,专注于任务相关的局部线索,而无需在部署时进行区域提议。它进一步结合单步动作生成和缓存的视觉-语言前缀重用,加速在线学习。在四个生物医学操作任务中,GRAFT在匹配的适应预算下提高了成功率32.5个百分点,同时减少了在线策略更新的计算开销。

🔬 方法详解

问题定义:本论文旨在解决预训练的视觉-语言-动作(VLA)策略在细粒度生物医学任务中在线适应的困难。现有方法在处理微妙的视觉线索时效果不佳,且任务级奖励对重要区域的指导有限,导致学习任务相关的视觉基础变得困难。

核心思路:GRAFT框架的核心思路是通过区域级监督学习视角特定的视觉锚点,专注于任务相关的局部线索,从而提高在线适应的效率。该设计避免了在部署时需要进行区域提议,降低了计算负担。

技术框架:GRAFT的整体架构包括两个主要模块:区域级视觉锚点学习和单步动作生成。前者通过监督学习获取视角特定的视觉信息,后者结合缓存的视觉-语言前缀重用,加速在线学习过程。

关键创新:GRAFT的主要创新在于引入区域级监督学习,使得机器人能够在没有区域提议的情况下,直接聚焦于任务相关的局部线索。这一方法显著提高了在线适应的效率,与传统方法相比具有本质区别。

关键设计:在设计中,GRAFT采用了特定的损失函数来优化视觉锚点的学习,并通过缓存机制提高了动作生成的速度。具体的网络结构和参数设置在实验中经过调优,以确保最佳性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在四个生物医学操作任务中,GRAFT显著提高了成功率,达到了32.5个百分点的提升。同时,该方法在匹配的适应预算下,成功降低了在线策略更新的计算开销,展示了其高效性和实用性。

🎯 应用场景

GRAFT框架在生物医学操作等细粒度任务中具有广泛的应用潜力。通过提高机器人在复杂环境中的适应能力,该研究能够推动医疗机器人技术的发展,提升手术精度和效率。未来,该方法还可扩展到其他需要高精度操作的领域,如制造业和服务机器人。

📄 摘要(原文)

Pretrained vision-language-action (VLA) policies provide strong priors for robot manipulation, yet adapting them online to fine-grained biomedical tasks remains challenging. Task success often hinges on subtle, view-dependent visual cues, while task-level rewards provide little guidance about which regions matter, making it difficult to learn task-relevant visual grounding from limited real-robot interaction. Online adaptation is further constrained by the computational cost of VLA inference and replay-based updates. We introduce GRAFT (Grounded Reinforcement Adaptation for Fast Task Learning), a framework for efficient online VLA adaptation through grounded perception. GRAFT uses region-level supervision to learn view-specific visual anchors that focus perception on task-relevant local cues without requiring region proposals at deployment. It further combines single-step action generation with cached visual-language prefix reuse to accelerate online learning. Across four biomedical manipulation tasks, GRAFT improves success rates by 32.5 percentage points under matched adaptation budgets, while reducing the computational overhead of online policy updates.