PointRL: Learning Point-Level Vision-Language Grounding from Verifiable Annotation Evidence

📄 arXiv: 2608.25299v1 📥 PDF

作者: Jingyang Su, Pu Cao, Xiuze Jin, Longyue Zhang, Qing Song, Lu Yang

分类: cs.CV

发布日期: 2026-08-26


💡 一句话要点

提出PointRL框架以解决视觉语言指向行为学习问题

🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉语言模型 点级定位 强化学习 可验证注释 多模态学习 机器人操作 图形用户界面

📋 核心要点

  1. 现有方法在学习可靠的指向行为时面临监督空间非唯一性的问题,导致多实例指令的覆盖、计数一致性和重复抑制困难。
  2. 本文提出的PointRL框架通过将不同类型的注释证据转化为指向指令,利用隐藏的验证证据来提高学习效果。
  3. 实验结果表明,PointRL在PointArena上将模型准确率提升了9.47%,并在其他基准测试中也显示出显著的性能提升。

📝 摘要(中文)

视觉语言模型(VLMs)越来越依赖点坐标作为视觉定位的紧凑和可执行接口,广泛应用于图形用户界面交互、机器人操作和交互式视觉系统。然而,由于监督空间的非唯一性,学习可靠的指向行为仍然具有挑战性。本文提出了PointRL,一个可验证的强化学习框架,从现有的异构注释证据中学习点级定位。PointRL将边界框、掩膜和实例标签转换为指向指令,同时保留其目标支持、实例成员资格和集合约束作为隐藏的验证证据。所提出的奖励机制评估解析性、点的有效性、实例覆盖、基数一致性以及冗余或缺失的预测。在PointArena上,PointRL将Qwen3.5-4B的整体准确率从56.11%提高到65.58%。在RoboSpatial、BLINK和Ref-Adv上的进一步评估显示,基于相同骨干网络的外部基准测试也有提升,表明可验证的点级反馈可能有助于这些设置中的空间定位。

🔬 方法详解

问题定义:本文旨在解决视觉语言模型在学习点级视觉定位时面临的监督空间非唯一性问题。现有方法难以处理多实例指令的覆盖和计数一致性,导致指向行为的可靠性不足。

核心思路:PointRL框架的核心思想是将现有的异构注释证据(如边界框、掩膜和实例标签)转换为指向指令,同时保留这些注释的目标支持和实例成员资格作为隐藏的验证证据,以提高学习的准确性和可靠性。

技术框架:PointRL的整体架构包括数据预处理模块、指向指令生成模块和验证模块。数据预处理模块负责将不同类型的注释转换为可用的指向指令,指向指令生成模块则基于这些指令进行学习,而验证模块则使用隐藏的验证证据对预测进行评分。

关键创新:最重要的技术创新在于引入了可验证的隐藏证据,通过这种方式,模型不仅依赖于直接的指向指令,还能利用额外的验证信息来提高预测的准确性。这一设计与现有方法的本质区别在于其引入了一个外部验证机制。

关键设计:在关键设计方面,PointRL采用了特定的奖励机制来评估解析性、点的有效性、实例覆盖、基数一致性以及冗余或缺失的预测。此外,模型的损失函数设计考虑了这些因素,以确保训练过程中的有效反馈。具体的网络结构和参数设置在实验部分进行了详细描述。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,PointRL在PointArena上将Qwen3.5-4B的整体准确率从56.11%提升至65.58%,提升幅度达到9.47%。在RoboSpatial、BLINK和Ref-Adv等外部基准测试中,基于相同骨干网络的模型也表现出显著的性能提升,验证了可验证的点级反馈的有效性。

🎯 应用场景

该研究的潜在应用领域包括图形用户界面交互、机器人操作和其他需要视觉语言理解的交互式系统。通过提高点级视觉定位的准确性,PointRL能够增强这些系统的智能化水平,提升用户体验和操作效率。未来,该框架可能在更广泛的多模态学习任务中发挥重要作用。

📄 摘要(原文)

Vision-language models (VLMs) increasingly rely on point coordinates as a compact and executable interface for visual grounding in GUI interaction, robotic manipulation, and interactive visual systems. However, learning reliable pointing behavior remains difficult because the supervision space is inherently non-unique: many coordinates may be valid within the same target region, while multi-instance instructions require target coverage, count consistency, and duplicate suppression. This work presents PointRL, a verifiable reinforcement learning framework that learns point-level grounding from existing heterogeneous annotation evidence. PointRL converts bounding boxes, masks, and instance labels into pointing instructions, while retaining their target supports, instance membership, and set constraints as hidden verifier evidence, i.e., annotations kept outside the prompt and used by a deterministic checker to score predictions. The proposed reward evaluates parseability, point validity, instance coverage, cardinality consistency, and redundant or missing predictions. On PointArena, PointRL improves the overall accuracy of Qwen3.5-4B from 56.11% to 65.58%. Further evaluations on RoboSpatial, BLINK, and Ref-Adv show same-backbone gains on the evaluated external benchmarks, suggesting that verifiable point-level feedback may benefit spatial grounding in these settings.