Hi-Token: Hierarchical Coordinate Tokenization for Generative Visual Grounding

📄 arXiv: 2608.03471v1 📥 PDF

作者: Xiuyuan Zhu, Ke Lu, Kun Dong, Siwen Jiao, Hao Wu, Zijin Du, Shun Mao, Dongming Zhang, Jian Xue

分类: cs.CV

发布日期: 2026-08-04

备注: 15 pages, 7 figures, 15 tables


💡 一句话要点

提出Hi-Token以解决视觉定位中的坐标表示问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉定位 生成模型 多模态学习 坐标表示 深度学习

📋 核心要点

  1. 现有的生成视觉语言模型在处理边界框坐标时未能有效利用数值顺序和轴语义,导致定位精度不足。
  2. 论文提出的Hi-Token通过为坐标的不同数位引入特定的轴符号,增强了坐标表示的结构性和重用性。
  3. 实验结果表明,Hi-Token在多个模型和基准测试中均显著提高了定位性能,尤其是在低重叠预测方面表现优异。

📝 摘要(中文)

生成视觉语言模型(VLMs)通常将边界框坐标视为独立的输出符号,导致数值顺序和轴语义隐含。我们识别出这种表示方式是视觉定位中的一个重要错误来源。Hi-Token通过为每个坐标编码特定于轴的符号,增加了粗到细的结构,并提高了符号的重用,同时保留了现有的VLM架构。Hi-GAR通过几何奖励补充了这种表示,使用多个尺度的框重叠和坐标准确性进行组相对策略优化(GRPO)。在匹配训练条件下的对比实验表明,Hi-Token在评估的IoU范围内改善了定位效果。Hi-GAR进一步减少了低重叠预测,仅在训练期间使用。对三种VLM骨干网络和RefCOCO系列的实验显示,各模型和基准测试均有一致的提升。Hi-R1在大多数报告的指标上超过了强基线。

🔬 方法详解

问题定义:论文要解决的具体问题是生成视觉语言模型在视觉定位任务中对边界框坐标的处理不够有效,导致定位精度低下。现有方法未能充分利用坐标的数值顺序和轴语义,造成了错误的定位结果。

核心思路:论文的核心解决思路是引入Hi-Token,通过为每个坐标的不同数位(百位、十位、个位)使用特定的轴符号,从而增强坐标表示的结构性。这种设计旨在提高坐标的重用性和表示的清晰度,进而改善定位效果。

技术框架:整体架构包括Hi-Token和Hi-GAR两个主要模块。Hi-Token负责坐标的层次化表示,而Hi-GAR则在训练过程中提供几何奖励,优化模型的预测能力。整个流程通过对比不同模型的表现来验证方法的有效性。

关键创新:最重要的技术创新点在于Hi-Token的层次化坐标表示方法,它通过引入轴特定的符号来解决现有方法中坐标表示的不足。这一创新使得模型在处理坐标时更加精确,显著提升了定位性能。

关键设计:在设计中,Hi-Token的参数设置包括对坐标的层次化编码方式,损失函数则结合了几何奖励机制,以提高模型在不同尺度下的预测准确性。网络结构上,Hi-GAR的引入使得训练过程更具针对性,进一步优化了模型的输出。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,Hi-Token在多个模型和基准测试中均实现了显著提升,尤其在IoU范围内的定位精度上,Hi-R1在大多数指标上超过了强基线,验证了其有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、机器人导航和增强现实等场景,能够显著提升视觉系统在复杂环境中的定位精度。通过改进坐标表示,未来的视觉语言模型将更有效地理解和处理视觉信息,推动多模态交互的进步。

📄 摘要(原文)

Generative Vision-Language Models (VLMs) commonly treat bounding-box coordinates as independent output symbols, leaving numerical order and axis semantics implicit. We identify this representation as an important source of error in visual grounding. Hi-Token encodes each coordinate with axis-specific tokens for the hundreds, tens, and ones digits, which adds coarse-to-fine structure and increases token reuse while retaining the existing VLM architecture. Hi-GAR complements this representation with a geometry-based reward for Group Relative Policy Optimization (GRPO), using box overlap and coordinate accuracy at multiple scales. Controlled comparisons under matched training conditions show that Hi-Token improves localization throughout the evaluated IoU range. Hi-GAR further reduces low-overlap predictions and is used only during training. Experiments on three VLM backbones and the RefCOCO family show consistent gains across models and benchmarks. Hi-R1 achieves higher values than strong specialist baselines on most reported metrics. Analyses of token frequency, digit boundaries, object scale, and IoU distributions explain the effects of coordinate representation and reward training. The results show that structured coordinate generation provides an effective approach to generative visual grounding.