One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

📄 arXiv: 2607.27902v1 📥 PDF

作者: Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin

分类: cs.CV

发布日期: 2026-07-30

备注: 15 pages, 11 figures. Accepted to ACM Multimedia 2026

期刊: Proceedings of the 34th ACM International Conference on Multimedia (MM '26), 2026

DOI: 10.1145/3767308.3835174


💡 一句话要点

提出单补丁文本检测方法以解决场景文本定位精度问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 场景文本检测 视觉标记定位 多模态大语言模型 强化学习 几何信息恢复 文本识别 鲁棒性提升

📋 核心要点

  1. 现有的多补丁文本检测方法在处理密集或小文本实例时,常常引入冗余噪声和定位模糊,影响检测精度。
  2. 本文提出了单补丁文本检测(SPaTS)框架,通过单个锚点视觉标记处理文本实例,并进行全图细化以恢复几何信息。
  3. 实验结果表明,SPaTS在性能上显著优于现有的闭源MLLMs和OCR MLLMs,提升了文本检测的准确性和鲁棒性。

📝 摘要(中文)

场景文本检测需要文本识别与空间定位之间的高精度对齐。尽管视觉标记定位已成为多模态大语言模型(MLLMs)的有前景的方案,但现有的多补丁范式常常引入冗余噪声和定位模糊,尤其是在密集或小文本实例中。为此,本文提出了单补丁文本检测(SPaTS),通过单个锚点视觉标记处理每个文本实例,并通过全图细化恢复几何形状。为准确识别该锚点,本文引入了单补丁选择优化(SPaSO),利用强化学习框架优化离散视觉标记选择。通过方向嵌入对齐(DEA)和补丁增强解码(PED),进一步提高表示的鲁棒性和定位精度。大量实验表明,SPaTS在性能上显著优于现有的闭源MLLMs和OCR MLLMs。

🔬 方法详解

问题定义:本文旨在解决场景文本检测中的高精度对齐问题,现有的多补丁方法在密集文本实例中存在冗余噪声和定位模糊的痛点。

核心思路:提出单补丁文本检测(SPaTS),通过单个锚点视觉标记来处理每个文本实例,避免多补丁带来的噪声,并通过全图细化恢复几何信息。

技术框架:SPaTS框架包括单补丁选择优化(SPaSO)模块,通过强化学习优化视觉标记选择,方向嵌入对齐(DEA)模块用于抑制不稳定的规范偏差,补丁增强解码(PED)模块则用于融合语言语义与全图特征。

关键创新:最重要的创新在于通过单补丁选择优化来优化视觉标记选择,显著减少了冗余信息的干扰,与现有多补丁方法形成本质区别。

关键设计:在设计中,采用了基于补丁级奖励的强化学习策略,方向嵌入对齐通过解耦特征的大小和方向来提高鲁棒性,补丁增强解码则通过跨注意力机制增强几何边界回归的能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,SPaTS在多个基准数据集上均显著优于现有的闭源MLLMs和OCR MLLMs,具体性能提升幅度达到XX%,验证了其在文本检测任务中的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、智能监控和增强现实等场景文本识别任务。通过提高文本检测的精度和鲁棒性,SPaTS能够在复杂环境中更有效地识别和定位文本信息,具有重要的实际价值和未来影响。

📄 摘要(原文)

Scene text spotting requires high-precision alignment between textual recognition and spatial localization. While visual-token grounding has emerged as a promising formulation for Multimodal Large Language Models (MLLMs), the previous multi-patch paradigm often introduces redundant noise and localization ambiguity, particularly for dense or small text instances. To address this, we propose Single-Patch Text Spotting (SPaTS), a vision-centric framework that routes each text instance through a single anchor visual token and then recovers geometry via full-image refinement. To accurately identify this anchor without oracle labels, we introduce Single-Patch Selective Optimization (SPaSO), a reinforcement learning framework that optimizes discrete visual-token selection using patch-level rewards. To further improve representation robustness and localization precision, we introduce Directional Embedding Alignment (DEA) to suppress unstable norm bias by decoupling feature magnitude and direction, and Patch-Enhanced Decoding (PED) to fuse the routed anchor with language semantics and cross-attend over the full-image feature map for geometry-aware boundary regression beyond coordinate-space surrogates. Extensive experiments demonstrate that SPaTS consistently and significantly outperforms both frontier closed-source MLLMs and OCR MLLMs. Code will be released soon.