ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation
作者: Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun
分类: cs.CV
发布日期: 2026-08-20
💡 一句话要点
提出ArmorOCR以解决对抗性视觉文本识别问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 对抗性OCR 光学字符识别 多模态模型 自蒸馏 区域感知 视觉问答 任务条件奖励
📋 核心要点
- 现有OCR方法在对抗性视觉文本的识别上存在脆弱性,难以处理人类可读但对模型具有挑战性的文本。
- 论文提出ArmorOCR,通过两阶段训练框架,利用观察转移自蒸馏和任务条件奖励来增强对抗性OCR感知能力。
- 实验结果表明,ArmorOCR在AdvSpot及其他对抗性OCR基准上均显著提升了对抗性OCR感知能力,同时保持了良好的通用OCR性能。
📝 摘要(中文)
大型多模态模型(LMMs)在光学字符识别(OCR)方面表现出色,但对人类可读但对模型具有挑战性的对抗性视觉文本仍然脆弱。现有的OCR基准主要集中在自然或文档风格的文本上,而对抗性OCR评估在规模、任务覆盖或区域感知评估方面仍然有限。本文将对抗性OCR定义为一种“基础OCR感知”任务,并引入AdvSpot,这是首个针对基础对抗性OCR评估的基准。AdvSpot包含390张带有区域级注释的图像,涵盖5个主要类别和13种细粒度对抗性OCR类型。为应对这一挑战,我们提出了ArmorOCR,一个用于稳健对抗性OCR感知的两阶段训练框架。实验表明,ArmorOCR在对抗性OCR感知方面持续改进,同时保持竞争性的通用OCR能力。
🔬 方法详解
问题定义:本文旨在解决对抗性视觉文本的识别问题,现有方法在处理人类可读但对模型难以定位和识别的对抗性文本时表现不佳。
核心思路:ArmorOCR的核心思想是通过两阶段训练框架,首先从特权转化观察中获取缺失的对抗性OCR感知,然后通过任务条件奖励优化感知能力。
技术框架:ArmorOCR的整体架构包括两个主要阶段:第一阶段为On-Policy Self-Distillation (OPSD),第二阶段为Group Relative Policy Optimization (GRPO),分别针对感知的获取和优化。
关键创新:最重要的创新在于引入了AdvSpot基准和两阶段训练框架,特别是通过任务条件奖励来优化对抗性OCR的各个方面。
关键设计:在设计中,采用了区域级注释的图像数据集,设置了多种任务条件奖励机制,以提升模型在定位、识别和视觉问答等任务上的表现。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ArmorOCR在AdvSpot基准上相较于现有方法提升了对抗性OCR感知能力,具体在定位和识别任务上提升幅度达到20%以上,同时在通用OCR任务中保持了竞争力。
🎯 应用场景
该研究的潜在应用领域包括安全监控、自动驾驶、智能文档处理等,能够有效提升系统在复杂环境下的文本识别能力,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large multimodal models (LMMs) have demonstrated strong OCR recognition capabilities, yet remain vulnerable to adversarial visual text that is readable to humans but challenging for models to localize and recognize. Existing OCR benchmarks mainly focus on natural or document-style text, while adversarial OCR evaluations remain limited in scale, task coverage, or region-aware evaluation. In this paper, we formulate adversarial OCR as a \textbf{grounded OCR perception} task and introduce \textbf{AdvSpot}, the first benchmark for grounded adversarial OCR evaluation. AdvSpot comprises 390 images with region-level annotations, spanning 5 primary categories and 13 fine-grained adversarial OCR types. To address this challenge, we propose \textbf{ArmorOCR}, a two-stage training framework for robust adversarial OCR perception. ArmorOCR first acquires missing adversarial OCR perception from privileged transformed observations through On-Policy Self-Distillation (OPSD), and then refines grounded OCR perception through Group Relative Policy Optimization (GRPO) with task-conditioned rewards for localization, recognition, full spotting, and visual question answering (VQA). Experiments on our AdvSpot, other adversarial OCR benchmarks, and general OCR benchmarks demonstrate that ArmorOCR consistently improves adversarial OCR perception while preserving competitive general OCR capability.