On the Design Fundamentals of Pixel Text Representation Learning

📄 arXiv: 2609.01147v1 📥 PDF

作者: Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

分类: cs.CV, cs.CL

发布日期: 2026-09-01

备注: EMNLP 2026

🔗 代码/项目: GITHUB


💡 一句话要点

提出Pixel Linguist II以解决视觉文本表示学习的多项挑战

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉文本表示 多语言理解 像素编码 自然语言处理 图像-文本对 布局感知 对比学习 深度学习

📋 核心要点

  1. 现有的像素-文本编码器在处理固定分辨率预训练和视觉捷径学习等方面存在显著不足,影响了多语言文本理解能力。
  2. 论文提出了四个关键设计原则,包括可变图像分辨率、自然图像-文本对、布局感知渲染和双阶段多语言课程,以提升视觉文本表示学习的效果。
  3. Pixel Linguist II在英语、跨语言和多语言视觉STS及ViDoRe任务上设定了新的最优结果,并在80%视觉标记压缩下保持鲁棒性。

📝 摘要(中文)

文本丰富的视觉输入需要能够直接在像素空间中读取、检索和压缩语言的模型,但现有的像素-文本编码器在固定分辨率预训练、视觉捷径学习、弱视觉基础和多语言视觉文本理解方面存在困难。本文探讨了构建稳健的视觉文本表示学习所需的基本设计原则。通过系统的控制消融实验,我们识别出四个关键组件:可变图像分辨率和渲染字体大小为高分辨率文档泛化提供空间代理;自然图像-文本对对于基础和防止文本崩溃至关重要;布局感知渲染有助于防止像素级捷径;双阶段多语言课程促进有效的跨语言对齐。通过将这些原则整合到可扩展的训练方案中,我们训练了Pixel Linguist II,取得了新的状态-of-the-art结果。

🔬 方法详解

问题定义:本文旨在解决现有像素-文本编码器在固定分辨率预训练、视觉捷径学习和多语言理解中的不足,导致模型在处理文本丰富的视觉输入时效果不佳。

核心思路:通过识别和整合四个关键设计原则,论文提出了一种新的训练方案,以增强视觉文本表示的鲁棒性和泛化能力。

技术框架:整体架构包括可变图像分辨率和字体大小的渲染、自然图像-文本对的生成、布局感知的渲染策略,以及双阶段的多语言课程设计,确保模型在多种语言和视觉场景下的有效学习。

关键创新:最重要的创新在于提出了布局感知渲染和双阶段多语言课程,这些设计有效防止了模型在训练过程中的视觉捷径学习,提升了跨语言对齐能力。

关键设计:在训练过程中,采用了动态渲染技术以适应不同分辨率,使用统一对比损失函数来增强图像与文本之间的关联,同时在数据集上进行了大规模的训练,涵盖了超过2.8亿个样本。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

Pixel Linguist II在英语、跨语言和多语言视觉STS及ViDoRe任务上设定了新的最优结果,尤其在80%视觉标记压缩下仍保持鲁棒性,显示出在光学上下文压缩方面的巨大潜力。

🎯 应用场景

该研究的潜在应用领域包括多模态信息检索、跨语言文本理解和智能文档处理等。通过提升视觉文本表示的能力,Pixel Linguist II可以在教育、翻译和信息检索等多个领域产生实际价值,推动相关技术的发展与应用。

📄 摘要(原文)

Text-rich visual inputs require models that can read, retrieve, and compress language directly in pixel space, yet existing pixel-text encoders struggle with fixed resolution pretraining, visual shortcut learning, weak visual grounding, and multilingual visual text understanding. In this work, we investigate the fundamental design principles required for robust visual text representation learning. Through systematic controlled ablations, we identify four critical components: variable image resolutions and rendered font sizes provide spatial proxies for high-resolution document generalization; natural image-text pairs are indispensable for grounding and prevent text-only collapse; layout-aware rendering helps prevent pixel-level shortcuts; and a two-stage multilingual curriculum enables effective cross-lingual alignment. By integrating these principles into a scalable training recipe, we train Pixel Linguist II, a native-resolution vision encoder trained with on-the-fly rendering, unified contrastive grounding, and a multilingual curriculum over 280M training examples. Pixel Linguist II sets new state-of-the-art results on English, cross-lingual, and multilingual Visual STS and ViDoRe, while also enabling better MLLM downstream evaluation. Notably, Pixel Linguist II remains robust under 80\% visual token compression, showing great promise for optical context compression. Our code and resources are available at https://github.com/Pixel-Linguist/Pixel-Linguist-II.