When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

📄 arXiv: 2608.04726v1 📥 PDF

作者: Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang

分类: cs.AI, cs.CV

发布日期: 2026-08-05


💡 一句话要点

提出提示区域对齐以解决多模态推理中的语义通道差距问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态推理 视觉问题理解 提示区域对齐 可视化任务语义 语义通道差距

📋 核心要点

  1. 现有多模态语言模型在处理视觉问题时,常常面临语义通道差距,导致推理效果不佳。
  2. 本文提出的提示区域对齐方法,通过将问题区域与输入语义对齐,提升了模型对视觉问题的理解能力。
  3. 实验结果显示,该方法在四个基准上的VTS准确率从58.0提升至66.3,显著改善了模型性能。

📝 摘要(中文)

多模态大型语言模型在处理截图和文档时,任务可能以像素形式呈现。然而,现有基准通常将问题以文本形式呈现,导致模型在不同通道上的指令使用效果不明。本文提出了可视化任务语义(VTS),通过将问题移入图像中来控制干预,发现所有24个模型-任务对的准确率平均下降17.8个百分点。尽管模型能够正确转录视觉问题,但往往未能有效利用,暴露出超越光学字符识别(OCR)的语义通道差距。为缩小这一差距,本文提出了提示区域对齐方法,旨在将问题区域与输入语义对齐,并从掩蔽视图中恢复其干净表示。在相同的训练成本下,该方法将四个基准的VTS准确率从58.0提升至66.3,同时保持原始界面的准确性,且推理时无需OCR或区域元数据。

🔬 方法详解

问题定义:本文旨在解决多模态语言模型在处理视觉问题时的语义通道差距,现有方法在将问题转化为视觉形式时效果不佳,导致推理准确率下降。

核心思路:提出提示区域对齐方法,通过将问题区域与输入的语义进行对齐,帮助模型更好地理解和利用视觉信息,从而提升推理能力。

技术框架:整体架构包括三个主要模块:问题区域识别、语义对齐和清晰表示恢复。首先识别出图像中的问题区域,然后将其与文本语义进行对齐,最后从掩蔽视图中恢复出清晰的表示。

关键创新:最重要的技术创新在于提示区域对齐的设计,使得模型能够在不依赖OCR或区域元数据的情况下,直接从视觉信息中提取语义。与现有方法相比,该方法在处理视觉问题时表现出更高的准确性和有效性。

关键设计:在模型训练过程中,采用了特定的损失函数来优化区域对齐效果,并设计了适应性网络结构以增强模型对视觉信息的处理能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,采用提示区域对齐方法后,四个基准的VTS准确率从58.0提升至66.3,提升幅度达到8.3个百分点。同时,该方法在保持原始界面准确性的前提下,显著改善了模型在视觉问题上的推理能力。

🎯 应用场景

该研究的潜在应用领域包括智能文档分析、视觉问答系统和多模态交互界面等。通过提升模型对视觉信息的理解能力,能够在实际场景中更好地支持用户的决策和信息获取,具有重要的实际价值和未来影响。

📄 摘要(原文)

Multimodal large language models increasingly reason over screenshots and documents where the task itself may be written in pixels. Yet benchmarks usually place questions in text, leaving it unclear whether models use the same instruction equally well across channels. We introduce Visualized Task Semantics (VTS), a controlled intervention that moves the question into the image while keeping the source problem and answer fixed. Across six MLLMs and four benchmarks, accuracy drops in all 24 model-task pairs, by 17.8 points on average. Models often transcribe the visual question correctly yet fail to use it, exposing a semantic channel gap beyond OCR. To reduce this gap, we present prompt-region grounding, whose core design aligns the question region with typed semantics and recovers its clean representation from a masked view. At matched training cost, our method raises four-benchmark VTS accuracy from 58.0 to 66.3 while preserving accuracy on the original interface, and requires no OCR or region metadata at inference. Reading task-bearing text and grounding it as an instruction for reasoning are distinct capabilities.