Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning

📄 arXiv: 2608.04452v1 📥 PDF

作者: Pengcheng Pan, Xinfang Zhang

分类: cs.CV, cs.AI, cs.CL

发布日期: 2026-08-05


💡 一句话要点

提出Q-CueGraph以解决多模态推理中的视觉证据选择问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态推理 视觉证据选择 图像理解 任务条件策略 OCR技术 智能问答 信息检索

📋 核心要点

  1. 现有方法在多模态推理中缺乏有效的任务条件策略,导致图像检查位置选择不可靠。
  2. Q-CueGraph通过将问题与图像表示映射到预算化的坐标级观察,明确了视觉证据的选择过程。
  3. 在多个基准测试中,Q-CueGraph在V*Bench上准确率达到0.833,相较于全图推理有显著提升。

📝 摘要(中文)

高分辨率像素和裁剪或缩放工具赋予多模态大型语言模型检查图像的能力,但未提供可靠的任务条件策略来决定检查位置。Q-CueGraph明确了这一决策。它将问题和图像表示映射到预算化的坐标级观察,适用于冻结的阅读器。文本丰富的图像使用可重用的OCR/布局图,自然图像搜索在相同的选择、组合和预算接口后实例化查询条件的视觉节点。可选的效用优化通过训练答案的正确性学习冻结阅读器可以使用的候选裁剪,而无需区域框监督。在冻结的Qwen2.5-VL-7B阅读器上,Q-CueGraph在V*Bench上达到0.833的准确率,而全图推理为0.696,且在InfographicVQA上从约一半的图像区域达到92%的全图ANLS。通过六个基准测试,显式观察在证据可定位、问题区分其位置以及分辨率限制全图阅读时最为有价值。

🔬 方法详解

问题定义:论文旨在解决多模态推理中视觉证据选择的有效性问题。现有方法在图像检查时缺乏明确的任务条件策略,导致选择不准确,影响推理效果。

核心思路:Q-CueGraph的核心思想是将用户提出的问题与图像表示结合,生成预算化的坐标级观察,从而为冻结的阅读器提供明确的检查位置。该方法通过优化视觉证据的选择,提高了推理的准确性和效率。

技术框架:Q-CueGraph的整体架构包括问题映射模块、图像表示模块和观察生成模块。首先,将问题与图像进行结合,生成视觉节点,然后通过预算化策略选择合适的观察区域。

关键创新:Q-CueGraph的主要创新在于引入了查询条件的视觉节点,允许在相同的选择和预算接口下进行灵活的视觉证据选择。这一设计与传统的全图推理方法形成鲜明对比,显著提升了局部证据的利用效率。

关键设计:在关键设计上,Q-CueGraph使用了可重用的OCR/布局图来处理文本丰富的图像,并通过可选的效用优化机制学习候选裁剪的有效性,避免了区域框的监督需求。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在实验中,Q-CueGraph在V*Bench上达到了0.833的准确率,相比全图推理的0.696有显著提升。此外,在InfographicVQA上,Q-CueGraph在仅使用约一半图像区域的情况下,达到了92%的全图ANLS,展示了其在局部证据利用上的优势。

🎯 应用场景

Q-CueGraph在多模态推理领域具有广泛的应用潜力,特别是在需要从复杂图像中提取信息的任务中,如信息检索、问答系统和智能助理等。其明确的视觉证据选择策略能够显著提升系统的响应速度和准确性,未来可能推动更多智能应用的发展。

📄 摘要(原文)

High-resolution pixels and crop or zoom tools give multimodal large language models the ability to inspect an image, but they do not provide a reliable task-conditioned policy for deciding where to inspect. Q-CueGraph makes this decision explicit. It maps a question and an image representation to budgeted, coordinate-level observations for a frozen reader. Text-rich images use a reusable OCR/layout graph; natural-image search instantiates query-conditioned visual nodes behind the same selection, composition, and budgeting interface. Optional utility refinement learns which candidate crops the frozen reader can use from training-answer correctness, without region-box supervision. With a frozen Qwen2.5-VL-7B reader, Q-CueGraph reaches 0.833 accuracy on V*Bench versus 0.696 for full-image inference from a 19% image-area budget, and reaches 92% of full-image ANLS on InfographicVQA from about half the image area. Across six benchmarks, explicit observation is most valuable when evidence is localizable, the question discriminates its location, and resolution limits full-image reading.