When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

📄 arXiv: 2608.23978v1 📥 PDF

作者: Zhengxiang Wang, Owen Rambow

分类: cs.AI, cs.CV

发布日期: 2026-08-25

备注: EMNLP 2026 Main


💡 一句话要点

提出交互式视觉定位框架以解决LVLMs的不足问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视觉定位 交互式学习 视觉语言模型 信息获取 多模态交互

📋 核心要点

  1. 现有的视觉定位方法通常忽视了目标信息的不完整性和模糊性,导致模型在真实场景中的表现不佳。
  2. 本文提出了一种新的评估框架,允许通过对话获取目标信息,从而更好地模拟现实中的交互式视觉定位过程。
  3. 实验结果显示,当前LVLMs在交互式视觉定位任务中的表现显著低于人类基线,尤其在没有初始描述的情况下,模型性能最低。

📝 摘要(中文)

视觉定位通常被评估为从信息丰富的指称表达到视觉目标的一次性映射。然而,这种方法忽略了现实世界引用的一个核心特性:目标信息往往是不完整和模糊的,并且通过互动建立。本文引入了一个控制评估框架,用于在大型视觉语言模型(LVLMs)中进行交互式视觉定位,变化了提供的目标信息量和通过对话获取的信息量。在四个以人为基础的视觉上下文和四种交互协议中,当前的LVLMs表现显著低于任务级人类基线。互动可以帮助通过后续问题来细化或修复初始目标描述。没有初始描述时,性能最低,表明主动的问题驱动定位仍然困难。LVLMs的置信度也常常超过其经验准确性,后续研究确认了这些模式在不同描述来源、推理努力、重复互动、描述提供者和视觉上下文中的一致性。总体而言,交互式视觉定位仍然是一个重要挑战,需要视觉匹配、信息寻求和综合。

🔬 方法详解

问题定义:本文旨在解决现有视觉定位方法在处理不完整和模糊目标信息时的不足,尤其是在缺乏初始描述的情况下,模型的性能显著下降。

核心思路:通过引入交互式对话机制,允许模型在定位过程中主动询问和获取更多目标信息,从而提高定位的准确性和可靠性。

技术框架:整体架构包括四个主要模块:信息提供模块、对话交互模块、视觉匹配模块和性能评估模块。信息提供模块负责初始目标描述的生成,对话交互模块处理用户的后续问题,视觉匹配模块则进行目标的定位和确认。

关键创新:本文的主要创新在于引入了交互式对话机制,使得模型能够在定位过程中动态获取信息,而不是依赖于一次性提供的描述。这一设计使得模型在面对模糊或不完整信息时,能够更灵活地进行调整。

关键设计:在模型设计中,采用了多轮对话机制,允许用户与模型进行多次交互。此外,损失函数的设计考虑了模型在不同交互阶段的表现,以优化整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,当前LVLMs在交互式视觉定位任务中的表现显著低于人类基线,尤其在没有初始描述的情况下,模型的准确率降低至50%以下。通过引入对话机制,模型在后续问题的帮助下,性能有所提升,但仍未达到人类水平,显示出该领域的挑战性。

🎯 应用场景

该研究的潜在应用领域包括智能助手、机器人导航和增强现实等场景。在这些应用中,模型能够通过与用户的互动,实时获取和更新目标信息,从而提高任务执行的准确性和效率。未来,该研究可能推动更智能的交互式系统的发展,使其在复杂环境中更具适应性。

📄 摘要(原文)

Visual grounding is typically evaluated as a one-shot mapping from an informative referring expression to a visual target. This formulation misses a central property of real-world reference: target information is often incomplete, ambiguous, and established through interaction. We introduce a controlled evaluation framework for interactive visual grounding in large vision-language models (LVLMs), varying how much target information is provided upfront and how much must be acquired through dialogue. Across four human-grounded visual contexts and four interaction protocols, current LVLMs perform significantly below task-level human baselines. Interaction can help when follow-up questions refine or repair an initial target description. Performance is lowest when no initial description is provided and target information must be acquired through questions, indicating that proactive question-driven grounding remains difficult. LVLMs are also poorly calibrated, often reporting confidence that exceeds their empirical accuracy. Follow-up studies confirm these patterns across varied description sources (human versus AI), reasoning efforts, repeated interactions, description providers, and visual contexts. Overall, interactive visual grounding remains an important challenge, requiring visual matching, information seeking and synthesis.