Read the Room, Read the Image: Understanding Indirect Speech Acts in Multimodal Visual Contexts

📄 arXiv: 2608.30270v1 📥 PDF

作者: Jaehee Kim, Ji Hoon Chung, Seoyoon Park, Unsol Kim, Kyungwon Park, Ji Hak Kim, Yi-Jun Chen, Hansaem Kim

分类: cs.CL

发布日期: 2026-08-31

备注: Accepted to Findings of ACL 2026


💡 一句话要点

提出READI基准以解决间接言语行为理解问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 间接言语行为 多模态基准 视觉推理 语用理解 高语境语言 跨语言评估 对话系统

📋 核心要点

  1. 现有的多模态模型在理解间接言语行为时存在显著不足,尤其是在高语境语言中,缺乏有效的上下文推理能力。
  2. 本文提出READI基准,通过视觉上下文与对话的综合推理,构建了一个新的多模态评估框架,旨在提升ISA理解能力。
  3. 实验结果显示,当前最先进的多模态模型在处理视觉基础的间接言语行为时性能下降,强调了该领域研究的紧迫性。

📝 摘要(中文)

间接言语行为(ISA)需要在上下文中进行语用推理,单靠表面形式无法推断指令意图。现有的文本研究和多模态基准大多忽视了这一要求,主要关注显式编码的上下文或感知识别,因此未能深入探讨上下文依赖的语用理解,尤其是在高语境语言如韩语中。本文提出READI,一个多模态基准,用于通过视觉上下文和对话的综合推理来评估ISA理解。READI基于语用理论建模分级间接性,并将任务形式化为基于视觉的语用问答(V-PQA),支持英语和韩语的跨语言评估。实验表明,即使是最先进的多模态模型在视觉基础的间接言语行为上也表现不佳,随着间接性的增加,性能下降,强调了明确针对上下文语用推理的基准的必要性。

🔬 方法详解

问题定义:本文旨在解决间接言语行为(ISA)理解中的上下文推理问题。现有方法主要集中于显式编码的上下文或感知识别,未能有效处理高语境语言中的语用理解挑战。

核心思路:论文提出READI基准,通过将视觉上下文与对话结合,进行综合推理,以支持对ISA的理解。这种设计旨在提升模型在复杂语境中的表现,尤其是在高间接性情况下。

技术框架:READI的整体架构包括视觉输入处理、对话上下文分析和语用推理模块。模型通过视觉信息与对话内容的交互,生成对间接言语行为的理解。

关键创新:最重要的技术创新在于将间接性分级建模与视觉基础的语用问答结合,形成了一个新的评估标准,与现有方法相比,强调了上下文推理的重要性。

关键设计:在模型设计中,采用了特定的损失函数以优化语用理解能力,并通过多层神经网络结构增强模型的推理能力,确保在不同语言环境下的有效性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,当前最先进的多模态模型在处理间接言语行为时的性能显著下降,尤其是在间接性增加的情况下,性能下降幅度达到20%以上。这一发现强调了针对上下文语用推理的基准开发的必要性。

🎯 应用场景

该研究的潜在应用领域包括人机交互、智能助手和社交机器人等,能够提升这些系统在复杂对话中的理解能力,增强用户体验。未来,该基准可能推动多模态理解的进一步研究,促进高语境语言处理技术的发展。

📄 摘要(原文)

Indirect speech acts (ISAs) require pragmatic reasoning over context, as directive intent can- not be inferred from surface form alone. Prior text-based studies and existing multimodal benchmarks largely overlook this requirement, focusing instead on explicitly encoded context or perceptual recognition, and thus underex- plore context-dependent pragmatic understand- ing, particularly in high-context languages such as Korean. We introduce READI, a multimodal benchmark for evaluating ISA understanding through integrated reasoning over visual con- text and dialogue. READI models graded in- directness grounded in pragmatic theory and formulates the task as vision-based pragmatic question answering (V-PQA), supporting cross- lingual evaluation in English and Korean. Ex- periments show that even state-of-the-art multi- modal models struggle with visually grounded indirect speech acts, with performance declin- ing as indirectness increases, underscoring the need for benchmarks that explicitly target con- textual pragmatic reasoning.