Belief Without Behavior: Measuring the Translation of Theory of Mind into Coordinated Social Action in Vision-Language Models

📄 arXiv: 2608.20975v1 📥 PDF

作者: Tonglin Yan, Gregoire Sergeant-Perthuis, David Rudrauf

分类: cs.AI

发布日期: 2026-08-21


💡 一句话要点

提出MOSAIC基准以解决理论心智与社会行为之间的脱节问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心智理论 多模态交互 社会行为 具身代理 行为生成 信念-行动耦合 实验基准 VLMs

📋 核心要点

  1. 现有方法在评估心智理论推理与具身行为时存在孤立性,未能测量社会推理与社会行动之间的差距。
  2. 提出MOSAIC基准,通过两个具身代理在多种场景中互动,整合言语、空间轨迹、注视和面部表情,评估ToM约束下的行为表现。
  3. 实验结果显示,VLMs在ToM约束下未能产生一致的行为,PCM-LLM模型在所有条件下表现优异,验证了信念-行动耦合的重要性。

📝 摘要(中文)

有效的社会互动要求代理人能够将心理状态推理转化为协调的行为信号,涵盖言语和非言语渠道。然而,现有基准将心智理论(ToM)推理与具身行为孤立评估,未能测量社会推理与社会行动之间的差距。本文提出了MOSAIC(多模态社会行动、推理与沟通的协调),这是一个受控基准,两个具身代理在合作和竞争场景中互动,要求整合言语陈述、空间轨迹、注视方向和面部表情,并在系统变化的ToM约束下进行评估。对13个模型的评估发现,VLMs未能产生与ToM顺序约束一致的行为,且施加明确的ToM顺序约束未能带来可靠的行为变化。信号级分析揭示了两个序列瓶颈:大多数模型无法产生方向一致的非言语信号,即使信号存在,VLM代理也未能解读他人行为并作出反应。PCM-LLM作为具有明确ToM模块的结构性参考点,在所有条件下均表现出色,表明明确的信念-行动耦合是此类任务的关键要素。

🔬 方法详解

问题定义:本文旨在解决现有基准在评估心智理论(ToM)推理与社会行为之间的脱节问题。现有方法往往将这两者孤立评估,导致无法全面理解社会互动的复杂性。

核心思路:论文提出MOSAIC基准,设计了两个具身代理在多种场景中互动的实验,要求整合多种信号(言语、非言语)并在系统变化的ToM约束下进行评估,以更全面地测量社会推理与行为之间的关系。

技术框架:MOSAIC基准包含多个模块,首先是代理的行为生成模块,其次是信号整合模块,最后是行为评估模块。代理在合作和竞争场景中进行互动,生成的行为信号通过系统的ToM约束进行评估。

关键创新:最重要的技术创新在于引入了明确的ToM模块,使得信念与行动之间的耦合成为可能。这一设计与现有方法的本质区别在于强调了信念推理对行为生成的直接影响。

关键设计:在模型设计中,采用了特定的损失函数来优化信号的一致性,并通过参数调节确保模型能够在多模态输入下有效工作。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,13个模型在200次试验中,VLMs未能产生与ToM顺序约束一致的行为,而PCM-LLM在所有条件下均表现优异,表明明确的信念-行动耦合是成功的关键。此发现为未来的多模态社交智能系统设计提供了重要指导。

🎯 应用场景

该研究的潜在应用领域包括人机交互、社交机器人和虚拟助手等。通过提升模型在复杂社交场景中的表现,能够更好地支持人类与机器之间的自然交流,进而推动智能系统在社会互动中的实际应用。

📄 摘要(原文)

Effective social interaction requires agents to translate mental state inferences into coordinated behavioral signals across verbal and nonverbal channels simultaneously. Yet existing benchmarks evaluate theory of mind (ToM) reasoning and embodied behavior in isolation, leaving unmeasured the gap between social inference and social action. We introduce MOSAIC (Multimodal Orchestration of Social Action, Inference, and Communication), a controlled benchmark in which two embodied agents interact across cooperative and competitive scenarios requiring integration of verbal statements, spatial trajectories, gaze direction, and facial expression under systematically varied ToM constraints. Evaluating 13 models, including 11 VLMs, across 200 trials per model, we find that VLMs fail to produce behaviors consistent with the expected outcomes under ToM-order constraints, and that imposing explicit ToM-order constraints produces no reliable behavioral change aligned with the specified reasoning level. Signal-level analysis reveals two sequential bottlenecks: most models cannot produce directionally coherent nonverbal signals, and even when signals are present, VLM agents fail to interpret others behaviors and react to them. PCM-LLM, included as a structured architectural reference point with an explicit ToM module, succeeds across all conditions, suggesting that explicit belief-action coupling is a sufficient ingredient for this class of tasks.