Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

📄 arXiv: 2608.09638v1 📥 PDF

作者: Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen

分类: cs.AI, cs.CL, cs.CY, cs.GT

发布日期: 2026-08-10


💡 一句话要点

提出Avalon-ToM-Bench以评估细粒度的心智理论

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心智理论 不对称信息 社交推理 大型语言模型 游戏机制 评估基准 推理能力 人工智能

📋 核心要点

  1. 现有的心智理论评估方法要么过于简化,要么缺乏有效的诊断能力,无法全面评估智能体的社交推理能力。
  2. 本文提出Avalon-ToM-Bench,通过不对称信息机制将心智理论细分为多个维度,以更全面地评估智能体的推理能力。
  3. 实验结果表明,模型在游戏规则理解上表现良好,但在社交推理能力上存在明显不足,且通过专门的推理训练可显著提升性能。

📝 摘要(中文)

心智理论(ToM)对智能体之间的互动至关重要,但现有评估方法要么依赖于简化的静态场景,要么在互动设置中提供有限的诊断洞察。本文提出Avalon-ToM-Bench,这是一个通过《抵抗:阿瓦隆》的不对称信息机制来操作化ToM的细粒度基准。该基准将ToM分解为一个2×2的分类法——认识论与动机推理交叉推理与行动,使用人类设计的、受限于视角的查询。对28个大型语言模型的基准测试揭示了三个重要见解:1)推理能力,而非知识;2)表达能力,而非表示;3)策略,而非深思。

🔬 方法详解

问题定义:本文旨在解决现有心智理论评估方法的不足,特别是它们在社交推理能力评估上的局限性。现有方法往往依赖于静态场景或互动设置,无法提供深入的诊断信息。

核心思路:Avalon-ToM-Bench通过不对称信息机制,将心智理论分解为认识论与动机推理的交叉推理与行动,从而提供更细致的评估框架。该方法利用人类设计的查询,确保评估的多样性和深度。

技术框架:整体架构包括数据收集、模型评估和结果分析三个主要模块。首先,通过设计特定的查询收集数据,然后对28个大型语言模型进行评估,最后分析模型在不同维度上的表现。

关键创新:最重要的技术创新在于将心智理论细分为多个维度,并通过不对称信息机制进行评估,这与现有方法的单一维度评估形成鲜明对比。

关键设计:在实验中,采用了线性探测和激活引导等机制分析模型的内部状态,发现模型在隐藏层中能够正确表示心智状态推理,但在生成过程中未能有效表达。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,模型在游戏规则理解上表现良好,但在心智理论能力上存在明显不足。通过专门的推理训练,模型的性能提升显著,平均提升达11.0分,而测试时的链式思维仅提升1.1分,表明推理策略的重要性。

🎯 应用场景

Avalon-ToM-Bench的潜在应用场景包括智能体的社交行为建模、游戏AI的设计以及人机交互系统的优化。该基准能够帮助研究人员更好地理解和提升智能体的社交推理能力,从而在多种应用中实现更自然的交互。未来,该研究可能推动心智理论在人工智能领域的广泛应用,提升智能体的智能水平。

📄 摘要(原文)

Theory of Mind (ToM) is essential for agent interactions, yet existing evaluations either rely on static scenarios that oversimplify mental-state reasoning or interactive settings that provide limited diagnostic insight. We present Avalon-ToM-Bench, a fine-grained benchmark that operationalizes ToM through the asymmetric-information mechanics of The Resistance: Avalon. Rather than evaluating end-to-end gameplay, it decomposes ToM into a 2$\times$2 taxonomy -- epistemic versus motivational reasoning crossed with inference versus action -- using human-crafted, perspective-constrained queries. Benchmarking 28 LLMs reveals three insights: 1) Reasoning, not knowledge. Models show strong game-rule comprehension but markedly weaker ToM abilities, isolating failures to social reasoning rather than missing domain knowledge. 2) Expression, not representation. Mechanistic analyses via linear probing and activation steering show that models frequently represent correct mental-state inferences in their hidden states but fail to express them during generation -- linear probes recover 77-82% accuracy versus 62-70% from the models' own chain-of-thought. 3) Policy, not deliberation. Dedicated reasoning training yields substantial improvements whereas test-time chain-of-thought provides only marginal gains (+11.0 versus +1.1 points on average), suggesting that robust ToM depends on a learned reasoning policy rather than increased inference-time deliberation.