MultivationBench: A Benchmark for Multimodal Sequential Motivation Reasoning
作者: Kawai Chung, Chunkit Chan, Yauwai Yim, Yuxuan Liu, Haochen Shi, Weiqi Wang, Qing Zong, Tianshi Zheng, Yixuan Fu, Kai Chung Wong, Hao Liang, Yifan Gao, Xi Yang, Janet Hui-wen Hsiao, Yangqiu Song
分类: cs.AI
发布日期: 2026-07-29
备注: 31 pages, including appendices; 6 figures and 22 tables. Code: https://github.com/HKUST-KnowComp/MultivationBench
💡 一句话要点
提出MultivationBench以解决多模态序列动机推理评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态推理 序列动机推理 心理学框架 视觉叙事 模型评估
📋 核心要点
- 现有方法主要评估静态文本或孤立视觉快照,无法反映真实世界中动机的累积性,导致动机推理能力不足。
- 本文提出MultivationBench基准,结合心理学框架,要求模型整合多模态上下文以推断演变的动机。
- 实验结果显示,所有测试模型在序列上下文中保持一致的动机推理存在困难,揭示了静态识别与动态推理之间的脱节。
📝 摘要(中文)
多模态大型语言模型因其潜在的社会智能而受到广泛关注,但其在序列动机推理方面的能力仍未得到充分研究。现有评估主要集中于静态文本或孤立的视觉快照,无法反映现实世界行为驱动因素的累积特性。为填补这一空白,本文提出了MultivationBench,一个旨在严格评估故事驱动的视觉叙事中的多模态动机推理的基准。该基准基于已建立的心理学框架——马斯洛的需求层次理论和赖斯的基本欲望,要求模型整合累积的多模态上下文以推断不断演变的动机。结果表明,MultivationBench提出了显著挑战:所有测试模型在序列上下文中保持一致的动机推理方面均表现不佳,揭示了静态识别能力与人类社会理解所需的动态推理之间的关键脱节。
🔬 方法详解
问题定义:本文旨在解决多模态序列动机推理的评估问题。现有方法多集中于静态文本和孤立视觉信息,无法有效捕捉行为动机的动态变化与累积特性。
核心思路:提出MultivationBench基准,通过结合心理学理论,要求模型在多模态上下文中推断动机,强调动机推理的序列性与动态性。
技术框架:该基准包括多个模块,首先是数据集构建,结合故事驱动的视觉叙事,其次是模型评估,最后是动机推理的结果分析,确保模型能够处理复杂的多模态信息。
关键创新:最重要的创新在于将心理学框架引入多模态推理评估,强调了动机的演变过程,与现有方法相比,提供了更为全面的评估标准。
关键设计:在模型设计中,采用了特定的损失函数以优化多模态信息的融合,设置了参数以适应不同的上下文场景,确保模型能够有效整合信息并进行推理。
🖼️ 关键图片
📊 实验亮点
实验结果显示,所有测试模型在序列动机推理任务中均表现不佳,未能保持一致的动机推理,揭示了静态识别能力与动态推理之间的显著差距。这一发现强调了在多模态推理中考虑序列上下文的重要性。
🎯 应用场景
该研究的潜在应用领域包括社交机器人、智能助手和教育技术等,能够帮助这些系统更好地理解和预测人类行为,提升人机交互的自然性和有效性。未来,随着多模态推理能力的提升,这些技术有望在心理健康监测、个性化推荐等领域发挥重要作用。
📄 摘要(原文)
Multimodal Large Language Models have sparked significant interest due to their potential for social intelligence; however, their ability to perform sequential motivation reasoning remains insufficiently studied. Existing evaluations predominantly examine static text or isolated visual snapshots, which do not reflect the cumulative nature of real-world behavioral drivers. To address this gap, we introduce MultivationBench, a benchmark designed to rigorously evaluate multimodal motivation reasoning within story-driven visual narratives. The benchmark builds upon established psychological frameworks - Maslow's hierarchy and Reiss's basic desires - and requires models to integrate accumulated multimodal context to infer evolving motivations. Results indicate that MultivationBench presents a significant challenge: all tested models struggle to maintain consistent motivation reasoning across sequential contexts, revealing a critical disconnect between static recognition capabilities and the dynamic reasoning essential for human-like social understanding.