Multimodal Rapport Estimation in Real-World HRI

📄 arXiv: 2608.18401v1 📥 PDF

作者: Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

分类: cs.HC, cs.CL, cs.RO

发布日期: 2026-08-19

备注: 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)


💡 一句话要点

提出多模态方法以解决真实场景中的人机互动质量评估问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 人机互动 多模态融合 关系评分 零样本学习 真实场景评估 智能机器人 音频视觉分析

📋 核心要点

  1. 现有的自动评估方法主要在实验室环境中开发,无法直接应用于真实场景,导致互动质量评估的可靠性不足。
  2. 本研究提出了一种多模态方法,通过分析文本、音频和视觉数据,自动估计人机互动中的关系评分,以适应真实环境的复杂性。
  3. 实验结果显示,零样本大语言模型在真实场景中表现优异,融合模型的整体表现最佳,且估计性能受互动时长和组大小的影响。

📝 摘要(中文)

在真实世界的人机互动(HRI)中,评估互动质量是一个重要挑战。如果能够可靠地估计互动质量,结果可以用于改善对话策略,并最终使机器人能够自主调整其行为。然而,现有的自动评估方法主要是在受控实验室环境中开发的,尚不清楚它们是否可以直接应用于用户自由 disengage 和多方参与自然发生的真实环境。本研究调查了使用在日本药店收集的62个多模态录音会话自动估计第三方评定的关系评分。我们比较了零样本大语言模型、预训练的文本、音频和视觉模型及其预测级融合。结果表明,在真实世界的HRI中,零样本大语言模型表现强劲,而音频和视觉模型则提供互补信息。特别是,Gemini 2.5 Flash作为单一模型表现优异,而结合Gemini(文本)与HuBERT和V-JEPA的融合模型整体表现最佳。进一步分析显示,估计性能在互动时长和组大小条件下有所不同。这些发现表明,真实世界HRI中的关系估计需要考虑超出实验室环境假设的上下文变异性。

🔬 方法详解

问题定义:本论文旨在解决在真实世界人机互动中,如何可靠地评估互动质量的问题。现有方法在实验室环境中开发,缺乏对真实场景中用户行为的适应性,尤其是在用户可能随时 disengage 的情况下。

核心思路:论文的核心思路是利用多模态数据(文本、音频和视觉)来自动估计互动中的关系评分,特别关注在真实环境中如何有效融合这些信息,以提高评估的准确性和可靠性。

技术框架:研究采用了62个多模态录音会话的数据,比较了零样本大语言模型与预训练的音频和视觉模型,并进行了预测级的融合。整体流程包括数据收集、模型训练、性能评估和结果分析。

关键创新:本研究的关键创新在于首次在真实世界的HRI场景中应用零样本大语言模型,并通过多模态融合提升了关系评分的估计精度,克服了传统方法的局限性。

关键设计:在模型设计中,使用了Gemini 2.5 Flash作为单一模型,并通过结合Gemini(文本)与HuBERT和V-JEPA的融合模型来优化性能。关键参数设置和损失函数的选择也经过精心调整,以适应多模态数据的特性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,零样本大语言模型在真实场景中的表现强劲,尤其是Gemini 2.5 Flash模型表现优异。融合模型结合Gemini(文本)与HuBERT和V-JEPA的结果,整体性能最佳,显示出在互动时长和组大小条件下的适应性,显著提升了关系评分的估计准确性。

🎯 应用场景

该研究的潜在应用领域包括社交机器人、智能客服和人机协作系统等。通过提高人机互动的质量评估能力,机器人可以更好地理解用户需求,优化互动策略,从而提升用户体验和满意度。未来,这种技术可能会推动更智能的自主机器人系统的发展,使其在复杂环境中更有效地与人类互动。

📄 摘要(原文)

Evaluating interaction quality in real-world HRI is an important challenge. If interaction quality can be estimated reliably, the results can be used to improve dialogue strategies and ultimately enable robots to adapt their behavior autonomously. However, existing automatic evaluation methods have been developed primarily in controlled laboratory settings, and it remains unclear whether they can be directly applied to real-world environments, where users are free to disengage and multi-party participation may arise naturally. In this study, we investigate the automatic estimation of third-party-rated rapport scores using 62 sessions of multimodal recordings collected in a Japanese drugstore. We compare zero-shot LLMs, pretrained text, audio, and visual models, and their prediction-level fusion. The results show that, in real-world HRI, zero-shot LLMs achieve strong performance, while audio and visual models tend to provide complementary information. In particular, Gemini 2.5 Flash performs strongly as a single model, and a fusion model combining Gemini (text) with HuBERT and V-JEPA performs best overall. Further analyses showed that estimation performance varied across interaction-duration and group-size conditions. These findings suggest that rapport estimation in real-world HRI requires evaluation and model design that account for contextual variability beyond that assumed in laboratory settings.