Does Listening Matter? Backchanneling and Nodding in AI Clone

📄 arXiv: 2608.19527v1 📥 PDF

作者: Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara

分类: cs.HC, cs.CL, cs.SD

发布日期: 2026-08-20

备注: This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)


💡 一句话要点

通过多模态听觉行为提升AI克隆的真实感与存在感

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: AI克隆 多模态交互 真实感提升 人机交互 语音克隆 行为预测 在线教育 社交机器人

📋 核心要点

  1. 现有的AI克隆技术主要关注语音和内容的模仿,缺乏对倾听行为的模拟,导致用户体验不足。
  2. 本文提出通过实时预测模型集成语言反馈和头部点头行为,增强AI克隆的互动性和真实感。
  3. 实验结果表明,添加多模态倾听行为后,用户对虚拟形象的注意力感和共在感显著提升,验证了该方法的有效性。

📝 摘要(中文)

AI克隆通常只模仿特定人物的言语和声音,而忽视其倾听行为。本文研究了将多模态倾听行为(如语言反馈和点头)添加到AI克隆中是否能增强其存在感和真实性。我们将基于实时预测模型的语言反馈和头部点头行为集成到配备语音克隆和基于大语言模型(LLM)响应的AI克隆中。在一项包含35名参与者的实验中,添加这些行为显著提高了虚拟形象的注意力感、与真实人物交谈的感觉和共在感。这些结果表明,AI克隆的真实度应超越声音和响应内容,纳入互动倾听行为。

🔬 方法详解

问题定义:本文旨在解决现有AI克隆在模拟人际互动时缺乏真实倾听行为的问题。传统方法仅关注语音和内容的再现,未能有效提升用户的沉浸感和真实感。

核心思路:通过引入多模态的倾听行为(如语言反馈和头部点头),增强AI克隆的互动性,使其在与用户交互时更具真实感和存在感。这样的设计旨在模拟人类的自然交流方式,提升用户体验。

技术框架:整体架构包括三个主要模块:语音克隆模块、基于LLM的响应生成模块和实时行为预测模块。语音克隆模块负责生成与目标人物相似的声音,LLM模块生成自然语言响应,而行为预测模块则实时分析用户输入并生成相应的倾听行为。

关键创新:本文的主要创新在于将多模态倾听行为系统地集成到AI克隆中,突破了传统AI克隆仅关注语音和内容的局限,提升了虚拟形象的互动性和真实感。

关键设计:在设计中,使用了特定的参数设置以优化行为预测模型的准确性,并采用了适应性损失函数来平衡语音生成与行为生成的质量。此外,网络结构上结合了卷积神经网络(CNN)和循环神经网络(RNN),以更好地处理时序数据。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,添加多模态倾听行为后,用户对虚拟形象的注意力感提升了显著的比例,具体数据表明,参与者对与AI克隆的互动感受更为真实,增强了共在感,验证了该方法的有效性。

🎯 应用场景

该研究的潜在应用场景包括虚拟助手、在线教育、社交机器人等领域。通过提升AI克隆的真实感和互动性,可以改善用户体验,促进人机交互的自然性和有效性,未来可能在心理治疗、陪伴机器人等领域发挥重要作用。

📄 摘要(原文)

AI clones that imitate a specific person typically reproduce what the person says and how they sound, but not how they listen. We investigate whether adding multimodal listening behaviors gives such a clone more presence and authenticity. We integrated verbal backchannels and head nodding, driven by real-time prediction models, into an AI clone equipped with voice cloning and LLM-based responses. In a within-subjects study (N=35), adding these behaviors significantly improved the perceived attentiveness of the avatar, the sense of talking with the real person, and the feeling of co-presence. These results indicate that AI clone fidelity should extend beyond voice and response content to include interactive listening behavior.