MyMentorLLM: A psychotherapy GenAI environment with multimodal voice/text patients, trainees and experts for deliberate practice

📄 arXiv: 2607.25667v1 📥 PDF

作者: Rodolfo Rizzi, Alessandro Grecucci, Massimo Stella

分类: cs.CL, cs.AI

发布日期: 2026-07-28

备注: 27 pages, 6 figures, 2 tables; 1 supplementary table


💡 一句话要点

提出MyMentorLLM以解决心理治疗师培训的可扩展性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心理治疗 认知行为疗法 多模态学习 模拟环境 专家监督 情感动态 培训系统

📋 核心要点

  1. 心理治疗师的培训和监督难以扩展,现有方法在规模化上存在挑战。
  2. MyMentorLLM通过多模态语音和文本环境,提供了一个标准化的CBT培训模拟平台。
  3. 实验结果显示,模拟患者的情感特征与真实情况相符,且监督反馈显著提高了诊断准确性。

📝 摘要(中文)

心理治疗师需要反复的培训和专家监督,但可扩展性存在问题。本文介绍了MyMentorLLM,这是一个基于多模态语音和文本的模拟环境,用于认知行为疗法(CBT)的有意练习,生成了2100个完整的CBT培训会话。每个会话连接了一个DSM-5-TR基础的患者(患有重度抑郁、广泛性焦虑或边缘性人格障碍)、一名培训中的治疗师和一名专家监督者。初步实施中,采用CBT的结构化程序和基于能力的监督促进了标准化的模拟和评估。会话分析了情感动态、治疗能力和诊断准确性。模拟患者表现出与障碍一致的情感特征,培训治疗师的反应与真实人类咨询相似。监督质量在不同的LLM中有所不同,尽管大多数模型高估了培训者的能力,但本地语音到语音的模型最接近人类评分。监督者的反馈在7个LLM中有5个提高了模拟心理治疗师的诊断能力,且随着模型规模的增大,症状识别的准确性也有所提升。

🔬 方法详解

问题定义:本文旨在解决心理治疗师培训中的可扩展性问题,现有方法难以提供足够的实践机会和有效的反馈。

核心思路:MyMentorLLM通过创建一个多模态的模拟环境,使治疗师能够在安全的环境中进行有意练习,促进技能提升和反馈获取。

技术框架:该系统包括三个主要模块:模拟患者生成模块、治疗师培训模块和专家监督模块。模拟患者根据DSM-5-TR标准生成,治疗师在模拟环境中进行互动,专家提供反馈。

关键创新:本研究的创新在于结合多模态输入(语音和文本)来提升模拟的真实感和有效性,尤其是在情感动态的表现上。

关键设计:在模型设计中,采用了基于能力的监督机制,确保反馈的质量和准确性,同时通过调整模型规模来优化症状识别的准确性。具体的损失函数和网络结构细节尚未明确说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,模拟患者的情感特征与真实情况高度一致,且在5个LLM中,监督者的反馈显著提高了模拟心理治疗师的诊断能力。随着模型规模的增大,症状识别的准确性也得到了提升,显示出模型性能的显著改善。

🎯 应用场景

MyMentorLLM的潜在应用领域包括心理治疗师的培训、教育机构的课程设计以及心理健康服务的提升。通过提供一个标准化的模拟环境,该系统能够帮助培训者在实际工作中更有效地应对各种心理健康问题,提升治疗效果。未来,该技术可能扩展到其他医疗培训领域,促进更广泛的技能提升和知识传播。

📄 摘要(原文)

Psychotherapists need repeated training and supervision by experts; however, scalability is problematic. Here we present MyMentorLLM, a multimodal voice- and text-based simulation environment for deliberate practice, used to generate 2,100 complete Cognitive Behavioural Therapy (CBT) training sessions. Each session links a DSM-5-TR-grounded patient (with major depressive, generalised anxiety or borderline personality disorder), a therapist-in-training and an expert supervisor. As an initial implementation, we adopted CBT because its structured procedures and competency-based supervision facilitate standardised simulation and evaluation. Sessions were analysed for emotional dynamics, therapeutic competence and diagnostic accuracy. Simulated patients expressed disorder-congruent emotional profiles, which trainee therapists mirrored as in real human counselling. The quality of supervision differed across LLMs: while most models overestimated trainees' competences, native speech-to-speech was closest to human scores. Supervisors' feedback led to better diagnoses in simulated psychotherapists in 5 out of 7 LLMs, and symptom identification accuracy increased with model size. This work shows that simulation of deliberate practice is possible for CBT training, although patient fidelity, calibration of supervisors, and harmful feedback should be evaluated together.