DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment
作者: Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen
分类: cs.LG, cs.AI, cs.MM
发布日期: 2026-07-28
💡 一句话要点
提出DynaBridge以解决DASS结构心理健康评估中的多模态融合问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态融合 心理健康评估 DASS-21 动态摘要 风险预测 声学分析 视觉分析 文本分析
📋 核心要点
- 现有的多模态融合模型在心理健康评估中未能充分利用问卷的心理测量结构,导致评估效果不佳。
- DynaBridge通过动态摘要引导的方式,融合声学、视觉和文本信息,增强了对DASS-21结构的理解和应用。
- 在AdoDAS验证集上,DynaBridge在D/A/S风险预测和DASS-21项目预测上均显著优于现有基线,验证了其有效性。
📝 摘要(中文)
多模态行为分析为评估抑郁、焦虑和压力提供了一种可扩展的方法,但现有的通用融合模型往往忽视了问卷标签的心理测量结构。在DASS-21中,风险标签是通过固定的项目到子量表的映射从有序症状项目中得出的。本文提出了DynaBridge,一个动态摘要引导的跨任务多模态框架,用于DASS结构的心理健康评估。DynaBridge编码了多个会话中的声学、视觉和文本线索,并通过冻结的LLM生成的DASS感知摘要作为参与者级别的语义证据进行增强。它预测有序项目分布,从项目级软评分重构抑郁、焦虑和压力风险证据,并将这些证据与直接的多模态风险预测融合。在官方的AdoDAS验证分割上,DynaBridge超越了官方基线和代表性的多模态方法,实现了0.5012的D/A/S风险预测平均F1和0.3216的DASS-21项目预测平均QWK。这些结果展示了多模态线索、语义摘要与DASS-21心理测量结构之间的桥接价值。
🔬 方法详解
问题定义:本文旨在解决现有多模态融合模型在心理健康评估中忽视DASS结构的问题,导致评估结果的准确性和可靠性不足。
核心思路:DynaBridge通过动态生成的摘要来引导多模态信息的融合,结合声学、视觉和文本线索,增强了对心理健康状态的理解。
技术框架:DynaBridge的整体架构包括多个模块:首先是信息编码模块,接着是摘要生成模块,最后是风险预测模块,形成一个闭环的评估流程。
关键创新:DynaBridge的核心创新在于将动态摘要与多模态信息融合,形成了基于DASS结构的语义证据,显著提升了评估的准确性。
关键设计:在设计中,采用了冻结的LLM生成DASS感知摘要,结合高置信度的语义线索进行风险预测,使用了特定的损失函数来优化模型性能。
🖼️ 关键图片
📊 实验亮点
DynaBridge在AdoDAS验证集上取得了0.5012的D/A/S风险预测平均F1和0.3216的DASS-21项目预测平均QWK,显著超越了官方基线和其他代表性多模态方法,展示了其在心理健康评估中的有效性和优势。
🎯 应用场景
该研究具有广泛的应用潜力,尤其在心理健康评估、临床诊断和个性化治疗方案制定等领域。通过更准确的心理状态评估,能够为患者提供更有效的干预措施,提升心理健康服务的质量和效率。未来,DynaBridge的框架还可以扩展到其他心理健康相关的多模态数据分析中。
📄 摘要(原文)
Multimodal behavioral analysis offers a scalable approach to assessing depression, anxiety, and stress, yet generic fusion models often ignore the psychometric structure of questionnaire labels. In DASS-21, risk labels are derived from ordered symptom items through fixed item-to-subscale mappings. We propose \textbf{DynaBridge}, a dynamic summary-guided cross-task multimodal framework for DASS-structured mental health assessment. DynaBridge encodes acoustic, visual, and textual cues across multiple sessions and augments them with frozen-LLM-generated DASS-aware summaries as participant-level semantic evidence. It predicts ordinal item distributions, reconstructs depression, anxiety, and stress risk evidence from item-level soft scores, and fuses this evidence with direct multimodal risk predictions. A confidence-aware refinement strategy further incorporates high-confidence semantic cues conservatively. On the official AdoDAS validation split, DynaBridge outperforms the official baseline and representative multimodal methods, achieving 0.5012 mean F1 for D/A/S risk prediction and 0.3216 mean QWK for DASS-21 item prediction. These results show the value of bridging multimodal cues, semantic summaries, and DASS-21 psychometric structure.