BALMS: Benchmarking Agentic LLMs for Longitudinal Mental Health Sensing
作者: Yu Yvonne Wu, Arvind Pillai, Yuliang Chen, Yuwei Zhang, Sudarshan Regmi, Tess Z. Griffin, Michael V. Heinz, Lisa A. Marsch, Nicholas C. Jacobson, Andrew Campbell
分类: cs.CL
发布日期: 2026-08-27
备注: Accepted to EMNLP 2026 Main Conference
💡 一句话要点
提出BALMS基准以解决长期心理健康感知问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 心理健康 长时间监测 可穿戴设备 自然语言处理 LLM驱动代理 数据基准 推理能力 行为特征
📋 核心要点
- 现有方法主要依赖短期检索,无法有效评估长期心理健康信号与幸福感评分之间的关系。
- 论文提出BALMS基准,通过系统性评估LLM驱动的代理系统在长期心理健康感知中的能力。
- 实验结果显示,零-shot代理通常无法超越简单均值基线,且链式思维提示对推理导向的基础模型有改善,但不保证时间基础或数值正确性。
📝 摘要(中文)
心理健康评估依赖于情节自我报告量表,将主观状态如压力转化为数值评分,但只能提供稀疏的幸福感快照。可穿戴设备提供了连续、低负担的行为和生理信号监测。尽管最近的LLM驱动个人健康代理能够对可穿戴信号进行自然语言查询,但主要处理短期检索。为填补这一空白,本文提出BALMS,这是第一个系统性基准,评估基于LLM的代理系统在长期心理健康感知中的表现。BALMS涵盖3个真实世界的纵向数据集、2个任务家族和3种代理范式,评估5个开源和闭源LLM基础模型。研究发现,零-shot代理在大多数情况下表现不佳,只有在使用更强的基础模型或语义特征时才有所改善。
🔬 方法详解
问题定义:本文旨在解决现有心理健康评估方法在长期信号推理和幸福感评分预测方面的不足,现有方法主要依赖短期数据,无法提供全面的心理健康监测。
核心思路:提出BALMS基准,通过系统性评估LLM驱动的代理系统在长期心理健康感知中的表现,重点关注历史信息的选择性检索和时间证据的基础。
技术框架:BALMS涵盖三个真实世界的纵向数据集,包含两个任务家族(幸福感评分预测和基于LLM的推理生成),并评估三种代理范式,使用五个不同的LLM基础模型。
关键创新:BALMS是第一个系统性基准,专注于LLM驱动的代理在长期心理健康感知中的应用,强调了历史信息的选择性检索和推理能力的重要性。
关键设计:在实验中,使用了零-shot学习和链式思维提示,评估了不同基础模型的性能,发现强大的基础模型和语义特征能够提升代理的表现。实验还分析了效率和时间扩展性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,零-shot代理在大多数情况下未能超越简单均值基线,只有在使用更强的基础模型或语义特征时才有所改善。链式思维提示对推理导向的基础模型有一定的提升,但并未保证时间基础或数值的正确性。
🎯 应用场景
该研究的潜在应用领域包括心理健康监测、个性化健康管理和智能可穿戴设备。通过提供更准确的长期心理健康评估,BALMS可以帮助医疗专业人员更好地理解患者的心理状态,并制定相应的干预措施,具有重要的实际价值和未来影响。
📄 摘要(原文)
Mental health assessment relies on episodic self-report scales, which convert subjective states such as stress into numerical scores but provide only sparse snapshots of wellbeing. Wearable devices offer longitudinal behavioral and physiological signals for continuous, low-burden monitoring. Recent LLM-driven personal-health agents enable natural language queries over wearable signals, but mainly handle short-term, retrieval-based lookups (e.g., highest step count over a week). They do not evaluate whether agents can reason over long-term signals to predict wellbeing scores paired with evidence-grounded rationales. To address this gap, we introduce BALMS, the first systematic benchmark of LLM-based agentic systems for longitudinal mental health sensing. BALMS spans 3 real-world longitudinal datasets, 2 task families (closed-form wellbeing-score prediction and rationale generation auto-graded by an LLM-as-Judge), 3 agentic paradigms evaluated across 5 open- and closed-source LLM backbones. We find that zero-shot agents rarely outperform a simple mean baseline, except with stronger backbones or compact, semantically meaningful features. Chain-of-thought prompting improves reasoning-oriented backbones, but does not guarantee temporal grounding or numerical correctness. Together with more analysis on efficiency and temporal scaling, BALMS highlights the need for longitudinal mental health agents that selectively retrieve history, ground temporal evidence, and reason over interpretable behavioral features.