Neurai-VN Benchmark: Standardized Machine Learning Models for Multimodal Digital Phenotyping in Mental Health Classification
作者: Quoc-Cuong Pham, Hoang-Thuy-Duong Vu, Thi-Thanh-Huong Ha, Huy-Hieu Pham
分类: cs.LG
发布日期: 2026-07-28
💡 一句话要点
提出Neurai-VN基准以解决心理健康分类中的数据异质性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 数字表型 心理健康 多模态数据 分类任务 基准评估 机器学习 可穿戴设备
📋 核心要点
- 现有的心理健康监测方法面临数据集异质性和预处理流程不一致的问题,导致评估进展困难。
- 本研究提出了基于Neurai-VN数据集的可重复基准,定义了四个临床相关的二分类任务,并使用标准化的交叉验证进行评估。
- 实验结果显示,健康对照与抑郁症的F1分数达到0.71,为未来相关研究提供了可靠的基线。
📝 摘要(中文)
数字表型(DP)利用智能手机和可穿戴设备在心理健康监测中展现出显著潜力。然而,由于数据集异质性和预处理流程不一致,进展评估仍然困难。本研究提出了基于Neurai-VN数据集的可重复基准,该数据集由100名越南成年人在两周内收集的被动感知和主动评估的高分辨率多模态数据组成。基准定义了四个临床相关的二分类任务,并使用标准化的受试者交叉验证进行评估。代表性的线性、树基和神经网络基线模型在预定义特征配置下进行了评估。五折交叉验证的平均受试者F1分数在健康对照与抑郁症、健康对照与临床的任务中分别达到了0.71,而健康对照与焦虑、抑郁与焦虑的任务则分别为0.69和0.56。这些基准结果为未来多模态DP在心理健康分类任务中的研究提供了可重复的基线。
🔬 方法详解
问题定义:本研究旨在解决心理健康分类任务中由于数据集异质性和预处理不一致导致的评估困难。现有方法缺乏标准化的基准,影响了结果的可比性和可重复性。
核心思路:论文提出了一个基于Neurai-VN数据集的标准化基准,包含多模态数据的被动感知和主动评估,旨在为心理健康分类提供可靠的评估框架。
技术框架:整体架构包括数据收集、特征提取、模型训练和评估四个主要模块。数据收集阶段使用智能手机和可穿戴设备,特征提取阶段则定义了多种特征配置。
关键创新:最重要的创新在于建立了一个可重复的基准,允许研究者在相同的条件下进行比较,解决了以往研究中缺乏统一评估标准的问题。
关键设计:在模型训练中,使用了线性、树基和神经网络等多种基线模型,并在五折交叉验证中评估了不同特征配置的表现,确保了结果的可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,健康对照与抑郁症的平均F1分数达到0.71,健康对照与焦虑的F1分数为0.69,抑郁与焦虑的F1分数为0.56。这些结果为未来的多模态心理健康分类研究提供了重要的基准和参考。
🎯 应用场景
该研究的潜在应用领域包括心理健康监测、临床诊断和个性化治疗方案的制定。通过提供标准化的评估基准,研究者可以更有效地比较不同的多模态数据处理方法,推动心理健康领域的研究进展。
📄 摘要(原文)
Digital phenotyping (DP) using smartphones and wearable devices has shown considerable potential for mental health monitoring. However, progress remains difficult to evaluate due to heterogeneous datasets, inconsistent preprocessing pipelines. In this study, we present a reproducible benchmark built upon the Neurai-VN dataset, a high-resolution, multimodal dataset comprising passive sensing and active assessment from wearable and smartphone devices, collected from 100 Vietnamese adults over two weeks. The benchmark defines four clinically relevant binary classification tasks evaluated using standardized subject-wise cross-validation. Representative linear, tree-based, and neural baseline models are evaluated across predefined feature configurations. Mean subject-level F1 scores across five cross-validation folds reached 0.71 for Healthy Control vs. Depression and Healthy Control vs. Clinical, while Healthy Control vs. Anxiety and Depression vs. Anxiety achieved 0.69 and 0.56, respectively. These benchmark results provide reproducible baselines for future research on multimodal DP for mental health classification tasks.