ReMiX-MAE: Learning Missing-Channel Cross-Modal Representations from RGB-Only Clinical Facial Videos for Sympathetic-Mediated Pain Assessment
作者: Nan Bi, Taoyue Wang, Lijun Yin, Vandana Sharma
分类: cs.CV
发布日期: 2026-08-03
💡 一句话要点
提出ReMiX-MAE以解决临床面部视频缺失通道问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 自动化疼痛评估 多模态学习 自监督学习 面部表征 临床应用
📋 核心要点
- 现有的自动化疼痛评估方法受到缺乏高质量面部视频数据和疼痛线索微弱的限制,难以有效应用于临床。
- 本文提出ReMiX-MAE,通过自监督学习从RGB、热成像和深度视频中提取面部特征,并增强对缺失模态的鲁棒性。
- 实验结果表明,ReMiX-MAE在RGB-only设置下优于传统的RGB-only掩码自编码器,且在外部数据集上表现出更强的转移能力。
📝 摘要(中文)
在真实临床中,自动化疼痛评估受到缺乏临床基础面部视频数据和疼痛线索微弱的限制。为了解决这些挑战,本文提出了ReMiX-MAE(重建缺失通道跨模态掩码自编码器),这是一种自监督的多模态掩码预训练框架,能够从同步的RGB、热成像和深度视频中学习可转移的面部表征,并显式训练对缺失模态的鲁棒性,从而实现仅使用RGB的部署。我们收集了具有视频级自报告和纵向治疗轨迹的Sympathetic Mediated Pain (SMP)数据集,并在RGB-only部署下评估ReMiX-MAE,结果显示其在SMP上始终优于RGB-only的掩码自编码器基线,并在五类挑战性设置中,伪多模态特征提供了额外的提升。
🔬 方法详解
问题定义:本文旨在解决临床环境中自动化疼痛评估面临的挑战,尤其是缺乏高质量的面部视频数据和疼痛线索微弱的问题。现有方法往往依赖于RGB视频,难以充分利用热成像和深度信息。
核心思路:ReMiX-MAE通过自监督学习框架,结合RGB、热成像和深度视频,学习可转移的面部表征,并显式训练模型对缺失模态的鲁棒性,从而实现仅使用RGB视频的有效部署。
技术框架:该方法包括数据收集、预训练和评估三个主要阶段。首先,收集具有视频级自报告的Sympathetic Mediated Pain (SMP)数据集;其次,采用掩码自编码器进行多模态预训练;最后,评估模型在RGB-only设置下的表现。
关键创新:ReMiX-MAE的核心创新在于其自监督的多模态掩码预训练框架,能够有效地从缺失模态中恢复信息,并在数据稀缺的临床环境中实现更好的性能。
关键设计:在模型设计中,采用了特定的损失函数来优化多模态特征的学习,同时设置了适当的超参数以提高模型的鲁棒性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,ReMiX-MAE在RGB-only设置下的表现显著优于传统的RGB-only掩码自编码器基线,尤其是在五类挑战性设置中,伪多模态特征提供了额外的性能提升,验证了其在数据有限的临床环境中的优势。
🎯 应用场景
该研究的潜在应用领域包括临床疼痛评估、心理健康监测和医疗影像分析等。通过实现仅使用RGB视频的疼痛评估,ReMiX-MAE能够在数据稀缺的环境中提供有效的解决方案,提升临床决策的效率和准确性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Automated pain assessment in real clinics is limited by scarce clinically grounded facial video data with weak labels (often sequence-level self-report) and by the fact that pain cues can be subtle or near-neutral in RGB, while thermal and depth signals are informative yet impractical to deploy routinely. To address these challenges, we propose ReMiX-MAE (Reconstructing Missing Channel Cross-Modal Masked Autoencoder), a self-supervised multimodal masked pretraining framework that learns transferable facial representations from synchronized RGB, thermal, and depth videos and explicitly trains robustness to missing modalities, enabling RGB-only deployment. To fill the gap of clinically grounded facial pain data with video-level self-report and longitudinal treatment trajectories, we collect the Sympathetic Mediated Pain (SMP) dataset with paired pre- and post-recordings across multiple visits. Under RGB-only deployment, we evaluate ReMiX-MAE using both direct feature extraction and pseudo-multimodal features decoded from RGB. ReMiX-MAE consistently outperforms an RGB-only masked autoencoder baseline on SMP, with pseudo-multimodal features providing additional gains in the challenging five-class setting. Across external datasets, ReMiX-MAE further shows more robust and label-efficient transfer than RGB-only baselines, highlighting its advantage in data-limited clinical settings.