CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

📄 arXiv: 2608.12944v1 📥 PDF

作者: Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

分类: cs.LG, eess.IV, stat.ML

发布日期: 2026-08-13


💡 一句话要点

提出CardioState-JEPA以解决心脏信号多模态学习问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 心脏信号处理 多模态学习 Transformer模型 生理感知 共享表示 延迟对齐 自监督学习

📋 核心要点

  1. 现有心脏信号模型通常只针对单一模态进行训练,未能充分利用不同传感器间的共享生理信息,导致信息利用不充分。
  2. CardioState-JEPA通过生理感知的联合嵌入预测架构,学习ECG、PPG和PCG的共享表示,强调共享生理特征而非单一模态的波形特征。
  3. 在25个下游任务中,CardioState-JEPA的编码器在PPG分类、PCG杂音检测和ECG分类上分别提升了8.2、18.8和15.5 AUROC点,超越了最佳自监督信号基线。

📝 摘要(中文)

心电图(ECG)、光电容积描记法(PPG)和心音图(PCG)提供了对同一心脏周期的互补视角,但现有的心脏基础模型通常仅针对单一传感模态进行训练,未能充分利用传感器间的共享生理信息。本文提出CardioState-JEPA,一个心脏基础模型,通过生理感知的联合嵌入预测架构,学习ECG、PPG和PCG的单一共享表示。该模型将异构波形映射到共同的标记空间,使用单一共享的Transformer编码器进行处理,并通过预测掩蔽的潜在心脏状态进行学习,重点关注共享生理而非传感器特定的波形外观。为处理电气、机械和血流动力学事件之间的时间偏移,跨模态预测使用学习的延迟对齐器来匹配相应的心脏时间信号。

🔬 方法详解

问题定义:本文旨在解决现有心脏信号模型仅针对单一模态训练的问题,导致不同传感器间的共享生理信息未被充分利用。

核心思路:CardioState-JEPA通过生理感知的联合嵌入预测架构,学习ECG、PPG和PCG的共享表示,强调共享生理特征而非单一模态的波形特征,从而实现跨模态学习。

技术框架:该模型将异构波形映射到共同的标记空间,使用单一共享的Transformer编码器进行处理,并通过预测掩蔽的潜在心脏状态进行学习。模型还引入了学习的延迟对齐器,以处理不同模态信号之间的时间偏移。

关键创新:最重要的创新在于通过联合嵌入预测架构实现了跨模态的共享表示学习,突破了传统模型仅针对单一模态的限制,促进了不同心脏信号之间的互相监督。

关键设计:模型设计中包括了共享的Transformer编码器、掩蔽预测损失函数以及延迟对齐器的实现,确保了不同模态信号在潜在心脏时间上的对齐。具体的参数设置和网络结构细节在实验部分进行了详细说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

CardioState-JEPA在25个下游任务中表现出色,PPG分类提升8.2 AUROC点,PCG杂音检测提升18.8 AUROC点,ECG分类提升15.5 AUROC点,超越了最佳自监督信号基线,并在多个ECG基准上与使用临床文本或监督标签训练的模型相当或更优。

🎯 应用场景

该研究的潜在应用领域包括心脏病监测、早期诊断和个性化医疗等。通过实现多模态信号的共享表示学习,CardioState-JEPA能够提高心脏疾病的检测精度和效率,具有重要的临床价值和未来影响。

📄 摘要(原文)

Electrocardiography (ECG), photoplethysmography (PPG), and phonocardiography (PCG) provide complementary views of the same cardiac cycle, yet existing cardiac foundation models are trained for a single sensing modality, leaving the shared physiology across sensors unexploited. We introduce CardioState-JEPA, a cardiac foundation model to learn a single shared representation jointly across ECG, PPG, and PCG, built on a physiology-aware joint-embedding predictive architecture. The model maps heterogeneous waveforms into a common token space, processes them with a single shared Transformer encoder, and learns by predicting masked latent cardiac states, placing the pretraining target on shared physiology rather than sensor-specific waveform appearance. To handle the temporal offsets between electrical, mechanical, and hemodynamic events, cross-modal prediction uses a learned delay aligner that matches signals at the corresponding cardiac time. Because synchronized multi-sensor recordings are scarce, CardioState-JEPA first learns within-modality structure from abundant unimodal data and then uses paired data to align modalities in latent cardiac time. Evaluated as a frozen encoder across 25 downstream tasks spanning ECG, PPG, and PCG, our encoder improves average PPG classification by 8.2 AUROC points, PCG murmur detection by 18.8 AUROC points, and ECG classification by 15.5 AUROC points over the best self-supervised signal baseline and matches or exceeds cardiac models trained with privileged clinical text or supervised labels on several ECG benchmarks. These results establish that heterogeneous cardiac signals can mutually supervise a single foundation model of cardiac physiology.