Scale-Aware Pretraining of Time Series Foundation Models via Multi-Patch Token Alignment and Hybrid Masking

📄 arXiv: 2608.20005v1 📥 PDF

作者: Taihua Chen, Xiang Ma, Yixin Zhang, Tailin Zhan, Manyu Sun, Lizhen Cui

分类: cs.LG

发布日期: 2026-08-20


💡 一句话要点

提出SATS以解决时间序列预训练中的尺度不一致问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 时间序列分析 预训练模型 尺度感知 对齐机制 混合掩蔽 深度学习 模型效率

📋 核心要点

  1. 现有方法在处理异构数据集时,往往面临补丁大小不一致和表示碎片化的问题。
  2. 本文提出SATS,通过尺度感知的令牌对齐机制和混合掩蔽策略,有效解决了时间序列预训练中的尺度问题。
  3. 实验结果显示,SATS在多个指标上超越竞争基线,尤其在MSE和GIFT-Eval MASE上分别提升了9.2%和8.3%。

📝 摘要(中文)

在异构数据集上预训练时间序列基础模型需要有效处理不同的采样频率。现有方法通常采用特定数据集的补丁大小和独立的前馈网络,导致表示碎片化,或强制使用固定补丁大小而忽视内在的时间变化。为此,本文提出了SATS,采用尺度感知的令牌对齐机制,将补丁大小视为显式的尺度概念。通过引入对比启发的对齐正则化器,SATS在不同尺度间对齐表示空间,同时保留独特的建模能力。此外,提出了一种结合随机和连续掩蔽的混合掩蔽策略,以捕捉多尺度的时间结构。在LSTF基准测试中的实验结果表明,SATS在均方误差(MSE)上提高了9.2%,在GIFT-Eval MASE上提高了8.3%,并且在模型效率上相比先进基线提升了65.6%,显示出其在时间序列预训练中的有效性和可扩展性。

🔬 方法详解

问题定义:本文旨在解决在异构数据集上预训练时间序列模型时,因采样频率不同而导致的补丁大小不一致和表示碎片化的问题。现有方法往往采用固定补丁大小,无法有效捕捉时间序列的内在变化。

核心思路:SATS通过引入尺度感知的令牌对齐机制,将补丁大小视为尺度的显式表示,结合对比启发的对齐正则化器,确保不同尺度间的表示空间对齐,同时保留各自的建模能力。

技术框架:SATS的整体架构包括尺度感知的令牌对齐模块和混合掩蔽策略。前者通过对齐不同尺度的表示空间,后者则通过随机和连续掩蔽的结合,捕捉多尺度的时间结构。

关键创新:SATS的主要创新在于其尺度感知的令牌对齐机制和混合掩蔽策略,这与现有方法的固定补丁大小和单一掩蔽策略形成鲜明对比,显著提升了模型的表示能力和效率。

关键设计:在设计中,SATS采用了对齐正则化器以增强不同尺度间的对齐效果,同时在掩蔽策略中结合了随机和连续掩蔽,以更好地捕捉时间序列的多尺度特征。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,SATS在LSTF基准测试中实现了9.2%的均方误差(MSE)提升和8.3%的GIFT-Eval MASE提升,同时在模型效率上相比先进基线提升了65.6%,展现出其卓越的性能和可扩展性。

🎯 应用场景

该研究的潜在应用领域包括金融市场分析、气象数据预测和医疗监测等时间序列数据处理场景。通过提高时间序列模型的预训练效率和准确性,SATS能够为各类时间序列分析任务提供更强大的支持,推动相关领域的发展。

📄 摘要(原文)

Pretraining time series foundation models across heterogeneous datasets necessitates effective handling of varying sampling frequencies. Current methods either employ dataset-specific patch sizes and separate FFNs, leading to fragmented representations, or enforce a fixed patch size that neglects inherent temporal variations. To address this, we propose SATS, featuring a scale-aware token alignment mechanism that treats patch size as an explicit notion of scale. By incorporating a contrastive-inspired alignment regularizer, SATS aligns representation spaces across scales while preserving distinct modeling capacities. Furthermore, a hybrid masking strategy combining random and contiguous masking is introduced to capture multi-scale temporal structures. Experimental results on LSTF benchmarks demonstrate that SATS achieves a 9.2% improvement in MSE and an 8.3% gain in GIFT-Eval MASE compared to competitive baselines. Notably, SATS consistently delivers SOTA performance while achieving a 65.6% increase in model efficiency over advanced baselines, highlighting its effectiveness and scalability in time series pretraining.