Into the ORBIT for Time Series: Training Regimes for Foundation Models
作者: Hongjie Xia, Yiding Liu, Yifan Hu, Peiyuan Liu, Zewei Dong
分类: cs.LG, cs.AI
发布日期: 2026-08-13
💡 一句话要点
提出ORBIT训练范式以优化时间序列基础模型的训练
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 时间序列模型 基础模型 增量训练 自助采样 预测性能 深度学习 缺失值处理
📋 核心要点
- 现有时间序列模型在训练过程中对数据分布的控制不足,导致领域不平衡和预测性能下降。
- 提出ORBIT训练范式,通过自助多层采样和增量训练,显著提高数据集的控制和模型的适应性。
- 在多种领域和频率下进行的实验表明,模型在零-shot预测任务中表现优异,性能显著提升。
📝 摘要(中文)
时间序列基础模型(TSFMs)的进展主要依赖于架构创新,而针对大规模异构语料的训练范式尚未得到充分探索。因此,预训练分布往往在领域不平衡、上下文需求、预测范围和缺失值方面控制不佳。本文提出了ORBIT(全范围自助增量训练),一种明确且可控的训练范式。ORBIT结合了自助多层采样和全范围增量训练,控制数据集暴露、样本记录、目标变量、上下文窗口和预测范围。在ORBIT框架下,我们训练了Falcon-2.0,一个简单的单变量编码器Transformer,具备缺失值感知的三通道补丁标记化和并行补丁预测。通过GIFT-Eval和fev-bench的评估,展示了在不同领域和频率下的强大零-shot预测性能。
🔬 方法详解
问题定义:本文旨在解决时间序列基础模型在训练过程中对数据分布控制不足的问题,现有方法在领域不平衡和缺失值处理上存在明显短板。
核心思路:提出ORBIT训练范式,通过自助多层采样和全范围增量训练,使得训练过程中的数据分布显式且可控,从而提高模型的预测性能。
技术框架:ORBIT框架包含两个主要模块:自助多层采样模块用于控制数据集的暴露和样本选择,增量训练模块则在单一训练阶段内调整上下文长度和预测范围。
关键创新:引入Rank-Guided Cross-Depth Alignment作为训练目标,利用深层表示作为浅层的停梯度教师,避免了额外的推理成本,这是与现有方法的本质区别。
关键设计:在模型Falcon-2.0中,采用缺失值感知的三通道补丁标记化和并行补丁预测,确保了模型在处理缺失数据时的有效性。
🖼️ 关键图片
📊 实验亮点
在GIFT-Eval和fev-bench的评估中,使用ORBIT训练的Falcon-2.0模型在零-shot预测任务中表现优异,超越了多个基线模型,展现出强大的跨领域适应能力和高效的预测性能。
🎯 应用场景
该研究的潜在应用领域包括金融市场预测、气象数据分析和医疗健康监测等。通过优化时间序列模型的训练过程,能够提高模型在实际应用中的预测准确性和鲁棒性,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Time series foundation models (TSFMs) have advanced primarily through architectural innovation, while training regimes for large-scale heterogeneous corpora remain under-explored. As a result, pre-training distributions are often poorly controlled with respect to domain imbalance, context requirements, prediction horizons, and missingness. We introduce ORBIT (Omni-Range Bootstrap Incremental Training), a training paradigm that makes this distribution explicit and controllable. ORBIT combines Bootstrap Multi-Level Sampling, which controls dataset exposure and samples records, target variables, context windows, and prediction horizons, with Omni-Range Incremental Training, which varies context lengths and prediction horizons throughout a single training stage. Under ORBIT, we train Falcon-2.0, a simple univariate encoder-only Transformer with missingness-aware triple-channel patch tokenization and parallel patch prediction. We further introduce Rank-Guided Cross-Depth Alignment, a training objective that uses late-layer representations as stop-gradient teachers for shallow layers without additional inference cost. Evaluations on GIFT-Eval and fev-bench demonstrate strong zero-shot forecasting performance across diverse domains and frequencies.