CENTILE: A Telemetry Foundation Model Evaluated by the Decisions It Drives
作者: Zifan Zhang, Zhichao Hou, Tingxiang Ji, Yuchen Liu
分类: cs.NI, cs.LG
发布日期: 2026-08-03
🔗 代码/项目: GITHUB
💡 一句话要点
提出CENTILE以优化网络和系统遥测决策
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 遥测数据 生成模型 高性能计算 网络资源配置 决策优化 条件分位数 机器学习
📋 核心要点
- 现有方法依赖于多个预测器来处理不同任务的遥测数据,导致效率低下且难以扩展。
- CENTILE通过预训练生成模型,统一处理异构遥测数据,提供灵活的预测能力,简化决策过程。
- 实验结果显示,CENTILE在回填调度中将平均减速率降低约77%,并将规则违反率减少近一半,显著提升了决策质量。
📝 摘要(中文)
现代计算和网络基础设施持续发出遥测数据,然而操作人员通常需要为每个任务、实体和时间范围使用单独的预测器。本文提出了一种生成模型CENTILE,该模型在操作员自己的事件流上进行预训练,旨在替代传统的多预测器方法。CENTILE将异构遥测视为事件驱动的、不规则时间的实体流,并在单次处理过程中提供灵活的预测范围。实验表明,CENTILE在高性能计算调度和网络资源配置决策中表现出色,显著降低了回填的平均受限减速率和规则违反率。代码已公开在GitHub上。
🔬 方法详解
问题定义:本文旨在解决现有遥测数据处理方法中,使用多个预测器导致的效率低下和决策质量不稳定的问题。现有方法在处理高维度和异构数据时,往往无法有效利用历史信息,导致预测性能饱和在简单的最后值基线附近。
核心思路:CENTILE的核心思想是构建一个生成基础模型,通过在操作员的事件流上进行预训练,替代多个专用预测器。该模型能够处理异构遥测数据,并在单次推理中提供灵活的预测范围,无需未来时间戳。
技术框架:CENTILE的整体架构包括数据预处理、模型训练和决策回放三个主要模块。首先,对异构遥测数据进行整理和标准化;其次,使用生成模型进行预训练;最后,通过回放模型生成的条件分位数来评估决策效果。
关键创新:CENTILE是首个通过预训练模型提升高性能计算调度和网络资源配置决策的遥测模型。与传统方法相比,CENTILE能够在不同领域和时间段之间实现零-shot转移,显著提高了决策的准确性和效率。
关键设计:在模型设计上,CENTILE采用了特定的损失函数来优化条件分位数的预测,确保模型在多种场景下的适应性。此外,模型结构经过精心设计,以支持高维度数据的处理和实时决策的需求。
🖼️ 关键图片
📊 实验亮点
在实验中,CENTILE显著降低了回填调度的平均受限减速率,提升幅度达到约77%。同时,模型还将规则违反率减少了近50%,显示出其在实际应用中的有效性和优势。这些结果表明CENTILE在遥测数据处理和决策优化方面的巨大潜力。
🎯 应用场景
CENTILE的研究成果在高性能计算和网络管理等领域具有广泛的应用潜力。通过优化遥测数据的处理和决策过程,CENTILE能够帮助运营商更高效地管理资源,提高系统的整体性能和可靠性。未来,该模型还可以扩展到其他领域,如智能制造和物联网,推动更智能的决策支持系统的发展。
📄 摘要(原文)
Modern computing and networking infrastructure emits telemetry continuously, yet operators convert it into decisions with a separate predictor per task, entity, and horizon. One generative model, pretrained once over an operator's own event streams, could replace this fleet, an approach that already scales to high-cardinality streams in recommendation systems. However, point-forecast error on operational telemetry saturates near simple last-value baselines, so lower error alone need not improve the decisions it feeds. To close this gap, we present \sys, a generative foundation model for network and systems telemetry, evaluated by replaying the decisions its calibrated conditional quantiles drive. \sys treats heterogeneous telemetry as event-driven, irregularly timed entity streams and serves flexible forecast horizons in a single pass, requiring no future timestamps. To our knowledge, \sys is the first pretrained telemetry model to improve both HPC scheduling and network provisioning decisions under replay, its runtime estimator transferring zero-shot across months and its pretrained weights across domains from hours of target data. Extensive experiments on HPC job logs and network traffic confirm that \sys lowers the mean bounded slowdown of backfilling by up to approximately $77\%$ over deployed user estimates and roughly halves the deployed rule's violation rate. Our code is available at https://github.com/ZzZTripleZzZ/all-in-one.