TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments
作者: Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren
分类: cs.AI
发布日期: 2026-08-14
💡 一句话要点
提出TimeSage-EV以解决动态环境下时间序列分析的有效性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 时间序列分析 动态环境 大型语言模型 实时基准 数据有效性 自我进化代理
📋 核心要点
- 现有时间序列分析方法多依赖固定快照,未能考虑数据更新对结论有效性的影响。
- 本文提出TimeSage-EV基准,实时跟踪动态环境中的时间序列数据,支持多种发布频率。
- 实验结果显示,前沿LLM代理在时间有效性和适应性方面存在显著性能差距,揭示了当前方法的不足。
📝 摘要(中文)
高风险领域的时间序列分析依赖于不断更新的数据发布,新的观察结果可能会改变证据基础及后续结论的有效性。现有的时间序列质量评估基准主要依赖于固定快照,未能评估时间有效性和截止日期意识下的证据使用。为此,本文提出了TimeSage-EV,这是一个针对动态环境中主动时间序列分析的实时基准,涵盖了60个真实的机构场景,跨越6个领域,包含从2023年2月到2026年5月的1485个场景-周期问答对。每个周期,大型语言模型代理接收时间序列数据和源报告,而被保留的目标发布提供了真实答案。TimeSage-EV评估状态识别、数据总结和前景推理。实验表明,前沿的LLM代理和TimeSage-1.0(一个具有可重用分析技能库的新型自我进化代理)在模型层次间存在显著的性能差距,并在时间有效性、外部上下文使用和适应性方面存在反复失败。我们将TimeSage-EV作为研究资源发布,并提供每月更新、代码、排行榜和失败模式分析。
🔬 方法详解
问题定义:本文旨在解决动态环境中时间序列分析的有效性问题,现有方法未能充分考虑数据更新对分析结果的影响,导致结论的时效性不足。
核心思路:TimeSage-EV基准通过实时跟踪多个真实场景中的时间序列数据,允许模型在不断变化的环境中进行分析,从而提高分析的时效性和准确性。
技术框架:该框架包括数据收集、模型训练和评估三个主要模块。数据收集模块负责获取时间序列数据和源报告,模型训练模块使用这些数据进行训练,而评估模块则通过与真实答案的对比来评估模型性能。
关键创新:TimeSage-EV的最大创新在于其动态更新的特性,允许模型在不断变化的环境中进行实时分析,这与传统的静态快照方法形成鲜明对比。
关键设计:在设计上,TimeSage-EV采用了可重用的分析技能库,支持多种数据发布频率,并在模型评估中引入了时间有效性和外部上下文的考量。
🖼️ 关键图片
📊 实验亮点
实验结果表明,使用TimeSage-EV的前沿LLM代理在状态识别和数据总结任务中表现出显著的性能提升,尤其是在处理时间有效性和外部上下文时,模型的适应性和准确性均有明显改善,揭示了当前方法的局限性。
🎯 应用场景
TimeSage-EV的研究成果在金融、医疗、气候监测等高风险领域具有广泛的应用潜力。通过实时分析动态数据,决策者能够更快地响应变化,从而提高决策的准确性和及时性,最终提升各领域的风险管理能力。
📄 摘要(原文)
Time series analysis in high-stakes domains relies on recurring data releases, where new observations can alter the evidence base and the validity of later conclusions. Existing time series QA benchmarks mostly rely on fixed snapshots, leaving temporal validity and cutoff-aware evidence use unevaluated. We introduce TimeSage-EV, a live benchmark for agentic time series analysis in evolving environments. It tracks 60 real institutional scenarios across 6 domains, comprising 1,485 scenario-period QA pairs from Feb 2023 to May 2026 and spanning monthly, weekly, daily, and irregular release cadences. At each period, large language model (LLM) agents receive time series data and source reports, while the withheld target release provides ground truth. TimeSage-EV evaluates state identification, data summarization, and outlook reasoning. Experiments with frontier LLM agents and TimeSage-1.0, a novel self-evolving agent with a reusable analytical skill library, reveal significant performance gaps across model tiers and recurring failures in temporal validity, exogenous context use, and adaptation. We release TimeSage-EV as a research resource with monthly updates, code, a leaderboard, and failure-mode analyses.