Revisiting Predictive Process Monitoring in the Age of Foundation Models: A Comparative Study of Sequence, Tabular, and LLM Approaches
作者: Lennart Fertig, Lukas Kirchdorfer, Tobias Sesterhenn
分类: cs.LG
发布日期: 2026-07-30
备注: Accepted at ECML PKDD 2026 Workshops
💡 一句话要点
比较序列、表格和大语言模型在预测过程监控中的应用
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 预测过程监控 序列模型 表格模型 大型语言模型 基准测试
📋 核心要点
- 现有的预测过程监控方法主要依赖深度序列模型,面临着模型性能和计算成本的挑战。
- 论文通过比较序列模型、表格基础模型和大型语言模型,系统性地评估它们在PPM中的表现。
- 实验结果显示,序列模型在下一个活动预测中表现最佳,而表格模型在时间任务上具有竞争力。
📝 摘要(中文)
预测过程监控(PPM)利用事件日志预测正在进行的过程实例的未来,例如预测下一个活动、案例完成的剩余时间或下一个事件的时间。近年来,PPM研究主要集中在从头训练的深度序列模型上,如长短期记忆(LSTM)模型,而基础模型方法,尤其是大型语言模型(LLMs),在PPM中逐渐受到关注。同时,具有上下文学习能力的表格基础模型提供了一个有前景的替代方案,但尚未系统性地进行基准测试。因此,经典的基于序列的模型在这一不断演变的环境中是否仍具竞争力仍不清楚。本文通过在多个数据集和预测任务上的受控基准比较这三种建模范式,结果表明序列模型在下一个活动预测中表现最佳,而表格基础模型在时间任务上具有竞争力,尽管LLMs通常表现较差且成本较高。
🔬 方法详解
问题定义:本文旨在解决预测过程监控(PPM)中不同建模方法的有效性问题,尤其是序列模型与基础模型的比较。现有方法主要依赖深度序列模型,存在性能和计算成本的挑战。
核心思路:论文的核心思路是通过系统性基准测试,比较序列模型、表格基础模型和大型语言模型在PPM中的表现,以确定各自的优势和适用场景。
技术框架:研究采用受控实验设计,使用多个数据集和预测任务,评估不同模型的性能。主要模块包括数据预处理、模型训练和性能评估。
关键创新:本文的创新在于首次系统性地比较了序列模型与表格基础模型和大型语言模型在PPM中的表现,揭示了不同模型在特定任务上的竞争力。
关键设计:在实验中,采用了标准的损失函数和评估指标,确保了结果的可比性。模型的超参数设置经过调优,以最大化性能。具体细节包括序列模型的层数、表格模型的特征选择等。
🖼️ 关键图片
📊 实验亮点
实验结果表明,序列模型在下一个活动预测任务中始终表现最佳,准确率显著高于其他模型。而在时间预测任务中,表格基础模型表现出竞争力,尽管大型语言模型通常表现较差,且成本较高。具体性能数据未提供。
🎯 应用场景
该研究的潜在应用领域包括企业流程管理、智能制造和服务优化等。通过准确预测过程中的活动和时间,企业能够更有效地分配资源、提高效率,并优化决策过程。未来,该研究可能推动PPM领域的进一步发展,促进新模型的应用与实践。
📄 摘要(原文)
Predictive process monitoring (PPM) leverages event logs to forecast the future of running process instances, for instance, predicting the next activity, the remaining time until case completion, or the time to the next event. While PPM research in recent years has been dominated by deep sequence models trained from scratch, such as Long Short-Term Memory (LSTM) models, foundation-model approaches---particularly large language models (LLMs)---are increasingly explored for PPM. At the same time, tabular foundation models with in-context learning capabilities offer a promising alternative but have not yet been systematically benchmarked for PPM. Thus, it remains unclear whether classical sequence-based models remain competitive in this evolving landscape. This paper compares the three modeling paradigms both conceptually and empirically through a controlled benchmark across multiple datasets and prediction tasks. The results show that sequence models consistently perform best for next activity prediction, whereas tabular foundation models are competitive on temporal tasks, with LLMs usually lagging behind despite higher cost.