Automated Event Log Generation from Unstructured Text Using Finetuned LLMs
作者: Maximilian Seeth, Gabriel Marques Tavares, Daniel Schuster
分类: cs.AI
发布日期: 2026-09-01
💡 一句话要点
提出基于微调大语言模型的自动事件日志生成方法以解决数据结构化问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 过程挖掘 大语言模型 事件日志 自动化数据翻译 微调技术
📋 核心要点
- 现有的事件日志生成方法依赖于专家手动创建,效率低下且成本高昂,导致组织知识未被充分利用。
- 本文提出了一种利用微调大语言模型的框架,将非结构化文本自动转换为结构化事件日志,解决了数据结构化的瓶颈。
- 实验结果表明,微调后的模型在事件日志生成任务中表现优异,显著超越了传统的少量示例和零示例提示方法。
📝 摘要(中文)
过程挖掘(PM)为从事件数据中发现和优化操作流程提供了强大的框架。然而,PM技术的有效性严格依赖于结构化事件日志的可用性。现有的事件日志通常由领域和过程挖掘专家费时创建,导致大量组织知识未被充分利用。本文探讨了大语言模型(LLMs)作为自动数据翻译器的有效性,提出了一种可扩展的框架,利用LLMs将非结构化文本资源转化为结构化事件数据。我们在新创建的文本到日志数据集上微调LLMs,结果表明,微调后的模型能够从非结构化资源中提取高保真事件日志,且其性能显著优于少量示例或零示例提示,强调了微调在生成可靠事件数据中的必要性。我们的研究为将未使用的数据引入过程挖掘生态系统提供了有前景的解决方案。
🔬 方法详解
问题定义:本文旨在解决现有事件日志生成方法的低效性和高成本问题,现有方法依赖专家手动创建日志,导致大量组织知识未被利用。
核心思路:通过微调大语言模型(LLMs),将非结构化文本资源(如事故票据、手册和报告)转化为结构化事件日志,从而实现自动化数据翻译。
技术框架:整体框架包括数据收集、模型微调和事件日志生成三个主要模块。首先,构建文本到日志的数据集;其次,利用该数据集对LLMs进行微调;最后,使用微调后的模型生成高保真的事件日志。
关键创新:最重要的创新在于通过微调LLMs实现高效的事件日志生成,显著提高了生成日志的准确性和可靠性,与传统方法相比,微调显著提升了模型性能。
关键设计:在微调过程中,采用了特定的损失函数以优化生成日志的质量,并调整了模型的超参数以适应特定的文本到日志转换任务。
🖼️ 关键图片
📊 实验亮点
实验结果显示,微调后的模型在事件日志生成任务中表现出色,相较于少量示例和零示例提示方法,性能提升幅度显著,具体提升幅度未知,表明微调是生成可靠事件数据的必要条件。
🎯 应用场景
该研究的潜在应用领域包括企业流程优化、事件管理和数据分析等。通过自动化生成事件日志,组织能够更高效地利用现有的非结构化数据,提升过程挖掘的效率和准确性,进而推动业务决策和流程改进。
📄 摘要(原文)
Process mining (PM) provides a powerful framework for discovering and optimizing operational processes from event data. However, the efficacy of PM techniques is strictly predicated on the availability of structured event logs. Thus far, event logs have often been laboriously created by domain and process mining experts. This costly effort causes large portions of organizational knowledge, including incident tickets, manuals, and textual reports, to remain underutilized. We address this bottleneck by investigating the efficacy of Large Language Models (LLMs) as automated data translators. We propose a scalable framework that leverages LLMs as data translators to bridge the gap between unstructured textual resources and structured event data. We finetune LLMs on a newly created text-to-log dataset, demonstrating that the resulting models can extract high-fidelity event logs from unstructured resources. Our results show that this finetuning approach outperforms few-shot or zero-shot prompting by a large amount, highlighting finetuning as a necessary pre-condition for generating reliable event data. We conclude that our method provides a promising pipeline for making previously unused data available to process mining ecosystems, effectively expanding the possibilities of using PM to further investigate organizational workflows.