Runtime Uncertainty Monitoring for LLM-Based Multi-Agent Systems Using Bayesian Networks

📄 arXiv: 2607.25877v1 📥 PDF

作者: Bart Custers, Koorosh Aslansefat

分类: cs.AI

发布日期: 2026-07-28

备注: This paper got accepted for Ninth International Workshop on Artificial Intelligence Safety Engineering (WAISE 2026): https://www.waise.org/


💡 一句话要点

提出基于贝叶斯网络的多智能体系统以解决不确定性监测问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多智能体系统 大型语言模型 贝叶斯网络 不确定性量化 精算风险建模 决策支持 概率传播

📋 核心要点

  1. 现有的精算风险建模方法在处理大型语言模型的输出不确定性时存在不足,可能导致错误的决策和合规问题。
  2. 论文提出了一种多智能体框架,利用专门的智能体进行数据处理和不确定性传播,结合贝叶斯网络进行风险评估。
  3. 实验结果显示,该框架在维持基线精算性能的同时,增强了对工作流程稳定性和不确定性传播的理解。

📝 摘要(中文)

本文研究了基于大型语言模型(LLMs)的多智能体系统(MAS)如何支持精算风险建模,特别关注不确定性量化。精算工作流程代表了高风险决策支持环境,其中不可靠的输出可能导致错误的风险评估、不公平的定价和监管不合规。为了解决LLMs的概率特性和智能体之间的依赖性引入的不确定性,提出了一种多智能体框架,其中专门的智能体在中央集线器下执行数据准备、建模、审查和解释任务。主要贡献是提出了一种使用令牌级对数概率和贝叶斯网络的不确定性传播新方法。重要的是,对数概率并未被视为正确性或任务成功的直接概率,而是经过长度归一化的对数概率摘要被转化为校准的任务级置信度估计,随后纳入贝叶斯网络。结果表明,该框架在再现基线精算性能的同时,提供了对工作流程稳定性和运行时不确定性传播的额外洞察。

🔬 方法详解

问题定义:本文旨在解决基于大型语言模型的多智能体系统在精算风险建模中面临的不确定性问题。现有方法未能有效处理LLMs输出的概率特性,导致风险评估不准确。

核心思路:提出了一种新的不确定性传播方法,通过使用令牌级对数概率和贝叶斯网络,来量化和管理多智能体系统中的不确定性。该设计旨在提高风险评估的准确性和可靠性。

技术框架:整体架构包括多个专门的智能体,分别负责数据准备、建模、审查和解释任务,所有智能体通过一个中央集线器进行协调。对数概率被转化为校准的置信度估计,并通过贝叶斯网络进行整合。

关键创新:最重要的创新在于将对数概率与贝叶斯网络结合,形成了一种新的不确定性传播机制。这种方法不同于传统的直接概率处理,能够更好地反映任务的复杂性和不确定性。

关键设计:在设计中,采用了长度归一化的对数概率摘要,并通过特定的校准过程生成任务级置信度估计,确保了模型在面对不确定性时的稳定性和可靠性。实验中还对参数设置和网络结构进行了优化,以提升整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,该框架在保持基线精算性能的同时,提供了对工作流程稳定性和运行时不确定性传播的深入洞察。具体而言,框架在不确定性量化方面的表现优于传统方法,显示出显著的性能提升,尤其是在复杂任务场景中。

🎯 应用场景

该研究的潜在应用领域包括保险、金融风险管理和其他高风险决策支持系统。通过提供更准确的风险评估和不确定性量化,能够帮助企业在复杂环境中做出更明智的决策,降低潜在损失。未来,该方法可能会扩展到其他领域,如医疗决策支持和自动化系统中的风险管理。

📄 摘要(原文)

This paper investigates how multi-agent systems (MAS)-based on large language models (LLMs) can support actuarial risk modelling, with a particular focus on uncertainty quantification. Actuarial workflows represent a high-stakes decision-support setting where unreliable outputs may lead to incorrect risk assessment, unfair pricing, and regulatory non-compliance. To address uncertainty introduced by the probabilistic nature of LLMs and dependencies between agents, a multi-agent framework is proposed in which specialised agents perform data preparation, modelling, review, and explanation tasks under a central hub. The main contribution is a novel approach to uncertainty propagation using token-level log-probabilities and a Bayesian Network. Importantly, log probabilities are not treated as direct probabilities of correctness or task success. Instead, length-normalised log-probability summaries are transformed into calibrated task-level confidence estimates before incorporation into the Bayesian Network. Results show that the framework reproduces baseline actuarial performance while providing additional insight into workflow stability and runtime uncertainty propagation.