A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents

📄 arXiv: 2607.26594v1 📥 PDF

作者: Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao

分类: eess.SY, cs.AI

发布日期: 2026-07-29


💡 一句话要点

提出基于语言模型的PID调节框架以优化化工过程

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: PID调节 语言模型 化工过程 自动化控制 实时优化 智能制造 监督微调 物理信息优化

📋 核心要点

  1. 现有PID调节方法依赖于过程模型,缺乏灵活性和实时性,难以适应复杂的化工过程。
  2. 本文提出了一种基于语言模型的PID调节框架,通过接收实时反馈和诊断信息,自动生成和优化PID增益。
  3. 实验结果显示,托管的LLMs在多个测试案例中成功率显著提升,尤其是Qwen3-0.6B的首次推荐成功率从86.5%提升至94.0%。

📝 摘要(中文)

PID调节在化工过程中通常依赖于已识别的过程模型,而工程师往往通过观察响应、诊断缺陷、调整增益和验证结果进行迭代调节。本文将这种工程师式的工作流程形式化为一种语言模型辅助的PID调节框架,适用于大型和小型语言模型(LLMs/SLMs)。通过接收闭环响应特征、控制工程诊断、调节偏好和基于内部模型控制(IMC)的示范,托管的LLMs能够生成并迭代修正PID增益。实验结果表明,经过监督微调的Qwen3-0.6B在100个FOPDT和100个SOPDT测试案例中,首次推荐成功率达到86.5%,PI-GRPO进一步提升至94.0%。

🔬 方法详解

问题定义:本文旨在解决传统PID调节方法在化工过程中的灵活性不足和实时性差的问题。现有方法通常依赖于静态的过程模型,难以适应动态变化的工况。

核心思路:提出了一种语言模型辅助的PID调节框架,通过实时接收闭环响应和控制诊断信息,自动生成和迭代优化PID增益,以模拟工程师的调节过程。

技术框架:该框架包括多个模块:首先,接收闭环响应特征和控制偏好;其次,利用IMC示范生成初始PID增益;最后,通过迭代过程进行增益的修正和优化。

关键创新:最重要的创新在于将语言模型应用于PID调节,利用其强大的生成能力和自适应能力,显著提高了调节的效率和准确性。与传统方法相比,该框架能够实时响应工况变化,提供更灵活的调节方案。

关键设计:在设计中,采用了监督微调(SFT)和物理信息引导的相对策略优化(PI-GRPO),并设置了非补偿性稳定性和性能奖励,以确保调节过程的稳定性和可靠性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,托管的LLMs(如DeepSeek-V4-Flash和Qwen3.7-Plus)在100个FOPDT和100个SOPDT测试案例中,成功率分别达到75-89%和77-79%。经过监督微调的Qwen3-0.6B,首次推荐成功率提升至86.5%,而PI-GRPO进一步提升至94.0%,显著提高了调节的可靠性和稳定性。

🎯 应用场景

该研究的潜在应用领域包括化工过程控制、自动化生产线和智能制造等。通过提高PID调节的效率和准确性,能够显著提升生产过程的稳定性和安全性,降低人工干预的需求,具有重要的实际价值和广泛的应用前景。

📄 摘要(原文)

PID tuning for chemical processes commonly relies on identified process models, whereas plant engineers often retune loops iteratively by observing responses, diagnosing deficiencies, adjusting gains, and validating the result. This work formalizes this engineer-like workflow in a language-model-assisted PID tuning framework applicable to both large and small language models (LLMs/SLMs). Hosted LLMs receive closed-loop response features, control-engineering diagnoses, tuning preferences, and internal model control (IMC)-based demonstrations to generate and iteratively correct PID gains under common acceptance criteria. For local deployment, Qwen3-0.6B is adapted through supervised fine-tuning (SFT) with simulation-verified IMC targets and physics-informed group relative policy optimization (PI-GRPO) with non-compensable stability and performance rewards. On 100 first-order plus dead time (FOPDT) and 100 second-order plus dead time (SOPDT) test cases, hosted LLMs (DeepSeek-V4-Flash and Qwen3.7-Plus) achieve final success rates of 75-89% and 77-79%, respectively. As for Qwen3-0.6B, supervised fine-tuning raises first-recommendation success to 86.5%, and PI-GRPO further increases it to 94.0%, primarily improving first-attempt reliability and stability margins.