Learning to Modulate, Not to Cycle: Soft Actor---Critic Recovers Inverter-Style Heat-Pump Control
作者: Faizan Ahmed, Aniket Dixit, James Brusey
分类: cs.LG, cs.AI
发布日期: 2026-08-10
备注: 9 pages, 4 figures, Accepted at UKCI 2026, Will be published in Springer
💡 一句话要点
提出基于SAC的控制策略以解决热泵压缩机循环问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 热泵控制 压缩机磨损 SAC算法 能源优化 热舒适度 马尔可夫决策过程
📋 核心要点
- 现有的强化学习控制方法在优化能源和舒适度时,未考虑压缩机的循环频率,导致压缩机磨损加剧。
- 本文提出在控制奖励中加入压缩机磨损项,通过SAC算法实现压缩机的持续调节,模拟逆变器驱动的热泵工作原理。
- 实验结果显示,SAC策略在热舒适度上有显著提升,热不适降低90.7%,且成本仅增加11.5%,完全消除了压缩机的开关循环。
📝 摘要(中文)
在住宅热泵中,开关循环是压缩机磨损的主要原因,而现有的强化学习(RL)控制器通常只优化能源成本和热舒适度,忽视了学习策略的循环频率。本文在控制奖励中加入了压缩机磨损的分级项,并研究了不同RL算法下的行为表现。通过在相同的马尔可夫决策过程上训练Soft Actor-Critic(SAC)和Proximal Policy Optimization(PPO),发现SAC学习到了一种持续调节的策略,使压缩机始终保持运行,达到了零启动次数,而PPO则退化为频繁的开关控制。实验结果表明,SAC策略在BOPTEST仿真器上将热不适降低了高达90.7%,成本仅增加11.5%,同时消除了所有基线循环。
🔬 方法详解
问题定义:本文旨在解决住宅热泵压缩机因频繁开关循环而导致的磨损问题。现有的强化学习控制方法主要关注能源成本和热舒适度,忽视了压缩机的循环频率,导致压缩机寿命缩短。
核心思路:论文提出在控制奖励中引入压缩机磨损的分级项,以此引导强化学习算法学习到一种持续调节的控制策略,模拟逆变器驱动热泵的工作方式。
技术框架:研究中使用了Soft Actor-Critic(SAC)和Proximal Policy Optimization(PPO)两种强化学习算法,针对相同的马尔可夫决策过程进行训练。通过对比这两种算法在控制策略上的表现,分析其对压缩机磨损的影响。
关键创新:最重要的创新在于将压缩机磨损纳入控制奖励中,使得SAC算法能够学习到一种持续运行的调节策略,避免了传统方法中频繁的开关控制。
关键设计:在训练过程中,设置了特定的奖励函数,包含了压缩机磨损的分级项。同时,采用了适合热泵控制的网络结构和参数设置,以确保学习到的策略能够有效降低热不适和压缩机的开关频率。
🖼️ 关键图片
📊 实验亮点
实验结果表明,SAC策略在BOPTEST仿真器上实现了零启动次数,热不适降低了90.7%,而成本仅增加了11.5%。相比之下,PPO方法则表现为频繁的开关控制,循环次数明显高于基线,显示出SAC在控制策略上的显著优势。
🎯 应用场景
该研究的潜在应用领域包括住宅和商业建筑的热泵控制系统。通过优化压缩机的运行策略,不仅可以延长设备的使用寿命,还能显著提高能源利用效率和用户的热舒适度,具有重要的实际价值和社会影响。
📄 摘要(原文)
On--off cycling is the main cause of compressor wear in residential heat pumps, yet reinforcement learning (RL) controllers for buildings typically optimise only energy cost and thermal comfort, ignoring how much the learned policy cycles. We add a levelised compressor-wear term to the control reward and study how the resulting behaviour depends on the RL algorithm. Training Soft Actor---Critic (SAC) and Proximal Policy Optimisation (PPO) on an identical Markov decision process for the BOPTEST bestest hydronic heat pump case, we find that SAC learns a continuous modulation policy that keeps the compressor permanently engaged---the operating principle of an inverter-driven heat pump---achieving zero start-ups per day, whereas PPO collapses to bang-bang control that cycles more than the baseline. On the BOPTEST emulator the SAC policy cuts thermal discomfort by up to 90.7% for an 11.5% cost increase, while eliminating all baseline cycling.