Reinforcement Learning-Based Laser Cutting Machine Parameter Optimization

📄 arXiv: 2608.10549v1 📥 PDF

作者: Khanh Quan Pham, Majid Kundroo, Geunwoo Ban, Seongho Bae, Taehong Kim

分类: cs.AI

发布日期: 2026-08-11

备注: 21 pages, 8 figures. Accepted manuscript published in Journal of Intelligent Manufacturing (2025). DOI: 10.1007/s10845-025-02619-z

期刊: Journal of Intelligent Manufacturing 37 (2025) 1813-1828


💡 一句话要点

提出RL²C算法以优化激光切割机参数

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 激光切割 强化学习 参数优化 Q学习 动态适应机制 工业应用 光学薄膜

📋 核心要点

  1. 现有的激光切割参数优化方法主要依赖试错,效率低且准确性不足。
  2. 本文提出的RL²C算法通过Q学习和动态适应机制,能够快速优化激光切割参数。
  3. 实验结果显示,RL²C在优化步骤和处理时间上均显著优于现有方法,提升效果明显。

📝 摘要(中文)

在激光切割光学薄膜时,实现高精度需要根据每种薄膜的特性仔细调整焦距和激光功率等参数。传统的试错方法效率低且不准确。为了解决这一问题,本文提出了基于强化学习的激光切割优化算法RL²C,该算法利用Q学习和ε-贪婪策略动态优化切割参数,显著减少了锥度尺寸和薄膜浪费。此外,RL²C还引入了动态环境适应机制,使其能够在多批实验中适应学习过程中遇到的新状态。实验结果表明,RL²C在找到最佳切割参数时所需的步骤和时间均少于多种基于强化学习的优化方法,优化步骤减少了12.5%,处理时间减少了81.8%。该研究展示了强化学习在工业激光切割过程中的潜力,提升了切割质量,减少了时间和薄膜浪费,并最小化了人工干预。

🔬 方法详解

问题定义:本文旨在解决激光切割光学薄膜时参数优化的效率和准确性问题。现有的试错方法不仅耗时长,而且在不同薄膜类型上难以达到最佳切割效果。

核心思路:RL²C算法通过强化学习中的Q学习方法,结合ε-贪婪策略,动态调整切割参数,以适应不同薄膜的特性,从而提高切割质量和效率。

技术框架:RL²C的整体框架包括环境状态的定义、动作选择、奖励反馈和策略更新四个主要模块。算法通过不断的实验反馈来优化参数设置,形成闭环学习过程。

关键创新:RL²C的主要创新在于引入了动态环境适应机制,使算法能够在多批实验中自我调整,适应新状态。这一设计使得算法在面对不同薄膜时表现出更高的灵活性和准确性。

关键设计:算法中的关键参数包括学习率、折扣因子和ε值的动态调整。此外,损失函数设计为考虑切割质量和时间的综合指标,以确保优化目标的全面性。网络结构采用了适合Q学习的深度神经网络,以增强学习能力。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,RL²C算法在优化激光切割参数时,优化步骤减少了12.5%,处理时间减少了81.8%。这些显著的性能提升表明,RL²C在提高切割质量和效率方面具有重要的实际应用价值。

🎯 应用场景

该研究的RL²C算法具有广泛的应用潜力,特别是在光学薄膜的激光切割领域。通过优化切割参数,能够显著提高生产效率和切割质量,降低材料浪费,适用于电子、光学和制造等多个行业。未来,该算法还可以扩展到其他激光加工领域,推动智能制造的发展。

📄 摘要(原文)

Achieving high accuracy in laser-based cutting of optical films requires careful tuning of parameters such as focal length and laser power beam, adjusted according to the specific properties of each film type. Trial-and-error based traditional methods are used to find the most suitable cutting parameters for various films, but they are slow and inaccurate. To address this issue, this paper presents the Reinforcement Learning for Laser Cutting (RL$^{2}$C) algorithm, which uses Q-learning with an epsilon-greedy policy to dynamically optimize cutting parameters, significantly reducing taper size and film wastage. Additionally, RL$^{2}$C incorporates a dynamic environment space adaptability mechanism to allow it to adapt to new states encountered during the learning process over multiple batches of experiments. Experimental results demonstrate that RL$^{2}$C requires fewer steps and less time to find optimal cutting parameters compared to various RL-based optimization methods. Specifically, RL$^{2}$C reduces the number of optimization steps by up to 12.5\% and processing time by up to 81.8\% compared to existing methods. This study demonstrates the potential of RL in industrial laser-cutting processes by improving cut quality, reducing time and film wastage, and minimizing manual interventions.