Hybrid-Adaptive Thread Tuning to Mitigate Simulation Execution Bottlenecks in High-Performance Reinforcement Learning Inference
作者: Jiming Su, Hantao Hua, Lujia Yin, Yiping Yao, Feng Zhu
分类: cs.LG, cs.MA, cs.PF
发布日期: 2026-08-06
🔗 代码/项目: GITHUB
💡 一句话要点
提出AutoThread以解决高性能强化学习推理中的仿真执行瓶颈问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)
关键词: 强化学习 多线程调度 仿真系统 动态负载 性能优化 神经网络 排队模型
📋 核心要点
- 现有多线程策略在动态负载下难以有效匹配线程资源,导致资源竞争和调度开销,影响强化学习推理的性能。
- 提出AutoThread,通过物理信息神经算子预测最佳线程数,并结合排队模型进行动态调优,以提高执行效率。
- 实验结果显示,AutoThread在静态策略上平均加速18.4%,并显著提高吞吐量和减少执行时间,展现出优越的性能。
📝 摘要(中文)
在仿真决策系统中,强化学习推理常受到仿真端执行开销的限制,现有的多线程策略在执行前或执行过程中难以匹配线程资源,导致资源竞争、调度开销和吞吐量降低。通过实证分析,本文识别出任务执行时间与调度时间的比率是确定最佳线程数的关键因素。基于这一洞察,提出了AutoThread,一种混合自适应线程调优方法,旨在缓解RL推理中的仿真瓶颈。AutoThread利用物理信息神经算子(PINO)作为线程数预测器,并结合有限源M/M/1排队模型来约束和引导预测,从而在动态负载下实现快速准确的估计。实验结果表明,AutoThread在静态策略基础上平均加速提升18.4%,吞吐量分别达到XGBoost和Reinforcer的1.7倍和1.8倍,执行时间较最先进方法减少高达83.8%。
🔬 方法详解
问题定义:本文旨在解决高性能强化学习推理中的仿真执行瓶颈问题。现有方法在动态负载下难以有效匹配线程资源,导致资源竞争和调度开销,进而降低吞吐量和执行效率。
核心思路:AutoThread的核心思路是通过物理信息神经算子(PINO)预测最佳线程数,并结合有限源M/M/1排队模型进行动态调优,以应对动态工作负载带来的挑战。这样的设计使得线程数的调整更加灵活和高效。
技术框架:AutoThread的整体架构包括两个主要模块:线程数预测模块和在线微调模块。线程数预测模块利用PINO进行初步预测,而在线微调模块则根据实际执行情况进行动态调整,以优化资源分配。
关键创新:本文的关键创新在于将物理信息神经算子与排队模型相结合,形成了一种新的线程调优方法。这种方法能够在动态负载下快速准确地估计最佳线程数,显著提升了执行效率。
关键设计:在设计中,采用了基于任务执行时间与调度时间比率的预测机制,并通过在线微调来补偿预测误差,确保资源分配的合理性和高效性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,AutoThread在静态策略上平均加速提升18.4%,吞吐量分别达到XGBoost和Reinforcer的1.7倍和1.8倍,执行时间较最先进方法减少高达83.8%。这些结果展示了AutoThread在高性能强化学习推理中的显著优势。
🎯 应用场景
该研究具有广泛的应用潜力,特别是在需要实时决策的仿真系统中,如自动驾驶、机器人控制和智能制造等领域。通过优化线程调度,能够显著提升系统的响应速度和处理能力,推动相关技术的发展与应用。
📄 摘要(原文)
In simulation-in-the-loop decision-making systems, reinforcement learning (RL) inference is often constrained by simulator-side execution overhead, where workloads are highly dynamic and sensitive to runtime thread configurations. Existing multithreaded strategies struggle to match thread resources before or during execution, causing resource contention, scheduling overhead, and reduced throughput. Through empirical analysis, we identify the ratio of task execution time to scheduling time as the key factor determining the optimal thread count. Building on this insight, we propose AutoThread, a hybrid adaptive thread-tuning method for mitigating simulation bottlenecks in RL inference. AutoThread employs a Physics-Informed Neural Operator (PINO) as a thread-count predictor and incorporates a finite-source M/M/1 queueing model to constrain and guide prediction, enabling fast and accurate estimation under dynamic workloads. It further performs load-aware online fine-tuning to compensate for prediction errors and refine resource allocation. Experiments show that AutoThread improves average speedup by 18.4\% over static strategies, achieves average throughput of 1.7x and 1.8x that of XGBoost and Reinforcer, respectively, and reduces execution time by up to 83.8\% compared with state-of-the-art methods. Our code and dataset are publicly available at https://github.com/suchenjm/AutoThread.