| 1 |
Dreamer-SAC: Off-Policy Learning in Latent World Models for Sample-Efficient Autonomous Driving |
提出Dreamer-SAC框架以解决自主驾驶中的样本效率问题 |
reinforcement learning policy learning PPO |
|
|
| 2 |
Efficient Hypergradient Descent for Inverse Reinforcement Learning |
提出高效超梯度下降法以解决逆强化学习中的计算挑战 |
reinforcement learning inverse reinforcement learning |
|
|
| 3 |
Scheduling Mixed RL Rollouts Beyond Prefix Locality |
提出MISA-T以解决异构RL回滚调度问题 |
reinforcement learning RLHF large language model |
|
|
| 4 |
ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation |
提出ReOrder-OPD以解决在政策蒸馏中的教师监督不可靠问题 |
teacher-student distillation |
|
|
| 5 |
IADD-TR: Intervention-Aware Dynamics Decoupling with Targeted Regularization for Model-Based Reinforcement Learning |
提出IADD-TR以解决模型基强化学习中的数据偏差问题 |
reinforcement learning policy learning |
|
|
| 6 |
Exploration-Driven Personalized Federated Reinforcement Learning via Intrinsic Motivation |
提出探索驱动的个性化联邦强化学习框架以解决隐私和探索问题 |
reinforcement learning distillation |
|
|
| 7 |
SQuaT: Self-Supervised Knowledge Distillation via Student-Aware Quantized Teacher Features |
提出SQuaT以解决量化模型蒸馏中的标签缺失问题 |
distillation |
✅ |
|
| 8 |
Critic-Free Pretraining for Efficient Online Reinforcement Learning Fine-Tuning |
提出无评论预训练以解决在线强化学习微调效率问题 |
reinforcement learning |
|
|
| 9 |
TideRL: Boosting Agentic RL Goodput with Readiness-Aware Scheduling |
提出TideRL以提升多轮强化学习的训练效率 |
reinforcement learning large language model |
|
|
| 10 |
Efficient Reinforcement Learning for Long-Horizon Tool-Use Agentic Tasks |
提出SINKFLEX-RL以解决长时间工具使用代理任务的挑战 |
reinforcement learning |
|
|
| 11 |
Partially Observable Learning for Multi-Platform Dispatch Optimization |
提出POLO框架以解决多平台调度优化中的部分可观测性问题 |
reinforcement learning reward shaping |
|
|