| 1 |
WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model |
提出WorldDynCache以解决扩散世界模型推理速度慢的问题 |
world model world models latent dynamics |
|
|
| 2 |
Diffusion Policy with Behavioral Advantage Correction for Offline Reinforcement Learning |
提出行为优势校正的扩散策略以解决离线强化学习中的Q值偏差问题 |
reinforcement learning offline reinforcement learning diffusion policy |
|
|
| 3 |
Understanding and Correcting Low-Frequency Bias in EEG Foundation Model |
提出FAME框架以解决EEG基础模型中的低频偏差问题 |
masked autoencoder foundation model |
|
|
| 4 |
Start Classifying: Categorical Critics for LLM Reinforcement Learning |
提出HL-Gauss PPO以优化大语言模型的强化学习评估 |
reinforcement learning PPO large language model |
|
|
| 5 |
Learning-Based Collaborative MEC for LLM Inference with Soft-Deadline Awareness via Transformer-Enhanced PPO |
提出基于Transformer增强的PPO以解决MEC服务器的LLM推理问题 |
PPO large language model |
|
|
| 6 |
Toward Plasticity-Preserving KL Regularization for Capability Retention in LLM Reinforcement Learning |
提出CoKL以解决LLM强化学习中的能力保留问题 |
reinforcement learning large language model |
✅ |
|
| 7 |
Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models |
提出ERILS以解决扩展策略回放在强化学习中的挑战 |
reinforcement learning large language model |
|
|
| 8 |
DART: Decoded Attention over Recurrent States for Efficient Long-Context Sequence Modeling |
提出DART以解决长序列建模中的注意力效率问题 |
Mamba SSM state space model |
|
|
| 9 |
HindSearch: Trajectory-Level Hindsight Critique for Search-Augmented Reinforcement Learning |
提出HindSearch以解决搜索增强强化学习中的失败轨迹信息损失问题 |
reinforcement learning distillation |
|
|
| 10 |
Structured Memory for Edge Language Models: Persistent Context and Corpus Retrieval via O(1) SSM State Injection |
提出PRECOG以解决检索增强生成模型的预填充成本问题 |
SSM |
|
|
| 11 |
Finite-Time Analysis of Discounted Exponential-Utility Reinforcement Learning |
提出有限时间分析以优化折扣指数效用强化学习 |
reinforcement learning |
|
|
| 12 |
LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation |
提出LEAP以解决低级代码生成中的反馈稀疏问题 |
reinforcement learning large language model |
|
|
| 13 |
Heterogeneous Multi-Agent Reinforcement Learning for Radio Resource Management under Coupled Finite-Horizon Constraints |
提出HeLyMARL以解决无线网络中的资源管理问题 |
reinforcement learning |
|
|
| 14 |
Progressive Agent Skill Generation via Reinforcement Learning |
提出Skill-α以解决技能生成中的监督信号缺失问题 |
reinforcement learning |
|
|
| 15 |
Analytic Planning under Uncertainty with Moment Closure |
提出基于时刻闭合的分析规划方法以应对不确定性问题 |
reinforcement learning deep reinforcement learning |
|
|