| 1 |
Contrastive Reinforced Policy Optimization via Privileged Self-Distillation |
提出对比强化策略优化以解决自蒸馏中的偏见问题 |
reinforcement learning contrastive learning distillation |
|
|
| 2 |
QQWorld: Quantile-Quantile Matching for World Model Regularization |
提出QQWorld以解决潜在世界模型的尾部样本问题 |
world model worldmodel world models |
|
|
| 3 |
FedOGL: Combating Catastrophic Forgetting in Federated Open-World Multimodal Graph Learning |
提出FedOGL以解决联邦开放世界多模态图学习中的灾难性遗忘问题 |
distillation multimodal |
|
|
| 4 |
Understanding Submodular Information Measure Based Objectives for Representation Learning: A Variance and Separation Perspective |
提出统一理论框架以理解子次模信息度量在表示学习中的应用 |
representation learning contrastive learning multimodal |
|
|
| 5 |
Cybersecurity Detection Classification with Reasoning-enabled Language Models |
提出基于推理的语言模型以解决网络安全检测分类问题 |
reinforcement learning large language model chain-of-thought |
|
|
| 6 |
Flux-OPD: On-Policy Distillation with Evolving Contexts |
提出Flux-OPD以解决开放领域任务偏好蒸馏问题 |
distillation large language model |
|
|
| 7 |
TAPO: Transition-Aware Policy Optimization for LLM Agents |
提出TAPO以优化大型语言模型代理的策略学习 |
reinforcement learning large language model foundation model |
|
|
| 8 |
S-CEReBrO: Breaking the Memory Barrier in Continuous EEG Monitoring |
提出S-CEReBrO以解决连续EEG监测中的内存瓶颈问题 |
linear attention spatiotemporal foundation model |
|
|
| 9 |
$β$-OPSD: Deriving with Policy Optimization, Training with Self-Distillation |
提出$β$-OPSD以提升推理语言模型的稳定性与性能 |
reinforcement learning distillation |
|
|
| 10 |
LM-GRASP: Instance-Specific Language Models for Combinatorial Construction via Online Imitation Learning |
提出LM-GRASP以解决组合优化中的实例特定学习问题 |
reinforcement learning imitation learning |
|
|
| 11 |
Beyond Binary Rewards: A Comparative Study of Reward Design for Reinforcement Unlearning |
提出奖励设计框架以提升强化学习去学习效率 |
reinforcement learning reward design |
|
|
| 12 |
Beyond the Best Teacher: Expanding and Compressing the Reasoning Solution Manifold |
提出扩展与压缩框架以提升推理解决方案的有效性 |
reinforcement learning distillation instruction following |
|
|
| 13 |
ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow |
提出ODEWorld以解决离散时间预测的低效问题 |
policy learning world model world models |
✅ |
|
| 14 |
Doubly Robust Functional Representation Learning for Longitudinal Causal Inference with Irregular Histories |
提出双重稳健功能表示学习以解决不规则历史的因果推断问题 |
representation learning |
|
|
| 15 |
On-Policy and Off-Policy Learning for Large Action Spaces |
提出结构化贝叶斯方法以解决大动作空间中的策略学习问题 |
policy learning |
|
|
| 16 |
Multi-channel Uplift Policy Learning |
提出ReAlloc框架以解决多渠道营销预算分配问题 |
policy learning |
|
|
| 17 |
Class-Aware Reinforcement Learning for Counterfactual Explanation Generation |
提出类感知强化学习以生成反事实解释 |
reinforcement learning |
|
|
| 18 |
Improving the Robustness/Accuracy Tradeoff Against Adversarial Attacks Using Information Bottleneck Distillation Through Dual Teachers |
通过双教师信息瓶颈蒸馏提升对抗攻击的鲁棒性与准确性 |
distillation |
|
|
| 19 |
Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning |
提出KGPS以解决RL微调中的动态提示选择问题 |
reinforcement learning large language model |
|
|
| 20 |
Policy Gradient Steering: Interventions from Behavioral Objectives |
提出政策梯度引导以解决现有行为干预方法不足问题 |
reinforcement learning large language model |
|
|