| 12 |
Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus |
提出对混合线性注意力大语言模型中大激活的系统研究 |
linear attention large language model |
✅ |
|
| 13 |
RT-SEMamba: Real-Time Speech Enhancement Mamba via Progressive Knowledge Distillation |
提出RT-SEMamba以解决实时语音增强问题 |
Mamba distillation |
|
|
| 14 |
Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs |
提出Self-Fix Step-DPO以解决大型语言模型自我纠错问题 |
reinforcement learning DPO large language model |
|
|
| 15 |
One Frozen Simulator Is Not Enough: Simulator Collapse in Multi-Agent RL |
提出多模拟器训练方法以解决多智能体RL中的模拟器崩溃问题 |
reinforcement learning large language model |
|
|
| 16 |
Hybrid-Policy Self-Editing for Composable Unstructured Knowledge Editing |
提出混合策略自编辑以解决非结构化知识编辑问题 |
distillation large language model |
|
|
| 17 |
Benchmarking Trustworthiness of SLMs: Pre-trained vs. Compressed |
评估小型语言模型的可信度:预训练与压缩的比较 |
distillation large language model |
|
|
| 18 |
When the API Speaks the Wrong Language: Revisiting Post-Training for Multilingual Tool Use |
提出后训练策略以解决多语言API调用中的语言不一致问题 |
reinforcement learning large language model |
|
|
| 19 |
Learning to Persuade Exposes How Easily LLMs Abandon Correct Beliefs |
提出对抗性说服框架以增强LLM的抗干扰能力 |
reinforcement learning large language model |
|
|
| 20 |
Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations |
提出偏好树优化框架以提升目标导向对话系统的性能 |
DPO direct preference optimization |
|
|