| 1 |
XP-JEPA: Cross-Predictive Physics Grounding for Forecastable Latent Dynamics |
提出XP-JEPA以解决自预测模型的物理约束不足问题 |
world model world models JEPA |
|
|
| 2 |
CoDrift: Compositional Drifting for Offline Reinforcement Learning |
提出CoDrift以解决离线强化学习中的多目标问题 |
reinforcement learning policy learning offline RL |
|
|
| 3 |
Bellman Calibration for Marginalized Importance Weighting in Offline Reinforcement Learning |
提出同调贝尔曼校准以解决离线强化学习中的重要性加权问题 |
reinforcement learning offline reinforcement learning |
|
|
| 4 |
On-policy Distillation with Verifiable Reward |
提出OPDVR以解决稀疏反馈与轨迹正确性问题 |
reinforcement learning distillation large language model |
✅ |
|
| 5 |
Robust Data-Collection Policy Learning for Low-Variance Online Policy Evaluation |
提出双循环梯度算法以解决强化学习中的高方差评估问题 |
reinforcement learning policy learning |
|
|
| 6 |
IAPO: Influence-Aware Policy Optimization for Credit Assignment in Multi-Turn Service Agents |
提出影响感知策略优化以解决多轮服务代理中的信用分配问题 |
reinforcement learning large language model |
|
|
| 7 |
SeisMamba: Low-Latency Single-Station Seismic Magnitude Estimation for Spatially Distributed Earthquake Early Warning |
提出SeisMamba以解决单站地震震级快速估计问题 |
Mamba |
|
|
| 8 |
Where Entropy Is Measured Matters: Policy Geometry in Bounded Continuous-Control PPO |
提出改进的PPO方法以优化连续控制策略的熵测量 |
PPO |
|
|
| 9 |
Evaluating Deep Multivariate Imputation Models on Wearable Device Data |
提出深度多变量插补模型评估方法以解决可穿戴设备数据缺失问题 |
MAE multimodal |
|
|
| 10 |
PhysicsBench: A Unified Leaderboard for Generative and Predictive Models in Engineering Design and Simulation |
提出PhysicsBench以统一评估工程设计中的生成与预测模型 |
predictive model |
|
|
| 11 |
ChorusTIC: Training-Free Multivariate Time Series Classification via Chorus In-Context Learning |
提出ChorusTIC以解决多变量时间序列分类问题 |
representation learning foundation model |
|
|
| 12 |
Low-Latency Activation-Regularized Sparse Neural Operators with Distillation Assistance Towards Real-Time Edge-Deployable Virtual Sensing |
提出稀疏激活正则化神经算子以解决边缘部署的实时虚拟传感问题 |
distillation |
|
|