| 28 |
MR-JEPA: A General Purpose Video Foundation Model for Cardiac MRI |
提出MR-JEPA以解决心脏MRI视频数据处理问题 |
JEPA MAE spatiotemporal |
|
|
| 29 |
VCAR: Training-Free 3DGS Segmentation via View Completeness and Axis-Aware Boundary Refinement |
提出VCAR以解决3D高斯分割中的训练开销与边界模糊问题 |
distillation 3D gaussian splatting 3DGS |
✅ |
|
| 30 |
Modality Disentangled Learning for Incomplete Multimodal Emotion Recognition: A Primitive Memory Distillation Perspective |
提出Primitive Memory Distillation框架以解决多模态情感识别中的缺失模态问题 |
teacher-student distillation multimodal |
✅ |
|
| 31 |
Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving |
提出多轨迹监督与策略优化对齐框架以提升VLA驾驶性能 |
imitation learning distillation vision-language-action |
|
|
| 32 |
VisLens: Single-Pass Interpretable Visual Search for Multimodal LLMs |
提出VisLens以解决多模态大语言模型的细粒度视觉搜索问题 |
reinforcement learning large language model multimodal |
|
|
| 33 |
Efficient and High-Quality Depth Estimation via Pixel-Space Diffusion with Linear Attention |
提出Lapis以解决高分辨率深度估计的计算效率问题 |
linear attention depth estimation monocular depth |
|
|
| 34 |
Can Video World Models Track Unobserved World States? |
提出视频世界模型以追踪未观察到的世界状态 |
world model world models Mamba |
|
|
| 35 |
Multimodal Shared Latent Representation of Narration, Microscope and iOCT Images for Phase Recognition in Vitreoretinal Surgery |
提出多模态共享潜在表示以解决玻璃体视网膜手术阶段识别问题 |
contrastive learning multimodal |
|
|
| 36 |
PRISM: Predictive Recomposition via Semantic Latent Decomposition for View-invariant Video Representation Learning |
提出PRISM以解决跨视角视频表示学习中的语义纠缠问题 |
representation learning egocentric |
✅ |
|
| 37 |
Rad-R: A Raw-ADC Radar Dataset and Capture-Invariant SSM for Hardware-Fault Diagnosis |
提出Rad-R数据集以解决汽车毫米波雷达硬件故障诊断问题 |
Mamba SSM |
|
|
| 38 |
DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution |
提出DreamX-Creator以解决音视频生成同步问题 |
reinforcement learning multimodal |
|
|
| 39 |
Motion-Saliency Complementary Masked Modeling for Point Cloud Video Understanding |
提出MoSaiC以解决点云视频理解中的动态场景建模问题 |
representation learning scene understanding |
|
|