| 1 |
S$^2$Prune: Spatially Structured Visual Token Pruning for Multimodal Large Language Models |
提出S$^2$Prune以解决多模态大语言模型的视觉标记剪枝问题 |
large language model multimodal |
✅ |
|
| 2 |
SinkPruner: Sink-Free Visual Token Pruning for Multimodal Large Language Models |
提出SinkPruner以解决多模态大语言模型的视觉标记冗余问题 |
large language model multimodal |
✅ |
|
| 3 |
Forbid Your Attention: Fooling Multimodal Large Language Models by Selectively Removing Intrinsic Focus in Spectral Domain |
提出相位感知对抗攻击框架以增强多模态大语言模型的鲁棒性 |
large language model multimodal |
|
|
| 4 |
Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System |
提出任务解耦架构以提升统一多模态模型的理解与生成协同能力 |
multimodal |
|
|
| 5 |
Semantic-Guided Multimodal Preprocessing for Vision Transformer-Based Clear Cell Renal Cell Carcinoma Grading |
提出语义引导的多模态预处理方法以解决CCRCC分级问题 |
multimodal |
|
|
| 6 |
Multimodal RGB-Infrared Combination for UAV-Based Wildfire Segmentation: A Comparative Study on FLAME3 |
提出RGB-红外融合方法以提升无人机野火分割精度 |
multimodal |
|
|
| 7 |
CMRVision: A Foundation Model for Cardiac MR Image Analysis |
提出CMRVision以解决心脏磁共振图像分析问题 |
foundation model |
|
|
| 8 |
Agentic Multimodal Models for Environmental Hyperspectral Unmixing |
提出一种基于多模态模型的框架以改进环境高光谱解混问题 |
multimodal |
|
|
| 9 |
FTU-Seek: Foundation Model-Guided Hard-Negative Learning for Sparse Functional Tissue Unit Segmentation |
提出FTU-Seek以解决稀疏功能性组织单元分割问题 |
foundation model |
|
|
| 10 |
Do Satellites See Commuters? A Critical Benchmark of Vision Foundation Models |
比较四种卫星视觉编码器以优化通勤OD生成 |
foundation model |
|
|
| 11 |
BrainDiff: Longitudinal Report Generation for Multimodal Brain MRI |
提出BrainDiff以解决多模态脑MRI的纵向报告生成问题 |
multimodal |
✅ |
|
| 12 |
IntroConformal: Conformal Factuality Guarantees for Large Vision-Language Models via Introspective Signals |
提出IntroConformal以解决大规模视觉语言模型的事实准确性问题 |
multimodal |
|
|
| 13 |
One Prompt Is Enough: Watermark Laundering Through Foundation Image Models |
提出水印洗涤方法以解决基础图像模型的隐形水印问题 |
foundation model |
|
|
| 14 |
ADGNet: Asymmetric Dual-text Guided Network for Infrared Small Target Detection |
提出ADGNet以解决红外小目标检测中的背景干扰问题 |
multimodal |
✅ |
|
| 15 |
Separating perception from reasoning in vision-language models: a model-free render ceiling for crystal structures |
提出无模型渲染上限以解决视觉语言模型的感知与推理分离问题 |
multimodal |
|
|