cs.CV(2026-08-07)

📊 共 24 篇论文 | 🔗 7 篇有代码

🎯 兴趣领域导航

支柱二:RL算法与架构 (RL & Architecture) (10 🔗2) 支柱九:具身大模型 (Embodied Foundation Models) (7 🔗4) 支柱三:空间感知与语义 (Perception & Semantics) (6) 支柱七:动作重定向 (Motion Retargeting) (1 🔗1)

🔬 支柱二:RL算法与架构 (RL & Architecture) (10 篇)

#题目一句话要点标签🔗
1 UniJEPA: A Unified Joint-Embedding Predictive Architecture for Task-Agnostic Visual World Modeling 提出UniJEPA以统一图像与视频的世界建模 world model world models JEPA
2 SimWAM: A Simple World Action Model for End-to-End Autonomous Driving 提出SimWAM以解决端到端自主驾驶中的未来生成问题 reinforcement learning flow matching world action model
3 Foundation Models Adaptation for Multi-View Multi-modal Cardiac MRI Segmentation and Direct Ejection Fraction Estimation 提出基础模型适应方法以解决多视角多模态心脏MRI分割问题 MAE foundation model
4 Debias in Text, Believe Your Eyes: Text-Anchored Cross-Modal Transfer for Visual Counter-Commonsense Reasoning 提出文本锚定的跨模态转移方法以解决视觉反常识推理问题 distillation large language model multimodal
5 Addressable Memory for Video World Models 提出WorldTrace以解决视频世界模型中的视觉持久性问题 world model world models
6 HazeSpikeMamba: Coupling Spiking-Inspired and State-Space Features for Self-Supervised Real-World Dehazing 提出HazeSpikeMamba以解决真实场景去雾问题 Mamba PULSE
7 GeoDistill-Refine: Silhouette-First Geometry Distillation for Annotation-Free Spacecraft Segmentation 提出GeoDistill-Refine以解决航天器图像分割中的几何错误问题 distillation
8 KnifeHunter: Structured Local Representation Learning for Fine-Grained Knife Image Retrieval in Law Enforcement 提出KnifeHunter以解决执法领域刀具图像检索问题 representation learning
9 AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward 提出AVCap以解决音视频联合描述的细节不足问题 reinforcement learning multimodal
10 Suppress and Diversify: Refining Robust Pathways for Corruption Robustness 提出Suppress and Diversify方法以增强模型对图像损坏的鲁棒性 representation learning implicit representation

🔬 支柱九:具身大模型 (Embodied Foundation Models) (7 篇)

#题目一句话要点标签🔗
11 GraphVerse: A Comprehensive Visual Graph Reasoning Benchmark for Multimodal Large Language Models 提出GraphVerse以解决多模态大语言模型的视觉图推理挑战 large language model multimodal
12 When One Modality Is Not Enough: Multimodal Sex and Life-Stage Classification of Red Deer from Aerial RGB-Thermal Video 提出多模态融合方法以提高红鹿性别与生活阶段分类精度 multimodal
13 RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs 提出RoRA框架以解决多模态大语言模型中的视觉标记剪枝问题 large language model multimodal
14 CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams 提出CAS2UML数据集以解决UML自动生成的评估难题 large language model multimodal
15 Multi-Agent Forensic Reasoning for Generalizable Deepfake Video Detection 提出多代理法医推理框架以解决深度伪造视频检测问题 large language model multimodal
16 I Seek You in Videos: Identity-Conditioned Queries for Person-Centric Video Reasoning 提出身份条件查询以解决视频推理中的身份匹配问题 multimodal
17 Prune Once: Retraining-Free Task-Agnostic Pruning for Vision-Language Models 提出PORTA以解决视觉语言模型的高效剪枝问题 multimodal

🔬 支柱三:空间感知与语义 (Perception & Semantics) (6 篇)

#题目一句话要点标签🔗
18 InstanceSplat: Instance-Aware Feed-Forward 3D Gaussian Splatting for Scene Understanding 提出InstanceSplat以解决实例感知3D重建问题 3D gaussian splatting 3DGS 3D reconstruction
19 Scenix: Sparse-View 3D Scene Reconstruction via Executable Scene Programs 提出Scenix以解决稀疏视图下的3D场景重建问题 scene reconstruction
20 AdvTiles: Physical Adversarial Camouflage Clothing against Person Detectors via Learnable Tiles 提出AdvTiles以解决物理对抗伪装服装的有效性与自然性问题 3D gaussian splatting gaussian splatting splatting
21 RegionDet: A Benchmark for Region Detection Beyond Object Instances 提出RegionDet基准以解决区域检测的挑战 open-vocabulary open vocabulary
22 Multiple Hypothesis Flow Estimation for Video Frame Interpolation under Matching Ambiguity 提出多假设光流估计框架以解决视频帧插值中的匹配模糊问题 optical flow
23 ECAD: Expanding Class-Agnostic Detection Beyond Thing-Centric Objectness 提出ECAD以解决传统物体检测的局限性问题 scene understanding

🔬 支柱七:动作重定向 (Motion Retargeting) (1 篇)

#题目一句话要点标签🔗
24 Geometry-Aware Camera Localization for Bronchoscopy 提出几何感知框架以解决支气管镜定位问题 geometric consistency

⬅️ 返回 cs.CV 首页 · 🏠 返回主页