cs.CV(2026-08-11)

📊 共 45 篇论文 | 🔗 10 篇有代码

🎯 兴趣领域导航

支柱三:空间感知与语义 (Perception & Semantics) (15 🔗3) 支柱九:具身大模型 (Embodied Foundation Models) (13 🔗4) 支柱二:RL算法与架构 (RL & Architecture) (12 🔗2) 支柱一:机器人控制 (Robot Control) (2) 支柱六:视频提取与匹配 (Video Extraction) (1 🔗1) 支柱四:生成式动作 (Generative Motion) (1) 支柱八:物理动画 (Physics-based Animation) (1)

🔬 支柱三:空间感知与语义 (Perception & Semantics) (15 篇)

#题目一句话要点标签🔗
1 CausalSplat: Towards Comprehensive Hierarchical Reasoning in 3D Gaussian Splatting 提出CausalSplat以解决3D高斯分割中的推理问题 3D gaussian splatting 3DGS gaussian splatting
2 CasDeblurGS: Cascaded 2D-to-3D Multi-View Consistency for 3D Gaussian Splatting from Two Blurry Images 提出CasDeblurGS以解决从模糊图像重建3D场景的问题 3D gaussian splatting gaussian splatting splatting
3 GS-CPE: Unified 6-Degree-of-Freedom Camera Pose Estimation via 3D Gaussian Splatting 提出GS-CPE以解决6自由度相机位姿估计问题 3D gaussian splatting 3DGS gaussian splatting
4 E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment 提出E$^3$mo-Bench以解决多模态情感理解的不足问题 open-vocabulary open vocabulary large language model
5 GeoSeg-OV: Bridging Geospatial Gaps with Structural Guidance for Open-Vocabulary Remote Sensing Segmentation 提出GeoSeg-OV以解决开放词汇遥感分割中的地理空间差异问题 open-vocabulary open vocabulary foundation model
6 Self-Geometry: GT-Free and Plug-and-Play Test-Time Adaptation for Geometrically Consistent 3D Vision Foundation Models 提出Self-Geometry以解决3D视觉模型中的几何一致性问题 VGGT geometric consistency foundation model
7 Visual Geometry Foundation-Aware Gaussians for Single-Frame Surround-View Driving Reconstruction 提出VGGD框架以解决单帧环视重建中的几何不稳定问题 3D gaussian splatting gaussian splatting splatting
8 ThinkAfford: Affordance-Centric Reasoning for Fine-Grained 3D Grounding in Cluttered Scenes 提出ThinkAfford以解决复杂场景中的3D功能区域定位问题 open-vocabulary open vocabulary affordance
9 Static in Frames, Dynamic in Events: Rethinking Features in Event Cameras as Motion Cues 提出基于事件相机的运动线索特征以提升运动估计精度 optical flow motion estimation spatiotemporal
10 Compact Feed-Forward 3D Gaussians via Saliency-Guided Primitive Merging 提出结构感知合并管道以优化3D高斯表示 3D gaussian splatting gaussian splatting splatting
11 Gaussian Sculpting: End-to-End Controllable Surface Reconstruction via Field Optimization 提出高质量表面重建方法以解决3D Gaussian Splatting局限性 3D gaussian splatting 3DGS gaussian splatting
12 Learning Gaussian Structure: Intervention-Guided Density Control for Feed-Forward Driving Reconstruction 提出学习高斯结构以解决驱动场景重建问题 3DGS scene reconstruction TAMP
13 3D Weighted Geometric Graph Neural Networks for Sheep Facial Pain Assessment 提出3D加权几何图神经网络以评估羊面部疼痛 monocular depth Depth Anything spatial relationship
14 Sensor-Informed Per-Point Covariance for Structured-Light 3D Imaging 提出传感器信息驱动的点云协方差模型以解决3D成像不确定性问题 3D reconstruction
15 Bridging Event Streams and DiT: Event-Guided Video Frame Interpolation 提出事件引导的视频帧插值方法以解决运动模糊问题 optical flow

🔬 支柱九:具身大模型 (Embodied Foundation Models) (13 篇)

#题目一句话要点标签🔗
16 PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models 提出PRMU基准以解决多模态大语言模型中的知识遗忘问题 large language model multimodal
17 MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment 提出多模态代码切换方法以解决视觉对象与语言对齐问题 large language model multimodal visual grounding
18 SapiensID 2.0: Aligning Human Recognition Foundation Models with Human Perception 提出SapiensID 2.0以解决人类识别模型的语义盲点问题 large language model foundation model multimodal
19 Foundation Model-Enabled Efficient Data Sampling (FEEDS): A label-efficient training strategy for pan-cancer, multi-tracer PET/CT datasets 提出FEEDS以解决肿瘤分割数据标注稀缺问题 foundation model
20 CARE: Confidence-Aware Reasoning for Reliable Medical VQA 提出CARE框架以解决医疗VQA中的信心误校准问题 large language model multimodal chain-of-thought
21 Evaluating Semantic and Spatial Guidance for Foundation Model Segmentation of Small-Scale PV in Remote Sensing Imagery 提出基于提示的模型以解决小规模光伏系统遥感影像分割问题 foundation model
22 InterPruner: Interactive Structured Pruning via Taylor-Implicit Criterion and Language-Prior Modulator for Multimodal Object Detection 提出InterPruner以解决RGB-红外多模态目标检测中的通道冗余问题 multimodal
23 MMArt A Multi-Perspective Multimodal Dataset for Visual Art Understanding 提出MMArt数据集以解决艺术作品多视角理解问题 multimodal
24 Retrieval-Augmented Vision Foundation Models for Robust Leukemia Cell Classification across Multiple Microscopy Datasets 提出基于检索增强的视觉基础模型以解决白血病细胞分类问题 foundation model
25 StreamFlow: Dynamic Memory Flows for Streaming Video Understanding 提出StreamFlow以解决流媒体视频理解中的记忆和效率问题 large language model multimodal
26 DriveVLA-M0: Failure-Aware Memory Augmentation for Autonomous Driving 提出DriveVLA-M0以解决自主驾驶中的失败适应问题 vision-language-action VLA
27 Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences 提出LVLMs作为判断者以解决图像序列中的时间推理问题 multimodal
28 Where To Look? : Causal Tracing of Vision Encoders in VLM 提出因果追踪方法以揭示视觉语言模型中的视觉信息驱动机制 multimodal

🔬 支柱二:RL算法与架构 (RL & Architecture) (12 篇)

#题目一句话要点标签🔗
29 Capturing Uncertainty in Human Motion for Representation Learning in Soccer 提出自监督学习框架以捕捉足球运动中的不确定性 representation learning human motion motion prediction
30 Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation 提出测试时自我演化框架以解决GUI视觉定位适应性问题 reinforcement learning distillation visual grounding
31 Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes 提出AD2-Bench以解决复杂城市场景中的多模态推理问题 reinforcement learning large language model multimodal
32 Temporally Grounded Compositional Camera Motion Understanding via Geometric Knowledge Distillation 提出CamDistill以解决视频中相机运动理解问题 distillation large language model foundation model
33 SAR2Agri: Learning SAR Intensity Representations for Agricultural Monitoring 提出SAR2Agri以解决农业监测中的SAR图像表示问题 JEPA contrastive learning curriculum learning
34 Unlocking the Power of Medical Tabular Data via Semantic-Aware Multimodal Pre-training 提出语义感知多模态预训练框架以提升医学表格数据的利用效率 representation learning multimodal
35 Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models 提出多视角关系蒸馏以解决视觉语言模型的空间推理问题 distillation scene understanding embodied AI
36 R4DSG: Relative 4D Scene Graph Memory for Object-Centric Question Answering in Long Egocentric Video 提出相对4D场景图记忆以解决长时间自我中心视频中的对象中心问答问题 world model world models egocentric
37 SafeCap: Improving LVLM Safety with Image Captioning Reinforcement Learning 提出SafeCap以提升大型视觉语言模型的安全性 reinforcement learning DPO multimodal
38 VidForensics-M1: Meta-Detection Reinforcement Learning with Verifiable Temporal Grounding for AI-Generated Video Forensics 提出VidForensics-M1以解决AI生成视频检测中的监督不足问题 reinforcement learning
39 Grid-Preserving Knowledge Distillation: Transferring Convolutional Inductive Bias to Vision Transformers under Data Scarcity 提出iBKD以解决数据稀缺下ViT性能不足问题 distillation
40 Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation 提出Stream Forcing以解决流媒体视频生成中的训练与推理不一致问题 world model world models

🔬 支柱一:机器人控制 (Robot Control) (2 篇)

#题目一句话要点标签🔗
41 Precise Top-Layer Fabric Segmentation for Fabric Destacking with Edge- and Shape-Aware Deep Networks 提出多分支深度网络以解决面料堆叠分割问题 manipulation
42 NullEdit: Stealthy Image Protection via VLM Condition Redirection 提出NullEdit以解决图像编辑隐私保护问题 manipulation

🔬 支柱六:视频提取与匹配 (Video Extraction) (1 篇)

#题目一句话要点标签🔗
43 HUI360: A 360° Egocentric Dataset and Baselines for Human-Robot Interaction Anticipation 提出HUI360数据集以解决人机交互意图预测问题 egocentric

🔬 支柱四:生成式动作 (Generative Motion) (1 篇)

#题目一句话要点标签🔗
44 PolyLayout: Hierarchical VLM-Guided Layout Generation Beyond Rectangular Rooms 提出PolyLayout以解决非矩形房间布局生成问题 physically plausible

🔬 支柱八:物理动画 (Physics-based Animation) (1 篇)

#题目一句话要点标签🔗
45 Beyond Pixels: From Video Priors to 4D Worlds 提出Latent-to-4D以解决动态3D场景生成问题 spatiotemporal

⬅️ 返回 cs.CV 首页 · 🏠 返回主页