cs.CV(2026-09-03)

📊 共 40 篇论文 | 🔗 4 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (12) 支柱三:空间感知与语义 (Perception & Semantics) (11 🔗2) 支柱二:RL算法与架构 (RL & Architecture) (10 🔗1) 支柱一:机器人控制 (Robot Control) (2) 支柱八:物理动画 (Physics-based Animation) (2 🔗1) 支柱六:视频提取与匹配 (Video Extraction) (1) 支柱四:生成式动作 (Generative Motion) (1) 支柱七:动作重定向 (Motion Retargeting) (1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (12 篇)

#题目一句话要点标签🔗
1 VisCAD: A Foundation Model Suite with Multimodal Industrial CAD Intelligence 提出VisCAD以解决工业产品CAD设计中的多模态挑战 foundation model multimodal
2 Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States 提出Puffin-World以实现统一的多模态3D世界生成与重建 multimodal
3 Occlusion-Robust Multimodal Emotion Recognition in VR via Fusion of Facial Images and EMG 提出多模态情感识别方法以解决VR中面部遮挡问题 multimodal
4 Tree species mapping in Denmark: A comparison of spectral-temporal features with geospatial foundation model embeddings 提出基于光谱时序特征与基础模型嵌入的树种映射方法 foundation model
5 Persistent Identity Preservation in Generative Image Models: A Benchmark and Evaluation System 提出持久身份保留机制以解决生成图像模型身份漂移问题 foundation model instruction following
6 Beyond Retrieval: Progressive Latent Memory Evolution for Streaming Video Understanding 提出LatentStream以解决流媒体视频理解中的记忆内化问题 large language model multimodal
7 Seeing Before Synthesizing: VLM-Guided Transition Event Discovery for Weakly-Supervised Dense Video Captioning 提出SBS框架以解决弱监督密集视频字幕生成中的视觉引导问题 visual grounding
8 Select, Compress, Reinvest: A Controlled Study of Visual-Token Allocation in Long-Video MLLMs 提出视觉令牌分配方法以优化长视频MLLM性能 TAMP
9 KnowVis: Knowledge-Centric Visual Summarization for Video Lectures 提出KnowVis以解决视频讲座认知负担问题 multimodal
10 CoFiE: Coarse-to-Fine Evidence Selection for Efficient Streaming Video Understanding 提出CoFiE框架以解决流媒体视频理解中的效率问题 multimodal
11 PL-SCEA: Reconfiguring Pretrained Attention for Few-Shot Industrial Anomaly Detection 提出PL-SCEA以解决工业异常检测中的注意力计算问题 foundation model
12 SafeRI: Recognition and Intervention for Token-Level Safety Intervention in Large Vision Language Models 提出SafeRI以解决视觉语言模型的安全干预问题 multimodal

🔬 支柱三:空间感知与语义 (Perception & Semantics) (11 篇)

#题目一句话要点标签🔗
13 TruncGradGS: Improved 3D Gaussian Splatting via Truncated Gradient Updates 提出TruncGradGS以解决3D高斯点云优化中的梯度消失问题 3D gaussian splatting gaussian splatting splatting
14 Laplacian Frequency Hierarchies for Efficient 3D Gaussian Splatting Training 提出拉普拉斯频率层次以解决3D高斯点云训练效率问题 3D gaussian splatting 3DGS gaussian splatting
15 STARS-GS: Structure-Aware Regularized Gaussian Splatting for Large-Scale Aerial Surface Reconstruction 提出STARS-GS以解决大规模航空表面重建中的几何一致性问题 3D gaussian splatting 3DGS gaussian splatting
16 Zero-Shot Novel Depth Synthesis Using 3D Foundation Models Scene Representations 提出Z3D方法以解决零样本深度合成问题 3D reconstruction VGGT foundation model
17 A Reverse Sign Language Dictionary: Open-Vocabulary Sign Recognition from Continuous Signing via Video Captioning and Description Retrieval 提出一种反向手语字典以解决开放词汇手语识别问题 open-vocabulary open vocabulary
18 Scal3R: Learning Efficient Multi-Relative Pose Query for Scalable Online 3D Reconstruction 提出Scal3R以解决长视频在线3D重建问题 3D reconstruction
19 Sparse auto-regressive modeling for scene generation from multi-view images 提出SPAR3S以解决稀疏视图下的3D场景生成问题 3D gaussian splatting gaussian splatting splatting
20 PointGT: Simultaneous Geometry and Texture Editing for Point-Based Representations 提出PointGT以解决点云表示中几何与纹理编辑的难题 3D gaussian splatting gaussian splatting splatting
21 ENEAS: Embedding-guided Neural Ensemble for Adaptive Segmentation 提出ENEAS以解决实例跟踪与语义发现问题 3D reconstruction foundation model
22 Stabilizing Camera-Controlled Novel View Synthesis at Inference Time 提出CamTrol++以解决相机控制的新视图合成不稳定问题 3D reconstruction geometric consistency
23 P-CORE: Self-Supervised Surface Consistency for Point-Based Neural Editing 提出P-CORE以解决点云表面一致性问题 splatting NeRF

🔬 支柱二:RL算法与架构 (RL & Architecture) (10 篇)

#题目一句话要点标签🔗
24 Drive-HWM: Hierarchical World Models for Dynamic-Latent Guided Autonomous Driving 提出Drive-HWM以解决自主驾驶中的长短期决策问题 world model world models optical flow
25 When Depth Hurts: Reliability-Aware Geometry Distillation for Depth-Free RGB-D Salient Object Detection 提出可靠性感知几何蒸馏框架以解决RGB-D显著目标检测问题 MAE distillation Depth Anything
26 TAP-Path: Task-Adaptive Structural and Token Pruning for Efficient and Trustworthy Pathology Foundation Models 提出TAP-Path以提升病理基础模型的效率与可靠性 representation learning foundation model
27 WorldReward: Reward Modeling for Camera-Conditioned World Models 提出WorldReward以解决相机条件下世界模型的奖励建模问题 world model world models
28 Semantic-Aware Subgraph State Space Model for WSI Classification in Histopathology 提出语义感知子图状态空间模型以解决WSI分类问题 Mamba SSM state space model
29 SV-WAM: An Efficient Surround-View World-Action Model for End-to-End Autonomous Driving 提出SV-WAM以解决传统世界模型在自主驾驶中的局限性 world model world models zero-shot transfer
30 Temporal Self-Distillation: Learning Visual State Tracking in Videos Without Supervision 提出S$^3$T框架以解决无监督视频状态跟踪问题 distillation privileged information
31 CORE: Improving Compositional Reasoning in MLLM Embedding via Reranker Distillation 提出CORE以改善MLLM嵌入模型的组合推理能力 contrastive learning distillation
32 Unfold The World: Factorize 4D Properties in Reinforcing Spatial Reasoning 提出FactoSR以解决视觉语言模型的空间推理问题 reinforcement learning policy learning multimodal
33 FlashRender: Few-Step Generative Rendering via Camera-Controlled Video MeanFlow 提出FlashRender以解决多步生成渲染中的离散化误差问题 distillation geometric consistency

🔬 支柱一:机器人控制 (Robot Control) (2 篇)

#题目一句话要点标签🔗
34 Rethinking 3D Noise: Learning 3D-Aware Video Priors via Optimization-Free Morphological Perturbations 提出3D形态扰动以解决稀疏视图下3D场景重建问题 manipulation 3D gaussian splatting 3DGS
35 Building Pretraining Data for World Models: An Unreal Engine-Based Pipeline for Action-Conditioned Video Generation 提出基于虚幻引擎的合成数据生成管道以解决动作条件视频生成问题 humanoid world model world models

🔬 支柱八:物理动画 (Physics-based Animation) (2 篇)

#题目一句话要点标签🔗
36 BooM-VVT: Boosting Mask-Free Video Virtual Try-On with Image-Level Pseudo Data 提出BooM-VVT以解决视频虚拟试穿中的遮挡与一致性问题 spatiotemporal
37 Cross-Dataset Transfer and Reliability of Explainable Artificial Intelligence for RhythmFormer Remote Photoplethysmography 提出量化解释方法以提升远程光电容积描记法的可靠性 PULSE

🔬 支柱六:视频提取与匹配 (Video Extraction) (1 篇)

#题目一句话要点标签🔗
38 GraFT: A Training-Free Framework for Spatial Reasoning in Multimodal Large Language Models via 3D Scene Graphs 提出GraFT框架以解决多模态大语言模型中的空间推理问题 egocentric large language model multimodal

🔬 支柱四:生成式动作 (Generative Motion) (1 篇)

#题目一句话要点标签🔗
39 Continuous Actions from Discrete Minds: Latent-Aligned Planning for End-to-End Autonomous Driving 提出LaPla框架以解决自动驾驶中的离散推理与连续动作之间的鸿沟问题 physically plausible VQ-VAE vision-language-action

🔬 支柱七:动作重定向 (Motion Retargeting) (1 篇)

#题目一句话要点标签🔗
40 VI3: Grounding Pretrained 3D Foundation Models with Inertial Cues 提出VI3框架以解决3D基础模型的尺度预测问题 geometric consistency foundation model

⬅️ 返回 cs.CV 首页 · 🏠 返回主页