cs.CV(2026-08-14)

📊 共 19 篇论文 | 🔗 5 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (8 🔗1) 支柱二:RL算法与架构 (RL & Architecture) (5 🔗2) 支柱三:空间感知与语义 (Perception & Semantics) (3 🔗1) 支柱一:机器人控制 (Robot Control) (2 🔗1) 支柱七:动作重定向 (Motion Retargeting) (1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (8 篇)

#题目一句话要点标签🔗
1 SSP: An Event-Matched Syn2Sim2Phy Cross-Domain Evaluation Framework for Autonomous Driving VLA Models 提出SSP框架以解决跨域评估VLA模型的性能差异问题 vision-language-action VLA
2 Rethinking Auxiliary Modalities in Multimodal Zero-shot Anomaly Detection: From Semantic Fusion to Conditional Modulation 提出辅助条件增强框架以解决多模态零-shot异常检测问题 foundation model multimodal
3 GBU-Palm: A Multimodal Video Dataset and Benchmark for Palm Presentation Attack Detection 提出GBU-Palm以解决现有掌纹攻击检测数据集不足问题 multimodal
4 Spatial Message Passing in Language Space for Pathology Image Interpretation 提出空间语言消息传递框架以解决病理图像解读问题 large language model multimodal
5 FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation 提出FIRM以解决遥感图像细粒度分割问题 large language model multimodal
6 CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets 提出CRAFT以解决图像个性化中的目标合成问题 multimodal
7 Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination 提出RA-Bench以解决AI生成视频检测的挑战 multimodal
8 SCVIB: Editable State-Conditioned Visual Instance Binding forMulti-Turn Personalized Localization 提出SCVIB以解决多轮个性化定位中的视觉实例绑定问题 visual grounding

🔬 支柱二:RL算法与架构 (RL & Architecture) (5 篇)

#题目一句话要点标签🔗
9 ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models 提出ForgeWM以解决交互式视频生成中的因果训练问题 world model world models distillation
10 Self-Supervised Visual On-Policy Distillation 提出自监督视觉在线蒸馏方法以解决信息不对称问题 policy learning teacher-student distillation
11 CSG-Mamba: A Convolutional Scoring Gating Vision State Space Network for Endoscopic Polyp Segmentation 提出CSG-Mamba以解决内窥镜息肉分割中的低对比度问题 Mamba SSM state space model
12 ProFocus: Interpreting Affective Experience in Artistic Images with Progressive Visual Focusing 提出ProFocus以解决艺术图像情感解读问题 representation learning large language model multimodal
13 Marionette: Predicting World States, Rendering Geometry, Painting Appearance 提出Marionette以解决长时间序列生成中的一致性问题 world model world models penetration

🔬 支柱三:空间感知与语义 (Perception & Semantics) (3 篇)

#题目一句话要点标签🔗
14 HiCo-GS: Hierarchical Context Aggregation and Geometric Consistency for Octree Gaussian Splatting 提出HiCo-GS以解决现有Octree Gaussian Splatting的特征隔离问题 gaussian splatting splatting geometric consistency
15 PISA: A Pseudo-Individual Source-Domain Feature Adaptation Framework for Test-Time Open-Vocabulary Object Detection 提出PISA框架以解决开放词汇目标检测中的性能下降问题 open-vocabulary open vocabulary
16 SPARGen: Unifying Spatial Perception and Reasoning through Native Multimodal Generation 提出SPARGen以统一空间感知与推理问题 3D reconstruction multimodal

🔬 支柱一:机器人控制 (Robot Control) (2 篇)

#题目一句话要点标签🔗
17 OpenBelief-Nav: Evidence-Preserving Object Memory for Open-Vocabulary Language-Guided Navigation 提出OpenBelief-Nav以解决开放词汇语言引导导航中的对象记忆问题 Unitree open-vocabulary open vocabulary
18 Zero-Shot Skeleton-Based Action Anticipation 提出零样本骨架动作预测方法以解决新动作识别问题 humanoid

🔬 支柱七:动作重定向 (Motion Retargeting) (1 篇)

#题目一句话要点标签🔗
19 Beyond Control Points: Arcsecond Relative-Motion Estimation of Vision Measurement Platforms With Incomplete or Absent Control Fields 提出控制自适应差分框架以解决视觉测量平台运动估计问题 motion estimation

⬅️ 返回 cs.CV 首页 · 🏠 返回主页