cs.CV(2026-08-05)

📊 共 50 篇论文 | 🔗 10 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (22 🔗4) 支柱三:空间感知与语义 (Perception & Semantics) (12 🔗2) 支柱二:RL算法与架构 (RL & Architecture) (9 🔗2) 支柱一:机器人控制 (Robot Control) (5 🔗2) 支柱六:视频提取与匹配 (Video Extraction) (2)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (22 篇)

#题目一句话要点标签🔗
1 Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs 提出无训练框架以解决多模态大语言模型的空间推理问题 large language model multimodal chain-of-thought
2 Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes 提出多模态预训练物理学以解决知识流动与协同问题 foundation model multimodal
3 Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking 提出代理框架以解决自动烹饪中的个性化与信任问题 large language model multimodal
4 Q-CueGraph: Query-Conditioned Visual Evidence Graphs for Multimodal Reasoning 提出Q-CueGraph以解决多模态推理中的视觉证据选择问题 large language model multimodal
5 OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing 提出OmniRouting以解决PCB布线中的约束感知推理问题 large language model multimodal
6 CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion 提出CSGen以解决可控生成精确曲线结构图像的问题 multimodal
7 Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition 提出多模态生成分类方法以解决零样本骨架动作识别问题 multimodal
8 Talk2Sensors: 3D Visual Grounding in Autonomous Driving via Sensor-Adaptive Physical Cue Matching 提出Talk2Sensors以解决户外3D视觉定位问题 visual grounding
9 ReGround: Restoring Visual Grounding in Multi-Step Reasoning through Self-Diagnosis and Visual Re-Examination 提出ReGround以解决多步推理中的视觉定位问题 visual grounding
10 iStructTab: Structured Feature Sequencing for Multimodal Learning of Image and Tabular Data 提出GEDS以解决多模态学习中的特征表示问题 multimodal
11 CoCo-IR: Contextual Composed Image Retrieval 提出CoCo-IR以解决复杂视觉搜索中的多轮交互问题 multimodal
12 Unleashing the Potential of Vision-Language Models for Generalizable AI-Generated Image Detection 提出语义原型校准方法以提升AI生成图像检测性能 foundation model
13 Persistent Object Narratives for Token-Efficient Video Language Models 提出SlotNarrative以解决视频语言模型的视觉令牌效率问题 large language model
14 DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation 提出DAC-Pose以解决姿态引导人类生成中的视觉伪影问题 multimodal
15 MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding 提出MetaVideoAgent以解决长视频理解中的自动化视频代理演化问题 multimodal
16 PhysMind: From Video to Executable Worlds for Training-Free Physical Reasoning 提出PhysMind框架以解决视频中的物理推理问题 chain-of-thought
17 FocusMem: Factorizing Content, Readout, and Trust in Latent GUI Memory 提出FocusMem以解决GUI记忆中的信息压缩与决策阶段问题 multimodal
18 REZE: Recognition-Based Zero-Shot Extraction for Video Temporal Grounding 提出REZE以解决视频时序定位中的零样本提取问题 TAMP
19 Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes 提出预测状态检索以解决视频未来状态获取问题 multimodal
20 Thinking with Anchors: Grounded and Efficient Document Reasoning 提出ADOPD 2026以解决文档理解中的空间推理问题 chain-of-thought
21 Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle 提出主动保护机制以应对视觉内容生命周期中的安全挑战 multimodal
22 CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models 提出CLIP-CC-Bench以评估段落级视频描述的准确性 multimodal

🔬 支柱三:空间感知与语义 (Perception & Semantics) (12 篇)

#题目一句话要点标签🔗
23 OutLangSplat: 3D Language Gaussian Splatting for UAV Outdoor Scenes 提出OutLangSplat以解决无人机户外场景的3D语言理解问题 3D gaussian splatting gaussian splatting splatting
24 EgoAfford: Task-Oriented Affordance Grounding via Egocentric Referring Segmentation 提出EgoAfford以解决复杂任务中的功能区域定位问题 affordance egocentric large language model
25 ACA-GS: Adaptive-Capacity Anchored Gaussian Splatting for Compact Dynamic Radiance Fields 提出自适应容量锚定高斯点云以解决动态辐射场存储效率问题 gaussian splatting splatting spatiotemporal
26 UniWorld-View: Large-Baseline View Synthesis via Video Diffusion Models 提出UniWorld-View以解决稀疏输入下的视图合成问题 3D gaussian splatting 3DGS gaussian splatting
27 SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding 提出SmartMage以解决3D场景理解中的模态选择问题 scene understanding large language model multimodal
28 Objects as Audio-Visual Modal Sound Fields 提出音频视觉模态声场以解决声学信息建模不足问题 3D gaussian splatting 3D reconstruction gaussian splatting
29 Cooking beyond Frames: A Stereo Event Camera Dataset in the Kitchen 提出EventKitchen数据集以解决人类日常活动识别问题 depth estimation stereo depth egocentric
30 Dense Metric Depth Completion from Sparse Direct Time-of-Flight Sensors 提出一种框架以解决稀疏直接飞行时间传感器的密集度量深度补全问题 metric depth
31 HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding 提出HiSC以解决3D场景理解中的冗余问题 scene understanding
32 Beyond Reprojection Error: Camera Calibration with 3D Targets 提出基于场景光线预测的相机标定方法以提升3D重建精度 3D reconstruction
33 An active-learning framework for real-time depth perception from monocular vision streams 提出在线主动学习框架以解决单目视觉深度感知问题 depth estimation
34 Revisiting Pose Sensitivity in Splat-based Computed Tomography under Sparse-view Reconstruction 提出稳定的梯度框架以解决稀视图CT中的姿态敏感性问题 splatting

🔬 支柱二:RL算法与架构 (RL & Architecture) (9 篇)

#题目一句话要点标签🔗
35 VQ-VAD: Vector-quantized Motion Representation Learning for Human-centric Video Anomaly Detection 提出VQ-VAD以解决视频异常检测中的运动表示学习问题 representation learning motion representation
36 HelloWorld: Enabling Socially Interactive Characters in Video World Models 提出HelloWorld以解决视频世界模型中社交互动缺失问题 world model world models distillation
37 OPD-V: Visual On-Policy Self-Distillation with Modality Balance 提出OPD-V以解决多模态语言模型中的模态不平衡问题 distillation privileged information large language model
38 UG-UMRE: Uncertainty-Guided Modality Augmentation and Distributional Calibration for Unified Multimodal Relation Extraction 提出UG-UMRE以解决多模态关系提取中的不确定性问题 contrastive learning multimodal
39 ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation 提出ToolArtist以解决开放世界图像生成中的复杂推理问题 reinforcement learning multimodal
40 Overcoming Statistical Bias in Action-Controllable World Models 提出CoCo框架以解决动作控制世界模型中的统计偏差问题 world model world models
41 Teaching MLLMs to Say No: Generalized Referring Expression Comprehension via Refusal Calibrated GRPO 提出拒绝校准的GRPO以解决广义指称表达理解问题 reinforcement learning large language model multimodal
42 Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation 提出TD-V2A以解决视频到音频生成中的视觉条件不足问题 representation learning visual pre-training multimodal
43 Poly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow Models 提出Poly-OPD框架以整合异构教师模型的优势 flow matching distillation

🔬 支柱一:机器人控制 (Robot Control) (5 篇)

#题目一句话要点标签🔗
44 MobileWAM: Bridging World Action Models to Mobile Manipulation with Chain-of-Foresight 提出MobileWAM以解决移动操控中的动态协调问题 whole-body control locomotion manipulation
45 CofactVLA: Deconfounding Vision-Language-Action Models via Counterfactual Intervention 提出CofactVLA以解决视觉-语言-动作模型中的因果混淆问题 manipulation flow matching vision-language-action
46 Faster-WAM: Efficient Inference-Time Future Conditioning for Robust World Action Models 提出Faster-WAM以解决高效推理时间未来条件化问题 manipulation world action model world action models
47 Differential 6-DOF Pose Estimation with Provable First-Order Immunity to Camera Calibration Errors 提出一种差分6自由度姿态估计方法以解决相机标定误差问题 manipulation motion estimation
48 Towards a satellite image manipulation and deepfake localization benchmark dataset 构建卫星图像操控与深伪检测基准数据集以解决验证真实性问题 manipulation

🔬 支柱六:视频提取与匹配 (Video Extraction) (2 篇)

#题目一句话要点标签🔗
49 The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering 提出EgoCross基准以解决跨领域第一人称视频问答问题 egocentric large language model multimodal
50 Promptable Animal Pose Tracking Across Species 提出基于视觉基础模型的动物姿态跟踪方法以解决标注数据不足问题 feature matching foundation model

⬅️ 返回 cs.CV 首页 · 🏠 返回主页