cs.CV(2026-08-13)

📊 共 46 篇论文 | 🔗 10 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (16 🔗2) 支柱二:RL算法与架构 (RL & Architecture) (13 🔗6) 支柱一:机器人控制 (Robot Control) (7 🔗1) 支柱三:空间感知与语义 (Perception & Semantics) (6 🔗1) 支柱八:物理动画 (Physics-based Animation) (2) 支柱六:视频提取与匹配 (Video Extraction) (1) 支柱四:生成式动作 (Generative Motion) (1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (16 篇)

#题目一句话要点标签🔗
1 TennisVAR: A Stroke-Evidence-Grounded Multimodal Large Language Model for Tactical Reasoning in Tennis Videos 提出TennisVAR以解决网球视频战术推理问题 large language model multimodal
2 Evaluation of Clinically Steerable Retinal Image Generation from Foundation Model Latent Spaces 提出可控视网膜图像生成方法以解决合成与真实图像差距问题 foundation model
3 When Is a Task Vector Enough? An Empirical Theory of Implicit Multimodal ICL 提出选择-实现假设以优化多模态内在学习任务 multimodal
4 How Good are Foundation Models in Longitudinal MRI Disease Progression Reasoning? 提出时间感知多视角MRI基准以解决疾病进展推理问题 foundation model
5 Reasoning for Social Audio-Visual Question Answering: Where Do We Stand? 提出IntentBench-Prime以解决多模态社交理解中的噪声问题 large language model multimodal chain-of-thought
6 Semantic Steering for Controllable Generation: Tuning-Free Concept Erasure in Multimodal Diffusion Transformers 提出无调优概念消除方法以解决多模态扩散模型的安全问题 multimodal
7 CW-BASS v2: Saturation-Aware Pseudo-Label Selection for Semi-Supervised Segmentation under Foundation-Model Teachers 提出CW-BASS v2以解决伪标签选择中的饱和问题 foundation model
8 Mr3D-VL: A generalist vision language foundation model for Multiparametric 3D Magnetic Resonance Imaging 提出Mr3D-VL以解决多参数3D磁共振成像的跨模态推理问题 foundation model
9 MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification 提出ARMDIL以解决跨数据集图像分类的泛化问题 large language model multimodal
10 Towards Physics-Faithful Generation of Scientific Diagrams 提出Princigram以解决科学图表生成中的物理真实性问题 multimodal chain-of-thought
11 UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations 提出UniTraffic-Agent以解决交通视频理解问题 large language model multimodal
12 Beyond Visual Evidence: Revealing and Mitigating Relational Privacy Leakage in Document MLLMs 提出动态关系去学习框架以解决文档多模态大语言模型隐私泄露问题 large language model multimodal
13 Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors 提出双流交叉锚定修正以解决长文本描述中的物体幻觉问题 large language model multimodal
14 AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design 提出AutoDesign框架以优化长时程代理设计过程 multimodal
15 TraVEL: Trajectory-Guided Video Embedding Learning for Driving-Video Retrieval 提出TraVEL以解决驾驶视频检索中的运动理解问题 multimodal
16 Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval 提出异构视觉-语言集成方法以解决基于文本的人体异常检索问题 multimodal

🔬 支柱二:RL算法与架构 (RL & Architecture) (13 篇)

#题目一句话要点标签🔗
17 HounsWorld: A Multimodal World Model for Hidden Patient-State Readout, Reconstruction, and Simulation 提出HounsWorld以解决临床智能中患者状态估计问题 world model world models multimodal
18 Scaling Representation Diversity: Modulated Attention and Reconstructive Regularization for Visual Grounding 提出整体数据-模型协同设计框架以解决视觉定位中的表示退化问题 JEPA open-vocabulary open vocabulary
19 Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ 提出Edit2TikZ以解决科学图形编辑的挑战 curriculum learning large language model multimodal
20 P2Fusion: Prompt-based Progressive Infrared-Visible Image Fusion via Dual-Prior Distillation 提出P2Fusion以解决红外-可见图像融合中的信息不对称问题 distillation foundation model multimodal
21 Beyond Correctness: Benchmarking and Aligning Response Behaviors in Hybrid-Thinking MLLMs 提出PatternEval和PatternRL以解决混合思维MLLM响应行为不一致问题 reinforcement learning large language model multimodal
22 PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 提出PlayWorld基准以解决长时间目标评估问题 world model world models
23 Alaya-EVOKE: From Linear-Scaling Supervision to Endless World 提出Evoke以解决长时间交互生成中的记忆与响应问题 world model world models linear attention
24 V-RAE: Rethinking Video Latent Spaces for Generation 提出V-RAE以优化视频生成的潜在空间 predictive model foundation model
25 Context-Matched Distillation: Teacher Causality for Autoregressive Video Distillation 提出上下文匹配蒸馏以解决自回归视频生成中的因果问题 distillation
26 HPSD: Hybrid-Policy Self-Distillation for Text-Image-to-Video Diffusion Models 提出HPSD以解决TI2V模型自蒸馏问题 distillation
27 A Controlled Study of Self-Supervised Image and Video Pretraining under Limited Resources 提出自监督学习方法以在资源有限条件下优化图像和视频预训练 representation learning foundation model
28 Dual-Manifold Geometry Guided Representation Learning: Adaptive Coupling between Kernel and Data Spaces 提出双流形几何引导表示学习以提升特征演化效果 representation learning
29 PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives 提出PlayWorld基准以解决长时间目标评估的模型比较问题 world model world models

🔬 支柱一:机器人控制 (Robot Control) (7 篇)

#题目一句话要点标签🔗
30 DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation 提出DreamX-Phi 1.0以解决机器人操作中的未来观察预测问题 manipulation world model world models
31 UniTexture: Cross-Task Universal Adversarial Textures for Vision-Language-Action Models 提出UniTexture以解决多任务VLA模型的跨任务脆弱性问题 manipulation vision-language-action VLA
32 RGB-D Video Generation for Improving Human-to-Robot Object Handover Prediction 提出Hand2Bot和PassGen以解决人机物体交接预测问题 sim-to-real human-to-robot zero-shot transfer
33 EgoPHI: Estimating Contact and Force from Egocentric Vision 提出EgoPHI以解决从自我视角估计接触和力的问题 sim-to-real egocentric egocentric vision
34 Learning Unified Video and Image Representation for Video Face Forgery Detection 提出UVIF框架以解决视频人脸伪造检测中的部分伪造问题 manipulation
35 Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization 提出GATO-Vid以解决视频生成中的空间控制问题 trajectory optimization
36 Spatially-Grounded Text-to-Video Generation via Inference-Time Gradient-Free Optimization 提出GATO-Vid以解决文本到视频生成中的空间控制问题 trajectory optimization

🔬 支柱三:空间感知与语义 (Perception & Semantics) (6 篇)

#题目一句话要点标签🔗
37 GS$^{2}$CI: Robust Gaussian Splatting For Snapshot Compressive Imaging via Large Vision Model Priors 提出GS²CI框架以解决快照压缩成像中的3D重建问题 3D gaussian splatting 3DGS gaussian splatting
38 LocusGS: Spatially Grounded Tokens for Feed-Forward 3D Gaussian Splatting 提出LocusGS以解决3D高斯分布空间一致性问题 3D gaussian splatting 3DGS gaussian splatting
39 Geometry-Grounded Unified 3D Perception for Autonomous Driving 提出GeoUP框架以解决多摄像头自动驾驶感知中的几何结构问题 depth estimation metric depth VGGT
40 Splat-based Metal Artifact Reduction in Cone-Beam CT via Polychromatic Modeling 提出基于Splat的金属伪影去除方法以解决CBCT成像问题 gaussian splatting splatting
41 RbFT-Net: Rectify-Before-Fuse Temporal Radar Anchors for 4D Radar-Camera Depth Completion 提出RbFT-Net以解决4D雷达-相机深度补全中的时序对齐问题 monocular depth metric depth
42 SNM-VFI: Symmetric Nonlinear Motion-Guided Generative Video Frame Interpolation 提出SNM-VFI以解决视频帧插值中的运动控制问题 optical flow

🔬 支柱八:物理动画 (Physics-based Animation) (2 篇)

#题目一句话要点标签🔗
43 UniCon-Former: Unified Convolution Transformer is All You Need for Hand Gesture Recognition 提出UniCon-Former以解决手势识别中的局部与全局特征学习问题 UniCon
44 SCOPE: Subspace Clustering with Online Per-Head Top-K Estimation for Sparse Video Attention 提出SCOPE框架以解决稀疏视频注意力的效率问题 spatiotemporal

🔬 支柱六:视频提取与匹配 (Video Extraction) (1 篇)

#题目一句话要点标签🔗
45 EgoMonth: A Month-Level Egocentric Video Benchmark for Long-Term Spatiotemporal Memory 提出EgoMonth以解决长视频理解中的记忆一致性问题 egocentric spatiotemporal large language model

🔬 支柱四:生成式动作 (Generative Motion) (1 篇)

#题目一句话要点标签🔗
46 Label-Free Deep-Tissue Peripheral Nerve Detection with a Handheld Multimodal OCT Probe and NerveDetNet 提出无标记深组织外周神经检测方法以解决手术中可视化难题 penetration multimodal

⬅️ 返回 cs.CV 首页 · 🏠 返回主页