cs.CV(2026-08-17)

📊 共 32 篇论文 | 🔗 4 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (13 🔗2) 支柱二:RL算法与架构 (RL & Architecture) (8) 支柱三:空间感知与语义 (Perception & Semantics) (4 🔗1) 支柱七:动作重定向 (Motion Retargeting) (3 🔗1) 支柱一:机器人控制 (Robot Control) (2) 支柱四:生成式动作 (Generative Motion) (2)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (13 篇)

#题目一句话要点标签🔗
1 CytoFormer: A Molecularly Supervised Cell Foundation Model for Histopathology Cell Classification 提出CytoFormer以解决细胞分类中的标注效率问题 foundation model
2 MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter 提出MIRROR以解决放射科报告生成中的信息失真问题 multimodal
3 Beyond Accuracy: Assessing Calibration of Geospatial Foundation Models and Their Sensitivity to Distribution Shifts 提出评估地理基础模型校准与分布变化敏感性的方法 foundation model
4 CoM$^3$eT: A foundation model for medical image analysis through federated, multidimensional context integration 提出CoM$^3$eT以解决医学图像分析中的多任务学习问题 foundation model
5 AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty 提出AnchorScore以解决MLLM注释难度评估问题 large language model multimodal
6 HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes 提出HarmTrace以解决有害表情包中的细粒度目标识别问题 large language model multimodal
7 Matched Outcomes, Divergent Gaze: How Foveated MLLMs Search Compared to Humans 比较多模态大语言模型与人类视觉搜索的差异 large language model multimodal
8 MLLM-Guided Semantic Correction for Text-to-Video Generation 提出MLLM引导的语义修正方法以解决文本到视频生成中的语义错误问题 large language model multimodal
9 Remote-Sensing City Layout Extraction with MLLM 提出基于多模态大语言模型的城市布局提取方法 large language model multimodal
10 PersonaShot: Benchmarking Person-Centric Narrative Continuity in Multi-Shot Video Generation 提出PersonaShot以解决多镜头视频生成中的叙事连续性问题 multimodal
11 Self-Routed Tensor Adapters for Parameter-Efficient Universal Visual Adaptation 提出自路由张量适配器以解决多领域视觉适应问题 foundation model
12 Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models 提出视觉层剖析方法以优化视觉语言模型性能 multimodal
13 Representation Is Not Enough: Body-Localized Thermal Evidence for Contactless Stress and Craving Sensing in Opioid Use Disorder 提出FABLE-Therm以解决无接触压力与渴望感知问题 foundation model

🔬 支柱二:RL算法与架构 (RL & Architecture) (8 篇)

#题目一句话要点标签🔗
14 SIGMA-Lane: Scale-pyramId Gated MAmba for Temporally Consistent Video Lane Detection 提出SIGMA-Lane以解决视频车道检测中的时序一致性问题 Mamba SSM state space model
15 Deep Thought Alignment: Trajectory-Level Latent Distillation for Video Reasoning 提出Latent-OPD以解决视频推理中的蒸馏效率问题 distillation multimodal
16 SQuad: Sub-Quadratic Attention Distillation for Efficient Video Generation 提出SQuad以解决视频生成中的自注意力计算效率问题 flow matching distillation
17 PosterText: Towards Unified Visual Text Generation and Editing for E-commerce Poster 提出PosterText以解决电商海报生成与编辑的统一问题 reinforcement learning distillation instruction following
18 FLEET: Token-Based Feature Extraction for Event Camera-based Reinforcement Learning 提出FLEET以解决事件相机强化学习中的特征提取问题 reinforcement learning
19 Calibration-Free Vehicle Speed Estimation: A Monocular Keypoint-Template Approach 提出无校准车辆速度估计方法以解决传统方法的局限性 MAE optical flow
20 HarnessEval-W: Agentifying the Evaluation of Visual Worlds 提出HarnessEval-W以解决视觉世界评估的信任性问题 world model world models
21 StreamOPD: A Post-Training Recipe with Spatio-Temporal Cue Gating for Streaming Video Understanding 提出StreamOPD以解决流媒体视频理解中的记忆限制问题 reinforcement learning distillation

🔬 支柱三:空间感知与语义 (Perception & Semantics) (4 篇)

#题目一句话要点标签🔗
22 Beyond Similarity Matching: Structured Reasoning for Open-Vocabulary Referring Segmentation in 3DGS 提出QAGaussian以解决3DGS中的开放词汇指向分割问题 3D gaussian splatting 3DGS gaussian splatting
23 TR-GS: High-Fidelity Sparse-View CT Volumetric Rendering via t-Distribution Gaussian Splatting and Ray-Confidence Modeling 提出TR-GS框架以解决稀疏视图CT重建中的伪影问题 3D gaussian splatting 3DGS gaussian splatting
24 LaGSplat: Inferring Physics-Governed Interactive Simulation from Monocular Video Using Latent Lagrangian Gaussian Splatting 提出LaGSplat框架以从单目视频推断物理驱动的交互式模拟 gaussian splatting splatting NeRF
25 SplatGuide: Geometric Priors from 3D Gaussians for Pose-Free Novel View Synthesis 提出SplatGuide以解决无姿态图像的视角合成问题 3DGS NeRF

🔬 支柱七:动作重定向 (Motion Retargeting) (3 篇)

#题目一句话要点标签🔗
26 Spatial Temporal Synergy: Balancing Change and Invariance in Text Driven 3D Human Motion Editing 提出CIME框架以解决文本驱动3D人类动作编辑中的变化与不变性问题 human motion TAMP
27 A Plug-and-Play 2D Motion Interface for Real-World Motion Language Models 提出可插拔的2D运动接口以解决3D运动模型的输入限制问题 human motion
28 Depth-Dominant Skeleton Detection for Natural Scenes 提出深度主导的骨架检测方法以解决复杂场景下的检测问题 spatial relationship

🔬 支柱一:机器人控制 (Robot Control) (2 篇)

#题目一句话要点标签🔗
29 GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation 提出GaussianDWM++以解决3D场景理解与多模态生成问题 manipulation world model world models
30 SCOUT: Semantic Concept Discovery for Open-Vocabulary Editing of face Recognition Templates 提出SCOUT框架以实现面部识别模板的语义概念发现与编辑 manipulation open-vocabulary open vocabulary

🔬 支柱四:生成式动作 (Generative Motion) (2 篇)

#题目一句话要点标签🔗
31 Revisiting Classifier-Free Guidance Methods in Latent Diffusion Models 重新审视无分类器引导方法在潜在扩散模型中的应用 classifier-free guidance
32 GRNEdit: Efficient General Video Editing from a New Binary-Evidence Perspective in Generative Refinement Networks 提出GRNEdit以解决高效视频编辑问题 classifier-free guidance

⬅️ 返回 cs.CV 首页 · 🏠 返回主页