cs.CV(2026-08-18)

📊 共 33 篇论文 | 🔗 5 篇有代码

🎯 兴趣领域导航

支柱九:具身大模型 (Embodied Foundation Models) (12 🔗2) 支柱二:RL算法与架构 (RL & Architecture) (10 🔗2) 支柱三:空间感知与语义 (Perception & Semantics) (8 🔗1) 支柱八:物理动画 (Physics-based Animation) (2) 支柱七:动作重定向 (Motion Retargeting) (1)

🔬 支柱九:具身大模型 (Embodied Foundation Models) (12 篇)

#题目一句话要点标签🔗
1 MS-MFAD : Multimodal large language models for Face Anti-spoofing Detection 提出多模态大语言模型以解决面部反欺诈检测问题 large language model foundation model multimodal
2 DistillPath: An Efficient 22M Distilled Pathology Encoder Approaching Large Foundation Model Performance 提出DistillPath以高效编码病理图像,接近大型基础模型性能 foundation model
3 Where a New Concept Must Enter: Entry Point Gates Cross-Task Usability in Unified Multimodal Models 提出入口点门控机制以提升统一多模态模型的跨任务可用性 multimodal
4 BrainNorm: A Foundation Model that knows Normal via Semantic Atlas Pretraining 提出BrainNorm模型以实现脑部MRI的规范化分析 foundation model
5 When More Foundation Models Means Less: Diagnosing and Addressing Multi-View Fusion Failure 提出KAGES以解决多视图融合中的选择问题 foundation model
6 Plug-and-Play Traffic Element Awareness for End-to-End Autonomous Driving 提出交通元素感知以提升端到端自动驾驶性能 vision-language-action VLA
7 Code as Representation: A Compilable Parsing Paradigm for Academic Documents 提出可编译学术文档解析方法以解决科学知识表示问题 large language model multimodal
8 Improving Complex Moiré Removal with Generative Supervision 提出生成监督方法以改善复杂莫尔纹去除问题 foundation model
9 Scale Matters: Adaptive Granularity Selection for Cross-Species 3D Plant Organ Segmentation 提出AGS-PlantSeg以解决跨物种3D植物器官分割问题 foundation model
10 CoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video Editing 提出CoinVE-200K以解决复合指令引导视频编辑问题 instruction following
11 SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment 提出SE-MoLoRA以解决摄影评估中的语义与美学判断纠缠问题 multimodal
12 Primitive-Driven Compositional Forensic Visual Prompting for Open-World Face Anti-Spoofing 提出基于原始驱动的组合视觉提示以解决开放世界人脸反欺诈问题 foundation model

🔬 支柱二:RL算法与架构 (RL & Architecture) (10 篇)

#题目一句话要点标签🔗
13 TEAMS: Text-prompted spatiotEmporal dual-heAd Mamba Snake 提出TEAMS以解决深度蛇形实例分割中的复杂形态变化问题 Mamba state space model spatiotemporal
14 REChart: Reasoning-Efficient Chart Editing with Large Reasoning Models 提出REChart以解决图表编辑中的推理效率问题 reinforcement learning multimodal instruction following
15 AViTS: Adaptive Spatiotemporal Token Selection for Efficient Dynamic-Resolution Generation 提出AViTS以解决动态分辨率生成中的冗余计算问题 distillation spatiotemporal
16 Magnitude-Direction Decoupling for Fast Video Generation with Flow Matching Models 提出幅度-方向解耦方法以加速视频生成 flow matching classifier-free guidance
17 Primitive Representation Learning for Unsupervised Dynamic Contrast Enhanced MRI Reconstruction 提出基于原始表示学习的动态对比增强MRI重建方法 representation learning spatiotemporal
18 RetiWave-Mamba: A Dual-Stream Network for Retinal Disease Detection based on Multi-scale Context and Frequency-Adaptive Mamba Projection 提出RetiWave-Mamba以解决视网膜疾病检测中的噪声与细节处理问题 Mamba state space model
19 Continuity-Driven Representation Learning for Industrial Defect Detection 提出连续性驱动的表示学习框架以解决工业缺陷检测问题 Mamba representation learning
20 GenRec: Knowing Where to Reconstruct and Where to Generate 提出GenRec以解决稀疏输入图像的生成与重建问题 flow matching monocular depth NeRF
21 DynaForcing: Overcoming Dynamic Collapse in Self-Forcing Distillation for Streaming Avatar Generation 提出DynaForcing以解决自我强制蒸馏中的动态崩溃问题 distillation
22 S$^3$AM: A Single-Stream SAM with Reliability-Calibrated Frequency Adapter for Multi-modal Salient Object Detection 提出单流SAM框架以解决多模态显著目标检测中的冗余计算问题 Mamba foundation model

🔬 支柱三:空间感知与语义 (Perception & Semantics) (8 篇)

#题目一句话要点标签🔗
23 NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting 提出NGS-Marker以解决3D高斯点云水印保护问题 3D gaussian splatting 3DGS gaussian splatting
24 GroupForward: Building Referable 3D Scenes via Instance-Grouped Feed-Forward Gaussian Splatting 提出GroupForward以解决3D场景重建与理解问题 3D gaussian splatting 3DGS gaussian splatting
25 GS-Voxel: Fitting-Free Structured Latents for Large-Scale 3DGS Generation 提出GS-Voxel框架以解决大规模3D场景生成问题 3D gaussian splatting 3DGS gaussian splatting
26 SPVC: Structured and Panoptic Video Fixing for Cross-Dataset Driving Scene Rendering 提出SPVC框架以解决跨数据集驾驶场景渲染问题 3D gaussian splatting 3DGS gaussian splatting
27 Differentiable Voronoi Ray Tracing Beyond Rasterization Speeds 提出VoroTracing以解决实时光线追踪性能瓶颈问题 3D gaussian splatting gaussian splatting splatting
28 UniQuery4R: Unified 4D Scene Reconstruction from a Single Query 提出UniQuery4R以解决动态4D场景重建问题 scene reconstruction scene flow
29 GeoWeaver: Accurate Long-Sequence 3D Reconstruction via Hierarchical Geometric Assembly 提出GeoWeaver以解决长序列3D重建中的几何一致性问题 3D reconstruction
30 Initialization-Free Bundle Adjustment Revisited: A Controlled Experimental Study 重新审视无初始化束调整方法以解决3D重建问题 3D reconstruction

🔬 支柱八:物理动画 (Physics-based Animation) (2 篇)

#题目一句话要点标签🔗
31 ETHEREAL: A 25.6-$μ$s/inf. Low-latency Event-driven Graph-neural-network Processor for High-resolution Vision at the Edge 提出ETHEREAL以解决动态视觉传感器的低延迟处理问题 spatiotemporal
32 Noisy group neurons with synchronous resetting for high-performance spiking neural networks 提出噪声群神经元模型以解决深度脉冲神经网络训练难题 spatiotemporal

🔬 支柱七:动作重定向 (Motion Retargeting) (1 篇)

#题目一句话要点标签🔗
33 NeuroPath: Brain-Inspired Dual-Pathway Graph Convolutional Networks for Skeleton-Based Action Recognition 提出NeuroPath以解决骨架动作识别中的信息耦合问题 human motion

⬅️ 返回 cs.CV 首页 · 🏠 返回主页