Real-Time Video Anomaly Detection Using YOLO Pose Estimation and CLIP-Based Semantic Scoring
作者: Vanodhya G. Warnasooriya, Amir Hajian, Watchara Ruangsang, Supavadee Aramvith
分类: cs.CV, cs.AI, eess.IV
发布日期: 2026-08-31
备注: 5 pages, 2 figures, 3 tables. Presented at the 9th IEEE International Conference on Multimedia Information Processing and Retrieval (MIPR 2026); accepted for publication in IEEE Xplore
💡 一句话要点
提出轻量级框架以实现实时视频异常检测
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 视频异常检测 YOLO CLIP 实时处理 深度学习 计算机视觉 智能监控
📋 核心要点
- 现有的视频异常检测方法通常依赖于复杂的光流和独立的姿态估计器,导致实时性差和计算资源消耗高。
- 本文提出的框架通过YOLO v11n-pose进行姿态检测,并结合CLIP进行语义评分,显著简化了检测流程。
- 实验结果显示,该方法在多个数据集上实现了51 FPS的实时处理速度,并在AUROC指标上表现优异,提升幅度显著。
📝 摘要(中文)
本文提出了一种轻量级的两阶段框架,用于实时视频异常检测。第一阶段采用YOLO v11n-pose检测人员并在单次前向传播中提取十七个骨骼关键点。第二阶段通过CLIP ViT-B/32对每个裁剪的人体区域进行编码,并计算与预定义异常行为文本描述的余弦相似度。该架构消除了对光流、独立姿态估计器和基于密度的评分模块的需求。在CUHK Avenue、ShanghaiTech Campus和在朱拉隆功大学收集的自定义室内数据集上的实验表明,该系统在NVIDIA Titan XP GPU上实现了约51 FPS的端到端吞吐量,相较于多特征基线提升了3.36倍,同时保持了89.26%、70.26%和84.13%的帧级AUROC值。
🔬 方法详解
问题定义:本文旨在解决实时视频异常检测中的高计算复杂性和低效率问题。现有方法通常依赖于光流和独立的姿态估计器,导致实时性不足和资源消耗过大。
核心思路:论文提出的框架通过结合YOLO v11n-pose和CLIP,简化了异常检测流程。YOLO用于快速检测和提取人体关键点,而CLIP则用于对行为进行语义评分,从而提高检测效率。
技术框架:整体架构分为两个主要阶段:第一阶段使用YOLO v11n-pose进行人员检测和骨骼关键点提取;第二阶段通过CLIP ViT-B/32对裁剪的人体区域进行编码,并计算与预定义文本描述的相似度。
关键创新:该研究的创新点在于将YOLO和CLIP结合,消除了对光流和独立姿态估计器的依赖,实现了更高效的异常检测。与现有方法相比,该框架在速度和准确性上均有显著提升。
关键设计:在设计中,采用了YOLO v11n-pose进行实时姿态检测,CLIP ViT-B/32用于语义编码,损失函数通过余弦相似度计算实现,确保了模型的高效性和准确性。具体参数设置和网络结构细节在实验部分进行了详细描述。
🖼️ 关键图片
📊 实验亮点
实验结果显示,该框架在CUHK Avenue、ShanghaiTech Campus和自定义室内数据集上实现了约51 FPS的实时处理速度,相较于多特征基线提升了3.36倍。同时,帧级AUROC值分别达到了89.26%、70.26%和84.13%,展现了良好的检测性能。
🎯 应用场景
该研究的潜在应用领域包括公共安全监控、智能交通系统和人机交互等。通过实时检测异常行为,可以有效提高安全性和响应速度,具有重要的实际价值和广泛的应用前景。未来,该技术还可扩展到更多复杂场景中,进一步提升智能监控系统的智能化水平。
📄 摘要(原文)
We propose a lightweight two-stage framework for real-time video anomaly detection. The first stage employs YOLO v11n-pose to detect persons and extract seventeen skeletal keypoints in a single forward pass. The second stage encodes each cropped person region through CLIP ViT-B/32 and computes cosine similarity against predefined textual descriptions of anomalous behaviors. This architecture eliminates the need for optical flow, standalone pose estimators, and density-based scoring modules. Experiments on CUHK Avenue, ShanghaiTech Campus, and a custom indoor dataset collected at Chulalongkorn University demonstrate an end-to-end throughput of approximately 51 FPS on an NVIDIA Titan XP GPU, a 3.36x speedup over the multi-feature baseline, while maintaining frame-level AUROC values of 89.26%, 70.26%, and 84.13%, respectively.