The Role of Natural Language Understanding in Multimodal Video-Based Dengue Diagnosis
作者: Danial Sharifrazi, Saadat Behzadi, Julakha Jahan Jui, Mojtaba Mohammadi, Nouman Javed, Roohallah Alizadehsani, Prasad N. Paradkar, Asim Bhatti
分类: cs.AI, cs.CV
发布日期: 2026-08-13
💡 一句话要点
提出基于YOLO和CLIP的多模态框架以解决登革热病毒蚊子检测问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 多模态学习 视觉-语言模型 YOLO CLIP 登革热病毒 蚊子行为分析 对比学习
📋 核心要点
- 现有方法在检测蚊子感染行为时面临挑战,主要由于蚊子体型小、移动不规律以及环境因素的干扰。
- 本文提出了一种YOLO和CLIP结合的框架,通过对视频帧进行特征提取和文本提示对齐,实现了高效的分类。
- 实验结果显示,模型在帧级别上取得了98.54%的准确率和99.91%的灵敏度,展示了良好的性能提升。
📝 摘要(中文)
检测蚊子感染相关行为变化的挑战在于其体型小、移动迅速且受环境因素影响,导致特征提取困难。本文提出了一种基于YOLO和对比语言-图像预训练(CLIP)的视觉-语言框架,用于分类未感染和登革热病毒2型(DENV2)感染蚊子的飞行视频帧。首先,使用YOLO从背景中分离蚊子区域。然后,将从视频帧提取的视觉特征与生物学上有意义的文本提示在共享嵌入空间中对齐。通过监督双向对比学习对多模态模型进行微调,并通过基于帧级图像-文本相似性的分类进行评估。结果表明,该方法在帧级别上达到了98.54%的准确率和99.91%的灵敏度。
🔬 方法详解
问题定义:本文旨在解决从视频数据中检测蚊子感染相关行为变化的具体问题。现有方法在特征提取时受到蚊子体型小、移动迅速和环境因素影响,导致准确性不足。
核心思路:论文提出的核心思路是结合YOLO和CLIP,通过对蚊子区域的精确分离和视觉特征与文本提示的对齐,提升分类效果。这样的设计能够有效利用多模态信息,增强模型的理解能力。
技术框架:整体架构包括两个主要模块:首先使用YOLO进行蚊子区域的检测与分离,其次通过CLIP对提取的视觉特征与文本提示进行对齐。模型通过监督双向对比学习进行微调,并通过帧级图像-文本相似性进行分类评估。
关键创新:最重要的技术创新在于将YOLO与CLIP结合,形成一个多模态框架,能够在生物行为分析中提供更高的准确性和灵敏度。这种方法与传统的单一视觉模型相比,能够更好地处理复杂的背景和环境变化。
关键设计:在模型设计中,采用了双向对比学习作为损失函数,以增强图像与文本之间的语义对齐。同时,CLIP的预训练表示在特征提取中发挥了重要作用,确保了模型在特定领域的有效性。实验中还进行了消融实验,验证了微调和CLIP表示的重要性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,所提出的方法在帧级别上达到了98.54%的准确率和99.91%的灵敏度,显示出显著的性能提升。与传统视觉模型相比,采用多模态框架的分类效果更为优越,尤其在处理复杂背景时表现突出。
🎯 应用场景
该研究的潜在应用领域包括公共卫生监测、疾病传播预测和生态环境研究。通过准确识别感染蚊子的行为变化,可以为登革热等疾病的防控提供重要数据支持,进而提高公共卫生管理的效率和效果。未来,该框架还可扩展到其他病媒生物的监测与分析中,具有广泛的实际价值。
📄 摘要(原文)
Detecting infection-related behavioral changes in mosquitoes from video data is challenging because mosquitoes are small, move rapidly and irregularly, and are affected by environmental factors such as background, lighting, and shadows, which can make reliable feature extraction difficult. In this study, a YOLO- and Contrastive Language-Image Pre-training (CLIP)-based vision-language framework is proposed to classify mosquito flight frames of uninfected and Dengue virus serotype 2 (DENV2)-infected mosquitoes. First, YOLO is used to isolate mosquito regions from the background. Then, visual features extracted from video frames are aligned with biologically meaningful textual prompts in a shared embedding space. The multimodal model was fine-tuned using supervised bidirectional contrastive learning and evaluated through frame-level image-text similarity-based classification. The results show that the proposed method achieved 98.54% accuracy and 99.91% sensitivity at the frame level. After temporal aggregation of frame-level information, the model achieved complete video-level performance. The ablation results showed that fine-tuning and CLIP-based representations were essential for this domain, while the textual branch provided semantic image-text alignment rather than an accuracy advantage over the vision-only model. These findings suggest that vision-language models can provide a useful framework for analyzing infection-related biological behaviors from video data.