Heterogeneous Vision-Language Ensemble with Disagreement-Aware Reranking for Text-Based Person Anomaly Retrieval

📄 arXiv: 2608.12843v1 📥 PDF

作者: Huu-An Vu, Cam Tu Tran Thi, Thanh Toan Le Ngo, Hoang Vo, Do Trung Hieu, Hieu Dinh Trung Pham, Khang Minh Le, Huy Minh Nhat Nguyen

分类: cs.CV, cs.AI

发布日期: 2026-08-13

备注: Accepted at the ECCV 2026 Workshop


💡 一句话要点

提出异构视觉-语言集成方法以解决基于文本的人体异常检索问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 基于文本检索 异常行为识别 跨模态匹配 视觉-语言模型 多模态推理

📋 核心要点

  1. 核心问题:现有方法在处理复杂的行人异常行为时,缺乏有效的跨模态匹配能力,导致检索性能不足。
  2. 方法要点:提出了一种异构视觉-语言嵌入模型的集成方法,通过评分对齐和迭代融合来增强检索效果。
  3. 实验或效果:在PAB基准上取得了90.92%的mAP和高达98.68%的Recall@10,显著提升了检索性能。

📝 摘要(中文)

基于文本的人体异常检索旨在通过自然语言描述从大型图像库中检索出表现异常行为的行人。与传统的基于文本的人体检索相比,该任务需要对行人的外观、行为、物体交互和场景上下文进行细致的推理,从而使得跨模态匹配变得更加困难。本文提出了GENAI4E团队在AI City Challenge 2026 Track 4中的解决方案。我们的框架基于强大的检索骨干,通过评分对齐和迭代集成融合逐步整合异构视觉-语言嵌入模型,随后针对模糊查询进行基于分歧的视觉-语言模型重排序。在官方的行人异常行为(PAB)基准上,我们的方法达到了90.92%的mAP,85.13%的Recall@1,97.72%的Recall@5和98.68%的Recall@10,展示了结合互补的视觉-语言表示与选择性多模态推理在大规模基于文本的人体异常检索中的有效性。

🔬 方法详解

问题定义:本文旨在解决基于文本的人体异常检索问题,现有方法在处理行人外观、行为和场景上下文时存在匹配困难,导致检索效果不佳。

核心思路:论文提出通过异构视觉-语言嵌入模型的集成来增强检索能力,利用评分对齐和迭代融合的方式来提升模型的鲁棒性和准确性。

技术框架:整体架构包括一个强大的检索骨干,随后通过异构模型的集成和重排序模块来处理模糊查询,确保最终输出的检索结果更加准确。

关键创新:最重要的技术创新在于引入了分歧感知的重排序机制,能够有效处理模糊查询,提升检索的精确度和召回率。

关键设计:在模型设计中,采用了多种视觉-语言嵌入模型,并通过特定的损失函数和参数设置来优化模型性能,确保在大规模数据集上的有效性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,提出的方法在官方PAB基准上取得了90.92%的mAP,85.13%的Recall@1,97.72%的Recall@5和98.68%的Recall@10,明显优于现有基线,展示了方法的有效性和优越性。

🎯 应用场景

该研究的潜在应用领域包括智能监控、公共安全和交通管理等场景,能够帮助相关部门快速识别和处理异常行为,提升社会安全性。未来,该方法也可扩展到其他领域,如智能城市建设和人机交互等,具有重要的实际价值。

📄 摘要(原文)

Text-based person anomaly retrieval aims to retrieve pedestrians exhibiting anomalous behaviors from a large image gallery using natural language descriptions. Compared with conventional text-based person retrieval, this task requires fine-grained reasoning over pedestrian appearance, behaviors, object interactions, and scene context, making robust cross-modal matching significantly more challenging. This paper presents the GENAI4E team's solution to AI City Challenge 2026 Track 4. Our framework builds upon a strong retrieval backbone and progressively integrates heterogeneous vision-language embedding models through score alignment and iterative ensemble fusion, followed by disagreement-aware VLM reranking for ambiguous queries. On the official Pedestrian Anomaly Behavior (PAB) benchmark, our approach achieves 90.92% mAP, 85.13% Recall@1, 97.72% Recall@5, and 98.68% Recall@10, demonstrating the effectiveness of combining complementary vision-language representations with selective multimodal reasoning for large-scale text-based person anomaly retrieval.