TAU-Agent: An Agentic Retrieval-Augmented Framework for Traffic Anomaly Understanding
作者: Yuqiang Lin, Yan Shi, Sam Lockyer, Harish Tayyar Madabushi, Adrian Evans, Wenbin Li, Yinhai Wang, Nic Zhang
分类: cs.CV, cs.AI
发布日期: 2026-08-26
🔗 代码/项目: GITHUB
💡 一句话要点
提出TAU-Agent以解决交通异常理解问题
🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)
关键词: 交通异常理解 视频分析 多模态融合 检索增强 视觉-语言模型
📋 核心要点
- 现有方法在交通视频中检测和解释异常事件时面临挑战,尤其是在复杂场景和多样化事件的情况下。
- TAU-Agent通过中心检索代理协调视频字幕和开放词汇跟踪工具,增强了对交通异常的理解能力。
- 在AI City Challenge 2026中,TAU-Agent在多个任务上表现优异,显示出其在交通异常理解中的有效性。
📝 摘要(中文)
交通异常理解(TAU)需要模型和系统在交通视频中检测、推理和解释异常事件。为了解决这一挑战,本文提出了TAU-Agent,一个基于代理的检索增强框架。该框架通过中心检索代理协调两个视觉感知工具,即视频字幕工具和开放词汇跟踪工具,以检索和选择与查询相关的证据,包括字幕、时间间隔和物体轨迹。所选证据与采样的视频帧和输入查询一起提供给经过监督微调的视觉-语言模型,以进行最终推理和答案生成。我们在AI City Challenge 2026的领域内和领域外基准上评估了TAU-Agent,取得了Track 3得分0.6779、Track 7得分0.3998和Track 8得分67.9275,分别排名第二、第十二和第五。
🔬 方法详解
问题定义:本文旨在解决交通视频中异常事件的检测与理解问题。现有方法在处理复杂场景和多样化事件时存在局限性,难以有效推理和解释异常情况。
核心思路:TAU-Agent的核心思路是通过一个中心检索代理来协调多个视觉感知工具,以增强对交通异常的理解。通过检索与查询相关的证据,系统能够更好地推理和生成答案。
技术框架:TAU-Agent的整体架构包括三个主要模块:中心检索代理、视频字幕工具和开放词汇跟踪工具。中心代理负责协调这两个工具,检索相关证据,并将其与输入查询和视频帧结合,最终输入到视觉-语言模型中进行推理。
关键创新:TAU-Agent的主要创新在于其代理驱动的检索增强机制,能够有效整合多种视觉信息,提升了对交通异常事件的理解能力。这一设计与传统方法的单一模型处理方式形成鲜明对比。
关键设计:在技术细节上,TAU-Agent采用了监督微调的视觉-语言模型,并在证据选择和检索过程中引入了特定的参数设置,以优化模型性能。
🖼️ 关键图片
📊 实验亮点
在AI City Challenge 2026中,TAU-Agent在Track 3、Track 7和Track 8的得分分别为0.6779、0.3998和67.9275,分别排名第二、第十二和第五,显示出其在交通异常理解任务中的优越性能。
🎯 应用场景
该研究的潜在应用领域包括智能交通系统、自动驾驶车辆和城市交通管理等。通过提升交通异常事件的理解能力,TAU-Agent能够帮助相关系统更好地应对突发事件,提高交通安全和效率,具有重要的实际价值和未来影响。
📄 摘要(原文)
Traffic Anomaly Understanding (TAU) requires models and systems to detect, reason about, and explain anomalous events in transportation videos. To address this challenge, we propose TAU-Agent, an agentic retrieval-augmented framework for traffic anomaly understanding. Given a task query, a central retrieval agent orchestrates two visual perception tools, namely a Video Captioning Tool and an Open-Vocabulary Tracking Tool, to retrieve and select query-relevant evidence, including captions, temporal intervals, and object trajectories. The selected evidence, together with sampled video frames and the input query, is provided to a supervised fine-tuned vision-language model for final reasoning and answer generation. We evaluate TAU-Agent on both the in-domain and the out-of-domain benchmarks from the AI City Challenge 2026. TAU-Agent achieves scores of 0.6779 on Track 3, 0.3998 on Track 7, and 67.9275 on Track 8, ranking second, twelfth, and fifth, respectively. Code is available at: https://github.com/siri-rouser/TAU-Agent.