UniTraffic-Agent: Unified Traffic Video Reasoning for AI City Challenge 2026 Track 3 with Two Out-of-Domain Evaluations

📄 arXiv: 2608.13031v1 📥 PDF

作者: Peng Li, Qianqian Xu, Shilong Bao, Yangbangyan Jiang, Qingming Huang

分类: cs.CV, cs.AI

发布日期: 2026-08-13

备注: This paper has been accepted to ECCV 2026 AI City Challenge Workshop

🔗 代码/项目: GITHUB


💡 一句话要点

提出UniTraffic-Agent以解决交通视频理解问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 交通视频理解 多模态大语言模型 交通异常推理 行人意图推理 智能交通系统

📋 核心要点

  1. 现有方法在处理交通视频时面临稀疏事件和多视角的问题,导致理解和推理的困难。
  2. UniTraffic-Agent通过观察-推理-行动-验证的工作流程,整合多模态信息以提升交通事件理解能力。
  3. 在官方公共排行榜上,MR-CAS在TAR、FETV和PSI-VQA任务中分别取得了第16、2和4名的优异成绩。

📝 摘要(中文)

交通视频理解已成为智能交通中的重要问题,因为道路视频为事故、违规行为及车辆与脆弱道路使用者之间的互动提供了直接证据。一个有效的系统应能够解释交通事件的发展过程、发生原因及相关互动的时间,但由于交通视频包含稀疏事件和多样视角,这对多模态大语言模型(MLLMs)仍然是一个挑战。本文介绍了UniTraffic-Agent,这是第十届AI City Challenge第三轨道的MR-CAS解决方案,包含交通异常推理(TAR)和两个域外评估:鱼眼交通事件(FETV)和行人意图推理(PSI-VQA)。UniTraffic-Agent遵循观察-推理-行动-验证的工作流程,能够在一次请求中对同一视频片段的所有问题进行推理,并通过特定任务的动作适配器转换响应。

🔬 方法详解

问题定义:本文旨在解决交通视频理解中的稀疏事件和多视角带来的挑战,现有的多模态大语言模型在此方面表现不佳,难以有效推理交通事件的动态发展。

核心思路:UniTraffic-Agent采用观察-推理-行动-验证的工作流程,通过对时间戳视觉证据的采样,能够在一次请求中对同一片段的所有问题进行推理,从而提高效率和准确性。

技术框架:系统主要包括观察模块、推理模块、行动模块和验证模块。观察模块负责采集视频片段,推理模块进行事件分析,行动模块执行特定任务,验证模块则确保结果的准确性。

关键创新:UniTraffic-Agent的核心创新在于其整合了多模态信息处理能力,并通过任务特定的动作适配器实现了高效的响应转换,这与传统方法的逐个问题处理方式有本质区别。

关键设计:在设计中,UniTraffic-Agent使用了优化的损失函数以提高推理精度,并采用了适应性网络结构以支持多种任务的灵活处理。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

在实验中,UniTraffic-Agent在交通异常推理(TAR)任务中获得了0.5780的得分,排名第16;在鱼眼交通事件(FETV)任务中以0.4884的得分排名第2;在行人意图推理(PSI-VQA)任务中以64.4161的得分排名第4,显示出显著的性能提升。

🎯 应用场景

该研究的潜在应用领域包括智能交通监控、事故分析和交通管理系统。通过提升交通视频理解能力,UniTraffic-Agent能够为交通安全提供更为精准的决策支持,进而减少交通事故的发生,提升城市交通的整体效率。

📄 摘要(原文)

Traffic video understanding has become an important problem in intelligent transportation, as road videos provide direct evidence for accidents, violations, and interactions between vehicles and vulnerable road users. A useful system should explain how a traffic event develops, why it happens, and when the relevant interaction occurs, yet this remains difficult for multimodal large language models (MLLMs) because traffic videos contain sparse events and varied viewpoints. We introduce UniTraffic-Agent, the MR-CAS solution for Track~3 of the 10th AI City Challenge, which includes Traffic Anomaly Reasoning (TAR) and two out-of-domain evaluations: FETV for fisheye traffic events and PSI-VQA for pedestrian intention reasoning. UniTraffic-Agent follows an observe--reason--act--verify workflow that samples timestamped visual evidence, reasons over all questions from the same clip in one request, and converts responses through task-specific action adapters. On the official Public leaderboards, MR-CAS ranks 16th on TAR with a score of 0.5780, 2nd on FETV with 0.4884, and 4th on PSI-VQA with 64.4161. The code is available at https://github.com/Roclp/UniTraffic-Agent.