Video2Track: From Real-World Interaction Videos to Steerable Adversarial Closed-Track Testing for Automated Driving Systems

📄 arXiv: 2608.11592v1 📥 PDF

作者: Mengjie Tian, Xinrui Zhang, Tianyu Li, Peizhi Zhang, Guirong Zhou, Haojie Feng, Junpeng Huang, Qixiang Zhang, Lu Xiong

分类: cs.RO

发布日期: 2026-08-12


💡 一句话要点

提出Video2Track以解决自动驾驶系统闭环测试的复杂性问题

🎯 匹配领域: 支柱三:空间感知与语义 (Perception & Semantics)

关键词: 自动驾驶 闭环测试 场景语义映射 对抗性测试 多代理轨迹 Stackelberg博弈 视觉-语言模型 条件扩散模型

📋 核心要点

  1. 现有的闭环测试方法依赖于标准化协议,导致交互场景过于脚本化,难以模拟真实交通复杂性。
  2. 提出的Video2Track框架通过视频提取真实互动场景,并生成可操控的对抗性测试,增强了测试的多样性和真实性。
  3. 实验结果显示,该框架能够有效再现真实场景,并生成具有可控风险和交互风格的场景变体,提升了验证的有效性。

📝 摘要(中文)

闭环测试在自动驾驶系统(ADS)的验证和确认中起着基础性作用,尤其是在安全关键场景中,通过在受控条件下进行可重复评估。然而,现有方法大多依赖于标准化协议或预定义轨迹,导致交互过于脚本化,难以重现公共道路交通的自然复杂性。为了解决这一局限性,本文提出了Video2Track框架,将真实世界的互动驾驶场景从视频转化为可操控的对抗性闭环测试。该框架由两个紧密耦合的模块组成:场景语义映射模块和动态互动测试模块。闭环实验表明,该框架能够真实再现代表性的现实世界互动场景,并生成可执行的场景变体,提供可控的风险水平和交互风格,为现实和可操控的ADS验证提供了可扩展的方法。

🔬 方法详解

问题定义:本文旨在解决现有闭环测试方法在模拟真实交通复杂性方面的不足,现有方法往往依赖于预定义轨迹,无法有效重现自然交互场景。

核心思路:提出的Video2Track框架通过将真实世界的互动驾驶场景从视频中提取,并转化为可操控的对抗性测试,旨在提供更真实的测试环境。

技术框架:框架包含两个主要模块:场景语义映射模块和动态互动测试模块。前者通过视觉-语言模型从视频中提取结构化语义,并与闭环拓扑库进行匹配;后者基于提取的拓扑和交互锚点生成多样化的多代理轨迹。

关键创新:最重要的创新在于通过结合视觉-语言模型和条件扩散模型,实现了对真实场景的高保真再现,并通过Stackelberg博弈调节交互强度,提供了可控的测试环境。

关键设计:在动态互动测试模块中,采用了参数化的对抗目标来调节交互强度,确保生成的轨迹在多样性和安全性之间取得平衡。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,Video2Track能够有效再现真实世界的互动场景,并生成具有可控风险水平的场景变体。与传统方法相比,该框架在多样性和真实性上有显著提升,能够生成多达50种不同的交互风格,极大地丰富了测试场景的复杂性。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶系统的验证与确认,尤其是在复杂交通场景下的安全性测试。通过提供可控的测试环境,Video2Track可以帮助开发者更好地评估和优化自动驾驶算法,提升系统的安全性和可靠性。未来,该框架有望扩展到其他领域,如智能交通系统和机器人交互测试。

📄 摘要(原文)

Closed-track testing plays a fundamental role in the verification and validation of automated driving systems (ADS), particularly for safety-critical scenarios, by enabling reproducible evaluation under controlled conditions. However, most existing approaches still rely on standardized protocols or predefined trajectories, leading to overly scripted interactions and limited ability to reproduce the natural complexity of public-road traffic. To address this limitation, we propose Video2Track, a framework that transfers real-world interactive driving scenarios from videos into steerable adversarial closed-track testing. The framework consists of two tightly coupled modules. The first is a scenario semantic mapping module, which extracts structured semantics from driving videos using a vision-language model and grounds them onto a closed-track topology library via retrieval-augmented generation, thereby identifying compatible map segments and interaction anchors. The second is a dynamic interactive testing module, which conditions on the grounded topology and anchors to generate diverse multi-agent trajectories through a conditional diffusion model, while regulating interaction intensity via a Stackelberg game with a parameterized adversarial objective. Closed-track experiments demonstrate that the proposed framework can faithfully reproduce representative real-world interaction scenarios and generate executable scenario variants with controllable risk levels and interaction styles, providing a scalable approach for realistic and steerable ADS validation.