Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

📄 arXiv: 2608.09435v1 📥 PDF

作者: Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

分类: cs.AI

发布日期: 2026-08-10


💡 一句话要点

提出ST-Omni-R1以解决动态声音源理解问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱七:动作重定向 (Motion Retargeting) 支柱八:物理动画 (Physics-based Animation)

关键词: 动态声音源 多模态学习 时空推理 音频视觉融合 问答系统

📋 核心要点

  1. 现有的音频语言模型无法有效处理动态声音源的定位和跟踪,缺乏必要的空间音频线索。
  2. 本文提出ST-Omni-R1,通过结合FOA-derived语义和轨迹表示与全景视觉信息,解决了动态声音源理解的问题。
  3. ST-Omni-R1在四个能力层级上实现了77.83%的平均语义准确率,显著优于最佳基线的37.28%。

📝 摘要(中文)

理解动态声音源需要联合确定声音的产生者、位置及其随时间的运动。然而,现有的音频语言模型通常将片段表示为全局声学事件,而视觉语言模型缺乏定位和跟踪单个声源所需的空间音频线索。为评估这一缺失能力,本文引入了ST-OmniQA,这是一个基于全景视频和同步的第一阶Ambisonics音频构建的时空音频视觉问答基准。该基准包含40K视频和400K问答对,涵盖声音事件识别、到达方向、声源距离、运动轨迹和时间基础的音频视觉推理等四个能力层级。基于此基准,本文提出了ST-Omni-R1,集成了基于FOA的语义和轨迹表示与全景视觉上下文,并通过渐进式课程学习和推理树强化学习进行训练。ST-Omni-R1在四个层级上实现了77.83%的平均语义准确率,相比之下,最佳基线的准确率为37.28%。在三个公共空间音频基准上的结果进一步表明,其学习的空间和运动表示超越了ST-OmniQA。

🔬 方法详解

问题定义:本文旨在解决动态声音源的理解问题,现有方法在声音源定位和跟踪方面存在不足,无法有效利用空间音频信息。

核心思路:论文的核心思路是通过结合第一阶Ambisonics音频和全景视觉信息,构建一个多模态模型ST-Omni-R1,以实现更准确的声音源识别和运动轨迹推理。

技术框架:整体架构包括数据预处理、特征提取、模型训练和评估四个主要模块。数据预处理阶段将全景视频和FOA音频同步,特征提取阶段提取音频和视觉特征,模型训练阶段采用渐进式课程学习和推理树强化学习。

关键创新:最重要的技术创新在于ST-Omni-R1模型的设计,它有效整合了音频和视觉信息,提升了动态声音源的理解能力,与传统模型相比,能够更好地处理时空信息。

关键设计:在模型设计中,采用了特定的损失函数以优化音频和视觉特征的联合表示,同时使用了多层次的网络结构以增强模型的表达能力。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

ST-Omni-R1在四个能力层级上达到了77.83%的平均语义准确率,相较于最佳基线的37.28%有显著提升。此外,在三个公共空间音频基准上的表现也表明其学习的空间和运动表示具有良好的迁移能力。

🎯 应用场景

该研究在动态声音源理解方面具有广泛的应用潜力,尤其在智能监控、自动驾驶、虚拟现实和增强现实等领域。通过提升声音源定位和跟踪的能力,可以增强用户体验和系统的智能化水平,未来可能推动多模态交互技术的发展。

📄 摘要(原文)

Understanding dynamic sound sources requires jointly determining what produces a sound, where the source is located, and how it moves over time. Yet existing audio-language models often represent clips as global acoustic events, while vision-language models lack the spatial audio cues needed to localize and track individual sources. To evaluate this missing capability, we introduce ST-OmniQA, a spatio-temporal audio-visual question-answering benchmark built from panoramic videos paired with synchronized first-order Ambisonics (FOA) audio of moving sound sources. It contains 40K videos and 400K question-answer pairs organized into four capability levels covering sound-event recognition, direction of arrival, source distance, motion trajectories, and temporally grounded audio-visual reasoning. Building on this benchmark, we propose ST-Omni-R1, which integrates FOA-derived semantic and trajectory representations with panoramic visual context and is trained through progressive curriculum learning and reasoning-tree reinforcement learning. ST-Omni-R1 achieves 77.83\% average semantic accuracy across the four levels, compared with 37.28\% for the best evaluated baseline. Results on three public spatial-audio benchmarks further indicate that its learned spatial and motion representations transfer beyond ST-OmniQA.