PL-NBA: A Possession-level Universal Basketball Video Dataset Supporting Multiple Visual Understanding Tasks

📄 arXiv: 2608.19646v1 📥 PDF

作者: Yunhao Zhao, Haoying Sun, Jiarui Li, Zhuming Wang, Ya Jing, Xiangbo Shu, Lifang Wu, Changwen Chen

分类: cs.CV

发布日期: 2026-08-20


💡 一句话要点

提出PL-NBA数据集以解决篮球视频理解中的时序连续性问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 篮球视频理解 时序事件分析 多任务学习 数据集构建 动作预测 事件识别 视频字幕生成

📋 核心要点

  1. 现有篮球视频数据集无法保留比赛事件的时序连续性,限制了复杂任务的支持。
  2. 本文提出PL-NBA数据集,通过完整的NBA进攻回合构建样本,解决了现有数据集的不足。
  3. 实验结果表明,现有方法在事件识别、视频字幕生成等任务上表现有限,PL-NBA提供了新的挑战基准。

📝 摘要(中文)

近年来,体育视觉理解已成为计算机视觉的热门话题。现有的篮球视频数据集多采用单一动作或活动作为样本,无法保留比赛事件的时序连续性,也不支持复杂任务如动作预测。为了解决这一问题,本文构建了第一个基于回合的篮球视频数据集PL-NBA,每个样本由完整的NBA进攻回合组成。该数据集从60场NBA比赛中收集,包含11,000个有效的进攻回合片段和31,567个带有球员姓名、标题、事件类型和时间戳的注释事件。每个视频片段包含多个事件,保留了事件的连续性,有助于战术分析。实验在多个视觉理解任务上进行,包括事件识别、视频字幕生成、时序动作定位和动作预测,结果显示现有方法在这四个任务上的表现有限,表明PL-NBA是体育视频理解的一个具有挑战性的基准。

🔬 方法详解

问题定义:现有篮球视频数据集多采用单一动作或活动作为样本,无法保留比赛事件的时序连续性,限制了对复杂任务的支持,如动作预测和战术分析。

核心思路:本文提出PL-NBA数据集,通过构建完整的NBA进攻回合样本,保留事件的连续性,支持多种视觉理解任务,旨在填补现有数据集的不足。

技术框架:PL-NBA数据集由11,000个有效的进攻回合片段组成,包含31,567个注释事件。数据集的构建过程包括数据收集、事件标注和样本生成等多个阶段。

关键创新:PL-NBA是第一个基于回合的篮球视频数据集,能够同时支持事件识别、视频字幕生成、时序动作定位和动作预测等多种任务,具有较高的挑战性。

关键设计:数据集中每个视频片段包含多个事件,注释包括球员姓名、事件类型和时间戳等信息,确保了数据的丰富性和实用性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,现有方法在PL-NBA数据集上的表现有限,尤其在事件识别和动作预测任务中,性能提升幅度不明显,强调了该数据集作为新基准的重要性。

🎯 应用场景

PL-NBA数据集的构建为篮球视频分析提供了新的数据基础,能够广泛应用于体育分析、智能裁判系统和运动员表现评估等领域。未来,该数据集有望推动体育视觉理解的研究进展,促进相关技术的应用与发展。

📄 摘要(原文)

Visual understanding in sports has emerged as a hot topic in computer vision in recent years. Most existing basketball video datasets adopt single action or activity as sample, which can neither preserve the temporal continuity of game events nor support complex tasks such as action anticipation. To address this issue, this paper constructs the first possession-level basketball video dataset (PL-NBA), in which each sample is composed of a complete NBA offensive possession. Collected from 60 NBA games, PL-NBA contains 11,000 valid offensive possession clips and 31,567 annotated events with player names, captions, event types and timestamps. Each video clip includes multiple events and preserves the continuity of events, which is helpful for analysis of tactic. Experiment is conducted on multiple visual understanding tasks, including event recognition, video captioning, temporal action localization and action anticipation. Experimental results show that existing methods achieve limited performance on above four tasks, demonstrating that PL-NBA is a challenging benchmark for sports video understanding.