REFRAMED: Towards Realistic Audio Description Generation for Movies

📄 arXiv: 2608.09765v1 📥 PDF

作者: Igor Sterner, Mirella Lapata, Alex Lascarides, Frank Keller

分类: cs.CL, cs.CV

发布日期: 2026-08-10

备注: COLM 2026


💡 一句话要点

提出REFRAMED以解决电影音频描述生成的挑战

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 音频描述 视频理解 多模态学习 数据集构建 无障碍技术

📋 核心要点

  1. 现有的音频描述生成方法在内容和时机上过于依赖预设,导致任务简化为片段级字幕,无法有效捕捉叙事上下文。
  2. 本文提出REFRAMED数据集,支持模型共同决定描述内容及时机,推动音频描述生成的研究进展。
  3. 实验结果显示,尽管先进的AD系统在性能上优于基线,但仍未达到人类专家的水平,表明该领域仍有提升空间。

📝 摘要(中文)

音频描述(AD)是对视频中关键视觉内容的口头叙述,旨在为视障观众提供访问。与标准视频字幕不同,AD是一项结构化的编辑任务:描述必须插入对话的空白处,并仅传达理解叙事所需的信息。然而,现有方法在人工环境中生成AD,内容和时机均预先指定,降低了任务的复杂性。此外,它们依赖于嘈杂的转录和对齐管道,缺乏丰富的平行数据来建模叙事上下文。本文提出了一种新的AD生成形式,模型需共同决定描述内容及其时机。为此,我们推出了REFRAMED,一个包含2023个视频、3302个场景和206部电影的高质量数据集,提供专业的AD转录、字幕和对齐剧本。我们还提供了一个手动策划的挑战集,配对完整电影与多个AD参考,以及利用对话空白和多参考比较的评估协议。实验表明,尽管最先进的AD系统和多模态LLM超越了简单基线,但仍远未达到专家人类的表现。我们的数据集和基准为视频理解研究奠定了新基础。

🔬 方法详解

问题定义:本文旨在解决音频描述生成中的内容和时机预设问题,现有方法往往简化为片段级字幕,无法有效捕捉叙事的复杂性。

核心思路:提出一种新的AD生成形式,要求模型在生成过程中共同决定描述的内容和时机,以更好地反映叙事的动态变化。

技术框架:整体架构包括数据集构建、模型训练和评估三个主要阶段。数据集包含丰富的音频描述和对齐信息,模型通过多模态学习进行训练,评估则基于对话空白和多参考比较。

关键创新:REFRAMED数据集的构建是本研究的核心创新,提供了丰富的专业AD转录和多样化的评估标准,显著提升了AD生成的研究基础。

关键设计:在模型设计上,采用了多模态学习框架,结合了对话上下文和视觉信息,损失函数设计上注重对描述时机和内容的平衡,以提高生成质量。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,最先进的AD系统在REFRAMED数据集上表现优于简单基线,尽管仍未达到人类专家的表现,显示出该领域的研究潜力和提升空间。

🎯 应用场景

该研究的潜在应用领域包括电影、电视节目及其他视频内容的音频描述生成,能够为视障人士提供更好的观看体验。未来,该方法可扩展至其他多模态内容生成任务,推动无障碍技术的发展。

📄 摘要(原文)

Audio Description (AD) is a verbal narration of key visual content in videos, enabling access for visually impaired audiences. Unlike standard video captioning, AD is a structured editorial task: descriptions must be inserted into gaps in dialogue and must convey only what is needed to understand the narrative being told. However, existing approaches formulate AD generation in an artificial setting where both the content and timing of descriptions are pre-specified, reducing the task to clip-level captioning. They further rely on noisy transcription and alignment pipelines, and lack the rich parallel data required for modeling narrative context. We introduce a new formulation of AD generation in which models must jointly decide what to describe and when to do it. To support this, we present REFRAMED, a high-quality dataset of 2,023 videos that span 3,302 scenes from 206 movies, with professional AD transcripts (both American and British versions), professional subtitles and aligned screenplays. We also provide a manually curated challenge set that pairs full movies with multiple AD references, together with evaluation protocols that leverage dialogue gaps and multi-reference comparisons. Experiments with state-of-the-art AD systems and multimodal LLMs show that they outperform trivial baselines but fall far short of expert human performance. Our dataset and benchmark establish a new foundation for research on video understanding.