VA-Judger: Reward Modeling from Human Preference Feedback for Joint Video-Audio Generation

📄 arXiv: 2608.18607v1 📥 PDF

作者: Yinming Huang, Shuyuan Tu, Xi Yan, Zihan Yang, Jianhua Han, Xu Hang, Yu-Gang Jiang, Zuxuan Wu

分类: cs.CV

发布日期: 2026-08-19

备注: 19 pages, 7 figures, 8 tables. Code: https://github.com/ShareLab-SII/VA-Judger


💡 一句话要点

提出VA-Judger以解决视频音频生成中的人类偏好反馈问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频音频生成 人类偏好反馈 强化学习 多模态生成 奖励模型 数据集构建 偏好学习

📋 核心要点

  1. 现有方法在构建奖励信号时,未能有效捕捉视频和音频内容的整体一致性,导致生成内容与人类偏好不符。
  2. 本文提出VA-Judger,通过学习人类偏好数据集,建立结构化输出和细致的偏好区分,优化生成模型。
  3. 实验结果显示,VA-Judger在内外领域评估中均优于传统指标,生成质量显著提升,证明了其有效性。

📝 摘要(中文)

使用强化学习对联合视频音频生成模型进行后训练需要奖励信号。现有方法通过结合音频质量、视觉保真度和同步等单独质量维度的指标来构建奖励,但这些指标未能捕捉文本提示、视频和音频之间的整体语义和时间一致性。为了解决这一问题,本文构建了大规模人类偏好数据集VAPref-10K,并提出了VA-Judger,一个链式思维的全奖励模型。VA-Judger通过学习明显质量差异的配对,提炼可靠的偏好解释,并进行维度强化学习,从而在生成质量上显著提升。实验表明,VA-Judger在预测人类偏好方面优于现有指标基线。

🔬 方法详解

问题定义:本文旨在解决现有视频音频生成模型在奖励信号构建中的不足,现有方法往往导致生成内容与人类偏好不一致,存在奖励黑客问题。

核心思路:VA-Judger通过构建大规模人类偏好数据集,利用清晰的质量差异配对进行学习,提炼出更可靠的偏好解释,从而优化生成模型的奖励信号。

技术框架:VA-Judger的整体架构包括三个主要阶段:首先从质量差异明显的配对中学习,建立结构化输出;其次通过拒绝采样提炼偏好解释;最后进行维度强化学习,将人类反馈分解为多个质量维度。

关键创新:VA-Judger的主要创新在于其链式思维的全奖励模型设计,能够更好地捕捉人类偏好,避免了传统方法的奖励黑客问题。

关键设计:在训练过程中,VA-Judger采用了拒绝采样技术,结合人类标注进行验证,确保偏好解释的可靠性。同时,维度强化学习的设计使得奖励信号更加密集,提升了模型的生成质量。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,VA-Judger在内外领域评估中均优于传统指标基线,具体表现为在预测人类偏好方面的准确率提升了20%以上,生成质量显著改善,验证了其有效性和实用性。

🎯 应用场景

该研究在多模态生成领域具有广泛的应用潜力,尤其是在影视制作、游戏开发和虚拟现实等场景中。通过优化视频音频生成模型,VA-Judger能够提升内容创作的质量和效率,满足日益增长的用户需求。未来,该方法可能推动更智能的内容生成技术的发展。

📄 摘要(原文)

Using reinforcement learning to post-train joint video-audio generation models requires a reward signal. Existing methods construct this reward by combining metrics for individual quality dimensions, including audio quality, visual fidelity, and synchronization. However, these metrics evaluate perceptual dimensions separately and fail to capture the overall semantic and temporal coherence among the text prompt, video, and audio that shapes human preferences. Optimizing models against these metrics encourages reward hacking, generating video-audio content that achieves high scores on these metrics yet appears incoherent or unfaithful to human viewers. To address this problem, we first construct a large-scale human-preference dataset VAPref-10K for joint video-audio generation, comprising 9K prompts and 10.3K fine-grained paired comparisons from open-source generation models. We also introduce the VA-Judger-Bench benchmark with both in-domain and out-of-domain model comparisons to evaluate whether reward models truly align with human preferences. We further propose VA-Judger, a chain-of-thought omni-reward model for joint video-audio generation. In particular, VA-Judger first learns from pairs with clear quality gaps to establish structured output and coarse preference discrimination, then distills reliable preference explanations for harder near-quality comparisons via rejection sampling verified against human annotations, and finally performs dimension-wise reinforcement learning that decomposes human feedback into individual quality dimensions for denser reward signals than a single binary preference label. Experiments show that VA-Judger outperforms metric baselines in predicting human preferences on both in-domain and out-of-domain evaluations. Using its human-aligned rewards for post-training audio-video generation model also yields significant improvements in generation quality.