PhoenixNest-Video: Evidence-Grounded Multimodal Agent Framework for Automated Video Interview Assessment

📄 arXiv: 2609.02231v1 📥 PDF

作者: Fan Yuxuan, Huang Miaojun, Zhang Haimei, Wu Jingshen, Liu Hao

分类: cs.AI

发布日期: 2026-09-02

备注: Accepted by EMNLP 2026


💡 一句话要点

提出PhoenixNest-Video框架以解决视频面试评估的自动化问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 视频面试评估 多模态学习 强化学习 语义视频图 自动化评估

📋 核心要点

  1. 现有面试评估方法在处理大量申请者时,人工评估成本高且结果不一致,AI方法缺乏透明性和可追溯性。
  2. 本文提出的PhoenixNest-Video框架通过构建语义视频图和跨模态验证,实现了基于证据的自动化评估。
  3. 实验结果显示,PhoenixNest-Video在VInterview-2025数据集上达到了91.50%的准确率,优于更大规模的模型,且评分与专家小组一致性更高。

📝 摘要(中文)

面试评估需要基于行为证据进行逐项判断,但申请者数量激增使得人工评估成本高且不一致,现有AI方法则提供不透明的评分且缺乏可追溯的理由。本文提出了PhoenixNest-Video,一个基于证据的多模态代理框架,用于自动化视频面试评估。该框架构建了一个语义视频图作为结构化工作记忆,通过跨模态验证进行基于评分标准的检索,并生成与候选人材料相锚定的逐项评分。通过基于评分标准的强化学习训练的评分器,内部化了多级评分标准的判别结构。PhoenixNest-Video在VInterview-2025上达到了91.50%的等级准确率,显著超越了更大规模的专有模型。

🔬 方法详解

问题定义:本文旨在解决视频面试评估中的人工成本高、结果不一致以及现有AI方法缺乏透明性的问题。现有方法往往无法提供可追溯的评分依据,导致评估结果的可信度降低。

核心思路:PhoenixNest-Video框架的核心思想是通过构建语义视频图和跨模态验证,结合多模态信息(视觉、音频、文本)进行证据基础的评估,从而提高评分的准确性和透明度。

技术框架:该框架包括几个主要模块:首先构建语义视频图作为结构化工作记忆;其次进行基于评分标准的检索,结合视觉、音频和文本流进行跨模态验证;最后生成与候选人材料相锚定的逐项评分。

关键创新:最重要的创新点在于引入了基于评分标准的强化学习训练的评分器,该评分器通过双重奖励机制实现了评分标准的对齐和分数级别的区分,内部化了多级评分标准的判别结构。

关键设计:在设计上,采用了特定的损失函数来优化评分器的性能,并通过强化学习策略调整评分器的参数设置,以确保其在多模态信息融合时的有效性和准确性。具体的网络结构和参数设置在实验中进行了详细的调优。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

在VInterview-2025数据集上,PhoenixNest-Video达到了91.50%的等级准确率,显著优于其他更大规模的专有模型。这一结果表明,该框架在评分一致性和透明性方面具有显著优势,能够更好地支持人类评审的决策过程。

🎯 应用场景

PhoenixNest-Video框架在视频面试评估中具有广泛的应用潜力,能够为企业提供高效、透明的候选人评估工具。其自动化评估的能力不仅可以降低人力成本,还能提高评估的一致性和准确性,未来可扩展至其他领域如在线教育、招聘和人力资源管理等。

📄 摘要(原文)

Interview assessment requires per-criterion judgments grounded in behavioral evidence, yet surging applicant volumes have made human-only evaluation costly and inconsistent, while existing AI approaches yield opaque scores without traceable rationale. We introduce PhoenixNest-Video, an evidence-grounded multimodal agent framework for automated video interview assessment. It builds a semantic video graph as structured working memory, performs rubric-conditioned retrieval with cross-modal verification across visual, audio, and textual streams, and produces per-criterion scores anchored to the candidate's materials. A Scorer trained via Rubrics-based Reinforcement Learning with dual rewards for rubric alignment and score-level differentiation internalizes the discriminative structure of multi-level rubrics. PhoenixNest-Video attains 91.50\% grade-level accuracy on VInterview-2025, outperforming substantially larger proprietary models. A compact, rubric-grounded agent therefore scores candidates in closer agreement with an expert panel than direct prompting of much larger models, and exposes the evidence behind each score for human review.