SurgSkill-Bench: A Benchmark for Multimodal Surgical Skill Assessment

📄 arXiv: 2608.30872v1 📥 PDF

作者: Chaohui Dang, Zheheng Jiang, James Glasbey, David Luke, Theodoros Arvanitis, Le Zhang

分类: cs.CV

发布日期: 2026-08-31


💡 一句话要点

提出SurgSkill-Bench以解决外科技能评估的自动化问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 外科技能评估 多模态融合 视频分析 自动化评估 数据集构建

📋 核心要点

  1. 现有的外科技能评估方法依赖于专家评审,效率低且难以实现自动化。
  2. 本文提出SurgSkill-Bench数据集,结合视频、评分和文本评论,支持多模态的技能评估。
  3. 实验结果显示,内容自适应采样和专家评论的结合显著提升了评估性能,AUROC达到0.88。

📝 摘要(中文)

外科技术技能的客观评估对外科培训和结构化反馈至关重要,但现有流程仍依赖于劳动密集型的专家评审。现有的自动化方法主要集中于视觉输入,且对联合研究操作表现、结构化技能评分和评估者反馈的支持有限。我们提出了SurgSkill-Bench,这是一个初步的视频-评分-文本基准数据集,包含214个外科培训模拟视频、六维OSATS评分和专家自由文本评论。我们定义了两种评估设置:仅视频的OSATS预测和后期专家评论辅助预测。通过控制基线实验,我们发现内容自适应采样在视频仅评估中提升了性能,而评估者评论在辅助设置中提供了额外的评分相关信号。最佳的均值AUROC达到了0.88。

🔬 方法详解

问题定义:本研究旨在解决外科技能评估中缺乏自动化和多模态分析的问题。现有方法主要依赖专家评审,效率低下且难以扩展。

核心思路:我们提出SurgSkill-Bench数据集,结合视频、评分和专家评论,利用多模态信息进行外科技能的自动化评估。通过引入视频-文本共注意力机制,提升评估的准确性和可靠性。

技术框架:整体架构包括视频输入、评分预测和文本评论辅助三个主要模块。首先,使用冻结的视觉骨干网络提取视频特征;其次,进行内容自适应关键帧采样以优化输入;最后,结合专家评论进行辅助评分预测。

关键创新:最重要的创新在于引入了视频-文本共注意力融合模块,使得模型能够同时利用视觉信息和文本信息,从而提高评估的准确性。这一方法与传统的仅基于视觉输入的评估方法有本质区别。

关键设计:我们在模型中采用了内容自适应采样策略,以选择最具代表性的关键帧。此外,损失函数设计考虑了评分的多样性,确保模型能够有效学习不同类型的技能评分。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,内容自适应采样在视频仅评估中显著提升了性能,最佳均值AUROC达到了0.88。此外,专家评论的引入为辅助预测提供了额外的评分相关信号,进一步提高了评估的准确性。

🎯 应用场景

该研究的潜在应用领域包括外科培训、技能评估和医疗教育等。通过自动化的技能评估,能够为外科医生提供更为精准的反馈,提升培训效率,并为医疗机构提供数据支持,优化培训流程。未来,该方法有望推广至其他领域的技能评估,如机器人操作和复杂任务执行等。

📄 摘要(原文)

Objective assessment of surgical technical skill is important for surgical training and structured feedback, but current workflows remain dependent on labor-intensive expert review. Existing automated approaches primarily focus on visual inputs and provide limited support for jointly studying operative performance, structured skill scores, and evaluator feedback. We introduce SurgSkill-Bench, an initial video-score-text benchmark-style dataset containing 214 surgical training simulation videos, six-dimensional OSATS scores, and expert free-text comments. We define two evaluation settings: video-only OSATS prediction for automated assessment and post hoc expert-comment-assisted prediction, where evaluator comments are available as auxiliary information. We provide controlled baseline experiments using representative frozen visual backbones, content-adaptive key-frame sampling, and a simple video-text co-attention fusion module. Under internal video-level validation, content-adaptive sampling improves video-only performance in this dataset, while evaluator comments provide additional score-related signal in the assisted setting. The best mean AUROC reaches 0.88 under dataset-specific median dichotomization. We further discuss evaluation constraints related to dataset scale, metadata completeness, and the interpretation of comment-assisted prediction. Code will be released publicly at a later date.