Beyond BLEU: A Case for Redefining Sign Language Translation Benchmarks
作者: Oline Ranum, Edward Fish, Simon Hadfield, Richard Bowden
分类: cs.CL, cs.AI
发布日期: 2026-09-03
💡 一句话要点
提出新评估方法以改进手语翻译基准
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 手语翻译 BLEU-4 多模态评估 内容保留 机器翻译
📋 核心要点
- 现有的BLEU-4指标未能充分反映手语翻译的真实能力,导致模型可能学习到错误的相关性。
- 论文提出了一种基于开放权重的LLM问答协议的新评估方法,旨在更准确地衡量手语内容的保留。
- 实验结果显示,新的评估方法在内容传递和鲁棒性方面表现优于BLEU-4,尤其是在不同系统之间的比较中。
📝 摘要(中文)
BLEU-4是评估手语翻译(SLT)的标准指标,但其对手语能力的反映不足。SLT的多模态、低资源背景使得模型可能利用虚假相关性和口语先验,而非学习更强的手语表示。本文评估了六个SLT模型在Phoenix-2014T和CSL-Daily数据集上的时空理解与BLEU-4之间的关系,发现BLEU-4的提升并不一定意味着手语理解的改善。我们提出了一种新的评估方法,借鉴语言学习评估,使用开放权重的LLM问答协议来衡量内容保留,与人类排名更为一致,并且在对同义句的鲁棒性上比BLEU-4高出六到七倍。应用于SLT后,该协议更关注内容传递,对训练-测试重叠更为鲁棒,提供了该领域的不同视角。
🔬 方法详解
问题定义:本文旨在解决现有BLEU-4指标在手语翻译评估中的不足,特别是其未能准确反映手语理解能力的问题。现有方法容易导致模型学习到虚假的相关性,影响翻译质量。
核心思路:论文提出了一种新的评估方法,借鉴语言学习评估的理念,采用开放权重的LLM问答协议,重点关注内容保留的准确性,以更好地反映手语翻译的实际表现。
技术框架:该方法的整体架构包括数据预处理、模型训练和评估三个主要模块。在评估阶段,使用LLM问答协议对翻译结果进行分析,确保内容的完整性和准确性。
关键创新:最重要的创新在于引入了开放权重的LLM问答协议,该协议在内容保留的评估上比BLEU-4更为鲁棒,且在对同义句的处理上具有更高的稳定性。
关键设计:在参数设置上,采用了开放权重的设计以增强模型的灵活性,损失函数则侧重于内容保留的准确性,网络结构上结合了多模态输入,以更好地处理手语的时空特性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,新的评估方法在内容传递方面显著优于BLEU-4,尤其是在五个无注释系统的比较中,BLEU-4未能揭示出系统之间的真实差异,而新的方法使得一个有注释的系统在Phoenix-2014T上比其他系统高出9.3分。
🎯 应用场景
该研究的潜在应用领域包括手语翻译系统的开发、教育领域的手语学习工具以及相关的多模态交互技术。通过提供更准确的评估标准,未来可以推动手语翻译技术的进步,提升手语使用者的沟通效率和体验。
📄 摘要(原文)
BLEU-4 is the standard metric for evaluating sign language translation (SLT), but spoken-language metrics may not adequately reflect sign language proficiency. The multimodal, low-resource context of SLT allows models to exploit spurious correlations and spoken-language priors, rather than learning stronger sign representations. In this paper, we evaluate the relationship between spatio-temporal understanding and BLEU-4 across six SLT models on Phoenix-2014T and CSL-Daily, showing that gains in BLEU-4 are not on their own evidence of better sign language understanding. This work introduces an alternative inspired by language-learning assessment, using an open-weight-LLM QA protocol that measures salient content preservation. It aligns more closely with human rankings and is six to seven times more paraphrase-invariant than BLEU-4. Applied to SLT, this protocol targets content transfer, is more robust to train-test overlap, and gives a different picture of the field: the five gloss-free systems are largely within noise of one another on Phoenix-2014T, while the gloss-supervised system stands 9.3 points higher, a gap invisible to BLEU-4.