TQLite: Multi-LLM Jury Guided Distillation for Real-time MQM Translation Quality Evaluation
作者: Bhavin Jawade, Cameron R. Wolfe
分类: cs.CL, cs.AI, cs.LG
发布日期: 2026-08-04
备注: 16 pages, 9 figures
💡 一句话要点
提出TQLite以解决小型语言模型在翻译质量评估中的性能不足问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 翻译质量评估 小型语言模型 蒸馏训练 多模型聚合 合成数据生成
📋 核心要点
- 现有的LLMs和LRMs在翻译质量评估中表现优异,但其高计算成本限制了大规模应用。
- TQLite框架通过多LRM陪审团生成高质量的合成训练数据,提升SLMs的评估能力。
- 实验结果显示,TQLite训练的SLMs在MQM评估中性能显著提升,超越传统SLMs的评估能力。
📝 摘要(中文)
大型语言模型(LLMs)在基于MQM的翻译质量(TQ)评估中表现出色,而大型推理模型(LRMs)的最新进展则预示着更大的提升。然而,LLMs和LRMs在大规模部署时计算成本高昂,而小型语言模型(SLMs)虽然更高效,但在复杂推理任务中表现不佳。本文通过广泛的实证研究,对SLMs、LLMs和LRMs在多种TQ评估设置下进行了基准测试,提供了当前现状的全面视角,并建立了最佳实践。为了解决可扩展性挑战,本文提出了TQLite,这是一种新颖的蒸馏框架,使SLMs能够接近最佳LRM评估器的MQM评估性能。我们的结果表明,通过TQLite训练的SLMs在MQM评估性能上显著超越了标准SLMs的现成评估能力,提供了一种可扩展且具有成本效益的替代方案。
🔬 方法详解
问题定义:本文旨在解决小型语言模型(SLMs)在MQM翻译质量评估中性能不足的问题。现有的LLMs和LRMs虽然表现优异,但其高昂的计算成本使得大规模部署面临挑战。
核心思路:论文提出的TQLite框架通过多LRM陪审团生成高质量的合成训练数据,利用数据策划技术和多模型评估响应的聚合,提升SLMs的评估性能。
技术框架:TQLite的整体架构包括数据生成模块、模型训练模块和评估模块。数据生成模块通过多LRM生成合成数据,训练模块使用这些数据训练SLMs,评估模块则对训练后的模型进行性能测试。
关键创新:TQLite的核心创新在于通过多LRM陪审团生成合成训练数据,使得SLMs能够在MQM评估中接近LRM的性能。这一方法与传统的单一模型训练方式有本质区别。
关键设计:在设计中,TQLite采用了特定的损失函数来优化模型性能,并在网络结构上进行了调整,以适应合成数据的特性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,经过TQLite训练的SLMs在MQM评估中性能显著提升,超越了标准SLMs的评估能力,具体表现为在多种评估设置下,SLMs的性能提升幅度超过了XX%(具体数据待补充),展示了其作为高效评估工具的潜力。
🎯 应用场景
该研究的潜在应用领域包括机器翻译系统、翻译质量评估工具以及自然语言处理相关的评估任务。通过提升小型语言模型的评估能力,TQLite可以为资源受限的环境提供高效的解决方案,具有重要的实际价值和广泛的应用前景。
📄 摘要(原文)
Large language models (LLMs) have demonstrated impressive performance in MQM-based translation quality (TQ) evaluation, and recent advances in large reasoning models (LRMs) promise even greater improvements. However, both LLMs and LRMs are computationally expensive to deploy at scale, while small language models (SLMs)---though much more efficient---struggle with the complex reasoning required for evaluation tasks. In this work, we present an extensive empirical study benchmarking SLMs, LLMs, and LRMs across a wide range of TQ evaluation setups, providing a comprehensive view of the current landscape and establishing best practices. To address the scalability challenge, we introduce TQLite, a novel distillation framework that enables SLMs to approach the MQM evaluation performance of the best LRM-based evaluators. Our approach leverages a multi-LRM jury to generate high-quality synthetic training data via practical data curation techniques and aggregation of evaluation responses across a diverse panel of models. Our results demonstrate that SLMs trained via TQLite achieve strong MQM evaluation performance that far exceeds off-the-shelf evaluation capabilities of standard SLMs, offering a scalable and cost-effective alternative to LLM- and LRM-based evaluators.