QUORUM: QUality-Optimized Routing Using Multiple annotators

📄 arXiv: 2608.27974v1 📥 PDF

作者: Antonio Purificato, Maria Sofia Bucarelli, Andrea Bacciu, Amin Mantrach, Fabrizio Silvestri

分类: cs.CL

发布日期: 2026-08-28

备注: 4 figures, 18 pages

🔗 代码/项目: GITHUB


💡 一句话要点

提出QUORUM以解决数据标注质量与成本问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 数据标注 自然语言处理 大型语言模型 质量优化 成本控制 特征信号 多标注者 机器学习

📋 核心要点

  1. 现有的数据标注方法在处理复杂实例时表现不佳,尤其是需要细致推理或上下文理解的情况。
  2. QUORUM通过动态分配标注任务给人类或LLM标注者,利用特征信号评估实例难度,从而优化标注质量与成本。
  3. QUORUM在多种标注任务中表现出色,标注质量提升最多34.4%,成本降低8.8%,显示出其有效性。

📝 摘要(中文)

数据标注在自然语言处理领域仍然是一个主要瓶颈,需要大量人力以获得高质量标签。尽管大型语言模型(LLMs)提供了快速且具成本效益的替代方案,但其可靠性高度依赖于具体实例。本文提出QUORUM(基于多标注者的质量优化路由),这是一个预算感知的路由框架,能够在固定的标注预算下动态分配每个实例给人类或LLM标注者。与依赖模型置信度或不确定性估计的先前方法不同,QUORUM利用基于特征的信号来估计实例难度,并支持每个实例的多次标注,通过基于一致性的奖励来提高可靠性。实验结果表明,QUORUM在多种封闭和开放式标注任务中,标注质量提高了最多34.4%,同时成本降低了8.8%。

🔬 方法详解

问题定义:本文旨在解决数据标注过程中的质量与成本问题。现有方法往往依赖于模型的置信度或不确定性估计,导致在复杂实例上的表现不佳。

核心思路:QUORUM的核心思路是通过特征信号来动态评估实例的难度,并根据预算灵活分配标注任务,从而提高标注质量并降低成本。

技术框架:QUORUM的整体架构包括实例难度评估模块、标注者分配模块和基于一致性的奖励机制。首先评估实例难度,然后根据评估结果选择合适的标注者进行标注。

关键创新:QUORUM的创新之处在于其基于特征的实例难度评估方法,区别于传统依赖模型置信度的方式,从而提高了标注的可靠性。

关键设计:QUORUM设计了多次标注机制,允许对同一实例进行多次标注,并通过一致性奖励来整合不同标注者的意见,确保标注质量。具体的参数设置和损失函数设计在实验中进行了优化。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

QUORUM在多种标注任务中表现优异,标注质量提升最多达34.4%,同时成本降低8.8%。这些结果表明QUORUM在提高标注效率和质量方面的显著优势,超越了现有的竞争方法。

🎯 应用场景

QUORUM的研究成果在自然语言处理、数据标注和机器学习等领域具有广泛的应用潜力。它能够有效提高标注质量,降低成本,适用于需要大量高质量数据的任务,如文本分类、情感分析和机器翻译等。未来,QUORUM的框架可以扩展到其他类型的数据标注任务中,进一步推动人工智能的发展。

📄 摘要(原文)

Data annotation remains a central bottleneck in natural language processing, requiring human effort to obtain high-quality labels at scale. While Large Language Models (LLMs) offer a fast and cost-effective alternative, their reliability is highly instance-dependent: they perform well on simple inputs but often fail on examples requiring nuanced reasoning or contextual understanding. In this work, we address this challenge with QUORUM (QUality-Optimized Routing Using Multiple annotators), a budget-aware routing framework that dynamically assigns each instance to human or LLM annotators under a fixed annotation budget. Unlike prior approaches relying on model confidence or uncertainty estimates, QUORUM leverages feature-based signals to estimate instance difficulty and supports multiple annotations per instance, combining them through agreement-based rewards to improve reliability. We evaluate QUORUM across diverse closed- and open-ended annotation tasks in English and multilingual settings, and QUORUM improves annotation quality by up to 34.4% while reducing costs by 8.8% over competing methods. Code can be found at https://github.com/amazon-science/QUORUM.