A Scalable Pipeline for LLM-Teacher Distillation Labeling: Work-Stealing Job Scheduling and Memory-Aware GPU Concurrency

📄 arXiv: 2608.15975v1 📥 PDF

作者: Ravi Satya Durga Prasad Yenugula

分类: cs.DC, cs.AI, cs.CL, cs.LG

发布日期: 2026-08-17

备注: 8 pages, 1 figure, 3 tables. Code, tests, and all run artifacts: https://github.com/rsdpyenugula/hybrid-labeling-training


💡 一句话要点

提出可扩展的LLM教师蒸馏标注管道以解决GPU工作负载调度问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture)

关键词: 长文本标注 工作窃取 内存感知 GPU调度 蒸馏训练 自然语言处理 性能优化

📋 核心要点

  1. 现有方法在处理大规模文本标注时面临手动标注不可行和GPU工作负载调度不均的问题。
  2. 论文提出了一种工作窃取环池和内存感知并发规则的管道,以提高标注效率和质量。
  3. 实验表明,该方法在不均匀负载下的吞吐量显著提升,并且在设备故障时表现出更高的容错能力。

📝 摘要(中文)

使用LLM教师对大规模文本语料进行标注已成为训练数据的有效途径。手动标注每批数据在数量达到数百万时变得不可行,论文提出了一种简单且可重复的管道,解决了标注质量与GPU工作负载调度的问题。首先,采用工作窃取环池,每个工作节点拥有自己的任务队列,并在完成后从后继节点窃取任务。其次,设计了内存感知的并发规则,根据GPU上可容纳的模型副本数量来调整每节点的并行度。最后,提出了一种重新标注基准方法,通过教师对已有金标准数据集进行重新标注来评估质量与成本。实验结果表明,该管道在不均匀负载下的吞吐量是静态分片的3.4倍,并且在设备故障情况下表现出更高的容错性。

🔬 方法详解

问题定义:论文要解决的是在大规模文本标注中,如何有效利用GPU资源以应对不均匀和故障频发的工作负载。现有方法在处理这些问题时常常效率低下,导致资源浪费和标注质量不稳定。

核心思路:论文的核心思路是通过工作窃取机制和内存感知并发规则来优化GPU工作负载调度。工作窃取机制允许空闲的工作节点从其他节点窃取任务,从而提高资源利用率;内存感知并发规则则根据GPU的内存容量动态调整并行度,确保在不同设备上都能安全运行。

技术框架:整体架构包括工作窃取环池、内存感知并发控制和重新标注基准方法。工作窃取环池负责任务调度,内存感知并发控制根据GPU的模型副本数量调整并行度,而重新标注基准方法则用于评估标注质量与成本。

关键创新:最重要的技术创新点在于工作窃取机制的实现和内存感知并发规则的设计。与现有静态分片方法相比,该方法在动态负载下表现出更高的吞吐量和容错能力。

关键设计:关键设计包括使用原子条件写入和过期声明清理的任务声明协议,依赖于简单的比较与设置原语,且实现于单一的SQLite文件中,确保了实现的无依赖性和可重复性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,在不均匀负载下,该管道的吞吐量是静态分片的3.4倍,并且在半数工作节点故障的情况下,仅损失了0个任务,而静态分片则损失了953个任务。这表明该方法在容错性和效率上具有显著优势。

🎯 应用场景

该研究的潜在应用领域包括大规模文本数据的自动标注、自然语言处理模型的训练及优化等。通过提高标注效率和质量,能够显著降低人工成本,并加速模型的开发与迭代,具有重要的实际价值和未来影响。

📄 摘要(原文)

Labeling large text corpora with LLM teachers has become a practical route to training data at scale. At millions of items, hand-labeling every batch is not feasible, and two questions dominate: what label quality a teacher buys per dollar, and how to keep a fleet of GPU workers busy under skewed, failure-prone workloads. We present a simple, reproducible pipeline that addresses both. First, a work-stealing ring pool: each worker owns a queue, drains it first, and then steals from ring successors, with exactly-once task claims via atomic conditional writes and crash tolerance via stale-claim sweeping. The claim protocol requires only a compare-and-set primitive from its storage layer; we implement it on a single SQLite file, which makes the reference implementation dependency-free and the experiments reproducible on one machine. Second, a memory-aware concurrency rule that sizes per-node parallelism by how many model copies fit on the GPU, so the same code runs safely across device sizes. Third, a relabeling benchmark methodology in which the teacher relabels a public dataset that already has gold labels, so quality reduces to an agreement measurement and cost follows from measured throughput. Under skewed load the pool sustains up to 3.4 times the throughput of static sharding while matching it at zero skew, loses 0 of 2,000 tasks when half the workers are killed mid-run (static sharding loses 953), and yields measured quality and cost points for an instruction-tuned teacher on irony and sentiment tasks. All experiments run on public data and commodity hardware; code, tests, and run logs are released.