From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

📄 arXiv: 2609.01572v1 📥 PDF

作者: Olga Tsymboi, Dmitrii Stoianov, Ramil Latypov, Danil Taranets, Daniil Dryabin, Mikhail Gashkov, Viktor Zelenkovskiy, Aleksandr Fida, Gleb Alektorov, Nikita Gulyakov, Arthur Babkin, Aleksandr Medvedev, Pavel Gein, Anatolii Potapov

分类: cs.CL

发布日期: 2026-09-01


💡 一句话要点

提出自托管LLM以解决企业数据驻留问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 自托管LLM 数据驻留 流量整合 质量评估 模型训练 企业应用 GPU资源管理

📋 核心要点

  1. 现有方法在企业自托管LLM时面临数据驻留限制和GPU资源分散的问题。
  2. 论文提出通过生产错误分析整合流量,采用分轴训练和两阶段SLERP合并的方法来提高模型质量。
  3. 实验表明,该模型在多个基准上超越了参数总量约7倍的基线,并显著降低了服务成本。

📝 摘要(中文)

数据驻留限制迫使企业自托管大型语言模型(LLM),但不断采用新模型而不淘汰旧模型会扩展服务队伍,导致有限的GPU资源分散。本文通过生产错误分析识别的质量差距,整合来自200多个内部应用的流量到单一模型上,关注指令跟随、函数调用和内部任务分配三个方面。质量通过离线基准测试进行跟踪,并由确定性验证器或校准的LLM评审员评分。我们为每个轴训练单独的GRPO专家,并通过两阶段SLERP合并,避免了跨领域奖励干扰。实验结果显示,该模型在多个基准上超越了参数总量约7倍的基线,吸收了50%的平台流量,显著降低了服务成本。

🔬 方法详解

问题定义:本文旨在解决企业在自托管大型语言模型(LLM)时,由于数据驻留限制和新旧模型并存导致的GPU资源分散问题。现有方法未能有效整合来自多个应用的流量,造成服务效率低下。

核心思路:论文的核心思路是通过生产错误分析识别质量差距,并将流量整合到单一模型上。为避免跨领域奖励干扰,采用为每个质量维度训练单独的GRPO专家,并通过两阶段SLERP合并。

技术框架:整体架构包括三个主要模块:流量整合模块、质量评估模块和模型训练模块。流量整合模块负责收集来自200多个内部应用的请求,质量评估模块通过离线基准测试跟踪模型质量,模型训练模块则实现专家模型的训练和合并。

关键创新:最重要的技术创新在于采用分轴训练的GRPO专家模型,针对不同的质量维度(如指令跟随、函数调用等)进行优化,避免了传统方法中的奖励干扰问题。

关键设计:关键设计包括使用确定性验证器和校准的LLM评审员进行质量评分,以及在训练过程中采用两阶段SLERP合并不同专家的奖励,以确保模型在各个维度上的表现均衡。实验中还优化了损失函数和网络结构,以提高模型的整体性能。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,该模型在内部Arena基准测试中表现优异,指令跟随得分从0.85提升至0.83,函数调用得分从0.79提升至0.77,整体性能超越了参数总量约7倍的基线,成功吸收了50%的平台流量,处理每月116M请求,显著降低了服务成本。

🎯 应用场景

该研究的潜在应用领域包括企业内部的智能客服、自动化文档处理和数据分析等。通过自托管LLM,企业能够在遵循数据驻留政策的同时,提升服务质量和效率,降低运营成本。未来,该方法可能推动更多企业在数据隐私和合规性方面的创新应用。

📄 摘要(原文)

Data-residency constraints force enterprises to self-host LLMs, but continuous adoption of newer models without decommissioning their predecessors expands the serving fleet, fragmenting a finite GPU pool. We consolidate traffic from over 200 internal applications onto a single model by closing quality gaps identified through production error analysis along three axes: instruction following, function-calling, and internal task distribution. Quality is tracked by offline benchmarks stratified to production traffic and scored by deterministic verifiers or calibrated LLM judges. Rather than optimising all objectives jointly, which introduces cross-domain reward interference, we train a separate GRPO expert per axis and merge them via two-stage SLERP. Each expert's reward exposes a distinct failure mode, namely semantic collapse, over-calling, and verbosity hacking, each requiring a domain-specific fix. In non-reasoning mode the recipe surpasses a ${\sim}7\times$ larger by total parameters baseline on the in-house Arena with 69.6 to 65.8, instruction following with 0.85 to 0.83, and function-calling with 0.79 to 0.77, while lifting general dialogue benchmarks. The model absorbs 50% of platform traffic, 116M requests per month, at a fraction of the serving cost.