TuringLLM: Efficiently Scaling Foundation Models Toward Physical AI

📄 arXiv: 2608.30567v1 📥 PDF

作者: Yuheng Zhang, Yizhao Wang, Da Zhu, Hua Zhou, Yue He, Jiahui Hu, Shaman Tang, Hanlin Chen, Yuhua Wei, Anhua Liu, Shuang Su, Rui Xin, MingYuan Wang, MingHao Li, HaoJie Yang, Siqi Liu, Jianlei Zheng, WeiChao Huang, Qiman Wu, Hang Zhang, HongGou Yang, Xianming Liu

分类: cs.AI

发布日期: 2026-08-31

备注: Technical Report; includes supplementary material


💡 一句话要点

提出Turing-20B-A2B以提升物理AI应用的效率与性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 混合专家模型 动态分位路由 长上下文建模 低延迟响应 物理AI应用

📋 核心要点

  1. 现有模型在处理长上下文和低延迟物理AI应用时存在效率不足的问题。
  2. Turing-20B-A2B通过动态分位路由和混合注意力架构,实现了高效的专家分配和长上下文建模。
  3. 实验结果表明,该模型在基础能力上超过了Qwen3-8B Base,并在长上下文性能和预填充延迟方面表现优异。

📝 摘要(中文)

本文提出了Turing-20B-A2B,一个具有20亿参数的混合专家语言模型,旨在满足长上下文和低延迟的物理AI应用需求。该模型采用动态top-k配置的分位路由技术,实现了基于token的专家分配,同时保持了专家利用率的平衡和计算预算的控制。在部署过程中,进一步应用了容量受限路由以优化专家执行效率。Turing-20B-A2B还结合了Lightning Attention和少量全注意力层的混合注意力架构,支持高效的长上下文建模。尽管活跃参数预算紧凑,该模型在基础模型阶段的整体能力超过了Qwen3-8B Base,并接近Qwen3.5-9B Base,展现了模型能力、长上下文可扩展性和推理效率之间的有效平衡。

🔬 方法详解

问题定义:本文旨在解决现有语言模型在长上下文和低延迟物理AI应用中的效率不足问题,尤其是在专家模型的参数利用和计算预算控制方面的挑战。

核心思路:论文提出的Turing-20B-A2B模型通过动态top-k配置的分位路由技术,实现了token自适应的专家分配,确保了专家的高效利用和计算预算的合理控制。

技术框架:该模型的整体架构包括混合注意力机制,结合了Lightning Attention和少量全注意力层,以支持高效的长上下文建模。此外,模型在预训练阶段采用了渐进式三阶段课程,并通过YaRN技术扩展到512K的推理上下文长度。

关键创新:Turing-20B-A2B的主要创新在于其动态分位路由和容量受限路由的结合,显著提升了模型在长上下文处理和低延迟响应中的性能,区别于传统的静态专家模型。

关键设计:模型在参数设置上采用了20亿参数的混合专家结构,激活约2亿参数用于每个token的处理,同时在预训练阶段保持无丢失路由,确保了模型的高效性和稳定性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,Turing-20B-A2B在基础模型阶段的整体能力超过了Qwen3-8B Base,接近Qwen3.5-9B Base,且在长上下文性能和预填充延迟方面表现优异,展现了模型在实际应用中的高效性和可扩展性。

🎯 应用场景

Turing-20B-A2B模型在物理AI应用中具有广泛的潜在应用,如智能机器人、自动驾驶和长文本理解等领域。其高效的长上下文处理能力和低延迟响应特性,将为实时决策和复杂任务提供强有力的支持,推动相关技术的进步与应用。

📄 摘要(原文)

We present Turing-20B-A2B, a 20B-parameter Mixture-of-Experts language model that activates approximately 2B parameters per token, designed for long-context and latency-sensitive physical AI applications. The model adopts Quantile Routing in a dynamic top-k configuration, enabling token-adaptive expert allocation while maintaining balanced expert utilization and a controlled average compute budget. During deployment, we further apply capacity-constrained routing to prompt prefill for more regular and efficient expert execution, while retaining dropless routing during pretraining. Turing-20B-A2B also employs a hybrid attention architecture that combines Lightning Attention with a small number of full-attention layers for efficient long-context modeling. The model is pretrained with a progressive three-stage curriculum and extended to a native context length of 128K through continued pretraining, with further inference-time extension to 512K using YaRN. Despite its compact active-parameter budget, Turing-20B-A2B achieves, at the base-model stage, overall general capability exceeding Qwen3-8B Base and approaching Qwen3.5-9B Base, while maintaining strong long-context performance and favorable prefill-latency scaling. These results demonstrate an effective balance among model capability, long-context scalability, and practical inference efficiency.