TrainSDC: Characterizing and Mitigating Silent Data Corruption in Large Language Model Training
作者: Zhipeng Xia, Haotian Xu, Siyu Yun, Liqi Lin, Hu Liu, Yu Li, Cheng Zhuo
分类: cs.LG
发布日期: 2026-08-31
备注: 12 pages, 5 figures, and 6 tables. Includes an appendix with additional experiments
💡 一句话要点
提出TrainSDC以解决大语言模型训练中的静默数据损坏问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 静默数据损坏 大语言模型 Transformer 训练稳定性 错误传播机制 保护框架 梯度缩放 残差监控
📋 核心要点
- 现有方法对Transformer计算的脆弱性理解不足,导致静默数据损坏问题未得到有效解决。
- 提出TrainSDC框架,通过Q/K路径重计算、残差增益监控和指数感知梯度缩放来应对静默数据损坏。
- 在Llama 3.2-1B和Qwen3-0.6B的实验中,TrainSDC在故障注入下保持接近无故障的训练行为,运行时开销仅为1.65%-6.76%。
📝 摘要(中文)
大语言模型训练越来越容易受到静默数据损坏(SDC)的影响,但现有保护方法对Transformer计算的处理过于统一,且其脆弱性尚未得到充分理解。本文首次系统性地表征了Transformer训练中主要计算接口的SDC脆弱性,分析揭示了两种不同的错误传播机制:前向传播的脆弱性高度依赖位置,而反向传播的脆弱性则主要由梯度指数分布决定。基于这些观察,本文提出了TrainSDC,一个基于表征的保护框架,包含Q/K路径重计算、残差增益监控和指数感知梯度缩放。实验表明,TrainSDC在稀疏和密集故障注入下,训练行为接近无故障执行,同时仅引入1.65%-6.76%的运行时开销。
🔬 方法详解
问题定义:本文旨在解决大语言模型训练中静默数据损坏(SDC)的问题。现有方法对Transformer计算的处理过于统一,未能针对不同计算接口的脆弱性进行有效区分,导致训练过程中的错误传播未得到充分控制。
核心思路:论文的核心思路是通过系统性表征SDC脆弱性,识别前向和反向传播中的不同错误传播机制,从而设计出针对性的保护策略。通过重计算和监控机制,减少训练过程中的错误影响。
技术框架:TrainSDC框架主要包括三个模块:Q/K路径重计算、残差增益监控和指数感知梯度缩放。前者用于在前向传播中重新计算关键路径,后者监控训练过程中的残差变化,最后一个模块则根据梯度的指数分布调整梯度缩放策略。
关键创新:最重要的技术创新点在于首次系统性地分析了Transformer训练中的SDC脆弱性,并提出了针对性保护措施。这与现有方法的本质区别在于,现有方法往往未能考虑不同计算接口的特性。
关键设计:在设计中,Q/K路径重计算确保了关键路径的准确性,残差增益监控通过设定阈值来判断训练的稳定性,而指数感知梯度缩放则根据梯度的分布动态调整,确保训练过程的有效性和稳定性。具体参数设置和损失函数的选择在实验中进行了详细验证。
🖼️ 关键图片
📊 实验亮点
实验结果显示,TrainSDC在Llama 3.2-1B和Qwen3-0.6B模型上,能够在稀疏和密集故障注入的情况下,保持接近无故障的训练行为,运行时开销仅为1.65%-6.76%。这一结果表明,TrainSDC在保护模型训练的同时,几乎不影响训练效率。
🎯 应用场景
该研究的潜在应用领域包括大语言模型的训练和优化,尤其是在对模型可靠性要求较高的场景中,如自动驾驶、医疗诊断等。通过有效减轻静默数据损坏的影响,TrainSDC能够提升模型的训练稳定性和最终性能,具有重要的实际价值和未来影响。
📄 摘要(原文)
LLM training is increasingly vulnerable to silent data corruption (SDC), yet existing protection methods largely treat Transformer computations uniformly because their vulnerability remains poorly understood. We present the first systematic characterization of SDC vulnerability across major computation interfaces in both the forward and backward passes of Transformer training. Our analysis reveals two distinct error propagation mechanisms: forward-pass vulnerability is highly location dependent, with faults on the Q/K path producing persistent training deviations, whereas backward-pass vulnerability is largely governed by gradient exponent distributions rather than computation locations. Motivated by these observations, we propose TrainSDC, a characterization-guided protection framework consisting of Q/K-path recomputation, residual-gain monitoring, and exponent-aware gradient scaling. Experiments on Llama 3.2-1B and Qwen3-0.6B show that TrainSDC maintains training behavior close to fault-free execution under both sparse and dense fault injection while introducing only 1.65%-6.76% runtime overhead.