Groundhog Bit-Flip Attack: Seeding Infinite Generation Loops in Mixture-of-Experts LLMs through Bit Flips
作者: Huakang Lin, Tiancheng Zheng, Mingxuan Sun, Tianhong Xu, Fan Zhang, Yunsi Fei, Ruyi Ding
分类: cs.CL
发布日期: 2026-08-26
备注: 9 pages, 3 figures; Accepted at EMNLP 2026
💡 一句话要点
提出Groundhog Bit-Flip攻击以揭示MoE LLM的脆弱性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 混合专家 比特翻转攻击 拒绝服务攻击 大型语言模型 模型安全性 自适应设计 攻击面
📋 核心要点
- 现有的MoE架构在自适应设计上存在脆弱性,特定专家与某些标记的相关性使其易受攻击。
- 本文提出的GBFA通过翻转路由层比特,操控专家激活,从而实现对模型行为的影响。
- 实验结果显示,手动停用少量专家即可显著提高输出标记的使用率,展示了MoE架构的脆弱性。
📝 摘要(中文)
混合专家(MoE)架构通过路由机制选择性激活专家子网络,从而实现可扩展和高效的大型语言模型(LLM)。然而,这种自适应设计引入了新的攻击面:特定专家与某些标记(如序列结束)之间的不成比例相关性,使得对手能够通过轻量级扰动操控模型行为。本文提出了Groundhog Bit-Flip攻击(GBFA),这是针对MoE LLM的首个基于比特翻转的拒绝服务攻击。通过识别并翻转与相关专家激活相关的路由层比特,GBFA显著扩展了三种不同LLM模式下的解码标记使用,同时在很大程度上保持语义的完整性。对四种主要的现实世界MoE LLM进行实验,平均仅需手动停用不到4个专家,便可将输出膨胀至5912%,大多数测试样本达到最大标记。这些结果揭示了MoE架构对比特翻转的脆弱性,并强调了GBFA作为LLM可用性攻击的潜力。
🔬 方法详解
问题定义:本文旨在解决MoE LLM在特定专家与标记之间存在的不成比例相关性所带来的脆弱性,现有方法未能有效应对这一攻击面。
核心思路:GBFA通过识别并翻转与专家激活相关的路由层比特,利用轻量级扰动操控模型的输出行为,从而实现拒绝服务攻击。
技术框架:GBFA的整体架构包括比特翻转的识别模块、专家激活的分析模块和攻击实施模块,形成一个完整的攻击流程。
关键创新:GBFA是首个针对MoE LLM的比特翻转拒绝服务攻击,揭示了MoE架构在自适应设计下的脆弱性,具有重要的理论和实践意义。
关键设计:在实验中,研究者手动停用的专家数量平均少于4个,且通过比特翻转实现的输出膨胀率高达5912%,显示了攻击的高效性和潜在影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,手动停用平均不到4个专家即可使输出标记使用率膨胀至5912%。这一结果不仅展示了GBFA的高效性,还揭示了MoE架构在面对比特翻转攻击时的脆弱性,具有重要的安全隐患。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性评估和防护机制设计。通过揭示MoE架构的脆弱性,研究者可以为未来的模型设计提供改进建议,从而增强其抵御攻击的能力,确保模型的可靠性和安全性。
📄 摘要(原文)
Mixture-of-Experts (MoE) architectures enable scalable and efficient large language models (LLMs) by selectively activating expert sub-networks through a routing mechanism. However, this adaptive design introduces a new attack surface: specific experts become disproportionately correlated with certain tokens (e.g., end-of-sequence), allowing adversaries to manipulate model behavior via lightweight perturbations. In this work, we present \textbf{Groundhog Bit-Flip Attack (GBFA)}, the first bit-flip-based \textit{ Denial-of-Wallet availability attack} against MoE-based LLMs. By identifying and flipping routing-layer bits associated with related expert activations, we demonstrate that GBFA substantially extends the decoding token usage across three different LLM modes: conversational, reasoning, and agentic tasks, while largely preserving semantic fidelity. Across four main real-world MoE-based LLMs, manually deactivating on average fewer than \textbf{4 experts} drives average output inflation to $\mathbf{5912\%}$, with the majority of test samples reaching max tokens. These results reveal a robustness vulnerability of MoE architectures to bit flip, and highlight the potential of GBFA as an availability attack against LLMs.