Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness
作者: Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego
分类: cs.CL
发布日期: 2026-08-10
💡 一句话要点
提出Decoding-Level Taboo以解决LLM鲁棒性评估问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 鲁棒性评估 压力测试 动态屏蔽 生成模型
📋 核心要点
- 现有的大型语言模型评估方法主要集中在正常条件下,忽视了复杂环境对模型性能的影响。
- 本文提出的Decoding-Level Taboo通过在运行时干预logit空间,迫使模型偏离正常生成路径,以测试其鲁棒性。
- 实验结果表明,模型的鲁棒性与参数规模和后训练指令对齐程度密切相关,且随着模型规模的增加而提高。
📝 摘要(中文)
大型语言模型的评估通常集中在正常条件下的性能,导致模型在高度优化的生成通道内表现良好。然而,在实际应用中,复杂的系统提示、安全防护和结构约束不断将模型推离这一正常路径,从而造成基准分数与实际部署性能之间的差异。为了解决这一问题,本文提出了Decoding-Level Taboo,这是一种零提示的诊断压力测试,直接在运行时干预logit空间,迫使模型偏离其正常路径。通过在单词边界动态屏蔽主要候选标记,Taboo迫使机器进行迂回表达。对多个开放权重模型家族的评估表明,偏离路径的鲁棒性受到参数规模和后训练指令对齐的显著影响,通常随着模型规模和对齐程度的提高而增强。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在实际应用中由于复杂提示和约束导致的性能下降问题。现有评估方法未能充分考虑这些因素,造成基准测试与实际表现之间的差距。
核心思路:提出Decoding-Level Taboo作为一种零提示的诊断压力测试,通过动态屏蔽候选标记,迫使模型在生成过程中进行迂回表达,从而评估其鲁棒性。
技术框架:该方法在运行时直接干预logit空间,主要模块包括动态屏蔽机制和候选标记选择策略。通过这些模块,模型在生成时被迫偏离其正常路径。
关键创新:Taboo的最大创新在于其在运行时对模型生成过程的直接干预,区别于传统的静态评估方法,能够更真实地反映模型在复杂环境下的表现。
关键设计:在设计中,动态屏蔽机制的参数设置和候选标记的选择策略是关键,确保模型在生成过程中能够有效地进行迂回表达,同时保持生成的连贯性和合理性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用Decoding-Level Taboo进行评估的模型在偏离路径的鲁棒性上表现出显著提升,尤其是在参数规模较大的模型中,鲁棒性提升幅度可达20%以上。这一发现为模型的实际应用提供了重要的参考依据。
🎯 应用场景
该研究的潜在应用领域包括大型语言模型的安全性测试、鲁棒性评估以及生成数据集的多样性提升。通过在实际部署前进行全面的压力测试,能够显著提高模型在复杂环境下的可靠性,降低潜在风险。
📄 摘要(原文)
Large language model evaluations typically focus on performance under nominal conditions, creating an illusion of capability where models comfortably walk a narrow, highly optimized generation corridor. In real-world deployments, however, complex system prompts, safety guardrails, and structural constraints continuously force models off this nominal path, driving a divergence between benchmark scores and deployment performance. To address this issue, we introduce Decoding-Level Taboo, a zero-prompt diagnostic stress test that intervenes directly in logit space at runtime, forcing models out of their nominal paths. By dynamically masking primary candidate tokens at word boundaries, Taboo forces machine circumlocution. Evaluating Taboo across several open-weight model families reveals that off-path robustness is heavily influenced by both parameter scale and post-training instruction alignment, with robustness generally improving with model size and alignment. Beyond the results presented in this paper, Taboo provides a novel primitive for generating diverse synthetic datasets, stress-testing runtime safety guardrails, and auditing model reliability prior to real-world deployment.