Prompt-Robust Language Models: Which Training Strategies Work?

📄 arXiv: 2609.01217v1 📥 PDF

作者: Frederic Sadrieh, Michal Štefánik

分类: cs.AI

发布日期: 2026-09-01

备注: 5 pages, 5 figures, 13 tables. Camera-ready version; Accepted to EMNLP 2026 Findings


💡 一句话要点

提出针对提示敏感性问题的语言模型训练策略

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 语言模型 提示敏感性 鲁棒性训练 数据构建 微调策略 对比实验 自然语言处理

📋 核心要点

  1. 现有的大型语言模型在提示表述上存在显著的敏感性,导致性能波动。
  2. 本文通过对比不同的训练策略,提出了在每批次训练一个模板的简单数据构建策略,以提高模型的鲁棒性。
  3. 实验结果显示,尽管鲁棒性微调方法有所改进,但最佳与最差提示之间的性能差距仍然显著,达到40-57%。

📝 摘要(中文)

尽管大型语言模型表现出色,但它们对提示的表述仍然高度敏感。以往的研究通过优化数据构建或引入专门的鲁棒性目标来解决这一问题。本文在受控条件下重现并比较了这些策略,评估其在缓解模型提示敏感性方面的有效性。结果表明,当前的鲁棒性微调方法在标准微调和上下文学习上有所改进,但最佳与最差提示之间的性能差距仍高达40-57%。此外,测试的鲁棒性增强方法(如CoIN和PPCL)往往未能超越最简单的数据构建策略:每批次训练一个模板。我们的诊断解释了这些结果,辅助目标虽然惩罚了特定量,但未能超越这一点。数据构建策略因每个模板梯度的相互矛盾而有所不同,混合表述的批次迫使优化器调和竞争更新,而不是找到共享的、与提示无关的更新。

🔬 方法详解

问题定义:本文旨在解决大型语言模型对提示表述的敏感性问题。现有方法在提升鲁棒性方面存在不足,尤其是在不同提示之间的性能差异上。

核心思路:论文提出通过每批次训练一个模板的简单数据构建策略,来减少模型对提示的敏感性。这种方法旨在避免优化器在不同提示之间的竞争更新。

技术框架:研究采用了对比实验设计,比较了多种训练策略的效果,包括鲁棒性微调和简单的数据构建方法。主要模块包括数据构建、模型训练和性能评估。

关键创新:最重要的创新在于提出了一种简单而有效的数据构建策略,证明其在某些情况下优于复杂的鲁棒性增强方法。这一策略的本质区别在于其简化了训练过程,减少了提示间的干扰。

关键设计:在实验中,采用了不同的损失函数和参数设置,特别关注每个模板的梯度影响,以确保优化器能够找到更一致的更新方向。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果表明,当前的鲁棒性微调方法在标准微调和上下文学习上有所提升,但最佳与最差提示之间的性能差距仍高达40-57%。此外,简单的数据构建策略在某些情况下优于复杂的鲁棒性增强方法,显示出其有效性。

🎯 应用场景

该研究的潜在应用领域包括自然语言处理、对话系统和文本生成等。通过提高语言模型的鲁棒性,可以在实际应用中减少因提示变化导致的性能波动,从而提升用户体验和系统可靠性。

📄 摘要(原文)

Despite their strong performance, large language models remain highly sensitive to prompt formulation. Prior work addresses this through refined data construction or through dedicated robustness objectives. We reproduce and compare these strategies under controlled conditions, and measure how effective they are in addressing models' prompt sensitivity. We find the current robustness fine-tuning methods improve over standard fine-tuning and in-context learning, but the best-to-worst prompt gap remains as high as 40-57% of performance. Moreover, the recent robustness-enhancing methods we test - CoIN for contrastive alignment and PPCL for consistency regularization - often fail to outperform the simplest data construction strategy: training on one template per batch. Our diagnostics explain these results. The auxiliary objectives move the quantity they penalize, but do not generalize beyond it. Additionally, data construction strategies differ due to the conflicting signs of per-template gradients on 57-64% of parameters. Thus, batches that mix formulations force the optimizer to reconcile competing updates instead of finding a shared, prompt-agnostic one.