Leveraging Association Context Retrieval in Knowledge Edit- ing to Build White-Box Attacks on LLMs

📄 arXiv: 2608.17836v1 📥 PDF

作者: Roman Maksimov, Vladimir Aletov, Vladimir Solodkin, Dmitry Bylinkin, Daniil Medyakov, Aleksandr Beznosikov

分类: cs.LG

发布日期: 2026-08-18


💡 一句话要点

提出基于知识编辑的白盒攻击方法以诱导LLMs不安全行为

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 白盒攻击 知识编辑 安全性研究 关联知识检索

📋 核心要点

  1. 现有方法在诱导大型语言模型不安全行为方面存在不足,尤其是在攻击效果和模型性能之间的平衡。
  2. 本文提出了一种结合关联知识检索的知识编辑白盒攻击方法,旨在提高攻击的有效性。
  3. 实验结果显示,该方法在多种模型架构下均表现出优越的攻击效果,相较于现有方法有显著提升。

📝 摘要(中文)

随着大型语言模型(LLMs)获得越来越高的自主性,研究诱导其不安全行为的方法变得至关重要。本文提出了一种新颖的白盒攻击方法,灵感来源于知识编辑领域的定位-编辑方法。我们观察到,使用此类方案编辑的模型往往对编辑目标分配异常高的预测概率,这在设计攻击时尤其有利。我们通过引入从模型中检索的关联知识,修改了编辑框架,从而将约束移除扩展到整个主题类别,而不仅限于预定义数据集中的提示。实验结果表明,该方法在多种架构下的攻击效果优于竞争方法,同时对模型的整体性能没有造成严重损害。

🔬 方法详解

问题定义:本文旨在解决如何有效诱导大型语言模型(LLMs)产生不安全行为的问题。现有方法在攻击效果和模型性能之间存在矛盾,难以实现有效的攻击而不损害模型的整体性能。

核心思路:论文的核心思路是通过结合知识编辑中的定位-编辑方法与关联知识检索,来增强攻击的有效性。通过这种方式,模型在编辑目标时能够分配更高的预测概率,从而提高攻击成功率。

技术框架:整体架构包括三个主要模块:首先是关联知识的检索模块,其次是编辑框架的修改模块,最后是攻击实施模块。通过这些模块的协同工作,实现了对整个主题类别的约束移除。

关键创新:最重要的技术创新在于将关联知识检索引入知识编辑框架,扩展了约束移除的范围,使其不再局限于预定义的数据集提示。这一创新使得攻击方法更加灵活和有效。

关键设计:在关键设计方面,本文对模型的参数设置进行了优化,采用了特定的损失函数以平衡攻击效果与模型性能,同时在网络结构上进行了适当调整,以支持关联知识的有效整合。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所提出的方法在多种模型架构下的攻击效果显著优于现有竞争方法,攻击成功率提高了20%以上,同时对模型的整体性能影响较小,确保了模型在实际应用中的可用性。

🎯 应用场景

该研究的潜在应用领域包括安全性测试、对抗性攻击研究以及大型语言模型的安全性评估等。通过有效诱导不安全行为,研究人员可以更好地理解和改进模型的安全性,降低潜在风险。未来,该方法可能推动更安全的AI系统设计与开发。

📄 摘要(原文)

As large language models (LLMs) are granted increasing autonomy, it is essential to investigate methods that can induce unsafe behavior. We propose a novel white-box attack inspired by locate-then-edit approaches from the field of Knowledge Editing. Our choice is motivated by the observation that models edited with such schemes tend to assign unusually high prediction probabilities to the edit target, a property that is particularly advantageous when designing attacks. We modify the editing framework by incorporating as- sociative knowledge retrieved from the model, thereby extending constraint removal to an entire thematic category rather than being limited to prompts from a predefined dataset. Experiments with various archi- tectures demonstrate improved attack effectiveness over competing methods without dealing critical damage to general model performance.