Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

📄 arXiv: 2608.14303v1 📥 PDF

作者: Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

分类: cs.LG

发布日期: 2026-08-14


💡 一句话要点

提出CodeSIFT以检测受污染的代码生成提示批次

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 代码生成 安全性检测 影响函数 大型语言模型 恶意提示识别

📋 核心要点

  1. 现有的代码生成防御方法依赖于预定义的威胁模型,难以应对新型攻击。
  2. 论文提出CodeSIFT,通过影响函数检测异常提示批次,避免依赖特定漏洞知识。
  3. 在多个开放权重的代码LLM上测试,CodeSIFT在中高注入率下AUROC分数达到0.98,表现优越。

📝 摘要(中文)

大型语言模型(LLMs)在代码生成中越来越多地被使用,但它们仍然容易受到引发不安全实现的提示的攻击。现有防御方法通常依赖于预定义的威胁模型或已知的漏洞模式,这限制了它们对新型攻击的有效性。我们提出了CodeSIFT,这是一种与威胁模型无关的检测方法,利用影响函数识别引发异常模型行为的提示批次。CodeSIFT通过测量生成代码的参数空间影响,并使用统计测试来判断候选提示集是否偏离良性参考分布。我们引入了两个基准数据集,涵盖多种漏洞,并在三个开放权重的代码LLM上评估CodeSIFT,取得了高达0.98的AUROC分数,同时保持良好的假阳性率,显著优于静态分析基线。这些结果表明,基于影响函数的检测是识别恶意代码生成提示的有前景的方向。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型在代码生成中对恶意提示的脆弱性。现有方法依赖于已知的威胁模型,无法有效应对新型攻击,导致安全性不足。

核心思路:CodeSIFT的核心思想是利用影响函数来检测引发异常行为的提示批次,而不是专注于特定的漏洞。这种方法不需要对攻击类别的先验知识,使其更具通用性。

技术框架:CodeSIFT的整体架构包括数据收集、影响函数计算和统计测试三个主要模块。首先,收集生成的代码和相应的提示;然后,计算这些提示对模型参数空间的影响;最后,通过统计测试判断提示集是否偏离正常分布。

关键创新:最重要的技术创新在于引入影响函数作为检测机制,使得CodeSIFT能够在没有预定义威胁模型的情况下,识别出潜在的恶意提示。这与现有方法的本质区别在于其通用性和适应性。

关键设计:在实现中,CodeSIFT采用了特定的参数设置和损失函数,以确保影响函数的计算准确。此外,网络结构设计上考虑了模型的可扩展性,以适应不同规模的LLM。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CodeSIFT在三个开放权重的代码LLM上取得了高达0.98的AUROC分数,尤其在中高注入率下表现优异。同时,假阳性率保持在良好水平,显著优于静态分析基线,展示了其有效性和可靠性。

🎯 应用场景

该研究的潜在应用领域包括软件开发、自动化测试和安全审计等。通过有效检测恶意代码生成提示,CodeSIFT可以帮助开发者提高代码生成的安全性,减少潜在的安全漏洞,具有重要的实际价值和未来影响。

📄 摘要(原文)

Large language models (LLMs) are increasingly used for code generation, yet they remain vulnerable to prompts that elicit insecure implementations. Existing defenses typically rely on predefined threat models or known vulnerability patterns, limiting their effectiveness against novel attacks. We propose CodeSIFT, a threat-model-agnostic detection method that leverages influence functions to identify batches of prompts that induce anomalous model behavior. Rather than detecting specific vulnerabilities, CodeSIFT measures the parameter-space influence of generated code and uses a statistical test to determine whether a candidate prompt set deviates from a benign reference distribution. To evaluate our approach, we introduce two benchmark datasets covering a variety of vulnerabilities. We evaluate CodeSIFT on three open-weight code LLMs ranging from 3B to 7B parameters, achieving AUROC scores of up to 0.98 at moderate-to-high injection rates, while maintaining well-calibrated false positive rates and substantially outperforming static analysis baselines. These results suggest that influence-function-based detection is a promising direction for identifying malicious code-generation prompts without requiring prior knowledge of the underlying attack class.