Same Request, Different Boundary: Evaluating Cybersecurity Assistance across Conversational Contexts
作者: Rui Yang, Yang Hong, Yichao Xu, Zhengyu Liu, Ziyang Li, Yinzhi Cao
分类: cs.AI, cs.CR
发布日期: 2026-09-01
备注: 14 pages, 7 figures
💡 一句话要点
提出3R-Bench以评估对话上下文中的网络安全请求处理
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 网络安全 对话系统 大型语言模型 合规性评估 对话上下文 机器学习 人工智能
📋 核心要点
- 现有方法在处理网络安全请求时,无法有效区分恶意与合法请求,导致合法用户受到影响。
- 本文提出3R-Bench基准,通过引入对话上下文,评估模型在不同对话历史下的响应变化。
- 实验结果显示,模型在对话历史影响下的合规率变化显著,提供了对话上下文的重要性的新见解。
📝 摘要(中文)
大型语言模型(LLMs)能够解决复杂问题,但在高风险领域的误用可能导致严重后果。因此,模型提供者需要在不拒绝合法请求的情况下阻止恶意使用。现有的网络安全特定数据集未考虑请求的对话上下文。本文引入了3R-Bench(拒绝、重复和修订),这是一个包含150个真实网络安全请求的基准,并在此基础上评估了八个LLMs的表现。研究发现,先前的助手行为显著影响对未改变请求的响应,合规率在拒绝历史后从62.0%上升至接受历史后的85.1%。而在对话分解的情况下,合规率则下降,显示出对话上下文对模型响应的重要性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在网络安全领域对请求的处理问题,现有方法未能有效考虑对话上下文,导致合法请求被拒绝的风险。
核心思路:通过引入3R-Bench基准,结合拒绝、重复和修订的对话设置,评估模型在不同对话历史下的响应变化,以便更好地平衡安全性与可用性。
技术框架:整体架构包括数据集构建、模型评估和对话历史分析三个主要模块。数据集包含150个真实请求,并通过对话上下文进行增强。
关键创新:最重要的创新在于首次考虑对话上下文对网络安全请求响应的影响,揭示了先前助手行为对合规率的显著影响。
关键设计:在实验中,使用了376对请求的历史记录进行分析,设置了合规率的评估标准,并对模型的响应进行了详细的对比分析。实验中还考虑了失败反馈对合规率恢复的影响。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在对话历史影响下,合规率从拒绝历史后的62.0%上升至接受历史后的85.1%。而在对话分解情况下,合规率则显著下降,显示出对话上下文对模型响应的重要性,提供了新的研究方向。
🎯 应用场景
该研究的潜在应用领域包括网络安全助手、智能客服系统和其他需要处理复杂请求的对话系统。通过更好地理解对话上下文对模型响应的影响,可以提升系统的安全性与用户体验,减少误拒绝合法请求的风险,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large Language Models (LLMs) can solve complex problems, but their misuse in high-risk domains can lead to severe consequences. Model providers therefore restrict assistance for potentially harmful requests. Refusing all cybersecurity requests would therefore harm legitimate users. Providers need a mechanism to block malicious use without denying legitimate assistance to defenders. Existing cybersecurity-specific datasets evaluate this mechanism, but none considers the conversational context of a request. We introduce 3R-Bench (Refusal, Repetition, and Revision), a benchmark of 150 real-world cybersecurity requests augmented with two adversarial conversational settings, and evaluate eight LLMs on it. Prior assistant behavior strongly changes responses to an unchanged request: among 376 available pairs from a 400-pair panel, compliance rises from 62.0% after refused history to 85.1% after accepted history. The opposite pattern appears under dialogue decomposition. In comparison, compliance falls from 501/800 direct responses to 172/800 after dialogue; among 738 pairs returning model-authored text in both conditions, the decrease is 45.1 points. Failure feedback recovers only a small fraction of this loss.