A Unified Mechanistic Analysis of Knowledge- and Safety-Based Refusals

📄 arXiv: 2609.00760v1 📥 PDF

作者: Yuri Son, Seunghee Kim, Hyuhng Joon Kim, Taeuk Kim

分类: cs.CL

发布日期: 2026-09-01

备注: Accepted to EMNLP 2026 (Main Conference)


💡 一句话要点

提出统一机制分析以解决知识与安全拒绝问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 大型语言模型 知识基础拒绝 安全基础拒绝 机制分析 对比研究

📋 核心要点

  1. 现有研究主要孤立分析知识基础拒绝和安全基础拒绝,缺乏对其潜在机制的系统性理解。
  2. 本文通过构建新的数据集,系统性地探讨知识基础拒绝和安全基础拒绝的共同机制,揭示其重叠与区分特性。
  3. 实验结果表明,安全基础拒绝对知识基础拒绝的信号传递更强,且特定类型的专业化主要发生在模型的上层结构中。

📝 摘要(中文)

大型语言模型(LLMs)越来越多地被训练以拒绝超出其知识范围的查询(知识基础拒绝,KR)或违反安全政策的查询(安全基础拒绝,SR)。尽管KR和SR在表面上产生相似的响应,但它们大多是孤立研究的,尚不清楚它们是否共享一个潜在机制。本文通过对213个对比四元组的新数据集进行系统研究,发现KR和SR受重叠但可区分的机制支配。两者共享拒绝方向,但重叠是不对称的:SR对KR的信号传递更强。特定类型的专业化主要出现在上层,KR与不确定性和知识相关的表示对齐,而SR与安全和政策相关的表示对齐。因此,我们将拒绝过程描述为一个先承诺后具体化的过程:一个共享的初始机制承诺拒绝,然后在后续层中通过特定类型的特征指定理由是认知的还是规范的。

🔬 方法详解

问题定义:本文旨在解决知识基础拒绝(KR)和安全基础拒绝(SR)之间潜在机制的理解不足,现有方法多为孤立研究,缺乏系统性分析。

核心思路:通过构建一个包含213个对比四元组的新数据集,系统性地探讨KR和SR的共同机制,揭示其重叠与区分特性,进而提出拒绝过程的“先承诺后具体化”模型。

技术框架:研究采用对比分析的方法,首先收集数据集,然后通过模型的不同层次分析KR和SR的特征,最后总结出两者的机制差异。主要模块包括数据集构建、模型训练和机制分析。

关键创新:本文的主要创新在于揭示了KR和SR之间的重叠与区分机制,提出了拒绝过程的“先承诺后具体化”模型,这一视角与现有孤立分析方法本质上不同。

关键设计:在模型设计中,重点关注上层结构的特征表示,采用特定的损失函数来优化KR和SR的识别能力,同时调整网络结构以增强对不确定性和安全政策的理解。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,安全基础拒绝对知识基础拒绝的信号传递更强,且在模型上层结构中,知识基础拒绝与不确定性相关的表示对齐,安全基础拒绝与政策相关的表示对齐。这一发现为理解大型语言模型的拒绝机制提供了新的视角。

🎯 应用场景

该研究的潜在应用领域包括智能助手、自动客服系统和安全监控等。通过改进模型的拒绝机制,可以提高系统在处理复杂查询时的安全性和可靠性,未来可能对人机交互和自动化决策产生深远影响。

📄 摘要(原文)

Large language models (LLMs) are increasingly trained to decline queries that fall outside their knowledge (knowledge-based refusal, KR) or violate safety policies (safety-based refusal, SR). Although KR and SR result in superficially similar responses, they have largely been studied in isolation, leaving open whether they share an underlying mechanism. We address this gap with a systematic study on a new dataset of 213 contrastive quadruples that jointly probe both refusal types. We find that KR and SR are governed by overlapping yet distinguishable mechanisms. Both share a refusal direction, yet the overlap is asymmetric: SR signals transfer more strongly to KR than the reverse. Type-specific specialization emerges mainly in upper layers, with KR aligning with uncertainty- and knowledge-related representations and SR with safety- and policy-related ones. We thus characterize refusal as a commit-then-specify process: a shared initial mechanism commits to refusing, then type-specific features in later layers specify whether the grounds are epistemic or normative.