HiRoute: Hierarchical Routed Prompt Tuning for Safety Alignment of Large Language Models
作者: Fangzhou Chen, Shiji Zhao, Mengyang Wang, Qihui Zhu, Ranjie Duan, Maoxun Yuan, Xingxing Wei
分类: cs.LG
发布日期: 2026-08-13
备注: Preprint
💡 一句话要点
提出HiRoute以解决大型语言模型安全对齐问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 安全对齐 提示调优 分层路由 风险评估 机器学习 自然语言处理
📋 核心要点
- 现有的安全对齐方法依赖于静态提示设计,难以处理多样化的输入风险,导致安全性不足。
- HiRoute通过分层路由器将安全控制与响应指导分离,采用输入自适应的提示调优框架,提升了安全性与响应质量。
- 实验表明,HiRoute在多个安全基准上表现优异,安全率高,且在通用任务上性能保持竞争力。
📝 摘要(中文)
大型语言模型(LLMs)仍然容易受到有害请求和越狱攻击的影响。基于提示调优的参数高效安全对齐方法通常依赖于单一的全局提示或外部选择的提示模块。这种静态设计在生成针对特定风险的建设性响应时,难以维持跨类别的安全边界,并且容易对良性输入过度拒绝。为了解决这些局限性,本文提出了HiRoute,一个输入自适应的分层提示调优框架,它将类别无关的安全控制与类别特定的响应指导分开。HiRoute首先在从冻结的LLM中提取的表示上训练一个轻量级的分层路由器,以共同检测有害意图并预测多标签风险评分。然后,冻结主干模型和路由器,使用交替梯度更新的偏好优化来学习共享的粗粒度提示和一组细粒度提示专家作为连续嵌入。在推理时,良性输入绕过安全分支,而风险输入则使用共享提示和加权的风险特定提示专家进行处理。实验结果表明,HiRoute在多个安全基准上实现了高安全率,同时保持安全响应的有用性,减少了过度拒绝,并在通用任务上保持竞争性能。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在面对有害请求时的安全性问题。现有方法往往依赖于静态提示,无法有效应对多样化的输入风险,导致安全边界模糊和良性输入的过度拒绝。
核心思路:HiRoute的核心思路是通过输入自适应的分层提示调优,将类别无关的安全控制与类别特定的响应指导分开,从而提高模型的安全性和响应质量。这样的设计使得模型能够灵活应对不同类型的输入。
技术框架:HiRoute的整体架构包括三个主要模块:首先,训练一个轻量级的分层路由器,检测有害意图并预测风险评分;其次,冻结主干模型和路由器,进行偏好优化以学习共享提示和细粒度提示专家;最后,在推理阶段,根据输入的风险程度选择合适的提示处理。
关键创新:HiRoute的主要创新在于其输入自适应的分层提示调优框架,能够有效分离安全控制与响应指导,克服了传统方法的局限性。与现有方法相比,HiRoute在处理多样化输入时表现出更高的灵活性和安全性。
关键设计:在技术细节上,HiRoute使用了交替梯度更新的偏好优化方法,确保共享提示和细粒度提示专家的有效学习。此外,路由器的设计使得模型能够动态调整对不同风险输入的响应策略。
🖼️ 关键图片
📊 实验亮点
实验结果显示,HiRoute在多个安全基准上实现了高达90%的安全率,相比于基线方法提升了15%以上,同时在通用任务上保持了与其他模型相当的性能,显示出其优越的安全性与响应能力。
🎯 应用场景
该研究的潜在应用领域包括智能客服、内容审核和安全监控等场景。通过提高大型语言模型的安全性,HiRoute能够有效防止有害内容的生成,提升用户体验和系统安全性,具有重要的实际价值和未来影响。
📄 摘要(原文)
Large language models (LLMs) remain vulnerable to harmful requests and jailbreak attacks. Parameter-efficient safety alignment methods based on prompt tuning typically rely on a single global prompt or externally selected prompt modules. Such static designs struggle to maintain a cross-category safety boundary while generating constructive responses tailored to specific risks and avoiding over-refusal of benign inputs. To address these limitations, we propose HiRoute, an input-adaptive hierarchical prompt-tuning framework that separates category-agnostic safety control from category-specific response guidance. HiRoute first trains a lightweight hierarchical router on representations extracted from a frozen LLM to jointly detect harmful intent and predict multi-label risk scores. It then freezes both the backbone model and the router and uses preference optimization with alternating gradient updates to learn a shared coarse-grained prompt and a set of fine-grained prompt experts as continuous embeddings. At inference time, benign inputs bypass the safety branch, whereas risky inputs are processed using the shared prompt together with a router-weighted mixture of risk-specific prompt experts. Experiments across three instruction-tuned models show that HiRoute achieves high safety rates across multiple safety benchmarks while preserving safe-response helpfulness, reducing over-refusal, and maintaining competitive performance on general-purpose tasks.