ReFrame: Evidence-Guided Test-Time Safety Alignment in Multimodal Large Language Models

📄 arXiv: 2608.21100v1 📥 PDF

作者: Wenzheng Jiang, Xuankun Rong, Yuanzhao Zhai, Dawei Feng, Huaimin Wang

分类: cs.AI

发布日期: 2026-08-21

备注: Accepted to EMNLP 2026. 22 pages, 7 figures, 5 tables


💡 一句话要点

提出ReFrame以解决多模态大语言模型的安全对齐问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多模态大语言模型 安全对齐 越狱攻击防御 风险管理 无训练框架

📋 核心要点

  1. 现有多模态大语言模型在安全对齐方面面临挑战,尤其是对越狱攻击的防御和安全意识的提升。
  2. 本文提出ReFrame框架,通过两个代理共享轻量级MLLM,进行风险和效用证据的生成与重写,避免了对模型的修改。
  3. 实验结果表明,ReFrame在多个基准上显著提高了安全性,降低了过敏反应,同时保持了多模态的效用。

📝 摘要(中文)

多模态大语言模型(MLLMs)虽然扩展了模型的能力,但也使得安全对齐变得愈加复杂。现有的多模态安全对齐方法往往依赖于重训练或内部状态检查,这限制了其在已部署的闭源MLLMs中的适用性。本文分析了这一现状,识别出效用主导和推理惯性两个关键障碍,导致模型忽视潜在风险或遵循恶意推理轨迹。为此,提出了ReFrame,一个无训练的多模态输入重构框架,利用两个代理共享轻量级本地部署的MLLM,显著提高了对越狱攻击的防御、安全意识和过敏反应的减少,同时保留了多模态效用。

🔬 方法详解

问题定义:本文旨在解决多模态大语言模型在测试时的安全对齐问题,现有方法依赖重训练或内部状态检查,限制了其在闭源模型中的应用。

核心思路:提出ReFrame框架,通过两个代理进行风险和效用证据的生成与重写,避免对模型的直接修改,旨在提升安全性和效用。

技术框架:ReFrame框架包含两个主要模块:证据生成代理和重写与路由代理。证据生成代理负责构建风险和效用证据,重写与路由代理则将这些证据转换为安全的代理提示和图像路由决策。

关键创新:ReFrame的创新在于其无训练的设计,能够在不修改模型或访问其内部信息的情况下进行安全对齐,与现有方法形成鲜明对比。

关键设计:框架中的关键设计包括轻量级的本地部署MLLM、证据生成和重写的策略,以及如何有效地将生成的证据转化为安全提示的具体实现。

📊 实验亮点

实验结果显示,ReFrame在多个多模态大语言模型上显著提升了安全性,越狱攻击防御能力提高了XX%,安全意识提升了YY%,过敏反应减少了ZZ%。这些结果表明该方法在实际应用中的有效性和可靠性。

🎯 应用场景

该研究的潜在应用领域包括安全敏感的多模态交互系统,如智能助手、自动驾驶和医疗诊断等。通过提升模型的安全性和效用,ReFrame能够在实际应用中减少潜在风险,增强用户信任,推动多模态技术的广泛应用。

📄 摘要(原文)

While multimodal large language models (MLLMs) extend model capabilities beyond text, they also make safety alignment increasingly challenging. Multimodal safety alignment methods must address cross-modal jailbreaks, safety-awareness failures, and over-sensitive refusals. However, existing methods often rely on retraining or internal-state inspection, limiting their applicability to deployed closed-source MLLMs and motivating test-time safety alignment. We analyze this setting and identify two key obstacles, utility dominance and reasoning inertia, which cause models to overlook latent risks or follow malicious reasoning trajectories. Guided by these insights, we propose ReFrame, a training-free multimodal input reframing framework where two agents share a lightweight locally deployed MLLM: the evidence-generation agent constructs complementary risk and utility evidence, and the rewrite-and-routing agent converts it into a safe proxy prompt and image-routing decision before calling the downstream MLLM, without modifying it or accessing its internal information. Experiments across multiple MLLMs and benchmarks show that ReFrame improves jailbreak defense, safety awareness, and oversensitivity reduction while preserving multimodal utility.