When Context Misleads: Intent-Guided Decoding for Robust Retrieval-Augmented Generation

📄 arXiv: 2608.16515v1 📥 PDF

作者: Haolin Jin, Pengyue Yang, Huaming Chen

分类: cs.CL, cs.AI

发布日期: 2026-08-17


💡 一句话要点

提出意图引导解码以解决检索增强生成中的信任问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 检索增强生成 意图引导解码 上下文信任 事实恢复 自然语言处理 大型语言模型 问答系统

📋 核心要点

  1. 现有的RAG系统对检索证据的信任策略固定,导致对错误信息的过度信任或上下文使用不足。
  2. 提出意图引导解码(IGD)框架,根据用户意图动态调节检索上下文与参数记忆的使用。
  3. 在多个基准测试中,IGD显著提升了事实恢复能力,特别是在事实冲突基准上提高了65.4个百分点。

📝 摘要(中文)

检索增强生成(RAG)通过将生成过程与外部证据相结合来提升大型语言模型的性能,但也引入了来源信任问题:检索到的上下文可能有用、无关或甚至误导。现有的RAG系统通常对检索证据应用固定的信任策略,这可能导致对错误上下文的过度信任或在用户明确要求上下文跟随行为时的上下文使用不足。因此,本文提出了意图引导解码(IGD)框架,根据用户意图在检索上下文和参数记忆之间进行调节。IGD使用答案级过滤和标记级修正来引导最终解码轨迹。我们在三个忠实问答基准和三个事实冲突基准上评估了IGD,结果显示IGD在事实恢复方面显著提升,在事实冲突基准上比直接RAG提高了多达65.4个百分点,同时保持或改善了严格的上下文跟随行为,这一发现突显了在RAG中平衡事实性和忠实性的重要性。

🔬 方法详解

问题定义:本文旨在解决检索增强生成(RAG)中因固定信任策略导致的上下文信任问题,现有方法可能过度依赖错误信息或未能有效利用相关上下文。

核心思路:提出意图引导解码(IGD)框架,通过分析用户意图动态调整检索上下文与参数记忆的权重,确保生成内容的准确性与相关性。

技术框架:IGD框架包括两个主要模块:答案级过滤和标记级修正。答案级过滤用于评估检索到的上下文是否符合用户意图,而标记级修正则在生成过程中对每个生成标记进行调整,以确保最终输出的质量。

关键创新:IGD的创新在于其动态调整机制,能够根据用户意图灵活选择使用检索上下文或参数记忆,与传统的固定信任策略形成鲜明对比。

关键设计:在设计上,IGD采用了特定的损失函数来平衡上下文的信任度,并引入了多层次的网络结构以增强模型的适应性和灵活性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,IGD在事实冲突基准上相比直接RAG提升了多达65.4个百分点,且在保持严格上下文跟随行为的同时,显著提高了事实恢复能力。这些结果验证了IGD在平衡事实性与忠实性方面的有效性。

🎯 应用场景

该研究的潜在应用领域包括智能问答系统、对话生成和信息检索等。通过提升生成内容的准确性和相关性,IGD能够显著改善用户体验,未来可能在教育、客服和信息检索等多个行业产生深远影响。

📄 摘要(原文)

Retrieval-augmented generation (RAG) improves large language models by grounding generation in external evidence, but it also introduces a source trust problem: retrieved context may be useful, irrelevant, or even misleading. Existing RAG systems often apply a fixed trust policy toward retrieved evidence, which can either over-trust incorrect context or underuse context when the user explicitly asks for context-following behavior. Therefore, we propose Intent-Guided Decoding (IGD), a framework that arbitrates between retrieved context and parametric memory according to user intent. IGD uses answer-level filtering and token-level correction to steer the final decoding trajectory between retrieved context and parametric memory. We evaluate IGD on three faithful QA benchmarks and three factual-conflict benchmarks across five LLMs, IGD substantially improves factual recovery, achieving gains of up to 65.4 percentage points on factual-conflict benchmarks over Direct RAG, while preserving or improving strict context-following behavior, this findings highlight the importance of balancing factuality and faithfulness in RAG.