From Passive Response to Proactive Correction: Enhancing LLM Robustness Against Input Fact Perturbations
作者: Ping Wang, Xiangguo Sun, Bingbing Xu, Guocong Li, Xiaofeng Meng
分类: cs.CL
发布日期: 2026-08-26
备注: Accepted to the Main Conference of EMNLP 2026
💡 一句话要点
提出DEDUCE框架以增强LLM对输入事实扰动的鲁棒性
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 主动纠错 事实扰动 模型鲁棒性 多角度思考 数据集构建 性能评估
📋 核心要点
- 现有方法假设用户输入是可靠的,未能有效处理输入中的事实扰动,导致模型产生错误回应。
- 提出DEDUCE框架,通过三阶段流程实现从被动响应到主动纠错的转变,增强模型对输入错误的处理能力。
- 在TruthfulQA、FalseQA和MisFactQA基准测试中,DEDUCE显著提升了模型的准确性和纠错能力,验证了其有效性和可扩展性。
📝 摘要(中文)
大型语言模型(LLMs)在用户输入包含误导性前提时,常常产生自信但事实错误的回应。现有的幻觉缓解方法通常假设用户输入是可靠的,忽视了这些事实错误如何主动误导模型推理。为了解决这一脆弱性,本文提出了DEDUCE,一个将LLMs从被动响应者转变为主动纠错者的三阶段框架。DEDUCE通过细致的事实提取和验证检测错误,通过多角度思考制定纠正策略,并在提供可靠答案的同时纠正误解。实验结果表明,DEDUCE在多个基准测试中显著提高了模型的准确性和纠错能力。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在面对包含事实错误的用户输入时,产生自信但错误回应的问题。现有方法未能有效应对输入中的事实扰动,导致模型推理受到误导。
核心思路:提出DEDUCE框架,通过三阶段流程将LLMs转变为主动纠错者。第一阶段检测错误,第二阶段制定纠正策略,第三阶段纠正误解并提供可靠答案。这样的设计旨在增强模型对输入错误的鲁棒性。
技术框架:DEDUCE框架分为三个主要阶段:1) 细致的事实提取与验证以检测输入错误;2) 通过多角度思考制定纠正策略;3) 在提供可靠答案的同时纠正模型的误解。
关键创新:DEDUCE的核心创新在于其主动纠错机制,区别于现有方法的被动响应方式,能够有效应对输入中的事实扰动。
关键设计:在DEDUCE中,采用了细粒度的事实提取技术和多角度的策略制定方法,确保模型能够准确识别和纠正错误。具体的参数设置和损失函数设计未在摘要中详细说明,需参考原文获取更多技术细节。
🖼️ 关键图片
📊 实验亮点
实验结果显示,DEDUCE在TruthfulQA和FalseQA等基准测试中显著提高了模型的准确性和纠错能力,具体提升幅度达到了XX%(具体数据需参考原文)。在Qwen、LLaMA和Gemma等模型家族中均表现出一致的性能提升,验证了其有效性和可扩展性。
🎯 应用场景
该研究的潜在应用领域包括智能客服、教育辅导和信息检索等场景,能够提升语言模型在实际应用中的准确性和可靠性。未来,DEDUCE框架有望推动更智能的对话系统和信息处理工具的发展,减少用户因模型错误而产生的误导。
📄 摘要(原文)
Large language models (LLMs) frequently produce confident yet factually incorrect responses when user inputs contain misleading premises, a phenomenon we attribute to fact perturbations in the input. Existing approaches to hallucination mitigation typically assume reliable user inputs, overlooking how such factual errors can actively mislead model reasoning. To address this vulnerability, we propose DEDUCE, a three-stage framework that transforms LLMs from passive responders into proactive error correctors. DEDUCE operates in three stages: (1) detect errors through fine-grained fact extraction and verification; (2) devise correction strategies via multi perspective deliberation; and (3) correct misconceptions while delivering reliable answers. We also present MisFactQA, a dataset containing factual errors of varying degrees, and propose new metrics for evaluating model robustness. Experiments on TruthfulQA, FalseQA, and our MisFactQA benchmark demonstrate that DEDUCE significantly improves both accuracy and error correction capability. Consistent gains across Qwen, LLaMA, and Gemma families confirm its effectiveness and scalability.