Learning to Reason and Use Tools through Unsupervised Fine-Tuning in Task-Oriented Dialog Systems
作者: Markel Ferro, Oier Lopez de Lacalle
分类: cs.CL
发布日期: 2026-08-31
备注: Accepted to SEPLN 2026
💡 一句话要点
通过无监督微调提升任务导向对话系统的推理与工具使用能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 任务导向对话 无监督微调 推理能力 工具使用 动态信息检索 大型语言模型 ReAct框架
📋 核心要点
- 现有对话系统在动态信息检索中表现不佳,导致响应准确性低和幻觉现象频发。
- 本文提出了一种无监督微调管道,通过上下文学习推理轨迹,增强LLMs的外部知识访问能力。
- 实验结果显示,基于ReAct的系统在推理和工具使用方面优于基线,微调的8B模型性能超过70B的上下文系统。
📝 摘要(中文)
当前对话系统在动态信息检索方面存在困难,常导致幻觉现象和响应准确性降低。本文通过调整ReAct框架,使大型语言模型(LLMs)能够访问外部知识并生成事实响应。我们提出了一种无监督微调管道,通过上下文学习推理轨迹进行收集,并利用基于LLM的评判者过滤高质量样本以构建稳健的训练集。此外,论文引入了无监督自我改进循环,改进的检查点生成越来越好的轨迹以进行后续微调。实验结果表明,基于ReAct的系统在SIMMC数据集上优于基线,推理和工具使用能力显著提升。值得注意的是,我们微调的8B模型超越了70B的上下文系统。最后,论文还进行了错误分析、场景复杂度影响及跨领域泛化的探讨。
🔬 方法详解
问题定义:本文旨在解决任务导向对话系统在动态信息检索中的不足,现有方法常导致信息不准确和幻觉现象。
核心思路:通过无监督微调和上下文学习推理轨迹,增强大型语言模型的推理能力和工具使用能力,从而提高响应的准确性。
技术框架:整体架构包括无监督微调管道、LLM评判者过滤高质量样本、以及无监督自我改进循环,形成一个闭环的训练流程。
关键创新:最重要的创新在于引入了无监督自我改进循环,使得每次微调都能基于前一次的改进生成更优的推理轨迹,与现有方法相比,显著提升了模型的性能。
关键设计:在参数设置上,采用了特定的损失函数和网络结构,以确保推理轨迹的质量和多样性,同时利用LLM评判者进行样本的高效筛选。
🖼️ 关键图片
📊 实验亮点
实验结果表明,基于ReAct的系统在SIMMC数据集上表现优异,推理和工具使用能力显著提升。微调的8B模型在性能上超越了70B的上下文系统,展示了无监督微调的有效性和潜力。
🎯 应用场景
该研究的潜在应用领域包括智能客服、虚拟助手和其他需要动态信息检索的对话系统。通过提升对话系统的推理能力和工具使用能力,能够显著改善用户体验和信息获取的准确性,未来可能在多个行业中产生深远影响。
📄 摘要(原文)
Current dialogue systems struggle with dynamic information retrieval, often leading to hallucinations and lower response accuracy. We address this by adapting the ReAct framework for Task-Oriented Dialogue, enabling Large Language Models (LLMs) to access external knowledge and produce factual responses. Mainly, we propose an unsupervised fine-tuning pipeline that harvests reasoning trajectories via in-context learning inference. High-quality samples are filtered using an LLM-based judge to construct a robust training set. This is enhanced by a unsupervised self-improvement loop, where improved checkpoints generate increasingly better trajectories for subsequent fine-tuning iterations. Experiments on the SIMMC dataset demonstrate that ReAct-based systems outperform baselines due to superior reasoning and tool use. Notably, our fine-tuned 8B model surpasses a 70B in-context system. Finally, we present an error analysis, impact of scene complexity, and cross-domain generalization.