Training-Free versus Training-Based Intent Classification in LLMs: Accuracy, Robustness, and Failure Modes

📄 arXiv: 2608.02415v1 📥 PDF

作者: Nan Chen, Zhouhao Yang, Soufiane Hayou

分类: cs.CL

发布日期: 2026-08-03

备注: Accepted at the Conference on Language Modeling (COLM 2026)


💡 一句话要点

比较训练无关与训练相关的意图分类方法以提升分类准确性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 意图分类 大型语言模型 训练无关方法 鲁棒性 多层感知机

📋 核心要点

  1. 现有的意图分类方法在处理复杂任务时准确性不足,尤其是在混合意图和对抗性提示的情况下。
  2. 本文提出了两种基于内部表示统计的轻量级训练无关方法,并与训练相关的多层感知机分类器进行比较。
  3. 实验结果显示,训练相关方法在复杂任务上表现更佳,而训练无关方法在鲁棒性方面具有优势。

📝 摘要(中文)

在大型语言模型(LLMs)中,意图分类涉及将用户提示归类到预定义类别中,例如数学、编码或通用文本处理。此分类有助于将提示路由到针对特定领域优化的专用模型,从而提高准确性和计算效率。本文系统比较了训练无关与训练相关的意图分类方法,考虑了基于内部表示统计的两种轻量级训练无关方法,并将其与多层感知机分类器和线性探测器进行了比较。综合实证评估表明,训练无关和训练相关方法在简单基准上均表现良好,但在更复杂的分类任务中,训练相关分类器具有优势,而训练无关方法在混合意图和对抗性提示下更具鲁棒性。

🔬 方法详解

问题定义:本文旨在解决大型语言模型中的意图分类问题,尤其是现有方法在复杂任务和对抗性提示下的准确性和鲁棒性不足。

核心思路:通过引入两种训练无关的方法,利用内部表示的统计特性进行意图分类,旨在提高分类的准确性和鲁棒性。

技术框架:整体架构包括数据预处理、内部表示提取、分类器设计和性能评估四个主要模块。首先提取用户提示的内部表示,然后应用不同的分类器进行意图分类,最后评估分类性能。

关键创新:本文的创新在于提出了两种轻量级的训练无关方法,这些方法在处理简单和复杂任务时表现出不同的优势,与传统的训练相关方法相比,具有更好的鲁棒性。

关键设计:在方法设计中,采用了统计特性提取作为核心技术,设置了适当的超参数以优化分类器性能,同时使用了标准的损失函数进行训练和评估。具体的网络结构和参数设置在实验部分进行了详细说明。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,训练相关的分类器在复杂任务(如Java与Python的区分)上表现优于训练无关方法,而训练无关方法在处理混合意图和对抗性提示时展现出更高的鲁棒性。这一发现为意图分类方法的选择提供了新的视角。

🎯 应用场景

该研究的潜在应用领域包括智能客服、自动化问答系统和人机交互等场景。通过提高意图分类的准确性和鲁棒性,可以显著提升用户体验和系统的响应效率,具有重要的实际价值和未来影响。

📄 摘要(原文)

Intent classification in Large Language Models (LLMs) involves categorizing user prompts into predefined classes. For instance, given a user prompt, the system must determine whether it primarily concerns mathematics, coding, or general text processing. Such classification enables routing prompts to specialized models optimized for specific domains, improving both accuracy and computational efficiency. In this work, we conduct a systematic study comparing training-free vs training-based approaches for intent classification. For this purpose, we consider two lightweight, training-free methods based on statistics of internal representations and compare them against MLP classifiers and linear probes. Our comprehensive empirical evaluation reveals that 1) Both training-free and training-based methods saturate easy benchmarks (mathematics vs. coding vs. natural language), 2) Training-based classifiers have an advantage on harder classification tasks (e.g. Java vs Python), and 3) Training-free methods are generally more robust to mixed-intent and adversarial prompts.