From Confusion to Clarity: Confusion-Aware Retrieval and Knowledge Injection for Text Classification
作者: Manish Gupta, Chaitanya Giri, Jayasimha Talur
分类: cs.CL, cs.AI
发布日期: 2026-09-01
备注: EMNLP 2026 (Industry Track)
💡 一句话要点
提出混淆感知检索与知识注入以解决文本分类问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 文本分类 混淆感知 知识注入 大型语言模型 信息检索 模型迁移
📋 核心要点
- 现有方法在处理具有许多语义相似标签的文本分类任务时,无法有效区分相似标签,导致分类准确性下降。
- 本文提出的框架通过识别混淆标签对、扩展候选集并生成区分规则,来增强模型在标签选择上的能力。
- 在多个基准测试中,提出的方法在Macro F1指标上提升了最多10.0个百分点,且小模型通过跨模型迁移获得了显著提升。
📝 摘要(中文)
大型语言模型(LLMs)在将文本分类到具有许多语义相似标签的分类体系时面临挑战,因为这些区分是领域特定的,无法通过预训练捕获。为处理大标签空间,常用的方法是通过嵌入相似性检索前K个候选标签,并提示LLM在其中选择。然而,前K检索虽然减少了候选数量,却无法帮助模型区分相似标签。本文提出一个框架,(1) 识别模型难以区分的标签对,(2) 扩展候选集以包含混淆标签,(3) 生成有针对性的规则以区分相似候选。该框架无需微调,生成的规则可迁移至更小、更便宜的模型。在三个基准测试(WOS、Flipkart、LEDGAR)上,我们的方法在检索基线之上提高了最多10.0个百分点,较小模型(2B-20B)通过跨模型迁移获得了最多11.5个百分点的提升。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在文本分类中难以区分语义相似标签的问题。现有的前K检索方法虽然减少了候选标签数量,但未能有效帮助模型在相似标签之间做出正确选择。
核心思路:论文的核心思路是通过识别模型难以区分的标签对,扩展候选标签集,并生成有针对性的规则来帮助模型更好地进行选择。这种设计旨在增强模型的区分能力,而无需进行微调。
技术框架:整体框架包括三个主要模块:首先,识别混淆标签对;其次,扩展候选标签集以包含这些混淆标签;最后,生成针对性的规则以帮助模型区分相似标签。
关键创新:最重要的创新点在于提出了混淆感知的检索机制和知识注入方法,使得模型能够在没有微调的情况下,利用生成的规则进行有效的标签选择。这与传统的仅依赖于相似性检索的方法有本质区别。
关键设计:在设计中,框架不依赖于复杂的参数设置或损失函数,而是通过简单的规则生成机制来实现知识的注入,确保生成的规则能够有效迁移到更小的模型上。该方法的灵活性使其适用于多种模型架构。
🖼️ 关键图片
📊 实验亮点
实验结果显示,提出的方法在三个基准测试上相较于检索基线提高了Macro F1指标最多10.0个百分点。尤其是较小的模型(2B-20B)通过跨模型迁移获得了最多11.5个百分点的显著提升,证明了该方法的有效性和可迁移性。
🎯 应用场景
该研究的潜在应用领域包括文本分类、信息检索和自然语言处理等。通过提高模型在复杂标签空间中的分类能力,该方法可以广泛应用于电子商务、社交媒体内容分类和法律文书分析等实际场景,提升自动化处理的准确性和效率。未来,该框架的设计理念也可能推动其他领域的研究,促进更智能的模型开发。
📄 摘要(原文)
Large language models (LLMs) struggle to classify text into taxonomies with many semantically similar labels, as the distinctions are domain-specific and not captured by pre-training. To handle large label spaces, a common approach retrieves top-$K$ candidate labels by embedding similarity and prompt the LLM to choose among them. However, top-$K$ retrieval reduces the number of candidates but does not help the model tell similar ones apart. When two similar labels both appear as candidates, the model lacks the signal to choose correctly between them. We propose a framework that (1) identifies which label pairs the model struggles to distinguish, (2) expands the candidate set to include confusable labels, and (3) generates targeted rules to differentiate between similar candidates. The framework requires no fine-tuning, and the generated rules transfer to smaller, cheaper models. On three benchmarks (WOS, Flipkart, LEDGAR), our approach improves Macro F1 by up to 10.0pp over retrieval baselines, with smaller models (2B--20B) gaining up to 11.5pp via cross-model transfer.