Geometric Filtering of LLM-Generated Samples for Few-Shot Text Classification

📄 arXiv: 2608.13866v1 📥 PDF

作者: Benjamín Schindler, Gonzalo A. Ruz

分类: cs.LG, cs.CL

发布日期: 2026-08-14

备注: 6 pages, 2 figures, to be published in IEEE LACCI 2026


💡 一句话要点

提出几何过滤框架以提升LLM生成样本在少样本文本分类中的质量

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 文本分类 合成样本 几何过滤 少样本学习 命名实体识别 大型语言模型 数据增强

📋 核心要点

  1. 现有的LLM生成样本质量不均,导致部分样本无法有效用于文本分类。
  2. 提出的几何过滤框架通过计算样本与真实类别的距离来筛选合成样本,提高分类器训练数据的质量。
  3. 在多项实验中,该方法在性能上显著优于传统的SMOTE方法,且在命名实体识别任务中同样表现出色。

📝 摘要(中文)

大型语言模型(LLMs)能够生成用于文本分类的合成训练数据,但生成样本的质量参差不齐:一些样本位于嵌入空间的正确类别区域,而另一些则落在边缘或跨类别区域。我们提出了一种几何过滤框架,通过计算每个LLM生成样本与真实类别示例在句子嵌入空间中的欧几里得距离,选择几何一致的候选样本。一个软加权机制将过滤得分转化为分类器训练的样本权重。在13个数据集、5个分类器、10种增强方法和超过6700种配置的评估中,我们的方法比SMOTE提高了2.61个百分点(p<0.0001,Cohen's d=0.95,88.9%胜率)。该方法在命名实体识别任务中也具有良好的泛化能力(+9.26pp,100%胜率),且在4个提供商的5个LLM中表现稳健。一个关键发现是,最简单的基于距离的过滤器始终优于复杂的多标准替代方案。

🔬 方法详解

问题定义:本论文旨在解决大型语言模型生成的合成样本在文本分类任务中质量不均的问题。现有方法往往无法有效区分有效样本与无效样本,导致分类性能下降。

核心思路:我们提出了一种几何过滤框架,通过计算每个生成样本与真实类别示例在嵌入空间中的欧几里得距离,筛选出几何上与真实样本一致的候选样本。这样的设计能够有效提高样本的质量,从而提升分类器的性能。

技术框架:该框架主要包括样本生成、几何过滤和样本加权三个模块。首先,使用LLM生成合成样本;然后,通过计算与真实样本的距离进行几何过滤;最后,利用软加权机制将过滤得分转化为样本权重,用于分类器训练。

关键创新:本研究的关键创新在于提出了基于几何距离的过滤方法,简单而有效地提升了生成样本的质量。与复杂的多标准过滤方法相比,基于距离的过滤器在性能上表现更佳。

关键设计:在参数设置上,我们采用了欧几里得距离作为过滤标准,并设计了软加权机制以动态调整样本权重。此外,实验中使用了多种分类器和数据集,以验证方法的普适性和有效性。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,提出的方法在13个数据集上相较于SMOTE提高了2.61个百分点(p<0.0001,Cohen's d=0.95),并在命名实体识别任务中实现了+9.26pp的提升,展现出100%的胜率。这表明该方法在多种场景下均具有显著的性能优势。

🎯 应用场景

该研究的潜在应用领域包括文本分类、命名实体识别等自然语言处理任务。通过提升合成样本的质量,能够有效减少对标注数据的依赖,降低数据获取成本,促进少样本学习的研究和应用。未来,该方法有望在更多的NLP任务中得到推广和应用。

📄 摘要(原文)

Large language models (LLMs) can generate synthetic training data for text classification, but the quality of generated samples is heterogeneous: some fall in correct class regions of the embedding space while others land in peripheral or cross-class zones. We propose a geometric filtering framework that evaluates each LLM-generated sample by its Euclidean distance to real class examples in a sentence embedding space, selecting only geometrically consistent candidates. A soft weighting mechanism transforms filter scores into sample weights for classifier training. Evaluated across 13 datasets, 5 classifiers, 10 augmentation methods, and over 6,700 configurations, our method achieves +2.61 percentage points (pp) over SMOTE ($p<0.0001$, Cohen's $d=0.95$, 88.9% win rate). The approach generalizes to named entity recognition (+9.26pp, 100% win rate) without filter modification, and is robust across 5 LLMs from 4 providers. A key finding is that the simplest distance-based filter consistently outperforms complex multi-criteria alternatives.