ROBE: Reversed-Order-Biased-Experts for Extracting Extreme Long-tail Events from Historical Texts
作者: Stella Verkijk, Piek Vossen
分类: cs.CL
发布日期: 2026-08-25
备注: 15 pages, 3 figures
💡 一句话要点
提出ROBE方法以解决历史文本中极端长尾事件提取问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 长尾事件提取 历史文本分析 专家分类器 频率偏见 合成数据生成
📋 核心要点
- 核心问题:现有方法在提取历史文本中的长尾事件时面临严重的频率偏见,导致稀有事件的提取效果不佳。
- 方法要点:提出ROBE方法,通过创建专家分类器并赋予稀有事件更高的优先级,来有效提取长尾事件。
- 实验或效果:ROBE的实现方式在召回率和精确率上分别提高了0.10和0.16,最佳模型的F1值提升了0.10。
📝 摘要(中文)
本文提出了一种从17和18世纪的荷兰历史语料库中提取超过50种事件的方法。这些方法旨在解决一个几乎不可能实现的目标:提取长尾中的长尾。19世纪之前的历史数据本身就是一个小众领域,且在大型语言模型的预训练中未被覆盖。我们提出为训练数据中存在的事件子组创建专家分类器,基于频率相似性或语义相关性进行分组。针对代表性不足的事件,专家分类器在预测时被赋予更高的优先级,以避免频率偏差的影响。我们将这种新型分类器组合方式称为ROBE:反向顺序偏见专家。我们还提出了一种控制方法来创建特定领域的合成数据。ROBE的两种实现方式在召回率和精确率上分别比简单的微调编码器模型提高了0.10和0.16,最佳模型在长尾类别的F1值上提高了0.10。
🔬 方法详解
问题定义:本文旨在解决从历史文本中提取极端长尾事件的挑战。现有方法在处理19世纪之前的历史数据时,往往受到频率偏见的影响,导致稀有事件的提取效果不理想。
核心思路:论文提出通过创建专家分类器来针对训练数据中不同事件的子组进行分类,专家分类器在预测时优先考虑稀有事件,以减少频率偏见的影响。这种方法旨在更有效地提取长尾事件。
技术框架:整体架构包括数据预处理、专家分类器的创建与训练、事件预测和结果整合等主要模块。通过对事件进行分组,基于相似的频率或语义关系,构建多个专家模型。
关键创新:ROBE方法的核心创新在于反向顺序偏见专家的设计,通过优先考虑稀有事件的专家分类器,显著改善了长尾事件的提取效果。这一方法与传统的频率优先模型形成鲜明对比。
关键设计:在模型设计中,采用了特定的损失函数来平衡不同事件的权重,同时在网络结构上进行了优化,以适应长尾事件的特征。
🖼️ 关键图片
📊 实验亮点
ROBE方法在实验中表现出色,召回率提高了0.10,精确率提高了0.16,最佳模型在长尾类别的F1值上提升了0.10,显著优于简单的微调编码器模型,展示了其在长尾事件提取中的有效性。
🎯 应用场景
该研究的潜在应用领域包括历史文本分析、事件抽取和信息检索等。通过有效提取历史数据中的长尾事件,能够为历史研究、文化遗产保护和社会科学研究提供重要的数据支持,具有实际价值和深远影响。
📄 摘要(原文)
This paper proposes methods to extract over 50 types of events from a Dutch historical corpus spanning the 17th and 18th centuries. The methods we propose aim to tackle the impossible: extracting the long-tail of the long-tail. Historic data from before the 19th century is in itself a niche domain not covered in the pre-training of Large Language Models, and we aim to extract events only very scarcely annotated in the training data available for this domain. We propose creating expert classifiers for subgroups of the events present in the training data. We make these groupings based on similar frequency in the training data or on semantic relatedness. Experts trained on underrepresented events are assigned higher priority when predicting to avoid being dominated by frequency biases. We refer to this new way of combining classifiers, specifically tailored to protect the long-tail, as ROBE: Reversed-Order-Biased-Experts. We also propose a controlled method to create domain-specific synthetic data. Our two implementations of ROBE outperform a simple fine-tuned encoder model with a .10 increase in recall and a .16 increase in precision respectively. The best model achieves a .10 increase in f1 for a group of long-tail classes in our niche data set.