Fast and Accurate Quotation Attribution in Literary Texts

📄 arXiv: 2608.02359v1 📥 PDF

作者: Gaspard Michel, Hugo Attali, Elena V. Epure

分类: cs.CL

发布日期: 2026-08-03

🔗 代码/项目: GITHUB


💡 一句话要点

提出高效的引文归属方法以解决文学文本中的归属挑战

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 引文归属 自然语言处理 文学分析 长距离指代 编码器模型

📋 核心要点

  1. 引文归属问题在文学文本中仍然存在挑战,现有方法的准确性受到限制。
  2. 本文提出了一种基于编码器的高效联合评分方法,能够在共享上下文中处理多个引文归属。
  3. 实验结果显示,最佳模型在归属准确率上达到94.5%,并且处理速度显著提升。

📝 摘要(中文)

在文学文本中,将引文归属到其发言者仍然是一个开放的挑战。标准方法虽然高效,但准确性有限。相比之下,大型语言模型(LLM)方法表现优异,但其计算成本限制了在大规模文学分析中的应用。本文提出了一种基于编码器的高效公式,通过共享的大上下文窗口解决多个引文归属问题。使用我们的新公式“联合评分”,在包含超过35,000个手动标注引文的Project Dialogism Novel Corpus(PDNC)上报告了最新的性能。我们的最佳模型在A100 GPU上实现了94.5%的整体归属准确率,处理速度比标准方法快20倍,比基于LLM的方法快超过1000倍。对模型表示的分析表明,联合评分通过保留长距离指代解析信号来改善挑战性归属示例的表现,这种信息在预训练编码器中已经存在。为便于采用,我们发布了ModernBookNLP,一个修改版的BookNLP,替换了其引文归属模型。

🔬 方法详解

问题定义:本文旨在解决文学文本中引文归属的准确性问题。现有方法通常独立预测每个引文的发言者,虽然高效,但在准确性上存在不足,尤其是在复杂的上下文中。

核心思路:论文提出的联合评分方法通过在共享的大上下文窗口中同时处理多个引文归属,提升了模型的表现。该方法利用了预训练编码器中已有的长距离指代解析信号,从而提高了对复杂引文的归属能力。

技术框架:整体架构包括一个编码器模块,该模块接收整个文本作为输入,并通过联合评分机制同时处理多个引文的归属。该方法通过优化上下文信息的利用,增强了模型的推理能力。

关键创新:最重要的技术创新在于联合评分机制,它不同于传统方法的独立预测方式,能够在处理复杂上下文时保持信息的连贯性和一致性。

关键设计:在模型设计中,采用了特定的损失函数来优化引文归属的准确性,并在网络结构中引入了长距离依赖的处理机制,以增强模型对复杂引文的理解能力。通过这些设计,模型在准确性和处理速度上均有显著提升。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,最佳模型在Project Dialogism Novel Corpus上实现了94.5%的整体归属准确率,处理速度比标准方法快20倍,比基于LLM的方法快超过1000倍。这一显著提升表明联合评分方法在引文归属任务中的有效性和高效性。

🎯 应用场景

该研究的潜在应用领域包括文学分析、文本挖掘和自然语言处理等。通过提高引文归属的准确性,研究成果可以帮助学者更好地理解文学作品中的对话结构和人物关系,推动相关领域的研究进展。此外,改进的模型也可应用于其他需要上下文理解的文本分析任务,具有广泛的实际价值和未来影响。

📄 摘要(原文)

Attributing quotations to their speakers in literary texts remains an open challenge. Standard methods, which independently predict a speaker mention for each quotation, are efficient but still limited in accuracy. In contrast, large language model (LLM) approaches achieve strong performance, but their computational cost limits their use in large-scale literary analysis. We propose an encoder-based efficient formulation that resolves multiple quotation attributions within a shared, large context window. Using our new formulation, \textit{joint scoring}, we report state-of-the-art (SOTA) performance on the Project Dialogism Novel Corpus (PDNC), comprising more than 35,000 manually annotated quotations from 22 English novels. Our best model reaches 94.5\% overall attribution accuracy while processing novels $20\times$ faster than comparable standard methods and more than $1000\times$ faster than LLM-based approaches on an A100 GPU. An analysis of models' representations suggests that joint scoring improves on challenging attribution examples by preserving long-range anaphora resolution signal, an information that we found already present in pretrained encoders. To facilitate adoption, we release ModernBookNLP, a modified fork of BookNLP that replaces its quotation attribution model with our best system available at https://github.com/gasmichel/ModernBookNLP_QA/.