NE-R1: Enhancing Named Entity Recognition Model via Reinforcement Learning

📄 arXiv: 2609.02366v1 📥 PDF

作者: Meixuan Chen, Hehan Li, Ruizhi Zhao, Xin Lu, peizhi xu, Liwei Qian, LI Meifang, shuanglong li, Hanmeng Liu, Xin Pei, Yanbiao Ma

分类: cs.CL, cs.AI

发布日期: 2026-09-02

备注: EMNLP2026


💡 一句话要点

提出NE-R1框架以增强命名实体识别模型的性能

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 命名实体识别 强化学习 检索增强生成 多任务学习 领域特定实体

📋 核心要点

  1. 现有的命名实体识别方法在处理长尾和领域特定实体时表现不佳,主要由于缺乏足够的参数知识。
  2. NE-R1框架通过设计“按需检索”机制,结合多任务指令调优和强化学习优化,提升了NER模型的性能。
  3. 实验结果显示,NE-R1在多个基准测试中达到了最先进的性能,F1分数在领域内和跨域评估中均有显著提升。

📝 摘要(中文)

命名实体识别(NER)自大型语言模型(LLMs)问世以来取得了显著进展。然而,长尾和领域特定实体的识别仍然面临挑战,主要由于参数知识的不足。检索增强生成(RAG)提供了一种通过注入外部知识来解决这一问题的有效方法,但在处理熟悉案例时也引入了噪声和不必要的成本。本文提出了NE-R1,一个自适应检索增强的NER框架,设计了“按需检索”机制,并通过两阶段训练方法将其整合到模型中,最终在多个基准测试中实现了最先进的性能,领域内评估的平均F1分数提升了2.52%,零-shot跨域评估提升了1.18%。

🔬 方法详解

问题定义:本文旨在解决命名实体识别(NER)中长尾和领域特定实体识别的挑战,现有方法在处理这些实体时由于缺乏参数知识而表现不佳。

核心思路:NE-R1框架的核心思想是通过“按需检索”机制来动态选择外部知识与模型参数知识的结合,从而提高NER的准确性和效率。

技术框架:NE-R1的整体架构包括两个主要阶段:第一阶段是多任务指令调优初始化,第二阶段是结合链式思维(CoT)的端到端强化学习优化。

关键创新:NE-R1的创新点在于设计了一个多维度奖励机制,综合考虑了识别准确性和检索效益,从而合理选择参数化知识与外部知识的使用。

关键设计:在模型训练中,采用了多任务学习的策略,损失函数设计上考虑了准确性与检索收益的平衡,确保模型在不同场景下的适应性和鲁棒性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

NE-R1在多个基准测试中表现出色,领域内评估的平均F1分数提升了2.52%,而在零-shot跨域评估中提升了1.18%。这些结果表明,NE-R1在处理复杂实体识别任务时具有显著的优势,超越了现有的主流方法。

🎯 应用场景

NE-R1框架在命名实体识别领域具有广泛的应用潜力,尤其是在医疗、法律和金融等专业领域中,能够有效识别长尾和领域特定实体,提升信息提取的准确性和效率。未来,该框架还可以扩展到其他自然语言处理任务中,推动相关技术的发展。

📄 摘要(原文)

Named Entity Recognition (NER) has achieved substantial progress since the advent of large language models (LLMs). Nevertheless, the recognition of long-tail and domain-specific entities remains challenging due to the deficiency in parametric knowledge. Retrieval-augmented generation (RAG) offers a promising remedy by injecting external knowledge, but it also introduces noise and unnecessary cost when dealing with familiar cases. In this paper, we propose NE-R1, a novel framework for adaptive retrieval-augmented NER. We design a "retrieval-on-demand" mechanism for NER. Then we integrate it into models by a two-stage training method: (1) multi-task instruction tuning initialization; (2) end-to-end RL optimization with CoT. To achieve reasonable selection between parameterized and external knowledge, we design a multi-dimensional reward considering both accuracy and retrieval benefit. NE-R1 achieves state-of-the-art performance on various benchmarks, with an average F1 score gain of 2.52% in in-domain evaluation and 1.18% in zero-shot cross-domain evaluation.