CaRL-EM: Cost-Aware Reinforcement Learning for Entity Matching with LLMs

📄 arXiv: 2609.01195v1 📥 PDF

作者: Chaohui Guo, Michel Klein, Zhisheng Huang

分类: cs.CL

发布日期: 2026-09-01

备注: Accepted to ACL 2026 Main Conference


💡 一句话要点

提出CaRL-EM以解决实体匹配中的成本意识问题

🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 实体匹配 成本意识 强化学习 大型语言模型 动态规划 质量-成本优化 零样本迁移

📋 核心要点

  1. 现有方法通常独立做出成对决策,缺乏在多候选环境中的灵活性,且忽视推理成本。
  2. 论文提出CaRL-EM,通过强化学习控制器管理LLM操作,优化质量与成本的平衡。
  3. 实验结果显示CaRL-EM在7个基准上实现了更好的质量-成本权衡,且具备零样本迁移能力。

📝 摘要(中文)

实体匹配(EM)需要细致的上下文理解和领域知识。近期研究表明,大型语言模型(LLMs)在多个领域中可以作为强大的匹配工具,但大多数方法要么独立做出成对决策,要么依赖手动设计的复合管道,缺乏在现实多候选环境中的灵活性。同时,它们通常忽视了大规模推理的成本。我们将基于LLM的EM问题形式化为一个成本意识的序列决策问题,并提出了CaRL-EM,一个管理LLM操作的强化学习控制器。CaRL-EM根据锚记录的状态、候选集和成本,自适应选择不同的操作符(匹配/比较/选择/决策)和模型能力,以最大化质量-成本目标。实验表明,CaRL-EM能够根据任务复杂性动态规划使用廉价和昂贵的操作符,并在不同数据集和领域中实现稳健的零样本迁移,且在质量-成本权衡上优于强基线和手动设计的管道。

🔬 方法详解

问题定义:本论文旨在解决实体匹配中的成本意识问题,现有方法在多候选环境中缺乏灵活性,并且未能有效考虑推理成本。

核心思路:论文提出的CaRL-EM通过将LLM操作视为一个成本意识的序列决策问题,利用强化学习控制器自适应选择操作符,以优化质量与成本的平衡。

技术框架:CaRL-EM的整体架构包括状态输入(锚记录、候选集、成本信息)、操作符选择模块(匹配、比较、选择、决策)和质量-成本优化目标。该框架允许在不同LLM后端之间重用控制器,而无需重新训练。

关键创新:CaRL-EM的主要创新在于其动态规划能力,能够根据任务复杂性选择不同的操作符,并在推理时考虑成本,这与传统方法的静态决策形成鲜明对比。

关键设计:在设计上,CaRL-EM使用了强化学习策略来优化操作符的选择,采用了适应性模型能力配置,确保在不同任务和数据集上均能保持高效的推理性能。具体的损失函数和参数设置在实验中经过调优,以实现最佳的质量-成本平衡。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果表明,CaRL-EM在7个基准测试中表现优异,能够根据任务复杂性动态选择操作符,显著降低推理成本,同时在质量上保持或提升,超越了强基线和手动设计的管道,展示了其在质量-成本权衡上的优势。

🎯 应用场景

CaRL-EM的研究成果在多个领域具有广泛的应用潜力,尤其是在需要高效实体匹配的场景,如电子商务、社交网络和信息检索等。通过优化推理成本,该方法能够提高系统的整体效率,降低运营成本,未来可能在大规模数据处理和智能决策系统中发挥重要作用。

📄 摘要(原文)

Entity matching (EM) requires fine-grained contextual understanding and domain knowledge. Recent work shows that large language models (LLMs) can serve as strong matchers across domains, but most methods either make independent pairwise decisions or rely on manually designed composite pipelines, thus lacking flexibility in realistic multi-candidate settings. At the same time, they typically ignore inference cost at scale. We formulate LLM-based EM with candidates as a cost-aware sequential decision problem and propose CaRL-EM, a reinforcement learning controller that manages LLM operations. Given the state of an anchor record, its candidate set, and the cost, CaRL-EM adaptively chooses among different operators (Match/Compare/Select/Decide) and model capacities to maximize a quality-cost objective. The policy interacts with abstract operators, allowing the same controller to be reused with different underlying LLM backends at inference time without retraining. Experiments on 7 benchmarks show that CaRL-EM (i) learns to dynamically plan the usage of inexpensive and expensive operators based on task complexity, (ii) achieves robust zero-shot transfer across diverse datasets and domains, and (iii) consistently achieves a better quality-cost trade-off than strong LLM-based baselines and manually designed pipelines, yielding a lower inference cost at comparable or higher quality.