GEM: A Generative Embedding Model Bridging Reasoning and Retrieval

📄 arXiv: 2608.13200v1 📥 PDF

作者: Zhili Shen, Craig Macdonald

分类: cs.CL, cs.AI, cs.IR

发布日期: 2026-08-13


💡 一句话要点

提出GEM模型以解决检索与推理之间的鸿沟问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生成嵌入模型 用户意图推理 信息检索 智能问答 个性化推荐 深度学习

📋 核心要点

  1. 现有检索方法主要依赖表面匹配,无法有效理解用户复杂的需求,导致检索效果不佳。
  2. GEM模型通过推理用户意图和相关性标准,生成嵌入以增强检索过程,统一了生成与嵌入。
  3. 在推理密集和遵循指令的检索任务中,GEM显著优于传统方法,展示了其推理增强检索的有效性。

📝 摘要(中文)

现代大型语言模型在推理和遵循指令方面表现出色,使用户能够表达复杂多样的信息需求。然而,传统的检索方法主要依赖于查询与文档之间的表面匹配,导致用户需求表达与检索理解之间的差距不断扩大。本文提出了GEM,一个生成嵌入模型,通过明确推理用户意图和相关性标准来增强检索。GEM将生成与嵌入统一在一个模型中:首先对查询进行推理,然后附加一个嵌入标记以编码丰富的上下文进行检索。GEM在推理密集和遵循指令的检索任务中表现出色,超越了非推理变体和基线模型,并且其生成特性允许通过提示在测试时扩展计算,从而进一步提升检索性能。

🔬 方法详解

问题定义:本文旨在解决传统检索方法在理解用户复杂需求方面的不足,尤其是表面匹配导致的效果不佳问题。

核心思路:GEM模型通过推理用户的意图和相关性标准,生成一个嵌入标记来丰富上下文信息,从而提升检索的准确性和相关性。

技术框架:GEM的整体架构包括两个主要阶段:首先对用户查询进行推理,提取意图和相关性信息;然后生成嵌入标记,将这些信息编码并用于检索。

关键创新:GEM的最大创新在于将生成与嵌入结合在一个模型中,突破了传统检索方法的局限,能够更好地理解和响应用户需求。

关键设计:模型设计中采用了特定的损失函数以优化推理过程,并在网络结构上进行了调整,以确保生成嵌入的有效性和准确性。具体参数设置和网络细节在实验部分有详细说明。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

在推理密集和遵循指令的检索任务中,GEM模型的表现超越了传统的非推理变体,且在与基线模型的比较中显示出显著的性能提升,具体提升幅度未知,展示了其推理增强检索的有效性。

🎯 应用场景

GEM模型在信息检索、智能问答系统和个性化推荐等领域具有广泛的应用潜力。通过更好地理解用户意图,GEM能够提升用户体验和信息获取效率,未来可能对人机交互和智能系统的发展产生深远影响。

📄 摘要(原文)

Modern LLMs excel at reasoning and instruction following, enabling users to express complex and diverse information needs. However, conventional retrievers largely rely on surface-level matching between queries and documents, resulting in a growing gap between how users express their needs and how retrievers interpret them. In this paper, we present GEM, a generative embedding model that augments retrieval through its own knowledge by explicitly reasoning about user intent and relevance criteria. GEM unifies generation and embedding within a single model: it first reasons over the query, then appends an embedding token to encode the enriched context for retrieval. \zhili{Evaluated on reasoning-intensive and instruction-following retrieval tasks, GEM demonstrates the effectiveness of its reasoning-augmented retrieval, outperforming its non-reasoning variant and matching baselines using substantially larger models.} Furthermore, GEM's generative nature allows test-time compute scaling via prompting to further enhance retrieval performance. Our code is available at: https://anonymous.4open.science/r/GEM.