GEM: A Generative Embedding Model Bridging Reasoning and Retrieval
作者: Zhili Shen, Craig Macdonald
分类: cs.CL, cs.AI, cs.IR
发布日期: 2026-08-13 (更新: 2026-08-14)
💡 一句话要点
提出GEM模型以解决检索与推理之间的鸿沟问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 生成嵌入模型 信息检索 用户意图推理 检索增强 大型语言模型
📋 核心要点
- 现有检索方法主要依赖表面匹配,导致用户需求与检索理解之间的差距加大。
- GEM模型通过推理用户意图和相关性标准,增强检索过程,将生成与嵌入结合在一起。
- 在推理密集和指令跟随的检索任务中,GEM的表现超越了传统方法,显示出显著的性能提升。
📝 摘要(中文)
现代大型语言模型在推理和指令跟随方面表现出色,使用户能够表达复杂多样的信息需求。然而,传统的检索方法主要依赖于查询与文档之间的表面匹配,导致用户需求表达与检索器理解之间的差距不断扩大。本文提出了GEM,一个生成嵌入模型,通过明确推理用户意图和相关性标准来增强检索。GEM将生成与嵌入统一在一个模型中:首先对查询进行推理,然后附加嵌入标记以编码丰富的检索上下文。在推理密集和指令跟随的检索任务上,GEM展示了其推理增强检索的有效性,超越了非推理变体和基线模型,并且在计算能力上具有可扩展性。代码可在:https://anonymous.4open.science/r/GEM获取。
🔬 方法详解
问题定义:本文旨在解决传统检索方法在理解用户复杂需求时的不足,尤其是在推理和检索之间的鸿沟。现有方法往往无法有效捕捉用户的真实意图和相关性标准。
核心思路:GEM模型的核心思路是通过推理用户的查询意图,生成一个增强的上下文嵌入,从而提高检索的准确性和相关性。该设计旨在弥补传统方法的不足,使检索过程更加智能化。
技术框架:GEM的整体架构包括两个主要阶段:首先,对用户查询进行推理,提取出潜在的意图和相关性标准;然后,生成一个嵌入标记,将丰富的上下文信息附加到查询中,以便进行更有效的检索。
关键创新:GEM的主要创新在于将生成与嵌入结合在一个统一的模型中,通过推理增强检索能力。这一方法与传统的基于表面匹配的检索方法有本质区别,能够更好地理解用户的复杂需求。
关键设计:在模型设计中,GEM采用了特定的损失函数来优化推理和检索的效果,并在网络结构上进行了调整,以确保生成的嵌入能够有效捕捉上下文信息。
🖼️ 关键图片
📊 实验亮点
在推理密集和指令跟随的检索任务中,GEM模型的表现显著优于传统的非推理变体和基线模型,展示了其推理增强检索的有效性。具体而言,GEM在多个任务上实现了显著的性能提升,验证了其设计的有效性和实用性。
🎯 应用场景
GEM模型在信息检索、问答系统和智能助手等领域具有广泛的应用潜力。通过提升检索的准确性和相关性,GEM能够帮助用户更高效地获取所需信息,改善用户体验。此外,随着模型的进一步优化,GEM可能在其他需要推理的任务中展现出更大的价值。
📄 摘要(原文)
Modern LLMs excel at reasoning and instruction following, enabling users to express complex and diverse information needs. However, conventional retrievers largely rely on surface-level matching between queries and documents, resulting in a growing gap between how users express their needs and how retrievers interpret them. In this paper, we present GEM, a generative embedding model that augments retrieval through its own knowledge by explicitly reasoning about user intent and relevance criteria. GEM unifies generation and embedding within a single model: it first reasons over the query, then appends an embedding token to encode the enriched context for retrieval. Evaluated on reasoning-intensive and instruction-following retrieval tasks, GEM demonstrates the effectiveness of its reasoning-augmented retrieval, outperforming its non-reasoning variant and matching baselines using substantially larger models. Furthermore, GEM's generative nature allows test-time compute scaling via prompting to further enhance retrieval performance. Our code is available at: https://anonymous.4open.science/r/GEM.