GPTKB 2.0: Browsing, Querying, and Auditing a Disambiguated LLM-Derived Knowledge Base
作者: Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski
分类: cs.CL, cs.AI, cs.DB
发布日期: 2026-08-07
备注: 7 pages, 11 figures
💡 一句话要点
提出GPTKB 2.0以解决知识库歧义性问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 知识库 去歧义 大型语言模型 SPARQL查询 信息检索 知识图谱 智能问答
📋 核心要点
- 现有的LLM衍生知识库主要依赖表面字符串来识别实体,导致歧义性问题严重,影响知识的准确性和可用性。
- GPTKB 2.0通过上下文引导的去歧义方法,在构建知识库的过程中有效分离同名词并合并同义提及,提升了知识的质量。
- 该系统提供了用户友好的界面,支持SPARQL查询和自然语言问题,用户可以方便地浏览和审计知识库中的信息。
📝 摘要(中文)
我们展示了一个用于探索大规模去歧义知识库(KB)的网络演示,该知识库源自大型语言模型(LLM)。GPTKB 2.0包含3840万个三元组,涵盖160万个规范实体,以及207.6K合并关系和66K合并类别。与以往主要通过表面字符串识别实体的LLM衍生知识库不同,GPTKB 2.0在递归KB构建过程中进行上下文引导的去歧义,分离同名词并合并同义提及。该演示使得这一过程可供检查:用户可以浏览实体,跨KB跟踪链接,并审计单个事实的来源,包括表面形式、候选匹配、源三元组和去歧义决策。该界面还支持结构化的SPARQL查询、翻译为SPARQL的自然语言问题,以及从用户提供的文本链接到规范的GPTKB 2.0条目。GPTKB 2.0可在https://gptkb.org/上获取,完整的KB可离线下载。
🔬 方法详解
问题定义:本论文旨在解决现有LLM衍生知识库在实体识别中存在的歧义性问题,现有方法往往依赖表面字符串,导致同名词混淆和知识准确性下降。
核心思路:GPTKB 2.0通过上下文引导的去歧义技术,在知识库构建过程中动态识别和处理同名词与同义词,从而提高知识的准确性和一致性。
技术框架:整体架构包括数据收集、上下文分析、三元组生成和去歧义模块,用户可以通过前端界面与知识库交互,进行查询和审计。
关键创新:最重要的技术创新在于引入了上下文引导的去歧义机制,使得知识库在构建过程中能够实时处理歧义问题,显著提升了知识的质量和可用性。
关键设计:在设计中,采用了多层次的上下文分析算法,结合了候选匹配和源三元组的审计机制,确保了去歧义过程的透明性和可追溯性。具体的参数设置和损失函数设计未在摘要中详细说明,需参考完整论文。
🖼️ 关键图片
📊 实验亮点
实验结果表明,GPTKB 2.0在去歧义任务上相较于传统方法提升了知识准确性,具体性能数据和对比基线在摘要中未详细列出,需参考完整论文以获取更多信息。
🎯 应用场景
GPTKB 2.0的潜在应用场景包括智能问答系统、知识图谱构建、信息检索和数据整合等领域。其去歧义能力能够显著提升知识库的准确性和用户体验,具有广泛的实际价值和未来影响。
📄 摘要(原文)
We present a web demo for exploring a large-scale disambiguated knowledge base (KB) materialized from a large language model (LLM). GPTKB 2.0 contains 38.4M triples over 1.6M canonical entities, together with 207.6K consolidated relations and 66K consolidated classes. Unlike prior LLM-derived knowledge bases that largely identify entities by surface strings, GPTKB 2.0 performs context-guided disambiguation during recursive KB construction, separating homonyms and merging synonymous mentions as facts are elicited. The demo makes this process inspectable: users can browse entities, follow links across the KB, and audit the provenance of individual facts, including surface forms, candidate matches, source triples, and disambiguation decisions. The interface further supports structured SPARQL queries, natural-language questions translated to SPARQL, and entity linking from user-provided text to canonical GPTKB 2.0 entries. GPTKB 2.0 is available at https://gptkb.org/, with the full KB downloadable for offline use.