Data Citation for Large Language Models: A Challenge
作者: Gianmaria Silvello
分类: cs.IR, cs.AI, cs.DB, cs.DL
发布日期: 2026-08-26
备注: 7 pages, journal paper
💡 一句话要点
提出数据引用机制以解决大型语言模型的引用挑战
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 数据引用 大型语言模型 可验证性 知识图谱 跨学科合作
📋 核心要点
- 核心问题:现有方法在大型语言模型中缺乏有效的数据引用机制,导致输出的可验证性和数据源追溯性不足。
- 方法要点:论文提出通过训练数据归属、推理时的数据引用和知识图谱引用来解决数据引用的挑战。
- 实验或效果:虽然具体实验结果未知,但强调了跨学科合作的重要性,以推动数据引用机制的发展。
📝 摘要(中文)
大型语言模型在信息获取中扮演着越来越重要的角色,然而,关于它们是否引用输出背后的数据源的问题日益受到关注。现有研究主要将引用视为验证工具,适用于文本文件。本文提出数据引用不仅限于文本,还应涵盖数据,强调这是一个独特且更具挑战性的开放问题。作者探讨了如何确保模型在输出中引用数据,以保持可验证性、可追溯性和对数据创作者的信用。文章提出了三个研究方向,包括训练数据归属、推理时的数据引用和知识图谱事实的引用,强调跨数据库、信息检索、知识表示和人工智能领域的协作至关重要。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在输出中如何有效引用数据的问题。现有方法主要集中在文档级引用,未能满足数据引用的需求,导致可验证性和追溯性不足。
核心思路:论文提出三种研究方向,分别是训练数据归属、推理时的数据引用和知识图谱事实的引用,旨在确保模型输出的可验证性和对数据创作者的信用。
技术框架:整体架构包括三个主要模块:1) 训练数据归属模块,负责将影响估计转化为数据集引用;2) 推理时数据引用模块,识别数据集和查询结果;3) 知识图谱引用模块,定义单个三元组的引用含义及其信用传播。
关键创新:最重要的创新在于将数据引用从文档级扩展到数据级,强调数据的可追溯性和创作者的信用,这与现有方法的侧重点有本质区别。
关键设计:关键设计包括如何准确估计训练数据的影响、在推理时如何选择合适的数据集和子集,以及如何在知识图谱中定义引用的具体含义。具体参数设置和损失函数的设计尚未详细说明。
🖼️ 关键图片
📊 实验亮点
虽然具体实验结果未知,但论文强调了跨学科合作的重要性,以推动数据引用机制的发展,期望在未来的研究中实现更高的可验证性和追溯性。
🎯 应用场景
该研究的潜在应用领域包括学术研究、数据管理和人工智能系统的透明性。通过建立有效的数据引用机制,可以提高大型语言模型的可信度和可追溯性,从而促进数据创作者的权益保护和学术诚信的维护。
📄 摘要(原文)
Large language models increasingly mediate access to information, and a growing body of work asks whether they cite the sources behind their outputs. That work treats citation as a verification device and applies it to textual documents. Scholarly citation serves two further functions, credit and provenance, and it applies to data as much as to text. This paper argues that data citation for large language models is an open challenge, distinct from document-level citation grounding and harder to solve. We ask how such models should cite data so that outputs stay verifiable, provenance stays traceable, and credit reaches data creators and curators. We set out three research directions. Training data attribution has to turn influence estimates into references for corpora absorbed into model parameters. Data citation at inference time has to identify datasets, subsets, and query results at the right granularity and fixity. Citing knowledge graph facts has to define what a reference to a single triple denotes and how credit propagates along provenance. Progress on all three depends on joint work across the database, information retrieval, knowledge representation, and artificial intelligence communities.