Cross-Domain, Multi-Task Data-to-Text Generation without In-Domain Training Data
作者: Yifei Song, Kun Efimov-Zhang, Claire Gardent
分类: cs.CL, cs.AI
发布日期: 2026-08-24
备注: Accepted by EMNLP Findings 2026
💡 一句话要点
提出跨域多任务数据到文本生成方法以解决缺乏训练数据的问题
🎯 匹配领域: 支柱二:RL算法与架构 (RL & Architecture) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 跨域生成 数据到文本 知识蒸馏 结构保持 多任务学习 零-shot 推理 自然语言处理
📋 核心要点
- 现有的数据到文本生成方法通常依赖于特定领域的训练数据,缺乏跨域适应能力。
- 本文提出了一种数据驱动知识蒸馏(DDKD)方法,结合结构保持增强技术,以应对缺乏领域内训练数据的挑战。
- 实验结果显示,DDKD 在多个基准测试中表现优于微调和零-shot 推理,且小模型在某些领域的表现超过了更大的微调模型。
📝 摘要(中文)
结构化数据以多种形式存在(如表格、知识图谱、图表和时间序列),将其转换为文本可能涉及不同的生成任务。然而,之前的数据到文本(D2T)生成研究主要集中于特定任务和数据集,依赖于任务特定的训练数据或大型语言模型的零-shot 能力。本文研究了一种跨域 D2T 生成设置,其中既没有领域内的训练文本也没有测试参考,且领域、生成目标和输入结构差异显著。我们比较了数据驱动知识蒸馏(DDKD)与零-shot 推理和在域外 D2T 数据上的微调,提出了通过结构子抽样和扰动的结构保持增强。实验结果表明,在固定模型规模(17亿参数)下,DDKD 一直优于微调和零-shot 推理。
🔬 方法详解
问题定义:本文旨在解决在缺乏领域内训练数据的情况下进行跨域数据到文本生成的问题。现有方法通常依赖于特定领域的训练数据,限制了其在不同领域间的适应能力。
核心思路:论文提出的数据驱动知识蒸馏(DDKD)方法,旨在通过结构保持增强技术来提高跨域生成的效果。此方法不依赖于领域内的训练文本,而是利用结构信息进行有效的知识迁移。
技术框架:整体架构包括数据驱动知识蒸馏模块和结构保持增强模块。前者负责从源领域提取知识,后者通过结构子抽样和扰动来增强输入数据的多样性。
关键创新:最重要的创新在于提出了结构保持增强技术,使得模型在没有领域内训练数据的情况下仍能有效生成文本。这与传统的依赖于大量领域特定数据的方法形成鲜明对比。
关键设计:在模型设计上,使用了17亿参数的架构,并在损失函数中引入了结构信息的约束,以确保生成文本的结构合理性。
🖼️ 关键图片
📊 实验亮点
实验结果表明,在相同的模型规模下(17亿参数),DDKD 方法在五个基准测试中持续优于微调和零-shot 推理。此外,DDKD 生成的小模型在两个领域的表现超过了更大的微调模型,且在其他三个领域的表现相当,显示出其有效性和高效性。
🎯 应用场景
该研究的潜在应用领域包括智能客服、自动报告生成和数据分析等场景,能够在缺乏领域特定数据的情况下,依然实现高质量的文本生成。未来,该方法可能推动跨域自然语言处理任务的发展,提升模型的通用性和适应性。
📄 摘要(原文)
Structured data exists in many forms (tables, knowledge graphs, charts, and time series), and converting it into text may involve different generation tasks. However, most prior work on data-to-text (D2T) generation has focused on specific tasks and datasets, relying either on task-specific training data or on the zero-shot capabilities of large language models. We study cross-domain D2T generation in a setting where neither in-domain training text nor test references are available, and where domains, generation goals, and input structures vary substantially. We compare data-driven knowledge distillation (DDKD) against zero-shot inference and fine-tuning on out-of-domain D2T data, and introduce structure-preserving augmentation via structural subsampling and perturbation. Experiments on five benchmarks show that, at constant model size (1.7B parameters), DDKD consistently outperforms both fine-tuning and zero-shot inference. Moreover, the resulting small models outperform a much larger finetuned model on two of the five domains, achieving comparable performance on the remaining three. We further construct QUINTD-5, a fivefold extension of QUINTD-1, and show that simply scaling real target-domain inputs yields only modest gains, whereas our augmentation strategy remains more effective and more cost-efficient for cross-domain distillation.