Scaling Creative Writing Beyond Story-Centric Data with Attribute-Guided Genre Expansion
作者: Hwan Chang, Yongil Kim, Heuiyeen Yeen, Yireun Kim, Jinsik Lee, Hwanhee Lee
分类: cs.CL
发布日期: 2026-08-14
备注: CIKM 2026
💡 一句话要点
提出属性引导的体裁扩展框架以解决创意写作数据不足问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 创意写作 大型语言模型 体裁扩展 数据增强 机器学习
📋 核心要点
- 现有的创意写作数据主要集中在故事生成上,导致模型在多样化创意格式上的能力受限。
- 本文提出的框架通过分离主题广度与体裁控制,利用人类创作的提示和手动策划的体裁属性,扩展创意写作数据。
- 实验结果显示,基于新数据微调的模型在多项写作基准测试中超越了现有模型,证明了体裁扩展的重要性。
📝 摘要(中文)
高质量的创意写作数据在大型语言模型(LLMs)中仍然以故事为中心,限制了模型遵循多样创意格式的结构和功能规范的能力。本文提出了一种属性引导的体裁扩展框架,旨在超越故事生成,扩展创意写作数据。通过将主题广度与体裁形式控制分离,该框架利用人类创作的故事提示作为多样的创意种子,并利用手动策划的体裁属性来强制执行不同的结构、风格和格式规范。我们结合这些元素来提示强大的LLMs生成符合体裁的查询-响应对,并进行质量过滤。应用该框架,我们构建了多体裁集合,包含13种创意体裁的50K示例,包括故事、说唱、歌词、剧本、游戏设计、角色设计等。实验表明,基于我们的数据微调的模型在各类写作基准测试中表现优异,超越了基础模型和写作专业基线。
🔬 方法详解
问题定义:本文旨在解决现有创意写作数据以故事为中心的问题,导致模型在多样创意格式上的表现不足。
核心思路:通过属性引导的体裁扩展框架,分离主题广度与体裁形式控制,利用多样化的创意种子和手动策划的体裁属性,增强模型的创意写作能力。
技术框架:该框架包括三个主要模块:1) 人类创作的故事提示作为创意种子;2) 手动策划的体裁属性用于控制结构和风格;3) 强大的LLMs生成符合体裁的查询-响应对,并进行质量过滤。
关键创新:最重要的创新在于通过属性引导的方式实现体裁扩展,而非仅依赖故事生成,从而提升了模型的创意写作能力。
关键设计:在模型训练中,采用了手动策划的体裁属性作为输入,结合多样的创意种子,设计了特定的损失函数以确保生成内容的体裁一致性。通过质量过滤确保生成结果的高质量。
🖼️ 关键图片
📊 实验亮点
实验结果显示,基于新构建的多体裁集合微调的模型在多项写作基准测试中表现优异,超越了基础模型和写作专业基线,证明了体裁扩展的有效性。具体而言,模型在各类体裁的表现提升幅度显著,显示出更强的创意写作能力。
🎯 应用场景
该研究的潜在应用领域包括创意写作辅助工具、游戏设计、剧本创作等。通过提供多样化的创意写作数据,能够帮助创作者在不同体裁中进行灵感激发和内容生成,提升创作效率和质量。未来,该框架有望推动更多领域的创意生成应用。
📄 摘要(原文)
High-quality creative writing data for large language models (LLMs) remains dominated by story-centric data, limiting models' ability to follow the structural and functional conventions of diverse creative formats. We propose an attribute-guided genre expansion framework for scaling creative writing data beyond story generation. By separating thematic breadth from genre-form control, our framework leverages human-authored story prompts as diverse creative seeds, while utilizing manually curated genre attributes to enforce distinct structural, stylistic, and formatting conventions. We combine these to prompt strong LLMs for genre-faithful query-response pairs, which are then quality-filtered. Applying this framework, we construct the Multi-Genre Collection, a 50K-example corpus spanning 13 creative genres, including story, rap, lyrics, scripts, game design, character design, and other creative formats. Experiments across out-of-distribution writing benchmarks and held-out genre diagnostics demonstrate that models fine-tuned on our data consistently surpass not only base models and writing-specialized baselines, but also models trained on existing writing corpora. Genre-count ablations further indicate that controlled genre expansion, rather than story-centric scaling alone, is a key driver of robust creative writing capability.