Recipes for Creativity: Iterative Generation and Evaluation in Large Language Models

📄 arXiv: 2608.07243v1 📥 PDF

作者: Rens Anderson, Tessa Verhoef, Amirhossein Zohrehvand

分类: cs.AI, cs.CL, cs.NE

发布日期: 2026-08-07

备注: 7 pages, 3 figures, 1 table. Short paper accepted at ICCC'26

期刊: Proceedings of the 17th International Conference on Computational Creativity (ICCC'26), Coimbra, Portugal, June 29-July 3, 2026


💡 一句话要点

提出迭代生成与评估方法以提升大型语言模型的创意表现

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 生成模型 创意评估 迭代生成 人类反馈 食谱生成 TTCT评估 选择评分器

📋 核心要点

  1. 现有生成模型评估方法通常依赖单一作品,无法充分反映人类创造力的迭代特性。
  2. 本研究提出了一种基于迭代生成和选择的框架,结合FunSearch方法进行食谱生成和评估。
  3. 实验结果显示,迭代生成的食谱在创意评分上与人类基准相当,但评估者设计对结果影响显著。

📝 摘要(中文)

生成模型通常通过单一作品进行评估,而人类创造力则通过迭代生成、评估和完善过程展现。本研究探讨了迭代搜索是否能提升大型语言模型(LLM)的创造力,采用FunSearch方法生成2024年Pillsbury Bake-Off的食谱,并通过基于TTCT的LLM评估对输出进行评估。实验结果表明,迭代生成-选择能够产生与人类基准相当的创意评分,但单纯增加迭代次数并未提升创造力。相较之下,循环内评估者的设计显得尤为重要:较小的选择评分器在大多数TTCT维度上显著提高了评分,而温度对创造力的影响有限,仅在独创性方面有所体现。这些发现表明,评估者设计是主观创造性搜索中的首要设计变量。

🔬 方法详解

问题定义:本论文旨在解决生成模型评估中缺乏迭代过程的问题,现有方法往往忽视了人类创造力的迭代特性,导致评估结果不够全面和准确。

核心思路:论文提出通过迭代生成和选择的方法来提升大型语言模型的创造力,强调在生成过程中引入人类评估者的反馈,以实现更高质量的创意输出。

技术框架:整体架构包括三个主要模块:生成模块负责初步生成食谱,选择模块根据评估者反馈进行迭代选择,评估模块则使用TTCT标准对生成结果进行评分。

关键创新:最重要的创新在于引入了循环内评估者设计,发现较小的选择评分器在创意评分上表现优于较大的评分器,这一发现与现有方法的单一评估机制形成鲜明对比。

关键设计:在实验中,设置了不同的迭代次数、生成器温度和选择评分器的规模,结果显示选择评分器的规模对创意评分影响最大,而温度的影响主要体现在独创性方面。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,迭代生成的食谱在创意评分上与人类基准相当,但单纯增加迭代次数并未提升创造力。小型选择评分器在大多数TTCT维度上显著提高了评分,显示出评估者设计的重要性。

🎯 应用场景

该研究的潜在应用领域包括创意写作、食谱生成、游戏设计等,能够为相关领域提供更具创意和多样性的生成内容。通过优化评估者设计,未来的生成模型可以更好地模拟人类的创造过程,提升生成内容的质量和吸引力。

📄 摘要(原文)

Generative models are often evaluated through singular artifacts, whereas human creativity typically emerges through iterative generation, appraisal, and refinement. This pilot study examines whether iterative search improves LLM creativity by adapting FunSearch to recipe generation for the 2024 Pillsbury Bake-Off and evaluating outputs against human benchmarks using TTCT-based LLM evaluation. Across two experiments, we test iteration count, generator temperature, and in-loop selection-scorer model size. Results show that iterative generation-selection can produce recipes with creativity scores comparable to human benchmarks, but additional iterations alone do not improve creativity. The in-loop evaluator matters most: a smaller selection scorer yields significantly higher scores across most TTCT dimensions, while temperature has limited effects except for originality. These findings suggest that evaluator design is a first-order design variable in subjective creative search.