CLIN: an Objective Framework for Evaluating Creativity in Short Persian Literary Text

📄 arXiv: 2608.30754v1 📥 PDF

作者: Mohammad Reza Modarres, Armin Tourajmehr, Yadollah Yaghoobzadeh, Mohammad Taher Pilehvar

分类: cs.CL

发布日期: 2026-08-31

备注: Accepted to Findings of EMNLP 2026


💡 一句话要点

提出CLIN框架以评估波斯短文学文本的创造力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 创造力评估 大型语言模型 波斯文学 多维度评估 代理指标

📋 核心要点

  1. 现有方法在评估创造力时面临多维度和人类中心化的挑战,尤其是在低资源语言如波斯语中。
  2. 论文提出CLIN框架,通过简单且可解释的代理指标评估创造力的多个维度,旨在提高评估的一致性和效率。
  3. 实验结果表明,CLIN在与人类评估者的一致性上表现优越,且评估成本显著降低,具有实际应用价值。

📝 摘要(中文)

评估大型语言模型(LLM)输出的创造力仍然具有挑战性,因为创造力是多维且以人为中心的。本文研究了LLM在评估波斯短文学文本时的可靠性,发现LLM与人类的评估一致性在不同维度上差异显著。通过引入CLIN框架,分别使用主题感知的新颖性、上下文词汇聚类和词汇多样性来评估创造力的三个维度,结果显示这些代理指标在与人类的对齐度上可与最强的零-shot LLM评估者相媲美,同时显著降低了评估成本。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在评估波斯短文学文本创造力时的可靠性问题。现有方法在不同维度上的一致性差异显著,尤其在情感和吸引力等主观维度上表现较弱。

核心思路:论文提出的CLIN框架通过使用主题感知的新颖性、上下文词汇聚类和词汇多样性来分别评估创造力的三个维度,旨在提高评估的准确性和一致性。

技术框架:CLIN框架包括三个主要模块:1) 原创性评估使用主题感知的新颖性;2) 流畅性评估通过上下文词汇聚类实现;3) 阐述性评估则依赖于词汇多样性。每个模块独立工作,最终综合评估创造力。

关键创新:CLIN的主要创新在于使用简单且可解释的代理指标来评估创造力的多维度,克服了传统方法在主观维度上的不足,提供了一种新的评估思路。

关键设计:在设计过程中,CLIN框架的参数设置和指标选择经过精心调整,以确保在不同维度上都能实现与人类评估者的高一致性,同时降低评估成本。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,CLIN框架在原创性、流畅性和阐述性三个维度上与人类评估者的对齐度相当或更优,且评估成本显著低于最强的零-shot LLM评估者,展示了其在创造力评估中的有效性和实用性。

🎯 应用场景

该研究的潜在应用领域包括教育、文学创作和人工智能生成内容的评估。通过提供一种有效的创造力评估工具,CLIN能够帮助教师、作家和研究人员更好地理解和提升文学创作的质量,推动相关领域的发展。

📄 摘要(原文)

Evaluating creativity in large language model (LLM) outputs remains challenging because creativity is multidimensional and human-centered. We examine how reliably LLMs evaluate short literary text in Persian, a low-resource language, across multiple evaluation strategies and prompt formulations. We find that LLM-human agreement varies substantially across dimensions: alignment is stronger for structured TTCT-derived properties such as Originality, Fluency, and Elaboration, but considerably weaker for more subjective dimensions, particularly Emotion and Attractiveness. Judgments are also sensitive to prompt formulation, while few-shot prompting, ensembling, and multi-agent debate provide no consistent improvement. Motivated by this dimension-dependent behavior, we investigate whether structured creativity dimensions can instead be approximated using simple, interpretable proxy metrics. We introduce CLIN, which evaluates three TTCT-derived dimensions separately using topic-aware novelty for Originality, contextual lexical clustering for Fluency, and lexical diversity for Elaboration. These proxies achieve human alignment comparable to or better than the strongest zero-shot LLM judge in our setting while requiring substantially lower evaluation cost.