CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms
作者: Kaiyan Zhao, Zhongtao Miao, Zheyong Xie, Shaosheng Cao, Yoshimasa Tsuruoka
分类: cs.CL
发布日期: 2026-08-28
备注: Work in progress
💡 一句话要点
提出CNeo-Bench以解决中文新词识别与生成问题
🎯 匹配领域: 支柱一:机器人控制 (Robot Control) 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 中文新词 语言模型 基准评估 自然语言处理 机器学习
📋 核心要点
- 中文新词的识别与生成在现有大型语言模型中表现不佳,许多模型在定义生成任务中得分低于40%。
- CNeo-Bench基于4,759个新词构建了一个评估基准,并设计了两级评估框架,分别评估描述能力与操作能力。
- 实验结果显示,尽管少量示例可以帮助解决部分难题,但仍存在显著的错误,表明挑战超出简单提示的范畴。
📝 摘要(中文)
中文新词利用多样且独特的语言机制,如音韵替代(例如,886代表“再见”)和视觉字符分解,这在其他语言中较为罕见。我们介绍了CNeo-Bench,这是一个包含4,759个新词及其参考定义的基准,按语言机制分为五个顶级类别和九个子类别。CNeo-Bench配备了一个两级评估框架,区分模型能否描述新词与能否操作其底层机制。对18个大型语言模型的评估发现,中文新词仍然是一个开放性挑战;大多数模型在定义生成上得分低于40%,在多个子类别中出现了系统性的识别-操作差距:模型能够正确描述新词,但在源形式恢复任务中,往往用语义等价物(意译)替代源形式,而不是生成源形式。对1,058个难题的少量示例分析表明,语境示例可以解决许多困难案例,但仍留有明显的错误部分,表明挑战超出了单纯提示的范围。
🔬 方法详解
问题定义:本论文旨在解决中文新词的识别与生成问题,现有大型语言模型在此任务上普遍表现不佳,尤其是在定义生成和源形式恢复任务中。
核心思路:提出CNeo-Bench基准,系统性地评估模型对中文新词的理解与生成能力,设计两级评估框架以区分描述能力与操作能力。
技术框架:整体架构包括新词数据集的构建、评估框架的设计和模型的评估过程,主要模块包括新词分类、定义生成和源形式恢复。
关键创新:CNeo-Bench的构建及其两级评估框架是本研究的核心创新,能够有效识别模型在处理新词时的识别与操作能力的差距。
关键设计:在评估过程中,设置了明确的定义生成和源形式恢复任务,采用了多种语言模型进行对比实验,确保评估结果的全面性与准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,18个大型语言模型在定义生成任务中的平均得分低于40%。在源形式恢复任务中,模型普遍用语义等价物替代源形式,显示出明显的识别-操作差距。少量示例分析表明,尽管可以解决部分难题,但仍有显著错误存在,表明挑战超出简单提示的能力。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、机器翻译和社交媒体分析等。通过提升模型对中文新词的理解与生成能力,可以增强人机交互的自然性和准确性,推动智能助手和聊天机器人的发展。未来,该基准可能成为中文语言模型评估的重要参考标准。
📄 摘要(原文)
Chinese neologisms exploit diverse and unique linguistic mechanisms, such as phonetic substitution (e.g., 886 for ``bye-bye'') and visual character decomposition that are rare in other languages. We introduce CNeo-Bench, a benchmark of 4,759 such neologisms with reference definitions, organized into five top-level categories and nine subcategories by the linguistic mechanism behind each expression. CNeo-Bench is paired with a two-tier evaluation framework that separates whether a model can describe a neologism from whether it can operate on its underlying mechanism. Evaluating 18 LLMs, we find that Chinese neologisms remain an open challenge; most models fall below 40\% on definition generation, and on several subcategories a systematic recognition-manipulation gap emerges: models describe neologisms correctly but, in source-form restoration tasks, substitute a semantic equivalent (paraphrase) for the source form rather than producing the source form itself. A few-shot analysis on 1,058 hard items shows that in-context examples can solve many difficult cases, but leave a noticeable portion of errors remaining, indicating challenges beyond prompting alone can address.