Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
作者: Enrico Mensa, Lorenzo Zane, Calogero Jerik Scozzaro, Matteo Delsanto, Tommaso Milani, Daniele Paolo Radicioni
分类: cs.CL, cs.AI
发布日期: 2026-08-05
期刊: Proceedings of the Eleventh Italian Conference on Computational Linguistics (CLiC-it 2025), pages 722-734
💡 一句话要点
提出ProverbIT基准以评估LLM对意大利谚语的理解能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 谚语理解 文化嵌入 推理能力 自然语言处理 多项选择评估 意大利语
📋 核心要点
- 现有的LLMs在处理文化嵌入的语言表达时存在显著的理解差距,尤其是在谚语的完成和选择任务中表现不佳。
- 论文提出了ProverbIT基准,通过100个多项选择题评估LLMs对意大利谚语的理解能力,旨在揭示其推理能力的局限性。
- 实验结果显示,尽管模型在谚语完成任务中表现良好,但在不带正确答案的多项选择中性能显著下降,揭示了其对语言的表面理解而非深层理解。
📝 摘要(中文)
大型语言模型(LLMs)在计算语言学领域取得了显著进展,但在理解文化嵌入的语言表达方面仍存在显著差距。本文引入了ProverbIT,一个包含100个多项选择题的新意大利基准,旨在评估LLMs完成意大利谚语的能力。我们评估了包括大型推理模型(LRMs)和传统LLMs在内的13个前沿模型,涵盖谚语完成、带正确答案的多项选择和不带正确答案的多项选择三项任务。评估结果显示,尽管几乎所有模型在完成任务中表现出对谚语的知识,但在不带正确答案的多项选择格式中,性能显著下降,甚至最先进的推理模型也出现了明显退化。通过对两个LRMs的详细思维链分析,我们发现模型在推理过程中倾向于选择字面同义词,并频繁提及正确的谚语结尾,但未能成功识别选项中缺少这些结尾。这些发现表明,当前的LLMs在理解文化根植的表达时,依赖于记忆模式而非深层语义理解,突显了它们在比喻语言理解方面的重要局限性。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在理解和处理文化嵌入的语言表达(如意大利谚语)时的不足,尤其是在多项选择任务中表现不佳的问题。现有方法未能有效评估模型在此类任务中的推理能力。
核心思路:论文通过引入ProverbIT基准,设计了100个多项选择题,专注于评估LLMs在谚语完成和选择任务中的表现,揭示其推理过程中的偏差和局限性。
技术框架:整体架构包括三个主要任务:谚语完成、带正确答案的多项选择和不带正确答案的多项选择。评估了13个前沿模型,分析其在不同任务中的表现差异。
关键创新:最重要的技术创新在于通过详细的思维链分析,揭示了模型在推理过程中对字面同义词的偏好和对正确谚语结尾的提及,显示出其在理解比喻语言时的局限性。
关键设计:在实验中,模型的选择和评估标准包括谚语的完成率和多项选择的正确率,特别关注模型在缺少正确答案时的表现,以此揭示其推理能力的不足。
🖼️ 关键图片
📊 实验亮点
实验结果显示,尽管几乎所有模型在谚语完成任务中表现良好,但在不带正确答案的多项选择中,性能下降显著,甚至最先进的推理模型也未能有效识别缺失的谚语结尾。这一发现揭示了当前LLMs在比喻语言理解方面的重大局限性。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、教育技术和文化语言理解等。通过深入理解LLMs在处理文化嵌入语言表达时的局限性,可以为未来的模型设计提供指导,促进更具文化敏感性的语言处理系统的发展。
📄 摘要(原文)
Large Language Models (LLMs) have transformed computational linguistics and achieved remarkable performance across numerous natural language processing tasks, yet significant gaps persist in understanding how these systems process culturally embedded linguistic expressions. This paper introduces ProverbIT, a novel Italian benchmark comprising 100 multiple-choice questions designed to evaluate LLMs' ability to complete Italian proverbs. We assess 13 frontier models, including Large Reasoning Models (LRMs) and traditional LLMs, across three tasks: proverb completion, multiple-choice selection with correct answers, and multiple-choice selection without correct answers. Our evaluation reveals surprising results: while nearly all models demonstrate knowledge of the proverbs through successful completion tasks, performance drops dramatically when transitioning to multiple-choice formats without correct answers, with even state-of-the-art reasoning models showing substantial degradation. Through detailed Chain-of-Thought analysis of two LRMs, we uncover that models exhibit a strong bias toward selecting literal synonyms and frequently mention correct proverb endings during reasoning without successfully identifying their absence from the given options. These findings suggest that current LLMs rely heavily on memorized patterns rather than deeper semantic understanding of culturally grounded expressions, highlighting important limitations in their reasoning capabilities for figurative language comprehension.