To What Extent Do Large Language Models Understand Bangla Idioms?

📄 arXiv: 2609.03410v1 📥 PDF

作者: Mousumi Akter, Md. Faiyaz Abdullah Sayeedi, Nurul Labib Sayeedi, Swakkhar Shatabda

分类: cs.CL

发布日期: 2026-09-03


💡 一句话要点

提出孟加拉语习语理解基准数据集以提升LLM性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 孟加拉语 习语理解 大型语言模型 基准数据集 自然语言处理 低资源语言 模型评估

📋 核心要点

  1. 现有大型语言模型在理解低资源语言的习语表达时面临显著挑战,尤其是缺乏相关数据集支持。
  2. 本文提出了孟加拉语习语的首个大规模基准数据集,并设计了合成多项选择题数据集以辅助习语意义识别。
  3. 实验结果显示不同模型在习语相关任务上的表现差异明显,未发现单一模型在所有任务中均优于其他模型。

📝 摘要(中文)

习语表达是自然语言的重要组成部分,反映了文化细微差别,并对计算模型提出了独特挑战,尤其是在低资源语言中。本文首次提出了孟加拉语习语的大规模基准数据集,并辅以用于习语意义识别的合成多项选择题数据集。我们对近期的大型语言模型(LLMs)在三个与习语相关的任务上进行了全面评估,结果显示模型性能存在显著差异,没有单一的LLM在所有任务上持续优于其他模型。Phi-4-mini-instruct在改写任务中表现优异,Kimi-K2-32b-instruct在习语跨度检测中表现突出,而Gemini-2.5-flash在意义识别方面表现最佳。我们相信这些数据集和分析将为未来研究提供有价值的资源,以改善LLM对习语表达的理解,特别是在孟加拉语及其他低资源语言中。

🔬 方法详解

问题定义:本文旨在解决大型语言模型在理解孟加拉语习语时的不足,现有方法缺乏针对低资源语言习语的专门数据集和评估标准。

核心思路:通过构建大规模的孟加拉语习语基准数据集和合成多项选择题数据集,评估不同LLM在习语理解上的能力,探索其在不同任务中的表现差异。

技术框架:研究分为数据集构建和模型评估两个主要模块。首先,构建包含多种习语的基准数据集;其次,设计多项选择题以测试模型对习语意义的理解。

关键创新:首次针对孟加拉语习语提出了大规模基准数据集,填补了低资源语言习语理解研究的空白,推动了相关领域的研究进展。

关键设计:数据集包含多种习语及其上下文,采用零-shot和few-shot提示策略进行模型评估,确保评估的全面性和准确性。

🖼️ 关键图片

img_0
img_1
img_2

📊 实验亮点

实验结果显示,Phi-4-mini-instruct在改写任务中表现最佳,Kimi-K2-32b-instruct在习语跨度检测中表现突出,而Gemini-2.5-flash在意义识别任务中表现优异。不同模型在各个任务上的表现差异显著,未发现单一模型在所有任务中均优于其他模型。

🎯 应用场景

该研究为孟加拉语及其他低资源语言的自然语言处理提供了基础数据支持,能够帮助研究人员和开发者提升大型语言模型对习语的理解能力,推动相关应用的发展,如机器翻译、对话系统等。

📄 摘要(原文)

Idiomatic expressions are an integral part of natural language, reflecting cultural nuances and posing unique challenges for computational models, particularly in low-resource languages. In this paper, we present the first large-scale benchmark dataset of Bangla idioms, complemented by a synthetic multiple-choice question (MCQ) dataset for idiom meaning identification. We conduct a comprehensive evaluation of recent large language models (LLMs) across three idiom-related tasks: paraphrasing, idiom span detection, and meaning identification, leveraging zero-shot and few-shot prompting strategies. Our results reveal substantial variability in model performance, with no single LLM consistently outperforming others across all tasks. Notably, Phi-4-mini-instruct excels in paraphrasing, Kimi-K2-32b-instruct in span detection, and Gemini-2.5-flash in meaning identification. We believe that our datasets and analyses will provide valuable resources to guide future research in improving LLM comprehension of idiomatic expressions, particularly in Bangla and other low-resource languages.