IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)
作者: Shahd Gaben, Heba Sbahi, Samer Rashwani, Abdessalam Bouchekif, Mutaz Al-Khatib, Emad Mohamed, Somaya Eltanbouly, Mohammed Ghaly
分类: cs.CL
发布日期: 2026-08-05
备注: Includes supplementary materials. Submitted to the Journal of Scientific Data. Data and code are publicly available
💡 一句话要点
提出IslamicTurathBench以评估大型语言模型在伊斯兰学术传统中的表现
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 大型语言模型 伊斯兰学术 多任务数据集 评估基准 学术需求 问题-答案项 领域专家
📋 核心要点
- 现有的伊斯兰研究领域缺乏高质量的注释资源,限制了大型语言模型的有效应用。
- 本文提出IslamicTurathBench(ISTB),一个多任务、多学科的数据集,专注于经典伊斯兰学术的评估。
- ISTB包含3465个问题-答案项,并提供了来自学术人类参考小组的评分和十个系统的零-shot基线。
📝 摘要(中文)
大型语言模型(LLMs)在问答、教育和研究等领域的应用日益广泛,尤其是在宗教和文化领域。然而,在伊斯兰研究中,缺乏高质量的注释资源来支持关键概念和方法的研究。为此,本文介绍了IslamicTurathBench(ISTB),这是一个多任务、多学科的数据集,旨在评估LLMs在经典伊斯兰学术中的表现。ISTB由领域专家开发和审核,包含3465个问题-答案项,涵盖35部认可的经典著作,跨越12个世纪的七个主要伊斯兰研究领域。该数据集支持对模型能力的全面评估,结构化设计包括学术需求(初级、中级、高级)和任务格式(选择题、基于段落的理解和开放式知识问题)。
🔬 方法详解
问题定义:本文旨在解决伊斯兰研究领域中缺乏高质量注释资源的问题,这限制了大型语言模型的有效性和应用。现有方法未能充分考虑伊斯兰学术传统的复杂性和多样性。
核心思路:论文的核心思路是构建一个专门针对伊斯兰学术的多任务数据集,IslamicTurathBench(ISTB),以便全面评估大型语言模型在该领域的表现。通过与领域专家合作,确保数据集的质量和相关性。
技术框架:ISTB的数据集结构化设计包括两个维度:学术需求(初级、中级、高级)和任务格式(选择题、段落理解和开放式问题)。数据集包含3465个问题-答案项,覆盖35部经典著作。
关键创新:ISTB的主要创新在于其多任务、多学科的设计,能够支持对不同学术需求和任务格式的评估。这种设计使得模型能力的评估更加全面和细致。
关键设计:数据集中的问题和答案经过领域专家审核,确保其准确性和相关性。此外,ISTB还提供了来自学术人类参考小组的评分和多个系统的零-shot基线,以便进行对比分析。
🖼️ 关键图片
📊 实验亮点
在实验中,ISTB展示了其在评估大型语言模型方面的有效性,提供了3465个问题-答案项的综合评分。与十个系统的零-shot基线相比,模型在不同学术需求和任务格式下的表现得到了显著提升,展示了ISTB在多样化评估中的重要性。
🎯 应用场景
IslamicTurathBench(ISTB)在教育、研究和宗教领域具有广泛的应用潜力。它可以帮助研究人员和教育工作者评估和改进大型语言模型在处理伊斯兰学术内容时的能力,从而推动相关领域的知识传播和理解。此外,该数据集的设计也为其他文化和宗教领域的类似研究提供了借鉴。
📄 摘要(原文)
Large language models (LLMs) are increasingly used for question answering, education, and research, including in religious and cultural domains where answers depend on specialised source traditions. Yet in Islamic Studies, key concepts, methods, and debates preserved in the authoritative scholarly tradition, known as turath, lack high-quality annotated resources. We introduce IslamicTurathBench (ISTB), a multi-task, multi-discipline dataset for evaluating LLMs on classical Islamic scholarship. Developed and reviewed by domain experts, ISTB contains 3,465 question-answer items drawn from 35 recognised source works spanning more than 12 centuries of scholarship across seven key fields of Islamic Studies. To enable comprehensive profiling of model capabilities, ISTB is structured along two axes: scholarly demand (Beginner, Intermediate, and Advanced) and task format (multiple-choice questions, passage-based comprehension, and open-ended knowledge questions). ISTB includes aggregated scores from a scholarly human reference panel and zero-shot baselines from ten systems. The dataset supports reproducible evaluation of language-model behaviour across source works, disciplines, scholarly-demand levels, and question formats in a historically layered scholarly domain.