FrameBench:A Language Understanding Benchmark Based on Frame Semantics
作者: Chihiro Yano, Ryohei Sasano
分类: cs.CL
发布日期: 2026-09-03
备注: Accepted in EMNLP Findings 2026
🔗 代码/项目: GITHUB
💡 一句话要点
提出FrameBench基准以解决语言理解中的隐性信息问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 框架语义 语言理解 基准测试 大型语言模型 隐性信息 自然语言处理 多项选择题
📋 核心要点
- 现有大型语言模型在理解隐性信息方面的能力尚不明确,尤其是在框架语义的应用中。
- 本文提出FrameBench基准,通过多项选择题测试模型在不同上下文中对动词引发框架的区分能力。
- 实验结果表明,小模型面临挑战,而多个大型模型的表现超过了人类参考分数,显示出其潜力。
📝 摘要(中文)
在框架语义学中,句子理解通过将词汇意义与称为语义框架的背景知识关联来进行,从而使读者能够隐式丰富文本中的未陈述信息。尽管近期的大型语言模型在多种下游任务中表现出色,但它们是否能够重现人类在理解过程中自然进行的隐性丰富仍不明确。为了解决这一问题,本文提出了FrameBench,一个基于框架语义的基准,包含多项选择题,测试模型在不同上下文中区分同一动词所引发的框架的能力。我们使用FrameNet风格的资源和本土说话者的判断构建了该基准,实验结果显示小模型面临挑战,而多个大型模型的表现超过了人类参考分数。我们在https://github.com/SasanoLab/FrameBench发布了构建的FrameBench数据集及其评估代码。
🔬 方法详解
问题定义:本文旨在解决大型语言模型在理解过程中对隐性信息的处理能力不足的问题,尤其是在框架语义的背景下,现有方法未能有效评估模型的理解深度。
核心思路:通过引入FrameBench基准,利用多项选择题的形式,测试模型在不同上下文中对同一动词所引发的语义框架的区分能力,从而评估其隐性信息处理能力。
技术框架:整体架构包括数据集构建、模型评估和结果分析三个主要模块。首先,使用FrameNet风格的资源构建数据集;其次,设计多项选择题以测试模型能力;最后,通过与人类参考分数的对比进行评估。
关键创新:FrameBench的创新之处在于其基于框架语义的设计,使得模型不仅仅依赖于表面特征,而是深入理解词汇与背景知识之间的关系,这是与现有方法的本质区别。
关键设计:在数据集构建过程中,采用生成与验证的管道,结合本土说话者的判断,确保题目的质量和有效性。同时,评估过程中使用了多种大型语言模型进行对比,确保结果的全面性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,多个大型语言模型在FrameBench基准上的表现超过了人类参考分数,表明其在理解隐性信息方面的潜力。小模型则面临显著挑战,显示出模型规模与理解能力之间的关系。
🎯 应用场景
该研究的潜在应用领域包括自然语言处理、智能问答系统和机器翻译等。通过提升模型对隐性信息的理解能力,FrameBench能够为更复杂的语言理解任务提供支持,推动相关技术的进步和应用。未来,FrameBench可能成为评估语言模型理解能力的重要标准。
📄 摘要(原文)
In frame semantics, sentence comprehension is assumed to proceed by relating lexical meaning to background knowledge called semantic frames, thereby enabling readers to implicitly enrich the text with unstated information. Recent large language models (LLMs) have achieved strong performance across a wide range of downstream tasks. However, it remains unclear whether they can reproduce the kinds of implicit enrichment that humans naturally make during comprehension. To address this question, we introduce FrameBench, a benchmark grounded in frame semantics. FrameBench consists of multiple-choice questions that test whether models distinguish the frames evoked by the same verb across contexts. We construct the benchmark for English and Japanese using FrameNet-style resources and a generation-and-verification pipeline with native-speaker judgments. Our experiments on a diverse set of models reveal challenges for small models, while several large models surpass the human reference scores. We release the constructed FrameBench dataset and the code for dataset construction and evaluation at https://github.com/SasanoLab/FrameBench.