OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

📄 arXiv: 2608.20106v1 📥 PDF

作者: Nikita Khudov

分类: cs.CL

发布日期: 2026-08-20


💡 一句话要点

提出OenoBench以评估大型语言模型在葡萄酒领域的知识能力

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 知识基准 语言模型 葡萄酒领域 多项选择题 事实验证 模型评估 推理能力 审计机制

📋 核心要点

  1. 现有的语言模型在特定领域知识的评估上缺乏系统性和标准化的方法,导致评估结果的可靠性不足。
  2. 论文提出了OenoBench基准,通过构建多项选择题和验证事实,提供了一种系统化的评估框架,确保每个问题的来源可追溯。
  3. 实验结果显示,整体准确率在53%-84%之间,o3模型表现最佳,准确率达到83.6%,并揭示了不同模型在推理能力上的差异。

📝 摘要(中文)

我们介绍了OenoBench,这是一个葡萄酒领域的知识基准,包含3,266个多项选择题,涵盖六个领域(地区、葡萄品种、葡萄种植、酿酒、生产商、商业)和四个难度等级。该语料库由35个经过来源验证的抓取工具从政府注册(INAO、TTB、OIV)、同行评审期刊和维基百科/Wikidata中提取的38,104个原子事实构建而成。我们的方法论贡献是一个基于大型语言模型的流程,其中语言模型重新格式化经过验证的事实并审核结果,但从不作为真相来源:每个声明都追溯到一个URL,每个问题由五种策略生成,并通过九个代理进行审计,经过与人类金标准的Cohen's $κ$校准。评估十六个前沿配置,我们发现:整体准确率在53%-84%之间,以o3的83.6%领先。

🔬 方法详解

问题定义:本论文旨在解决现有语言模型在特定领域(如葡萄酒)知识评估中的不足,现有方法缺乏系统性和标准化,导致评估结果的可靠性和有效性不足。

核心思路:OenoBench基准通过构建多项选择题和验证事实,提供了一种系统化的评估框架,确保每个问题的来源可追溯,且不依赖于语言模型本身作为真相来源。

技术框架:整体架构包括数据抓取、事实验证、问题生成和审计四个主要模块。首先,通过35个抓取工具从多个权威来源提取事实;然后,使用语言模型生成问题;最后,利用九个代理进行审计,确保问题的质量和准确性。

关键创新:最重要的技术创新点在于构建了一个知识基准,结合了多种问题生成策略和严格的审计机制,使得评估过程透明且可追溯,与现有方法相比,显著提高了评估的可靠性。

关键设计:在参数设置上,采用了五种问题生成策略,并通过Cohen's $κ$进行审计校准,确保评估结果的准确性和一致性。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果显示,整体准确率在53%-84%之间,其中o3模型的准确率达到83.6%。此外,DeepSeek R1在推理模式下提升了6.8个百分点,而Anthropic在自身问题上表现出9个百分点的自我偏好,显示出不同模型在知识处理上的显著差异。

🎯 应用场景

该研究的潜在应用领域包括教育、葡萄酒产业的市场分析和消费者教育等。通过提供系统化的知识评估工具,OenoBench可以帮助行业内的从业者和研究人员更好地理解和应用葡萄酒相关知识,提升行业标准和消费者体验。

📄 摘要(原文)

We introduce OenoBench, a wine-domain knowledge benchmark of 3,266 multiple-choice questions across six pillars (regions, grape varieties, viticulture, winemaking, producers, business) and four difficulty tiers. The corpus is built from 38,104 atomic, source-anchored facts extracted by 35 provenance-verified scrapers from government registries (INAO, TTB, OIV), peer-reviewed journals, and Wikipedia/Wikidata. Our methodological contribution is an LLM-driven pipeline in which language models reformat verified facts and audit the result, but never serve as the source of truth: every claim traces to a URL, every question is generated by one of five strategies across five generator families, and every question is scored by a nine-agent audit calibrated against a human gold sheet via Cohen's $κ$. Evaluating sixteen frontier configurations, we find: (i) overall accuracy spans 53%-84%, led by o3 at 83.6%; (ii) reasoning-mode lift concentrates in DeepSeek R1 (+6.8pp) and is absent in Claude Opus and Gemini Pro; (iii) Anthropic shows +9pp self preference on its own questions while Google shows -8pp inverse preference; (iv) frontier open-weight models share the cost-vs-accuracy Pareto frontier with proprietary reasoning models; and (v) every config gains around 33pp on closed-book solvable items, revealing a parametric-recall ceiling that only the contextual slice avoids. We release corpus, audit findings, human-review app, and construction code under CC-BY-SA-4.0.