HealMed: Multilingual Evaluation of Large Language Models in Medicine

📄 arXiv: 2608.19981v1 📥 PDF

作者: Yingjian Chen, Fan Gao, Sherry T. Tong, Haoyu Zhang, Aosong Feng, Kevin W. Jin, Xing Wu, Jinghui Lu, Abdul Samad, Akbar Faruqi, Cesar Caraballo, Cibele Brandão, Dhruva, Gupta, Eunji Jeon, Gabriel Madera-Santiago, Geon Lee, Hugo Toshio Itikawa, Insook Cho, Isabelli Martins, Isarar Siddique, Israr Ahmed, Jihyo Kwak, Kanyakorn Veerakanjana, Luis Guilherme Cardoso, Minjin Kim, Piyalitt Ittichaiwong, Renee Dua, Santiago Gudiño-Rosales, Xiujie Chen, Zeo Lapalus, Zixin Xu, Michihiro Yasunaga, Rex Ying, Heuiseok Lim, Jaewoo Kang, Chanjun Park, Hang Jiang, Ethan Goh, Hyunjae Kim, Edison Marrese-Taylor, Yusuke Iwasawa, Yutaka Matsuo, Qingyu Chen, Irene Li

分类: cs.CL

发布日期: 2026-08-20


💡 一句话要点

提出HealMed基准以评估医学领域多语言大语言模型的性能

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 多语言评估 医学大语言模型 基准测试 翻译质量 鲁棒性

📋 核心要点

  1. 现有的医学领域大语言模型在多语言评估中存在显著性能差异,尤其是在低资源语言上表现不佳。
  2. HealMed基准通过整合来自九个数据集的多语言示例,提供了一个系统化的评估框架,旨在提升模型的多语言鲁棒性。
  3. 实验结果显示,专有模型在多语言环境下表现更为稳定,而开源模型的性能差异较大,翻译质量对评估结果影响显著。

📝 摘要(中文)

我们提出了HealMed,这是一个经过专家审查的多语言大语言模型在医学领域评估的基准。HealMed包含来自九个数据集的每种语言1000个示例,涵盖三种任务格式:多项选择问答(MCQA)、自然语言推理(NLI)和开放式问答(QA)。该基准由23名来自九个国家和地区的医学专家在两年内开发。每个翻译都由两名精通英语和目标语言的专家进行评估和修订。在HealMed上,低资源语言的性能下降最为明显,尽管不同语言和模型之间的差距变化显著。最强的专有模型在各语言间表现最为稳定,而许多开源和医学专用模型则显示出更大且不一致的差距。单靠医学专业化并不能确保多语言的鲁棒性。此外,专家修订可能会提高或降低测量性能,表明翻译质量对跨语言评估结果有重要影响。

🔬 方法详解

问题定义:本论文旨在解决医学领域大语言模型在多语言评估中的性能不均衡问题,尤其是低资源语言的表现不足。现有方法缺乏系统的多语言基准,导致评估结果不具可比性。

核心思路:HealMed基准通过专家审查和多语言示例的整合,提供了一个标准化的评估框架,旨在提高模型在不同语言间的鲁棒性和一致性。

技术框架:HealMed基准包含三个主要任务格式:多项选择问答(MCQA)、自然语言推理(NLI)和开放式问答(QA),每种格式均包含来自九种语言的1000个示例。评估过程由医学专家进行翻译和修订,确保翻译质量。

关键创新:HealMed的创新之处在于其多语言评估的系统性和专家审查机制,确保了翻译的准确性和评估的公正性。这与现有方法的随机性和缺乏标准化形成鲜明对比。

关键设计:在设计中,翻译质量的评估由两名流利的专家进行,确保每个示例的准确性。此外,模型的评估不仅考虑医学专业化,还关注多语言的表现稳定性。具体的损失函数和网络结构细节在论文中进行了详细描述。

🖼️ 关键图片

fig_0
img_1
img_2

📊 实验亮点

实验结果表明,专有模型在多语言评估中表现更为稳定,而开源模型的性能差异显著,尤其是在低资源语言上。翻译质量的影响也被明确指出,强调了评估过程中的细致修订的重要性。

🎯 应用场景

HealMed基准的潜在应用领域包括医学文本生成、临床决策支持系统以及多语言医疗信息检索等。通过提升模型在多语言环境下的表现,能够更好地服务于全球医疗需求,促进医学知识的传播与共享。

📄 摘要(原文)

We present HealMed, an expert-reviewed benchmark for multilingual evaluation of large language models in medicine. HealMed contains 1,000 examples in each of nine languages, drawn from nine datasets and covering three task formats: MCQA, NLI and open-ended QA. The benchmark was developed over two years by 23 physicians and medical experts based across nine countries and regions. Each translation was evaluated and revised by two experts fluent in English and the corresponding target language. On HealMed, performance declined most in low-resource languages, although the size of the gap varied markedly across languages and models. The strongest proprietary models were the most stable across languages, whereas many open-source and medically specialized models showed larger and less consistent gaps. Medical specialization alone did not ensure multilingual robustness. Furthermore, expert revision could either raise or lower measured performance, indicating that translation quality materially affects cross-language evaluation results.