DocTalkBN: A Novel Dataset of Expert Telemedicine Conversations in Bengali

📄 arXiv: 2608.27110v1 📥 PDF

作者: Anik Saha, Fahmida Sultana Naznin, Sadatul Islam Sadi, Ananya Shahrin Promi, Wahid Al Azad Navid, Rifat Shahriyar

分类: cs.CL

发布日期: 2026-08-27


💡 一句话要点

提出DocTalkBN数据集以解决孟加拉语医疗对话数据匮乏问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 医疗对话 自然语言处理 多模态数据集 低资源语言 临床推理 医学命名实体识别 远程医疗

📋 核心要点

  1. 现有的医疗对话数据集大多来源于医疗论坛或合成数据,缺乏真实的专家与患者互动,尤其是在低资源语言中。
  2. DocTalkBN数据集通过收集真实的孟加拉语医疗对话,保留了对话的自发性和上下文丰富性,提供了557.63小时的音频和文本数据。
  3. 实验结果表明,DocTalkBN在医疗三分诊分类、建议安全性评估和医学命名实体识别等任务中表现优异,成为临床推理任务的重要资源。

📝 摘要(中文)

可靠的医疗对话AI需要真实的专家与患者互动数据,但此类数据集在低资源语言(如孟加拉语)中仍然稀缺。本文提出DocTalkBN,这是一个大规模的多模态数据集,包含来自国家广播的真实医疗对话,涵盖557.63小时的音频和文本数据,涉及26个医学专业。该数据集保留了真实医疗互动的自发性和上下文丰富性,并构建了三个下游任务以支持基准驱动的研究,展示了其在临床推理任务中的实用性。我们将该资源公开,以促进低资源语言的医疗自然语言处理研究。

🔬 方法详解

问题定义:本文旨在解决低资源语言(如孟加拉语)中缺乏真实医疗对话数据集的问题。现有方法多依赖于医疗论坛或合成数据,无法反映真实的专家与患者互动。

核心思路:通过收集来自国家广播的真实医疗对话,DocTalkBN数据集保留了对话的自发性和上下文丰富性,提供了一个真实的多模态数据集,以支持医疗对话AI的研究。

技术框架:数据集包含557.63小时的音频和文本数据,涵盖26个医学专业,构建了三个下游任务:医疗三分诊分类、建议安全性评估和医学命名实体识别。

关键创新:DocTalkBN的创新在于其真实的对话数据来源,区别于以往的合成或论坛数据,能够更好地反映实际医疗场景中的互动特征。

关键设计:数据集包含1,515个多轮患者电话和10,274个主持人-医生问答交换,支持多种基准模型的评估,确保了数据的多样性和实用性。实验中使用了多种大型语言模型和编码器基线进行比较。

🖼️ 关键图片

fig_0
fig_1

📊 实验亮点

实验结果显示,DocTalkBN在医疗三分诊分类、建议安全性评估和医学命名实体识别任务中表现优异,尤其在临床推理任务中,显著提升了模型的准确性和可靠性,为低资源语言的医疗AI研究提供了重要基准。

🎯 应用场景

DocTalkBN数据集的潜在应用领域包括医疗对话系统、智能医疗助手和远程医疗服务等。通过提供真实的医疗对话数据,该研究有助于提高医疗自然语言处理技术的可靠性和安全性,推动低资源语言的医疗服务发展,改善患者的医疗体验。

📄 摘要(原文)

Reliable medical conversational AI requires authentic expert--patient interaction data, yet such datasets remain scarce, especially for low-resource languages such as Bengali. We present DocTalkBN, a large-scale multimodal dataset of real-world expert telemedicine conversations in Bengali, collected from nationally broadcast telemedicine programs featuring board-certified physicians. DocTalkBN contains 557.63 hours of paired audio and text, 1,515 multi-turn patient calls, 10,274 host--doctor question--answer exchanges, totaling 1.7M tokens, spanning 26 medical specialties. Unlike prior resources derived from medical forums, written health content, or synthetic data, our dataset preserves the spontaneity, contextual richness, and spoken characteristics of authentic medical interactions in a low-resource setting. To support benchmark-driven research, we further construct three downstream tasks from the corpus, medical triage classification, advice safety evaluation, and medical named entity recognition, and benchmark a diverse set of large language models and encoder-based baselines. Our results show that DocTalkBN is a practically useful resource, particularly for clinically grounded reasoning tasks. We release this resource to facilitate future research on reliable medical NLP and safer, more culturally grounded healthcare systems for low-resource languages. Our source codes and dataset are publicly available at https://anonymous.4open.science/r/doctalk.