A Cloud-Edge System for Multimodal Clinical Screening in Resource-Constrained Rural Settings

📄 arXiv: 2608.12745v1 📥 PDF

作者: Hei Ting, Chan, Chenwei Wu, Xueshen Liu, Zesen Zhao, Boyuan Zheng, Luis Filipe Nakayama, Michael G. Morley, Liyue Shen, Jiasi Chen, Z. Morley Mao

分类: cs.LG, cs.DC

发布日期: 2026-08-13

备注: 31 pages, 3 figures. In Proceedings of Machine Learning Research, Volume 340, 2026 (Machine Learning for Healthcare Conference)


💡 一句话要点

提出云边协同系统以解决资源匮乏农村地区的多模态临床筛查问题

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 云边协同 多模态融合 临床筛查 医学人工智能 资源匮乏

📋 核心要点

  1. 在资源匮乏的农村地区,现有医学AI技术的应用受到带宽和计算能力的限制,难以实现有效的临床决策。
  2. 本文提出了一种云-边协同架构,通过在边缘处理数据并利用云端LLM进行综合,解决了多模态信息整合的问题。
  3. 实验结果显示,该系统在多种临床场景中实现了高达99%的诊断工具召回率,且在成本和延迟上显著优于传统云端方法。

📝 摘要(中文)

医学人工智能已展现出专业级的诊断准确性,但在资源匮乏的农村地区,这些能力仍然难以获得。本文提出了一种云-边协同架构,利用轻量级的领域特定模型在边缘处理原始医疗数据,并将其转化为紧凑的结构化输出。云端的大型语言模型(LLM)则将这些输出综合为临床摘要。LLM驱动的调度器根据患者背景动态选择诊断工具,确保全面覆盖多模态信息。通过对20个多模态临床案例的评估,系统在不同网络条件下实现了98-99%的诊断工具召回率和92-96%的精确度,且在带宽不变的情况下保持了25-35秒的延迟,成本降低了4-15倍。这些结果突显了架构设计在高效多模态集成和事实基础提升中的重要作用。

🔬 方法详解

问题定义:本文旨在解决在资源匮乏的农村地区,医学AI技术因带宽和计算能力限制而无法有效应用的问题。现有方法往往依赖于云端处理,导致延迟和成本高昂。

核心思路:论文提出的云-边协同架构通过在边缘设备上使用轻量级模型处理原始医疗数据,生成结构化输出,并利用云端的LLM进行综合分析,从而实现高效的多模态信息整合。

技术框架:整体架构分为两个主要模块:边缘模块负责数据处理和初步分析,云端模块则负责综合和生成临床摘要。边缘模块使用领域特定的轻量级模型,云端模块则利用LLM进行动态调度和工具选择。

关键创新:最重要的创新在于结合了边缘计算与云计算的优势,通过动态选择诊断工具,确保了多模态信息的全面覆盖,同时避免了处理无关输入。与现有的云端单一处理方法相比,显著提升了效率和准确性。

关键设计:在模型设计上,边缘模块采用了轻量级的深度学习模型,确保在低计算能力下仍能有效运行。损失函数和参数设置经过优化,以适应不同的临床场景和数据类型。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,该云-边协同系统在20个多模态临床案例中实现了98-99%的诊断工具召回率和92-96%的精确度,且在不同网络条件下保持了25-35秒的延迟,成本降低了4-15倍。这些数据表明,该系统在临床准确性和效率上均优于传统的云端方法。

🎯 应用场景

该研究的潜在应用领域包括农村医疗、远程医疗和紧急医疗服务等。通过提供高效的多模态临床筛查工具,能够显著提升资源匮乏地区的医疗服务质量,降低医疗成本,并改善患者的健康结果。未来,该系统有望推广至更广泛的医疗场景,助力全球健康公平。

📄 摘要(原文)

Medical AI has demonstrated specialist-level diagnostic accuracy, yet these capabilities remain largely inaccessible in resource-constrained rural settings where bandwidth is scarce, compute is limited, and clinical decision-making requires integrating heterogeneous modalities. We introduce a cloud--edge collaborative architecture that addresses these constraints: lightweight, domain-specific models on the edge transform raw medical data into compact structured outputs, while a cloud LLM synthesizes these outputs into clinical summaries. An LLM-based orchestrator dynamically selects diagnostic tools based on patient context, promoting comprehensive modality coverage without processing irrelevant inputs. We evaluate on 20 multimodal clinical cases spanning cardiac, obstetric, trauma, and screening scenarios under three simulated network profiles (500,kbps--5,Mbps). The hybrid system achieves 98--99% diagnostic tool recall with 92--96% precision, matches or exceeds cloud-only baselines on clinical accuracy, and maintains bandwidth-invariant latency (25--35,s) at 4--15x lower token cost. These results highlight the role of architectural design in enabling efficient multimodal integration and improving factual grounding compared to cloud-only approaches under deployment constraints.