Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis
作者: Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke
分类: cs.CV, cs.MM
发布日期: 2026-08-25
备注: 5 pages, 2 figures. Published in ICASSP 2026
期刊: ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026
DOI: 10.1109/ICASSP55912.2026.11460659
💡 一句话要点
提出Boot-and-Feedback框架以解决乳腺超声诊断中的模型协作问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 乳腺超声 深度学习 多模态融合 模型协作 诊断准确性 可解释性 医疗影像分析
📋 核心要点
- 现有乳腺超声诊断方法依赖操作者,导致诊断结果的可靠性和一致性不足。
- 提出的BooF框架通过MLLM与专家模型的协作,利用BI-RADS词汇和视觉预测提高诊断的准确性。
- 实验结果显示,BooF在多个BUS数据集上显著提升了诊断准确性和可解释性,超越了当前最先进的方法。
📝 摘要(中文)
乳腺超声(BUS)在乳腺癌诊断中广泛应用,但仍然依赖操作者的经验。尽管深度学习展现出潜力,但确保诊断的可靠性和可解释性仍然具有挑战性。近期的多模态大语言模型(MLLMs)常因领域知识有限而生成虚假描述,误导下游专家模型,影响临床有效性。为应对这些挑战,本文提出了Boot-and-Feedback(BooF)模型协作框架,促进MLLM与专家模型的协同互动。在Boot阶段,MLLM在BI-RADS词汇和初步的良恶性视觉专家预测的指导下进行分析,避免产生幻觉。随后,Feedback阶段通过轻量级的注意力门控跨模态融合模块,将这些描述与视觉特征整合,使专家能够利用文本反馈并自适应过滤噪声。大量实验表明,BooF在诊断准确性和可解释性方面显著优于现有方法。
🔬 方法详解
问题定义:本文旨在解决乳腺超声诊断中模型协作的不足,现有方法在生成描述时常出现幻觉,影响诊断的可靠性和有效性。
核心思路:BooF框架通过分阶段的协作机制,首先在Boot阶段利用BI-RADS词汇和视觉专家的初步预测指导MLLM,随后在Feedback阶段整合文本与视觉信息,提升诊断的准确性和可解释性。
技术框架:整体框架分为两个主要阶段:Boot阶段和Feedback阶段。在Boot阶段,MLLM生成初步描述;在Feedback阶段,利用注意力门控跨模态融合模块,将文本描述与视觉特征结合。
关键创新:BooF框架的创新在于通过分阶段的反馈机制,减少了MLLM生成虚假描述的可能性,并有效整合了文本与视觉信息,提升了模型的协作效果。
关键设计:在设计中,采用了轻量级的注意力门控机制,以便在融合过程中自适应地过滤噪声,同时保持模型的高效性和准确性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,BooF框架在多个乳腺超声数据集上实现了显著的性能提升,诊断准确性提高了XX%,可解释性评分提升了YY%,超越了当前最先进的方法,证明了其有效性和实用性。
🎯 应用场景
该研究的潜在应用领域包括医疗影像分析、乳腺癌早期筛查和智能诊断系统。通过提升乳腺超声诊断的准确性和可解释性,能够为临床医生提供更可靠的决策支持,进而改善患者的治疗效果和预后。未来,该框架还可扩展到其他医学影像领域,推动智能医疗的发展。
📄 摘要(原文)
Breast ultrasound (BUS) is widely used for breast cancer diagnosis yet remains operator-dependent. While deep learning shows promise, ensuring diagnostic reliability and interpretability is challenging. Recent Multimodal Large Language Models (MLLMs) often generate spurious descriptions due to limited domain knowledge, which mislead downstream expert models and compromise clinical validity. To address these challenges, we propose the Boot-and-Feedback (BooF) model collaboration framework for synergistic MLLM-expert interaction. Specifically, in the Boot Stage, the MLLM is guided by the BI-RADS lexicon and preliminary benign-malignant vision-expert predictions, enabling it to transfer general reasoning to BUS analysis while avoiding hallucinations. Subsequently, the Feedback Stage integrates these descriptions with visual features via a lightweight Attention-Gated Cross-Modality Fusion Module. This allows the expert to leverage textual feedback while adaptively filtering noise. Extensive experiments on multiple BUS datasets demonstrate that BooF substantially outperforms state-of-the-art methods in terms of diagnostic accuracy and interpretability.