From Multi-Resolution Cells to Gigapixel Whole Slide Images Foundation Model for Computational Pathology
作者: Basit Alawode, Moshira Ali Abdalla, Dwarikanath Mahapatra, Muhammad Muzammal Naseer, Sajid Javed
分类: cs.CV
发布日期: 2026-08-04
💡 一句话要点
提出多分辨率金字塔变换器以解决病理图像分析中的分辨率限制问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 计算病理学 视觉变换器 多分辨率学习 跨分辨率注意力 癌症分类 组织表型分析 视觉问答
📋 核心要点
- 现有的计算病理学方法大多在单一分辨率的全切片图像上进行预训练,限制了模型的泛化能力。
- 本文提出的多分辨率金字塔变换器(MRPT)通过层次化聚合多分辨率信息,解决了不同尺度下的特征提取问题。
- 在34个多样化数据集上的实验表明,MRPT在癌症分类和组织表型分析等任务中显著优于现有模型。
📝 摘要(中文)
视觉变换器(ViTs)及其分层变体在计算病理学中表现出色,但大多数模型仅在单一分辨率的全切片图像(WSIs)上进行预训练,限制了其在不同分辨率下的泛化能力。本文提出了多分辨率金字塔变换器(MRPT),该模型通过生物学上有意义的连续跨分辨率注意力机制(CCRA)来捕捉尺度无关的交互,并通过对齐不同分辨率的嵌入来增强多分辨率语义一致性。MRPT在624M补丁、2.4M区域和36K WSIs上以多分辨率自监督方式进行预训练,学习了丰富的粗到细的组织病理特征。实验结果表明,MRPT在癌症亚型分类、组织表型分析和视觉问答等任务中超越了近期的基础模型和多模态大语言模型(MLLMs)。
🔬 方法详解
问题定义:本文旨在解决现有计算病理学模型在单一分辨率下训练所带来的泛化能力不足的问题。传统模型无法有效捕捉金字塔式的多尺度信息,导致在不同分辨率下的表现不佳。
核心思路:提出多分辨率金字塔变换器(MRPT),通过连续跨分辨率注意力机制(CCRA)来捕捉不同尺度之间的交互,同时确保多分辨率语义的一致性,从而提升模型的泛化能力。
技术框架:MRPT的整体架构包括多个模块,首先是多分辨率信息的提取,然后通过CCRA机制进行特征的聚合,最后通过对齐不同分辨率的嵌入来实现语义一致性。
关键创新:MRPT的主要创新在于引入了CCRA机制,使得模型能够在不同分辨率下有效捕捉特征交互,这一设计与传统的单一分辨率模型有本质区别。
关键设计:在模型设计中,MRPT使用了多分辨率自监督学习策略,训练过程中涉及624M补丁、2.4M区域和36K WSIs,确保了模型对组织病理特征的全面学习。
🖼️ 关键图片
📊 实验亮点
在34个多样化数据集上的实验结果显示,MRPT在癌症亚型分类、组织表型分析和视觉问答任务中均超越了最新的基础模型和多模态大语言模型,展现出显著的性能提升,具体提升幅度未知。
🎯 应用场景
该研究的潜在应用领域包括医学影像分析、癌症诊断和个性化医疗等。通过提升病理图像分析的准确性,MRPT有望在临床实践中提供更可靠的辅助决策支持,推动病理学的发展。
📄 摘要(原文)
Vision Transformers (ViTs) and their hierarchical variants have achieved strong performance in Computational Pathology (CPath). However, most are pre-trained on single-resolution Whole Slide Images (WSIs), limiting their generalization across arbitrary resolutions. Gigapixel WSIs inherently contain diagnostic patterns at multiple scales, including cellular morphologies, tissue architectures, and global context, mirroring how expert pathologists examine WSIs. We introduce Multi-Resolution Pyramid Transformer (MRPT), a model that hierarchically aggregates multi-resolution information from cellular to tissue and WSI levels. MRPT employs a biologically meaningful Consecutive Cross-Resolution Attention (CCRA) mechanism to capture scale-independent interactions and enforces multi-resolution semantic consistency by aligning embeddings across resolutions, yielding robust and generalizable WSI representations. Pre-trained in a multi-resolution self-supervised manner on 624M patches, 2.4M regions, and 36K WSIs, MRPT learns rich coarse-to-fine histopathology features. Extensive experiments on 34 diverse datasets show that MRPT surpasses recent foundation models and Multimodal Large Language Models (MLLMs) in cancer subtype classification, tissue phenotyping, and Visual Question Answering (VQA) for WSI understanding.