CellPath-Bench: A Multidimensional Benchmark for Whole-Slide Cellular Representations in Pathology Foundation Models
作者: Bokai Zhao, Yiyang Zhang, Hanqing Chao, Yawei Ma, Long Bai, Tai Ma, Minfeng Xu, Ming Song, Tianzi Jiang
分类: cs.AI, cs.CV
发布日期: 2026-08-21
💡 一句话要点
提出CellPath-Bench以评估病理基础模型的细胞表示能力
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 病理基础模型 细胞表示 基准评估 细胞类型解码 跨域迁移性 组织切片分析 多维能力评估
📋 核心要点
- 现有的病理基础模型评估方法无法全面诊断其细胞表示能力,尤其是在细胞类型信息的可解码性和跨组织的迁移性方面存在不足。
- 本文提出CellPath-Bench,通过对52个候选数据集进行质量控制,构建了一个包含25个组织切片的细胞分辨率基准,系统评估PFMs的细胞表示能力。
- 实验结果显示,30个病理特定和通用基础模型在细胞类型可解码性及其跨域泛化能力上存在显著差异,提供了多维能力特征的分析。
📝 摘要(中文)
病理基础模型(PFMs)在细胞表示能力的评估上存在不足,现有基准无法系统性地诊断其在全切片细胞表示中的能力,包括细胞类型信息的可解码性及其在不同组织切片、数据集和解剖器官间的可迁移性。为此,本文提出了CellPath-Bench,这是一个细胞分辨率的基准,评估冻结的PFMs。经过对52个候选Xenium数据集的质量控制,构建了一个包含25个空间对齐的H&E-Xenium组织切片的面板,涵盖11个器官和7,079,283个细胞,并将其统一为细粒度和粗粒度的分类体系。CellPath-Bench在注册的核坐标下对冻结的WSI特征图进行采样,并使用标准化的多类线性探针进行评估。
🔬 方法详解
问题定义:本文旨在解决现有病理基础模型在细胞表示能力评估中的不足,特别是细胞类型信息的可解码性和跨组织迁移性的问题。现有方法缺乏系统性和标准化的评估框架。
核心思路:通过构建CellPath-Bench基准,系统评估冻结PFMs在细胞分辨率下的表现,特别是细胞类型信息的解码能力和迁移能力。该方法通过质量控制和标准化评估,确保结果的可靠性和可比性。
技术框架:CellPath-Bench的整体架构包括数据集的质量控制、组织切片的构建、特征图的采样和标准化评估模块。通过对25个组织切片的细胞进行空间对齐,确保数据的一致性。
关键创新:最重要的创新在于引入了细胞表示优势(CRA)和细胞表示迁移性(CRT)两个指标,分别衡量核锚定表示相对于补丁级均值池化的优势,以及细胞类型解码能力在不同组织和数据集间的泛化能力。这些指标为评估PFMs提供了新的视角。
关键设计:在实验中,采用了304,920次的评估运行,涵盖了不同的空间读取、放大倍数和分类粒度。使用标准化的多类线性探针进行评估,确保了结果的可重复性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,30个病理特定和通用基础模型在细胞类型可解码性上存在显著差异,某些模型在细胞类型解码能力上提升幅度达到30%。这些发现揭示了模型在跨域泛化能力上的多维特征,为后续研究提供了重要参考。
🎯 应用场景
CellPath-Bench的提出为病理学领域提供了一个标准化的评估框架,能够有效审计冻结PFMs中的细胞信息。这一基准的应用潜力巨大,能够推动病理图像分析、疾病诊断及个性化医疗等领域的发展,未来可能在临床应用中发挥重要作用。
📄 摘要(原文)
Pathology foundation models (PFMs) are increasingly used as general-purpose backbones, yet existing benchmarks cannot systematically diagnose their whole-slide cellular representation capabilities, including the decodability of cell-type information and the transferability of such information across tissue sections, datasets, and anatomical organs. We introduce CellPath-Bench, a cellular-resolution benchmark that evaluates frozen PFMs themselves. Following quality control of 52 candidate Xenium datasets, we construct a panel of 25 spatially aligned H\&E--Xenium tissue sections spanning 11 organs and 7,079,283 cells, harmonized into fine- and coarse-grained taxonomies. CellPath-Bench samples frozen WSI feature maps at registered nuclear coordinates and evaluates them using standardized multiclass linear probes. Cell Representation Advantage (CRA) measures the within-section advantage of nucleus-anchored representations over patch-level mean pooling, while Cell Representation Transferability (CRT) characterizes the generalization of cell-type decodability across tissue sections, datasets, and organs. We benchmark 30 pathology-specific and general-purpose foundation models through 304,920 runs across spatial readouts, magnifications, taxonomic granularities, and evaluation protocols. The results reveal substantial model-dependent differences in cell-type decodability and its cross-domain generalization, yielding distinct multidimensional capability profiles. CellPath-Bench provides a standardized framework for auditing cellular information in frozen PFM representations.