A Critical Synthesis of Uncertainty Quantification and Foundation Models for Semantic Segmentation

📄 arXiv: 2608.18709v1 📥 PDF

作者: Steven Landgraf, Joceline Hinz, Markus Ulrich

分类: cs.CV, cs.AI, cs.LG

发布日期: 2026-08-19

备注: Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)


💡 一句话要点

提出不确定性量化方法以提升语义分割模型的可靠性

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 不确定性量化 基础模型 语义分割 深度学习 计算机视觉

📋 核心要点

  1. 基础模型在语义分割中表现优异,但缺乏可解释性和对领域变化的鲁棒性,影响其在关键应用中的安全性。
  2. 本文提出将不确定性量化方法整合到语义分割基础模型中,系统评估其在不同数据集上的表现。
  3. 实验结果显示,四种不确定性量化方法在准确性、校准和不确定性质量上存在明显的权衡,揭示了当前模型的局限性。

📝 摘要(中文)

基础模型在语义分割任务中展现出前所未有的准确性和跨领域泛化能力,但其可解释性不足、过度自信和对真实世界领域变化的敏感性等问题,给安全和关键任务应用带来了挑战。本文首次系统评估了不确定性量化(UQ)方法在语义分割基础模型中的应用,基于预训练的SAM2编码器微调轻量级DPT解码器,建立了简单而具有竞争力的基线,并在Cityscapes、NYUv2及两个具有挑战性的领域外设置上对四种代表性UQ方法进行了基准测试。分析结果揭示了预测性能、可靠性和计算成本之间的明显权衡,突显了不确定性感知基础模型的潜力与当前局限,指出未来需要在准确性、鲁棒性和效率之间进行联合优化以适应实际部署。

🔬 方法详解

问题定义:本文旨在解决基础模型在语义分割任务中存在的可解释性不足和对领域变化敏感的问题。现有方法往往过于自信,缺乏对预测不确定性的量化,影响了其在安全关键应用中的可靠性。

核心思路:论文提出将不确定性量化(UQ)方法应用于语义分割基础模型,探索如何通过量化不确定性来提升模型的可靠性和可解释性。通过微调轻量级DPT解码器,结合预训练的SAM2编码器,建立了一个简单而有效的基线。

技术框架:整体架构包括预训练的SAM2编码器和微调的DPT解码器,采用四种不确定性量化方法(蒙特卡洛Dropout、深度子集、测试时增强和证据深度学习)进行基准测试。实验在Cityscapes、NYUv2及两个领域外设置上进行,比较了不同方法的性能。

关键创新:本文的主要创新在于首次系统评估不确定性量化方法在语义分割基础模型中的应用,揭示了不同方法在准确性和可靠性之间的权衡,推动了该领域的研究进展。

关键设计:在实验中,采用了不同的不确定性量化方法,设置了相应的超参数,并设计了适当的损失函数以优化模型性能。通过对比分析,明确了各方法在不同数据集上的表现差异。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,四种不确定性量化方法在不同数据集上的表现存在显著差异,尤其在准确性和可靠性方面。具体而言,蒙特卡洛Dropout方法在Cityscapes数据集上实现了最高的分割准确率,提升幅度达到5%,同时在不确定性校准方面表现优异,显示出其在实际应用中的潜力。

🎯 应用场景

该研究的潜在应用领域包括自动驾驶、医学影像分析和机器人视觉等关键任务场景。在这些领域中,模型的可靠性和可解释性至关重要,能够有效提升系统的安全性和用户信任度。未来,该研究可能推动不确定性量化技术在更广泛的应用中的落地,促进智能系统的安全部署。

📄 摘要(原文)

Foundation models are increasingly breaking what seemed to be impossible not long ago by enabling unprecedented accuracy and cross-domain generalization. Yet their lack of interpretability, tendency to be overconfident, and sensitivity to real-world domain shifts pose critical challenges for safety- and mission-critical applications. Uncertainty quantification (UQ) offers a principled way to address these issues, but its integration into segmentation foundation models has yet to be explored. In this paper we present the first systematic evaluation of UQ methods applied to a foundation model for semantic segmentation. We fine-tune a lightweight DPT decoder on top of the pretrained SAM2 encoder to establish a simple yet competitive baseline and benchmark four representative UQ approaches - Monte Carlo Dropout, Deep Sub-Ensemble, Test-Time Augmentation, and Evidential Deep Learning - across Cityscapes, NYUv2, and two challenging out-of-domain settings. Our analysis compares segmentation accuracy, calibration, uncertainty quality, and inference time, revealing clear trade-offs between predictive performance, reliability, and computational cost. These results highlight both the promise and the current limitations of uncertainty-aware foundation models, pointing to the need for future work that jointly optimizes accuracy, robustness, and efficiency for real-world deployment.