Empirical Evaluation of Out-Of-Distribution Performance of Tabular Foundation Models

📄 arXiv: 2607.26000v1 📥 PDF

作者: Malena Loza, David Chushig-Muzo, Eva Milara, Luis Bote-Curiel, Luis Estrada-Petrocelli, Felipe Grijalva

分类: cs.LG, cs.AI

发布日期: 2026-07-28


💡 一句话要点

评估表格基础模型在分布外性能的表现

🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)

关键词: 表格基础模型 分布外性能 实证评估 数据分布变化 模型鲁棒性 高风险领域 资源需求

📋 核心要点

  1. 现有的表格基础模型在面对分布变化时表现不佳,缺乏对分布外性能的系统评估。
  2. 本文通过实证评估九种TFMs的分布外性能,涵盖多种预训练策略和架构,填补了这一研究空白。
  3. 实验结果显示,所有TFMs在分布变化下均表现出系统性性能下降,且高性能模型对资源的需求显著增加。

📝 摘要(中文)

表格基础模型(TFMs)作为新兴的表格预测任务方法,展现出与集成树模型相当的预测性能。然而,现有TFMs主要在独立同分布数据上进行训练和评估,忽视了现实场景中的分布变化对模型鲁棒性的影响。本文对九种TFMs在分布外(OOD)性能进行了实证评估,涵盖多种预训练策略和架构,使用了来自TableShift研究的三个真实数据集。结果表明,所有评估的TFMs在分布变化下均表现出系统性下降,且高性能模型在内存和计算资源上需求较大,超出标准部署基础设施的支持。此研究为高风险领域中结构性分布变化的OOD评估提供了实证依据。

🔬 方法详解

问题定义:本文旨在解决表格基础模型在分布外(OOD)性能评估不足的问题。现有方法主要在独立同分布数据上进行训练和评估,未能考虑现实应用中的分布变化对模型鲁棒性的影响。

核心思路:通过对九种不同架构和预训练策略的TFMs进行实证评估,分析它们在不同类型的分布变化下的性能表现,从而揭示TFMs在实际应用中的局限性。

技术框架:研究采用了三种真实世界数据集(HELOC、Voting、Childhood Lead),涵盖标签、社会经济和地理分布变化类型。评估过程包括模型训练、分布变化模拟及性能对比。

关键创新:本研究的创新点在于系统性地评估TFMs在分布外性能上的表现,揭示了与经典表格模型相似的性能下降趋势,并指出了高性能模型在资源需求上的显著差距。

关键设计:在实验中,采用了多种TFMs(如TabPFNv2、TabICL等),并对其在不同分布变化下的表现进行了量化评估,重点关注了模型的内存和计算资源需求。实验结果显示,性能下降幅度在0.003到0.060之间,具体取决于分布变化的类型。

🖼️ 关键图片

fig_0
fig_1
fig_2

📊 实验亮点

实验结果表明,所有评估的TFMs在分布变化下均表现出系统性性能下降,性能差距在0.003到0.060之间,显示出TFMs在面对现实世界数据时的脆弱性。此外,高性能模型的内存和计算资源需求显著高于标准部署基础设施的支持能力。

🎯 应用场景

该研究的潜在应用领域包括金融、医疗和社会科学等高风险领域,这些领域常常面临数据分布的结构性变化。通过提供对TFMs在分布外性能的深入理解,研究为模型的实际应用提供了重要的指导,帮助决策者在动态环境中做出更可靠的预测。

📄 摘要(原文)

Tabular Foundation Models (TFMs) have emerged as novel approaches for tabular predictive tasks, demonstrating competitive predictive performance to ensemble tree-based models. Most TFMs are trained and evaluated on independent and identically distributed data, but this assumption changes in real-world scenarios due to distribution shifts, which compromise the robustness of models. Limited research has been conducted of TFMs under distribution shifts. We present an empirical evaluation of Out-Of-Distribution (OOD) performance of nine TFMs, spanning diverse pre-training strategies and architectures: TabPFNv2, TabPFNv2.5, TabPFNv2.6, TabPFNv3, TabICL, TabICLv2, Mitra, LimiX and TabFM. Three real-world datasets from the TableShift study were considered (HELOC, Voting, Childhood Lead), covering label, socioeconomic, and geographic shift types. Our results show that all evaluated TFMs degrade systematically under distribution shift regardless of pre-training strategy, with shift gaps ranging from 0.003 to 0.060 depending on shift type. The relationship between in-distribution and OOD predictive performance documented for classical tabular models extends into TFMs. We also identified a scalability gap, as high-performing models demand significant memory and computational resources beyond what standard deployment infrastructure can support. This study extends existing benchmarks for OOD in tabular data, providing evidence to support their adoption in high-stakes domains characterized by structural distribution shifts.