Balanced Adaptive Prototype Selection for Scalable TabPFN Inference on Large-Scale Tabular Data
作者: Mahboobe Jadid, Melika Rezaye Garkani, Ali Mousavi
分类: cs.LG
发布日期: 2026-08-13
💡 一句话要点
提出平衡自适应原型选择以解决大规模表格数据推理问题
🎯 匹配领域: 支柱九:具身大模型 (Embodied Foundation Models)
关键词: 表格数据 预训练模型 原型选择 推理优化 机器学习
📋 核心要点
- 现有的预训练表格模型在处理大规模数据集时,推理上下文的限制导致其应用受到约束。
- 本文提出的BAPS框架通过选择平衡的自适应原型,构建信息保留的紧凑上下文,从而实现可扩展的推理。
- 在HIGGS和SUSY数据集上的实验表明,使用512个原型可以实现高效的上下文压缩,同时保持良好的预测性能。
📝 摘要(中文)
预训练的表格基础模型展现了强大的预测能力,但在大规模数据集上的应用受到推理上下文限制。本文提出了平衡自适应原型选择(BAPS)框架,旨在构建紧凑且信息保留的上下文,以实现可扩展的TabPFN推理。BAPS在不修改或重新训练预训练模型的情况下,联合保留了代表性结构、信息决策边界、局部密度、类别平衡和特征空间多样性。实验结果表明,在百万行的HIGGS和SUSY数据集上,512个原型能够保持强大的预测性能和可靠的校准,约实现了1953倍的上下文压缩。这些发现为扩展预训练表格基础模型到百万规模数据集提供了有效的上下文构建机制。
🔬 方法详解
问题定义:本文旨在解决预训练表格基础模型在大规模数据集推理时的上下文限制问题。现有方法在处理百万级数据时,往往无法有效保留信息,导致性能下降。
核心思路:BAPS框架通过选择平衡的自适应原型,构建紧凑的上下文,旨在在不修改或重新训练模型的情况下,保留重要的结构和信息,从而提升推理效率。
技术框架:BAPS的整体架构包括原型选择模块、信息保留模块和上下文构建模块。原型选择模块负责从数据中提取代表性样本,信息保留模块确保决策边界和类别平衡,而上下文构建模块则整合这些信息以形成最终的推理上下文。
关键创新:BAPS的主要创新在于其能够在不修改预训练模型的情况下,联合保留多种信息特征,如局部密度和特征空间多样性。这种方法与传统的单一原型选择方法有本质区别,能够更全面地反映数据的结构特征。
关键设计:在BAPS中,原型的数量和选择策略是关键设计因素。实验中使用了512个原型,并通过特定的损失函数来优化信息保留。此外,模型在Intel Core i7 CPU上运行,确保了实验的可重复性和可靠性。
🖼️ 关键图片
📊 实验亮点
实验结果显示,使用512个原型的BAPS框架在HIGGS和SUSY数据集上实现了约1953倍的上下文压缩,同时保持了强大的预测性能和可靠的校准。这一结果显著优于传统方法,展示了BAPS在大规模数据推理中的有效性。
🎯 应用场景
该研究的潜在应用领域包括金融、医疗和科学研究等需要处理大规模表格数据的行业。通过有效的上下文构建,BAPS能够帮助这些领域的研究人员和工程师更好地利用预训练模型进行数据分析和决策支持,提升工作效率和准确性。
📄 摘要(原文)
Pretrained tabular foundation models have demonstrated strong predictive capability; however, their application to large-scale datasets remains constrained by the limited inference context. This paper introduces Balanced Adaptive Prototype Selection (BAPS), a framework for constructing compact, information-preserving contexts for scalable TabPFN inference. Without modifying or retraining the pretrained model, BAPS jointly preserves representative structure, informative decision boundaries, local density, class balance, and feature-space diversity. Experiments on the million-row HIGGS and SUSY datasets show that 512 prototypes retain strong predictive performance and reliable calibration, corresponding to an approximately 1,953-fold context compression. All experiments were conducted on an Intel Core i7 CPU with 16 GB RAM and no GPU acceleration. These findings establish effective context construction as a practical mechanism for extending pretrained tabular foundation models to million-scale datasets.