自从我们推出 TimesFM 以来,人们处理时间序列预测的方式发生了巨大变化。现在,我们将同样的“零样本”逻辑引入表格数据领域。
我们推出 TabFM,这是一个专为表格数据设计的基础模型,旨在简化分类与回归工作流程。
快速链接
Hugging Face
GitHub
-
- 复制链接 ×
表格数据构成了企业数据基础设施的支柱,并为相当大比例的关键预测性机器学习应用提供动力。从预测客户流失到识别金融欺诈,表格回归与分类任务无处不在。多年来,诸如 AdaBoost、XGBoost 和随机森林等有监督的基于树的算法一直主导着这一领域,在结构化数据上提供了稳健的性能。
然而,部署这些传统模型的生命周期存在一个显著的瓶颈。将 XGBoost 模型拟合到新数据集并非仅仅是一个 `.fit()` 步骤那么简单;它不可避免地需要繁琐的人工操作。数据科学家必须投入大量时间进行广泛的超参数优化和特定领域的特征工程,才能从原始数据中提取出可靠的信号。
另一方面,更广泛的机器学习领域的最新进展——特别是大语言模型(LLM)的演进——已经改变了我们处理新任务的方式。LLM 通过上下文学习(ICL)展示了零样本预测的强大能力。这种技术让预训练模型能够通过在输入上下文中提供示例和指令来学习新任务,而无需更新任何底层模型权重。
今天,我们推出 TabFM,这是一个专为表格数据分类与回归设计的基础模型。通过将表格预测构建为一个 ICL 问题,TabFM 消除了手动模型训练、超参数调优以及复杂特征工程的需求。我们很高兴与大家分享这种方法如何让用户能够通过单次前向传播,在从未见过的表格上生成高质量的预测结果。TabFM 现已在我们 Hugging Face 和 GitHub 仓库中提供。
工作原理
传统机器学习范式依赖于针对特定数据集分布更新模型参数。相比之下,上下文学习(ICL)范式完全绕过了这一过程。TabFM 并非针对每个新任务进行传统训练阶段,而是将整个数据集——包括历史训练样本和目标测试行——作为一个统一的提示词。模型在推理时直接从该上下文中学习解读列与行之间的关系。
然而,将上下文学习应用于表格数据并不像对自然语言进行分词那样直接。标准语言模型处理的是有序的一维序列,但表格本质上是二维且无序的:交换两行或两列并不会改变数据的底层含义。为了有效处理这些多样化的表格结构,同时实现可扩展的零样本预测,TabFM 将 TabPFN 和 TabICL 等架构的优势融合为一种新颖的混合设计。如下图所示,该架构依赖于三种关键机制:
- 交替行与列注意力:首先,原始表格通过一个多层注意力模块进行处理。与 TabPFN 类似,此步骤在列(特征)和行(样本)上交替应用注意力。通过持续在这两个维度上进行注意力计算,模型学习到丰富的表征,能够天然地捕捉复杂的特征交互与依赖关系。这种深度上下文化有效完成了原本需要数据科学家进行繁琐手动特征工程的重任。
- 行压缩:在此上下文化之后,每一行经过交叉注意力处理的丰富信息被压缩成一个单一的稠密向量表征。
- 上下文学习(ICL):最后,一个专用的 Transformer 架构对这一系列压缩后的嵌入向量进行操作。采用 TabICL 的高效方法,对这些压缩后的行向量(而非原始未压缩的网格)进行注意力计算,大幅降低了计算成本。这确保了即使对于更大的数据集,预测步骤仍能保持极高的计算效率。
TabFM 模型架构。
基于合成数据的大规模训练
构建基础模型的典型方法是使用高容量神经网络,在海量多样化数据上进行训练。然而,表格机器学习面临的一个主要障碍是,高质量、多样化的表格数据集——尤其是那些能够反映真实工业数据分析所需的大规模表格——在开源领域极为稀缺。工业表格通常包含专有架构和敏感信息,因此无法用于广泛的预训练。
由于合成表格可以生成任意大的规模,它们实际上是在这种量级下预训练基础模型的唯一可行选择。因此,TabFM 完全在数亿个合成数据集上进行训练。这些数据集使用结构因果模型(SCM)动态生成,其中包含了大量随机函数。这种大规模合成生成过程捕捉了真实世界表格数据中普遍存在的各种分布和复杂特征关系。因此,该模型能够很好地泛化到未见过的真实表格,我们将在下面的基准测试中展示这一点。
性能与基准测试
为了严格测试 TabFM 与现有最先进方法的对比,我们在 TabArena 上对其进行了评估。TabArena 是一个动态基准测试系统,它根据两两对决的胜率计算 Elo 评分。这项全面的评估涵盖了 38 个分类数据集和 13 个回归数据集,样本量从 700 到 150,000 不等。
如下方性能图所示,我们对模型的两种不同配置进行了基准测试:
- TabFM:这代表了模型的即用能力。预测通过单次前向传播生成,无需任何调优或交叉验证。
- TabFM-集成:这种配置通过引入交叉特征和 SVD(奇异值分解)特征来进一步提升性能。我们使用非负最小二乘求解器计算 32 路集成的优化权重。对于分类任务,此变体还额外采用了 Platt 缩放作为校准步骤。
如需查看完整的 TabArena 基准测试结果——包括详细的逐折指标以及与特定基线模型的对战胜率——请访问我们的 GitHub 页面。
TabArena 分类任务(上图)和回归任务(下图)中排名前十的模型的 ELO 评分(↑)。(D) 表示默认设置;(T+E) 表示经过调优并集成。分数越高表示性能越优。
结论
通过将表格预测重新定义为上下文学习问题,TabFM 利用混合注意力架构和海量合成训练数据,原生地捕捉复杂的特征交互。这种方法成功消除了手动特征工程、超参数优化和重复模型训练等传统瓶颈,并且持续优于经过大量调优的行业标准监督学习算法。TabFM 将现代基础模型开箱即用的便捷性直接带入表格机器学习工作流,使从业者能够通过单次前向传播生成高精度预测。
为了方便使用,TabFM 正被直接集成到 Google BigQuery 中。在接下来的几周内,用户将能够在 BigQuery 中使用简单的 `AI.PREDICT` SQL 命令执行高级回归和分类任务——无需任何机器学习专业知识。
致谢
本项目是与 Erez Louidor Ilan、Taman Narayan、Shuxin Nie、Rajat Sen、Yichen Zhou、Joe Toth、Deqing Fu 和 Samet Oymak 共同完成的。我们感谢 Kimberly Schwede 为设计图表提供的帮助。
快速链接
Hugging Face
GitHub
-
- 复制链接 ×
其他相关文章
2026 年 7 月 15 日 探索扩散模型创造力的奥秘 * 算法与理论 · * 生成式 AI · * 机器智能
2026 年 7 月 9 日 SensorFM:迈向可穿戴健康数据的通用智能与接口 * 生成式 AI · * 机器智能
2026 年 6 月 26 日 利用冻结的多 token 预测在 Pixel 设备上加速 Gemini Nano 模型 * 机器智能 · * 移动系统 · * 自然语言处理