# 小米发布并开源表格结构化数据大模型 Xiaomi-TabLDM，回归登顶 OpenML-CTR23

- 来源：IT之家（RSS）
- 发布时间：2026-09-05 10:31
- AIHOT 分数：51
- AIHOT 链接：https://aihot.virxact.com/items/cmtntrqkc0bu4roqs7tocpsml
- 原文链接：https://www.ithome.com/0/998/683.htm

## AI 摘要

小米发布通用表格数据基础大模型 Xiaomi-TabLDM，以单一预训练模型和统一默认配置直接适配不同表格数据集，完成分类与回归预测，模型权重与代码已开源。模型基于结构因果模型生成的合成数据预训练，架构引入双流特征分组、轻量级注意力残差和稀疏混合专家，并探索 Test-Time Scaling。

## 正文

IT之家 9 月 5 日消息，小米今日正式发布通用表格数据基础大模型 Xiaomi-TabLDM。

据介绍，该模型以单一预训练模型、统一默认配置直接适配不同表格数据集，无需针对每个任务重新训练、调参或后置集成，即可完成分类与回归预测。

长期以来，金融、医疗、制造、物流等领域大量核心数据以表格形式存在，但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型，存在多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM 旨在将“一次预训练、跨任务使用”的基础模型范式带入结构化数据领域。

该模型从三个方向推进表格基础模型能力。预训练方面，Xiaomi-TabLDM 完全基于结构因果模型（SCM）生成的大规模合成数据进行预训练，覆盖不同数据规模、变量类型、依赖关系和函数关系，扩大预训练任务分布。模型架构方面，引入双流特征分组（dual-stream feature grouping）、轻量级注意力残差（lightweight Attention Residual）和稀疏混合专家（sparse Mixture-of-Experts），从不同粒度建模特征关系，通过稀疏专家扩大模型容量。推理方面，该模型进一步探索了 Test-Time Scaling，在保持预训练模型参数不变的情况下，通过增加推理阶段计算量持续提升预测性能。

在四大公开基准评测中，Xiaomi-TabLDM 均跻身第一梯队。回归能力表现突出：在 OpenML-CTR23 回归榜排名第一；在 TALENT、TabArena 和 BCCO 的回归任务中均排名第二；在 TALENT 二分类任务中同样排名第一。在性能与效率的平衡上，以 TabArena 回归任务为例，Xiaomi-TabLDM 取得第二高 Elo 评分的同时，训练时间比排名第一的 TabFM 减少 82%，预测时间减少 68%（Elo 评分原为国际象棋等级分制度，此处用于衡量模型在基准测试中的相对性能排名）。

在真实工业场景验证中，Xiaomi-TabLDM 相比传统机器学习展现出更高的预测精度和跨工况适应能力。材料性能预测场景下，该模型无需微调即可将预测精度提升 130%，减少约 90% 的无效试模与装机测试。零件重量预测场景中，相比 XGBoost，失误样本比例降低约 31%。生产组分预测场景中，平均误差相比 XGBoost 降低约 54%；当生产工况发生变化时，仅补充约 30 条新工况样本作为上下文，即可将平均误差降低约 62%。

该模型提供 scikit-learn 兼容接口，可通过 pip 安装使用。

目前，Xiaomi-TabLDM 相关模型权重与代码已正式开源，IT之家附相关代码及模型权重：

代码：https://github.com/ xiaomi-research / xiaomi-tabldm

权重：https://huggingface.co/ occams / Xiaomi-TabLDM

技术报告：https://arxiv.org/ abs/2609.03880
