小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

今日,小米正式发布 Xiaomi-TabLDM:通用表格数据基础大模型 Xiaomi-TabLDM 以单一预训练模型、统一默认配置直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。

长期以来,金融、医疗、制造、物流等领域的大量核心数据,都以表格形式存在。但传统表格机器学习通常需要针对每一个新数据集重新训练、调参甚至集成模型。存在需多次训练,不同版本管理等繁重的生产和部署代价。Xiaomi-TabLDM 希望将“一次预训练、跨任务使用”的基础模型范式进一步带入结构化数据。

基于此,Xiaomi-TabLDM 从 大规模合成数据预训练、高效模型 Scaling 和 Test-Time Scaling 三个方向推进表格基础模型能力。让一个模型能够充分地利用不同数据集中的上下文信息,在控制实际计算开销的同时扩展模型容量,并进一步通过增加推理计算持续提升预测性能。

小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

在四大公开基准上,Xiaomi-TabLDM 均跻身第一梯队。在回归与二分类任务上表现尤为突出:TALENT 二分类排名第一;OpenML-CTR23 回归榜排名第一; BCCO 总体排名第二;在 TabArena 回归任务排第二,并超过 TabPFN-3、AutoGluon 1.5 extreme、TabPFN-2.6、TabICL-v2 等强基线 在保持预测性能的同时,Xiaomi-TabLDM 也展现出良好的性能—效率权衡。

小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

回归任务在四大公开基准的排名

目前,Xiaomi-TabLDM 相关模型权重与代码已正式开源,相关代码及模型权重:

  • 代码:https://github.com/xiaomi-research/xiaomi-tabldm
  • 权重:https://huggingface.co/occams/Xiaomi-TabLDM
  • 技术报告:https://arxiv.org/abs/2609.03880

01 从“一表一模型”到“一次预训练、跨任务使用”

金融、医疗、制造、物流等大量真实世界场景中的核心数据,都以表格形式存在。长期以来,表格预测主要依赖 XGBoost、LightGBM、CatBoost 等传统机器学习方法,面对一个新的数据集,通常需要重新训练模型、调节超参数,甚至进行模型集成。

而表格数据基础模型正在推动这一范式发生变化:通过在大规模任务分布上进行预训练,一个模型可以直接利用新数据集中的标注样本作为上下文,理解当前任务并完成预测,而无需重新训练模型参数 这意味着,表格预测正在从过去的:“一个数据集,训练一个模型” 逐步走向:“一次预训练,一个模型适配不同数据集”。

Xiaomi-TabLDM团队希望进一步探索:表格数据能否像语言一样,通过基础模型获得跨数据集迁移能力,并随着模型、数据和推理计算的扩展,持续提升预测能力?

02 三个方向,进一步扩展表格基础模型能力

Xiaomi-TabLDM 主要从三个方向进一步推进:更大规模、更丰富的合成数据预训练,更高效的模型容量扩展,以及 Test-Time Scaling。

  • 更丰富的合成数据预训练 Xiaomi-TabLDM 完全基于合成表格任务进行预训练,通过结构化生成不同的数据规模、变量类型、依赖关系和函数关系,扩大预训练数据所覆盖的任务分布,让模型提前接触更加多样的表格结构。
  • 更高效的模型 Scaling。 Xiaomi-TabLDM 引入双流 Feature Group、轻量级 Attention Residual 和 Sparse Mixture-of-Experts:从不同粒度建模特征关系,在更深网络中选择性复用历史信息,并通过稀疏专家扩大模型容量,使性能提升不必伴随计算量同比增长。
  • 进一步探索 Test-Time Scaling。 在保持预训练模型参数不变的情况下,Xiaomi-TabLDM 可以通过增加推理阶段的计算,利用不同特征排列、数据变换和预测视角产生互补结果,并根据当前数据集自适应选择和组合,从而进一步提升预测性能。

    小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

多任务、多规模覆盖,大公开基准第一梯队

Xiaomi-TabLDM 在 TALENT、TabArena、BCCO、OpenML 四套公开 benchmark 上进行了系统评测,覆盖二分类、多分类和回归任务,以及从小规模到 10 万级样本的多种数据规模。

在四大公开基准的系统评测中,Xiaomi-TabLDM 展现出稳定的第一梯队性能。

  • 回归能力尤为突出:在 OpenML-CTR23 上排名第一,在 TALENT、TabArena 和 BCCO Regression 上均排名第二。
  • Xiaomi-TabLDM 兼顾性能与效率:在 TabArena Regression 上取得 1900 Elo 的同时,每 1K 样本验证时间仅为 3.12 秒,显著低于 TabFM 的 9.67 秒;在 TALENT 二分类任务上,Xiaomi-TabLDM 同样取得第一名。

小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

更强的预测能力,不必以更高的计算成本为代价。

Xiaomi-TabLDM 正在探索一条兼顾性能、规模与效率的表格基础模型 Scaling 路线

04 真实业务场景有效提升

在真实工业场景验证中,Xiaomi-TabLDM 相比传统机器学习展现出更高的预测精度更强的跨工况适应能力

  • 材料性能预测。传统材料研发长期受困于高成本、长周期的实验试错范式。Xiaomi-TabLDM 为突破这一瓶颈提供了全新路径:该模型能够通过精准的性能预测,显著降低对物理实验及昂贵材料测试的依赖。在新材料研发过程中,Xiaomi-TabLDM 展现出卓越的泛化能力,无需微调即可将预测精度提升130%,并减少约90%的无效试模与装机测试,大幅提升了研发效能。
  • 件重量预测。 基于产线传感器时序数据与工艺设定数据,预测每一模产品重量。相比 XGBoost,Xiaomi-TabLDM 将失误样本比例降低约 31%
  • 生产预测。 基于生产过程中的传感器与工艺数据,预测每批产品的残余组分。Xiaomi-TabLDM 平均误差相比 XGBoost 降低约 54%
  • 当生产工况发生变化时,仅补充约 30 条新工况样本作为上下文,Xiaomi-TabLDM 即可将平均误差 降低约 62%。更进一步,即使传统机器学习模型补充至 200 条新工况样本,其平均误差仍远高于Xiaomi-TabLDM;Xiaomi-TabLDM 仅使用约 15% 的新样本量,无需微调取得更优效果,体现出更强的小样本泛化与快速工况适应能力。

小米发布结构化数据大模型Xiaomi-TabLDM:开启表格数据Scaling Law

从公开基准到真实工业场景,Xiaomi-TabLDM 已完成了从研究验证到实际应用的一次完整探索。

Xiaomi-TabLDM 模型权重与代码已开源。欢迎全球开发者与研究人员共同参与,携手推动表格基础模型持续演进,探索结构化数据“大模型时代”的更多可能!

本文作者@小米技术,原文链接:https://mp.weixin.qq.com/s/wiY4rAg57zP8PiLmtqsr-A

AI情报

微信正式直连WorkBuddy,消息一键变上下文

2026-9-5 9:50:11

AI情报

微信AI“小微” PC 版上线,小工具大升级

2026-9-5 15:29:29

0 条回复 A文章作者 M管理员
    暂无讨论,说说你的看法吧