小米发布表格大模型开源登顶基准评测
「小米发布通用表格数据基础大模型Xiaomi-TabLDM,基于结构因果模型合成数据预训练,引入双流特征分组、轻量级注意力残差与稀疏混合专家架构,在四大基准评测中均列第一梯队,回归能力登顶OpenML-CTR23,相关代码与权重已开源。」
小米正式发布通用表格数据基础大模型Xiaomi-TabLDM。该模型以单一预训练模型和统一默认配置,即可直接适配不同表格数据集,无需针对每个任务重新训练、调参或后置集成,即可完成分类与回归预测。这一设计旨在将“一次预训练、跨任务使用”的基础模型范式引入结构化数据领域。
长期以来,金融、医疗、制造、物流等领域大量核心数据以表格形式存储,但传统表格机器学习往往需要针对每一个新数据集重新训练、调参甚至集成模型,带来多次训练及版本管理等繁重的部署代价。Xiaomi-TabLDM的出现有望改变这一局面。
在技术实现上,该模型从三个方向推进表格基础模型能力。预训练方面,完全基于结构因果模型生成的大规模合成数据进行预训练,覆盖不同数据规模、变量类型、依赖关系和函数关系,从而扩大预训练任务分布。模型架构方面,引入双流特征分组、轻量级注意力残差和稀疏混合专家,从不同粒度建模特征关系,并通过稀疏专家扩大模型容量。推理方面,进一步探索了测试时扩展,在保持预训练模型参数不变的情况下,通过增加推理阶段计算量持续提升预测性能。
评测结果显示,在四大公开基准测试中,Xiaomi-TabLDM均跻身第一梯队。其回归能力表现突出:在OpenML-CTR23回归榜排名第一;在TALENT、TabArena和BCCO的回归任务中均排名第二;在TALENT二分类任务中同样排名第一。在性能与效率的平衡上,以TabArena回归任务为例,Xiaomi-TabLDM取得第二高Elo评分,同时训练时间比排名第一的TabFM减少82%,预测时间减少68%。
在真实工业场景验证中,该模型相比传统机器学习展现出更高预测精度和跨工况适应能力。材料性能预测场景下,无需微调即可将预测精度提升130%,减少约90%的无效试模与装机测试。零件重量预测场景中,相比XGBoost,失误样本比例降低约31%。生产组分预测场景中,平均误差相比XGBoost降低约54%;当生产工况发生变化时,仅补充约30条新工况样本作为上下文,即可将平均误差降低约62%。
目前,Xiaomi-TabLDM相关模型权重与代码已全面开源,并提供scikit-learn兼容接口,可通过pip安装使用。这一开源动作将有助于开发者社区快速验证和落地表格数据基础模型,推动结构化数据建模技术走向更高效的范式。
来源:Heooo AI工具导航