NVIDIA正式推出开源基础模型Kumo Tabular,该模型隶属于NVIDIA Kumo结构化模型系列,已在Hugging Face平台上线。专为表格数据设计的Kumo Tabular支持分类和回归任务,无需训练、微调或特征工程,仅需一次前向传播即可预测新行标签。

该模型完全在人工生成数据上进行预训练,提供28M至215M三种参数量级,基于NVIDIA开源库运行,并采用OpenMDW-1.1许可,允许商业使用。在TabArena、BeyondArena、TALENT和ScoringBench四大权威基准测试中,Kumo Tabular均取得排名第一的成绩。

突破传统表格机器学习范式

表格数据是企业机器学习的基石,广泛应用于流失率预测、违约风险评估等场景。过去二十年,该领域主要依赖梯度提升树(Gradient-Boosted Trees),但每次面对新问题都需重新进行特征工程、超参数搜索及模型部署,流程繁琐且无法复用通用知识。

受大语言模型“上下文学习”(In-context Learning)范式的启发,Kumo Tabular将包含标签的表格视为上下文,直接在数百万张表格上预训练,从而在不更新权重的情况下完成新任务预测。给定包含已标记行和待预测行的表格,模型可在单次前向传播中返回类别概率或数值结果。

核心技术机制

Kumo Tabular是一种基于表格结构的Transformer模型,融合了列注意力、行注意力和上下文注意力机制,主要包含以下核心技术:

  • 单元格与行嵌入:数值型和分类型数据分别通过傅里叶特征及三角函数处理,缺失值被特殊对待而非插补。通过交替执行列注意力(理解值在列分布中的含义)和行注意力(学习特征间交互),将每一行转化为嵌入向量,并利用旋转位置编码区分不同列。
  • 上下文学习:最终Transformer作用于行嵌入向量,上下文行相互关注,查询行仅关注上下文行。这种设计确保预测结果仅取决于上下文和该行本身,不受其他并行评分行影响。结合Test-GQA技术,有效缩小了预测所需的缓存大小。
  • 长度感知注意力温度:为解决长表格推理中注意力分散问题,模型根据键数量的对数缩放每个查询的温度系数,确保无论表格行列规模如何变化,注意力机制均能保持锐利。

全人工合成数据训练

Kumo Tabular完全在人工生成的表格上预训练。数据生成器基于结构因果模型(SCM),通过程序化采样源源不断地生成具有全新因果图和机制的表格。训练过程模拟了现实世界数据的杂乱特性,包括多种缺失模式、粗化特征、高基数分类列及厚尾分布等,使模型具备无需数据清洗即可应对不完美数据的能力。

训练分为三个阶段,从基础形态识别逐步扩展至60,000行上下文。Kumo Tabular-Small/Medium/Large分别经历了约3,500万、7,100万和1.37亿张人工表格的训练。官方表示,相关训练配方和数据生成器即将发布。

性能表现与局限性

在统一单张RTX 6000 Pro评估环境下,Kumo Tabular以1950的ELO得分在TabArena排行榜位居榜首,速度比LimiX-2快26倍,确立了准确率-效率帕累托前沿的新SOTA水平。在BeyondArena、TALENT和ScoringBench中,该模型同样在各项关键指标上领跑。

目前,Kumo Tabular仅支持数值型和分类型列,文本、图像或时间戳需转换为特征。单次前向传播最多覆盖10个类别,但可通过错误纠正输出码(ECOC)扩展。若表格分布超出训练范围或查询行与上下文行分布不一致,准确性可能下降,因此部署前建议使用自有数据集验证。

开发者接入

Kumo Tabular通过NVIDIA新发布的GPU原生库structured-data-models运行,支持从pandas.DataFrame到预测结果的完整流程。该模型依据OpenMDW-1.1许可证发布,NVIDIA强调可信AI是共同责任,开发者在使用时应确保符合相关行业规范并解决潜在误用风险。