生活分享

NVIDIA 发布开放表格基础模型 Kumo Tabular,称在四项基准排名第一

NVIDIA 于 2026 年 9 月 29 日发布 Kumo Tabular,一款无需训练即可对表格数据进行分类与回归预测的开放基础模型。本文依据 NVIDIA 自身公布的资料,整理其运作方式、基准成绩、局限及对普通读者的意义。

阅读时间约 5 分钟

NVIDIA 发布开放表格基础模型 Kumo Tabular,称在四项基准排名第一
图片:Mokaair (Original editorial artwork)

发生了什么

NVIDIA 于 2026 年 9 月 29 日在 Hugging Face 博客发布 NVIDIA Kumo Tabular,这是 NVIDIA Kumo Structured 模型系列的一员,定位为表格数据的开放基础模型。据 NVIDIA 称,模型仅以人工合成数据预训练,有三种规模(2,800 万至 2.15 亿参数),以 OpenMDW-1.1 许可证发布,可用于商业用途。代码托管于 GitHub,模型权重托管于 Hugging Face,并通过 NVIDIA 新发布的 GPU 原生 structured-data-models 库运行。

表格数据是指像电子表格一样由列与行组成的数据,例如客户记录、交易、传感器日志和订单。NVIDIA 在文中指出,过去二十年这类预测工作多由梯度提升树(一种常用的传统机器学习方法)完成,但每遇到新问题,都要重新收集标签、设计特征(即人工挑选和加工输入字段)、搜索超参数(训练前需要人工设定的参数)、验证与部署。Kumo Tabular 则借鉴大语言模型的“上下文学习”概念:把已标注的表格作为示例读入,不更新模型本身,直接预测未知数据行。

NVIDIA 发布开放表格基础模型 Kumo Tabular,称在四项基准排名第一
Mokaair 编辑核查流程 · 图片:Mokaair (Original editorial artwork)
阅读完整文字说明

消息会先收集来源、独立核查,再交由 Jev 判断。

与传统做法有何不同

传统流程与 Kumo Tabular 的对比;右栏内容均来自 NVIDIA 自身说明。“前向运算”指模型把输入从头到尾计算一遍得出结果
方面传统梯度提升树流程Kumo Tabular(据 NVIDIA 描述)
面对新任务需为每个问题从头训练模型读入已标注行,一次前向运算即预测
特征工程与调参需要设计特征、搜索超参数NVIDIA 称无需训练、调参或特征工程
缺失值通常需处理或填补NVIDIA 称无需填补,模型会专门处理
回归输出通常为单一数值输出 999 个分位数,可得点预测与不确定性
支持的字段类型取决于模型与预处理仅数值与类别字段,其他类型需经内置预处理转换

模型如何运作与训练

NVIDIA 表示,Kumo Tabular 是围绕表格结构设计的 Transformer,采用 TabICL 与 TabPFN 提出的列、行与上下文注意力机制:先理解每个数值在其所在列中的含义,再理解同一行各列如何相互作用,最后把带标签的上下文行与待预测的查询行关联起来。

在训练数据方面,NVIDIA 表示每个训练表格都由结构因果模型(SCM)采样生成,并刻意加入真实数据中常见的缺陷,例如多种模式的缺失值、重复行标签不一致、类别很多的字段以及厚尾的回归目标。训练分三个阶段:先用 1,024 行、最多 100 列的表格,再把上下文从 400 行扩大到 10,240 行,最后延伸到 60,000 行。NVIDIA 称 Small、Medium、Large 三个版本分别见过约 3,500 万、7,100 万与 1.37 亿个人工表格,并表示训练方法与数据生成器将于日后发布。

NVIDIA 公布的基准成绩

下列榜单中的 ELO 是一种类似棋类评分、通过相互比较得出的相对排名分数,分数越高排名越靠前。

  • TabArena:NVIDIA 称以 ELO 1950 总排名第一,且在统一的单张 RTX 6000 Pro 评测设置下运行速度快于 LimiX-2。
  • BeyondArena:NVIDIA 称取得 ELO 1418、Improvability 7.78%,排名第一。
  • TALENT:NVIDIA 称在分类准确率、分类对数损失与回归 RMSE 上取得总体最佳排名,平均排名分别为 6.67、3.98 与 4.22。
  • ScoringBench:NVIDIA 称 Large 与 Medium 版本的平均排名分列第一和第二。

对普通读者的实际影响

多数人不会直接使用这类模型,但生活中许多判断背后都依赖表格预测,例如流失预测、违约风险、需求预估与定价。若 NVIDIA 所述属实,企业与研究人员构建这类预测模型的门槛与时间可能降低,小团队也更容易尝试。不过,更快做出预测不代表预测一定正确;在涉及个人权益的场景中,验证、校准与人工把关仍然重要。本文仅为信息整理,不构成任何产品或硬件的购买建议。

常见问题

Kumo Tabular 是什么?

据 NVIDIA 称,它是用于表格数据分类与回归的开放基础模型,属于 NVIDIA Kumo Structured 模型系列,于 2026 年 9 月 29 日在 Hugging Face 发布。

真的不需要训练吗?

NVIDIA 表示,用户提供带标签的数据行与待预测的数据行,模型一次前向运算即可输出预测,无需针对任务训练、调参或做特征工程。模型本身是事先以人工合成表格预训练的。

可以商用吗?

NVIDIA 表示模型以 OpenMDW-1.1 许可证发布,可供商业使用。实际使用前应自行阅读许可条款。

基准排名第一可信吗?

这些成绩均由 NVIDIA 自行公布,目前尚无独立来源佐证。NVIDIA 自己也建议在部署前用自有留出数据验证准确度与校准。

它能处理文本或图片吗?

NVIDIA 表示模型只直接处理数值与类别字段;文本、图片或时间戳需通过库内置的预处理转换为特征。

查看同分类最新消息

最新旅游情报攻略

资料来源

生活分享