生活分享

NVIDIA 發布開放表格基礎模型 Kumo Tabular,稱在四項基準排名第一

NVIDIA 於 2026 年 9 月 29 日發布 Kumo Tabular,一款可免費商用的開放模型。NVIDIA 稱,只要讀入已標註的表格,它不需另外訓練就能預測新資料。企業做客戶流失、違約或需求預測的流程可能因此簡化,但所有成績都由 NVIDIA 自行公布。

閱讀時間約 6 分鐘

NVIDIA 發布開放表格基礎模型 Kumo Tabular,稱在四項基準排名第一
圖片:Mokaair (Original editorial artwork)

發生了什麼事

NVIDIA 於 2026 年 9 月 29 日在 Hugging Face 部落格發布 NVIDIA Kumo Tabular。它是 NVIDIA Kumo Structured 模型系列的一員,定位為表格資料的開放基礎模型。基礎模型是指先用大量資料預訓練、可直接套用到不同任務的通用模型。據 NVIDIA 表示,這個模型只以人工合成資料預訓練,有三種規模,參數從 2,800 萬到 2.15 億。參數是模型內部可調整的數值,常用來衡量模型大小。模型以 OpenMDW-1.1 授權釋出,可用於商業用途。程式碼放在 GitHub,模型權重放在 Hugging Face,並透過 NVIDIA 新發布、在 GPU 上執行的 structured-data-models 函式庫運作。

表格資料是指像試算表一樣由欄與列組成的資料,例如客戶紀錄、交易、感測器日誌與訂單。NVIDIA 在文中指出,過去二十年這類預測工作多用梯度提升樹完成,這是一種把許多決策樹組合起來的傳統機器學習方法。但每遇到新問題,都要重新收集標籤,也就是已知答案,還要設計特徵(人工挑選或轉換輸入欄位)、搜尋超參數(控制訓練方式的設定),再驗證與部署。Kumo Tabular 借用大型語言模型的「情境內學習」概念:把已標註的表格當作範例讀入,不調整模型本身,就直接預測未知的資料列。

NVIDIA 發布開放表格基礎模型 Kumo Tabular,稱在四項基準排名第一
Mokaair 編輯查核流程 · 圖片:Mokaair (Original editorial artwork)
閱讀完整文字說明

消息會先蒐集來源、獨立查核,再交由 Jev 判斷。

與傳統做法有何不同

傳統流程與 Kumo Tabular 的比較;右欄內容均來自 NVIDIA 自身說明。分位數是把可能結果依大小切分的等分點,可看出預測的範圍
面向傳統梯度提升樹流程Kumo Tabular(據 NVIDIA 描述)
面對新任務需為每個問題從頭訓練模型讀入已標註列,一次前向運算即預測
特徵工程與調參需要設計特徵、搜尋超參數NVIDIA 稱無需訓練、調參或特徵工程
缺失值通常需處理或填補NVIDIA 稱無需填補,模型會特別處理
迴歸輸出通常為單一數值輸出 999 個分位數,可得點預測與不確定性
支援欄位類型依模型與前處理而定僅數值與類別欄,其他類型需經內建前處理轉換

模型如何運作與訓練

NVIDIA 表示,Kumo Tabular 是圍繞表格結構設計的 Transformer,這是大型語言模型也採用的神經網路架構。它使用 TabICL 與 TabPFN 提出的欄、列與情境內注意力機制,注意力機制讓模型決定該參考哪些資料。運作分三步:先理解每個數值在其欄位中的意義,再理解同一列各欄如何互動,最後把有標籤的情境列與待預測的查詢列連結起來。

在訓練資料方面,NVIDIA 表示每個訓練表格都由結構因果模型(SCM)抽樣產生。這種方法用隨機建立的因果關係圖,模擬資料是如何產生的。NVIDIA 也刻意加入真實資料常見的瑕疵,例如多種模式的缺失值、重複列的標籤不一致、類別很多的欄位,以及厚尾的迴歸目標,也就是極端值較常出現。訓練分三階段:先用 1,024 列、最多 100 欄的表格,再把情境從 400 列擴大到 10,240 列,最後延伸到 60,000 列。NVIDIA 稱 Small、Medium、Large 三個版本分別看過約 3,500 萬、7,100 萬與 1.37 億個人工表格,並表示訓練方法與資料產生器將於日後釋出。

NVIDIA 公布的基準成績

基準測試是用來比較不同模型表現的公開測試與排行榜。ELO 是類似棋賽的相對實力評分,分數越高越好。平均排名則是數字越小越好。

  • TabArena:NVIDIA 稱 Kumo Tabular 以 ELO 1950 總排名第一。在統一使用單張 RTX 6000 Pro 的評測設定下,執行速度也快於 LimiX-2。
  • BeyondArena:NVIDIA 稱其取得 ELO 1418、Improvability 7.78%,排名第一。
  • TALENT:NVIDIA 稱其在分類準確率、分類對數損失與迴歸 RMSE(均方根誤差,衡量數值預測偏差)取得總體最佳排名,平均排名分別為 6.67、3.98 與 4.22。
  • ScoringBench:NVIDIA 稱 Large 與 Medium 版本的平均排名分居第一與第二。

對一般讀者的實際影響

多數人不會直接使用這類模型,但生活中許多判斷背後都靠表格預測,例如預測客戶是否流失、評估違約風險、預估需求與訂定價格。若 NVIDIA 所述屬實,企業與研究人員建立這類預測模型的門檻與時間可能降低,小團隊也更容易嘗試。不過,更快做出預測不代表預測一定正確。在涉及個人權益的情境中,驗證、校準與人工把關仍然重要。本文僅為資訊整理,不構成任何產品或硬體的購買建議。

常見問題

Kumo Tabular 是什麼?

據 NVIDIA 表示,它是用於表格資料分類與迴歸的開放基礎模型,屬於 NVIDIA Kumo Structured 模型系列,於 2026 年 9 月 29 日在 Hugging Face 發布。

真的不需要訓練嗎?

NVIDIA 表示,使用者只要提供含標籤的資料列與待預測的資料列,模型一次前向運算就能輸出預測,不需針對任務訓練、調參或做特徵工程。模型本身已事先用人工合成表格預訓練過。

可以商業使用嗎?

NVIDIA 表示模型以 OpenMDW-1.1 授權釋出,可供商業使用。實際使用前應自行閱讀授權條款。

基準排名第一可信嗎?

這些成績都由 NVIDIA 自行測試並公布,並非第三方的獨立測試結果。NVIDIA 自己也建議在部署前用自有保留資料驗證準確度與校準。

它能處理文字或圖片嗎?

NVIDIA 表示模型只直接處理數值與類別欄位。文字、圖片或時間戳需透過函式庫內建的前處理轉為特徵。

查看同分類最新消息

最新旅遊情報攻略

資料來源

生活分享