ライフスタイル

NVIDIA、表形式データ向けオープン基盤モデル「Kumo Tabular」を発表 学習なしで予測、4つのベンチマークで1位と主張

NVIDIAは2026年9月29日、表形式データの分類と回帰予測を追加の学習なしで行えるとするオープン基盤モデル「Kumo Tabular」を発表した。顧客記録や取引データから解約や需要を予測する企業・研究者の作業を簡単にする可能性がある。仕組み、NVIDIAが公表した成績、制約を整理する。

読了目安 8 分

NVIDIA、表形式データ向けオープン基盤モデル「Kumo Tabular」を発表 学習なしで予測、4つのベンチマークで1位と主張
画像:Mokaair (Original editorial artwork)

何が起きたのか

NVIDIAは2026年9月29日、Hugging FaceのブログでNVIDIA Kumo Tabularを発表した。NVIDIA Kumo Structuredモデルシリーズの一つで、表形式データ向けのオープン基盤モデル(大量のデータで事前に学習し、さまざまな課題にそのまま使える汎用モデル)と位置づけられている。NVIDIAによると、モデルは人工的に合成したデータのみで事前学習されており、3つの規模(2,800万~2億1,500万パラメータ。パラメータ数はモデルの大きさの目安)がある。OpenMDW-1.1ライセンスで公開され、商用利用が可能だ。コードはGitHub、モデルの重みはHugging Faceで公開され、NVIDIAが新たに発表したGPUネイティブのstructured-data-modelsライブラリを通じて実行する。

表形式データとは、スプレッドシートのように列と行で構成されたデータのことで、顧客記録、取引、センサーログ、注文などが該当する。NVIDIAは記事の中で、過去20年間こうした予測作業の多くは勾配ブースティング木(多数の決定木を組み合わせる定番の機械学習手法)で行われてきたが、新しい問題のたびにラベル収集、特徴量設計(予測に役立つ入力項目を人が作り込む作業)、ハイパーパラメータ(学習の設定値)の探索、検証、デプロイをやり直す必要があったと指摘する。Kumo Tabularは大規模言語モデルの「インコンテキスト学習」(例を見せるだけで、モデル自体を再学習せずに課題をこなす方法)の考え方を取り入れ、ラベル付きの表を例として読み込み、未知の行を直接予測する。

NVIDIA、表形式データ向けオープン基盤モデル「Kumo Tabular」を発表 学習なしで予測、4つのベンチマークで1位と主張
Mokaair 編集検証フロー · 画像:Mokaair (Original editorial artwork)
詳しい説明を読む

情報源を収集し、独立検証を行ってから Jev が判断します。

従来の手法との違い

従来の流れとKumo Tabularの比較。右列の内容はすべてNVIDIA自身の説明に基づく
観点従来の勾配ブースティング木の流れKumo Tabular(NVIDIAの説明による)
新しいタスクへの対応問題ごとにモデルを一から学習する必要があるラベル付きの行を読み込み、1回の順伝播で予測
特徴量エンジニアリングと調整特徴量設計やハイパーパラメータ探索が必要NVIDIAは学習・調整・特徴量エンジニアリング不要としている
欠損値通常は処理や補完が必要NVIDIAは補完不要で、モデルが特別に扱うとしている
回帰の出力通常は単一の数値999個の分位点を出力し、点予測と不確実性を得られる
対応する列の種類モデルと前処理による数値列とカテゴリ列のみ。その他の種類は内蔵の前処理で変換が必要

モデルの仕組みと学習方法

NVIDIAによると、Kumo Tabularは表の構造を中心に設計されたTransformer(大規模言語モデルでも使われるAIの構造)で、TabICLとTabPFNが提案した列・行・インコンテキストのアテンション(データのどこに注目するかを決める仕組み)を採用している。まず各値がその列の中で持つ意味を理解し、次に同じ行の各列がどう相互作用するかを理解し、最後にラベル付きのコンテキスト行と予測対象のクエリ行を結びつける。

学習データについてNVIDIAは、各学習用の表を構造的因果モデル(SCM、変数どうしの因果関係を模して人工データを作る仕組み)からサンプリングして生成し、実データによくある不具合、たとえば複数パターンの欠損値、重複行のラベル不一致、カテゴリ数の多い列、裾の重い(極端な値が出やすい)回帰目標などを意図的に加えたと説明している。学習は3段階で行われた。まず1,024行・最大100列の表を使い、次にコンテキストを400行から10,240行に拡大し、最後に60,000行まで延長した。NVIDIAによると、Small、Medium、Largeの3バージョンはそれぞれ約3,500万、7,100万、1億3,700万個の人工的な表を学習しており、学習手法とデータ生成器は今後公開する予定だという。

NVIDIAが公表したベンチマーク成績

  • TabArena:NVIDIAによると、ELO(対戦形式の比較から算出するレーティング)1950で総合1位となり、単一のRTX 6000 Proによる統一評価設定の下でLimiX-2より高速に動作した。
  • BeyondArena:NVIDIAによると、ELO 1418、Improvability 7.78%で1位となった。
  • TALENT:NVIDIAによると、分類精度、分類の対数損失、回帰のRMSEで総合最良の順位を獲得し、平均順位はそれぞれ6.67、3.98、4.22だった。
  • ScoringBench:NVIDIAによると、LargeとMediumの平均順位がそれぞれ1位と2位だった。

一般読者への実際の影響

多くの人がこの種のモデルを直接使うことはないが、生活の中の多くの判断は表形式データの予測に支えられている。たとえば解約予測、デフォルト(債務不履行)リスク、需要予測、価格設定などだ。NVIDIAの説明どおりであれば、企業や研究者がこうした予測モデルを構築するハードルと時間が下がり、小規模なチームでも試しやすくなる可能性がある。ただし、予測が速くなることは予測が正しいことを意味しない。個人の権利に関わる場面では、検証、キャリブレーション、人によるチェックが引き続き重要だ。本記事は情報の整理のみを目的としており、いかなる製品やハードウェアの購入を勧めるものでもない。

よくある質問

Kumo Tabularとは何ですか?

NVIDIAによると、表形式データの分類と回帰に使うオープン基盤モデルで、NVIDIA Kumo Structuredモデルシリーズに属し、2026年9月29日にHugging Faceで発表されました。

本当に学習は不要なのですか?

NVIDIAによると、ユーザーがラベル付きの行と予測対象の行を与えれば、モデルは1回の順伝播で予測を出力でき、タスクごとの学習、調整、特徴量エンジニアリングは不要です。モデル自体は、人工的に合成した表で事前に学習されています。

商用利用はできますか?

NVIDIAによると、モデルはOpenMDW-1.1ライセンスで公開されており、商用利用が可能です。実際に使う前にライセンス条項を自身で確認してください。

ベンチマーク1位は信頼できますか?

これらの成績はすべてNVIDIA自身が公表したもので、独立した裏付けはまだ確認されていません。NVIDIA自身も、デプロイ前に自前のホールドアウトデータで精度とキャリブレーションを検証するよう推奨しています。

テキストや画像も扱えますか?

NVIDIAによると、モデルが直接扱えるのは数値列とカテゴリ列のみです。テキスト、画像、タイムスタンプはライブラリ内蔵の前処理で特徴量に変換する必要があります。

このトピックの最新ニュースを見る

最新の旅の情報・ガイド

出典

ライフスタイル