NVIDIAは、表データ予測向けのオープンモデル「Kumo Tabular」をHugging Faceで公開した。追加学習やチューニング、特徴量エンジニアリングを行わずに、分類と回帰の両タスクに対応できるという。
Kumo Tabularは、既知の値を含む表データを文脈として読み込み、新しい行の値を直接予測する仕組みを採用する。表データの予測に特化したモデルで、別途の学習工程を挟まずに推論できる点を特徴とする。
モデルは、パラメータ数2800万から2億1500万までの3種類を用意した。ライセンスはOpenMDW-1.1で、商用利用も可能だ。NVIDIAによると、TabArena、BeyondArena、Talent、ScoringBenchの4つのベンチマークで首位だったという。
企業ではこの20年ほど、顧客離脱や需要、価格の予測に勾配ブースティング木(gradient-boosted trees)を使ってきた。ただ、こうした手法は予測対象やタスクが変わるたびに、ラベル収集や特徴量設計、検証を改めて行う必要があった。
Kumo Tabularは、大規模言語モデル(LLM)で使われるインコンテキスト学習の考え方を表データに適用した。既知ラベル付きの表をコンテキストとして取り込み、新たな行の値をそのまま予測する。学習には人工生成した表データのみを用いたとしている。NVIDIAは、構造的因果モデル(SCM)でランダムな因果グラフを作成し、そこから表データを生成したと説明している。
NVIDIAは今後、学習手法と人工データ生成器も公開する予定だ。
Kumo Tabularは、NVIDIAが6月に買収したエンタープライズ向け予測AIソフトウェアのスタートアップ、Kumo AIの技術をベースにしているとみられる。
Kumo AIは、顧客情報や決済データなど企業の構造化データを基に、予測型の問いに答えるAIモデルを開発してきた。一般的な大規模言語モデルでは扱いにくい構造化データの分析に強みを持つという。Kumo AIは今年4月、最新モデル「KumoRFM-2」を投入しており、DoorDash、Reddit、Databricks、Snowflakeなどを顧客企業およびパートナーに持つ。