라이프스타일

NVIDIA, 오픈 표 형식 파운데이션 모델 Kumo Tabular 공개… 4개 벤치마크 1위 주장

NVIDIA가 2026년 9월 29일, 별도 학습 없이 표 형식 데이터로 분류와 회귀 예측을 하는 오픈 파운데이션 모델 Kumo Tabular를 공개했다. 표 데이터로 예측 모델을 만드는 기업과 연구자의 작업 방식을 바꿀 수 있다는 것이 NVIDIA의 주장이다. NVIDIA가 직접 공개한 자료를 바탕으로 작동 방식, 벤치마크 성적, 한계, 일반 독자에게 갖는 의미를 정리한다.

읽는 데 약 7분

NVIDIA, 오픈 표 형식 파운데이션 모델 Kumo Tabular 공개… 4개 벤치마크 1위 주장
사진: Mokaair (Original editorial artwork)

무슨 일이 있었나

NVIDIA는 2026년 9월 29일 Hugging Face 블로그에서 NVIDIA Kumo Tabular를 공개했다. NVIDIA Kumo Structured 모델 제품군의 일원으로, 표 형식 데이터를 위한 오픈 파운데이션 모델(미리 폭넓게 학습해 두어 여러 작업에 바로 쓸 수 있는 범용 모델)을 표방한다. NVIDIA에 따르면 이 모델은 인공적으로 합성한 데이터로만 사전 학습됐으며, 세 가지 규모(2,800만~2억 1,500만 파라미터)로 제공되고 OpenMDW-1.1 라이선스로 배포되어 상업적 용도로 사용할 수 있다. 코드는 GitHub에, 모델 가중치는 Hugging Face에 공개됐으며, NVIDIA가 새로 발표한 GPU 네이티브 라이브러리 structured-data-models를 통해 실행된다.

표 형식 데이터란 스프레드시트처럼 열과 행으로 구성된 데이터를 말한다. 고객 기록, 거래 내역, 센서 로그, 주문 등이 그 예다. NVIDIA는 지난 20년 동안 이런 예측 작업은 주로 그래디언트 부스팅 트리(여러 개의 의사결정 나무를 차례로 쌓아 오차를 줄여 가는 전통적 기계학습 기법)로 수행돼 왔지만, 새로운 문제가 생길 때마다 레이블(정답값) 수집, 특성 설계(예측에 쓸 입력 항목을 사람이 직접 만드는 작업, 즉 특성 공학), 하이퍼파라미터(모델의 설정값) 탐색, 검증과 배포를 처음부터 다시 해야 했다고 지적했다. Kumo Tabular는 대규모 언어 모델의 '인컨텍스트 러닝(in-context learning)' 개념, 즉 몇 가지 예시만 보고 모델을 다시 학습시키지 않은 채 새 작업을 푸는 방식을 차용해, 레이블이 달린 표를 예시로 읽어 들인 뒤 미지의 행을 바로 예측한다. 이 예측은 한 번의 순전파(모델이 입력을 한 차례 계산해 결과를 내는 과정)로 이뤄진다.

NVIDIA, 오픈 표 형식 파운데이션 모델 Kumo Tabular 공개… 4개 벤치마크 1위 주장
Mokaair 편집 검증 절차 · 사진: Mokaair (Original editorial artwork)
자세한 설명 보기

출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.

기존 방식과 무엇이 다른가

기존 방식과 Kumo Tabular 비교. 오른쪽 열 내용은 모두 NVIDIA 자체 설명에 근거함
항목기존 그래디언트 부스팅 트리 방식Kumo Tabular(NVIDIA 설명 기준)
새로운 작업 대응문제마다 모델을 처음부터 학습해야 함레이블이 달린 행을 읽고 한 번의 순전파로 예측
특성 공학과 튜닝특성 설계와 하이퍼파라미터 탐색 필요NVIDIA는 학습·튜닝·특성 공학이 필요 없다고 설명
결측값보통 처리하거나 대체(imputation)해야 함NVIDIA는 대체가 필요 없으며 모델이 별도로 처리한다고 설명
회귀 출력보통 단일 수치999개 분위수를 출력해 점 예측과 불확실성을 함께 제공
지원 열 유형모델과 전처리에 따라 다름수치형·범주형 열만 지원, 그 외 유형은 내장 전처리로 변환 필요

모델의 작동 방식과 학습

NVIDIA에 따르면 Kumo Tabular는 표 구조를 중심으로 설계된 Transformer(현재 대규모 언어 모델에 널리 쓰이는 신경망 구조)로, TabICL과 TabPFN이 제안한 열·행·인컨텍스트 어텐션(데이터의 어느 부분에 주목할지 계산하는 방식) 메커니즘을 채택했다. 먼저 각 값이 해당 열에서 어떤 의미를 갖는지 파악하고, 이어서 같은 행의 각 열이 어떻게 상호작용하는지 이해한 뒤, 마지막으로 레이블이 있는 컨텍스트 행과 예측 대상인 쿼리 행을 연결한다.

학습 데이터와 관련해 NVIDIA는 모든 학습용 표가 구조적 인과 모델(SCM)에서 샘플링해 생성됐으며, 실제 데이터에서 흔히 볼 수 있는 결함을 의도적으로 넣었다고 밝혔다. 다양한 패턴의 결측값, 중복 행의 레이블 불일치, 범주가 매우 많은 열, 꼬리가 두꺼운 회귀 타깃 등이 그 예다. 학습은 3단계로 진행됐다. 먼저 1,024행·최대 100열의 표를 사용하고, 이어 컨텍스트를 400행에서 10,240행으로 늘린 뒤, 마지막으로 60,000행까지 확장했다. NVIDIA는 Small, Medium, Large 세 버전이 각각 약 3,500만 개, 7,100만 개, 1억 3,700만 개의 인공 표를 학습했다고 밝혔으며, 학습 방법과 데이터 생성기는 추후 공개할 예정이라고 했다.

NVIDIA가 공개한 벤치마크 성적

아래의 ELO는 여러 모델의 성능을 서로 비교한 결과로 매기는 상대 순위 점수로, 높을수록 순위가 높다.

  • TabArena: NVIDIA는 ELO 1950으로 종합 1위를 차지했으며, 단일 RTX 6000 Pro를 사용한 통일된 평가 환경에서 LimiX-2보다 실행 속도가 빨랐다고 밝혔다.
  • BeyondArena: NVIDIA는 ELO 1418, Improvability 7.78%로 1위를 기록했다고 밝혔다.
  • TALENT: NVIDIA는 분류 정확도, 분류 로그 손실, 회귀 RMSE에서 종합 최고 순위를 기록했으며, 평균 순위는 각각 6.67, 3.98, 4.22였다고 밝혔다.
  • ScoringBench: NVIDIA는 Large와 Medium 버전이 평균 순위에서 각각 1위와 2위를 차지했다고 밝혔다.

일반 독자에게 미치는 실제 영향

대부분의 사람은 이런 모델을 직접 사용하지 않겠지만, 이탈 예측, 채무 불이행 위험, 수요 예측, 가격 책정 등 일상 속 많은 판단이 표 형식 데이터 예측에 기대고 있다. NVIDIA의 설명이 사실이라면 기업과 연구자가 이런 예측 모델을 구축하는 데 드는 문턱과 시간이 줄어들고, 소규모 팀도 더 쉽게 시도할 수 있을 것이다. 다만 예측을 더 빨리 만들 수 있다고 해서 예측이 반드시 정확한 것은 아니다. 개인의 권익이 걸린 상황에서는 검증, 보정, 사람의 확인이 여전히 중요하다. 이 글은 정보 정리일 뿐이며, 어떤 제품이나 하드웨어의 구매 권유도 아니다.

자주 묻는 질문

Kumo Tabular는 무엇인가요?

NVIDIA에 따르면 표 형식 데이터의 분류와 회귀를 위한 오픈 파운데이션 모델로, NVIDIA Kumo Structured 모델 제품군에 속하며 2026년 9월 29일 Hugging Face에서 공개됐습니다.

정말 학습이 필요 없나요?

NVIDIA에 따르면 사용자가 레이블이 달린 행과 예측할 행을 제공하면 모델이 한 번의 순전파로 예측을 출력하며, 작업별 학습·튜닝·특성 공학이 필요 없습니다. 모델 자체는 인공 합성 표로 사전 학습된 상태입니다.

상업적으로 사용할 수 있나요?

NVIDIA는 모델이 OpenMDW-1.1 라이선스로 배포되어 상업적 이용이 가능하다고 밝혔습니다. 실제로 사용하기 전에는 라이선스 조항을 직접 확인해야 합니다.

벤치마크 1위라는 결과를 믿을 수 있나요?

이 성적은 모두 NVIDIA가 자체 공개한 것이며, 외부 기관의 검증 결과는 함께 제시되지 않았습니다. NVIDIA 스스로도 배포 전에 따로 떼어 둔 자체 데이터로 정확도와 보정을 검증할 것을 권고했습니다.

텍스트나 이미지도 처리할 수 있나요?

NVIDIA에 따르면 모델은 수치형과 범주형 열만 직접 처리합니다. 텍스트, 이미지, 타임스탬프는 라이브러리에 내장된 전처리를 통해 특성으로 변환해야 합니다.

이 주제의 최신 뉴스 보기

최신 여행 소식·가이드

출처

라이프스타일