라이프스타일
NVIDIA, 오픈 표 형식 파운데이션 모델 Kumo Tabular 공개… 4개 벤치마크 1위 주장
NVIDIA가 2026년 9월 29일, 별도 학습 없이 표 형식 데이터로 분류와 회귀 예측을 하는 오픈 파운데이션 모델 Kumo Tabular를 공개했다. 표 데이터로 예측 모델을 만드는 기업과 연구자의 작업 방식을 바꿀 수 있다는 것이 NVIDIA의 주장이다. NVIDIA가 직접 공개한 자료를 바탕으로 작동 방식, 벤치마크 성적, 한계, 일반 독자에게 갖는 의미를 정리한다.
읽는 데 약 7분

무슨 일이 있었나
NVIDIA는 2026년 9월 29일 Hugging Face 블로그에서 NVIDIA Kumo Tabular를 공개했다. NVIDIA Kumo Structured 모델 제품군의 일원으로, 표 형식 데이터를 위한 오픈 파운데이션 모델(미리 폭넓게 학습해 두어 여러 작업에 바로 쓸 수 있는 범용 모델)을 표방한다. NVIDIA에 따르면 이 모델은 인공적으로 합성한 데이터로만 사전 학습됐으며, 세 가지 규모(2,800만~2억 1,500만 파라미터)로 제공되고 OpenMDW-1.1 라이선스로 배포되어 상업적 용도로 사용할 수 있다. 코드는 GitHub에, 모델 가중치는 Hugging Face에 공개됐으며, NVIDIA가 새로 발표한 GPU 네이티브 라이브러리 structured-data-models를 통해 실행된다.
표 형식 데이터란 스프레드시트처럼 열과 행으로 구성된 데이터를 말한다. 고객 기록, 거래 내역, 센서 로그, 주문 등이 그 예다. NVIDIA는 지난 20년 동안 이런 예측 작업은 주로 그래디언트 부스팅 트리(여러 개의 의사결정 나무를 차례로 쌓아 오차를 줄여 가는 전통적 기계학습 기법)로 수행돼 왔지만, 새로운 문제가 생길 때마다 레이블(정답값) 수집, 특성 설계(예측에 쓸 입력 항목을 사람이 직접 만드는 작업, 즉 특성 공학), 하이퍼파라미터(모델의 설정값) 탐색, 검증과 배포를 처음부터 다시 해야 했다고 지적했다. Kumo Tabular는 대규모 언어 모델의 '인컨텍스트 러닝(in-context learning)' 개념, 즉 몇 가지 예시만 보고 모델을 다시 학습시키지 않은 채 새 작업을 푸는 방식을 차용해, 레이블이 달린 표를 예시로 읽어 들인 뒤 미지의 행을 바로 예측한다. 이 예측은 한 번의 순전파(모델이 입력을 한 차례 계산해 결과를 내는 과정)로 이뤄진다.
자세한 설명 보기
출처를 수집하고 독립적으로 검증한 뒤 Jev가 판단합니다.
기존 방식과 무엇이 다른가
| 항목 | 기존 그래디언트 부스팅 트리 방식 | Kumo Tabular(NVIDIA 설명 기준) |
|---|---|---|
| 새로운 작업 대응 | 문제마다 모델을 처음부터 학습해야 함 | 레이블이 달린 행을 읽고 한 번의 순전파로 예측 |
| 특성 공학과 튜닝 | 특성 설계와 하이퍼파라미터 탐색 필요 | NVIDIA는 학습·튜닝·특성 공학이 필요 없다고 설명 |
| 결측값 | 보통 처리하거나 대체(imputation)해야 함 | NVIDIA는 대체가 필요 없으며 모델이 별도로 처리한다고 설명 |
| 회귀 출력 | 보통 단일 수치 | 999개 분위수를 출력해 점 예측과 불확실성을 함께 제공 |
| 지원 열 유형 | 모델과 전처리에 따라 다름 | 수치형·범주형 열만 지원, 그 외 유형은 내장 전처리로 변환 필요 |
모델의 작동 방식과 학습
NVIDIA에 따르면 Kumo Tabular는 표 구조를 중심으로 설계된 Transformer(현재 대규모 언어 모델에 널리 쓰이는 신경망 구조)로, TabICL과 TabPFN이 제안한 열·행·인컨텍스트 어텐션(데이터의 어느 부분에 주목할지 계산하는 방식) 메커니즘을 채택했다. 먼저 각 값이 해당 열에서 어떤 의미를 갖는지 파악하고, 이어서 같은 행의 각 열이 어떻게 상호작용하는지 이해한 뒤, 마지막으로 레이블이 있는 컨텍스트 행과 예측 대상인 쿼리 행을 연결한다.
학습 데이터와 관련해 NVIDIA는 모든 학습용 표가 구조적 인과 모델(SCM)에서 샘플링해 생성됐으며, 실제 데이터에서 흔히 볼 수 있는 결함을 의도적으로 넣었다고 밝혔다. 다양한 패턴의 결측값, 중복 행의 레이블 불일치, 범주가 매우 많은 열, 꼬리가 두꺼운 회귀 타깃 등이 그 예다. 학습은 3단계로 진행됐다. 먼저 1,024행·최대 100열의 표를 사용하고, 이어 컨텍스트를 400행에서 10,240행으로 늘린 뒤, 마지막으로 60,000행까지 확장했다. NVIDIA는 Small, Medium, Large 세 버전이 각각 약 3,500만 개, 7,100만 개, 1억 3,700만 개의 인공 표를 학습했다고 밝혔으며, 학습 방법과 데이터 생성기는 추후 공개할 예정이라고 했다.
NVIDIA가 공개한 벤치마크 성적
아래의 ELO는 여러 모델의 성능을 서로 비교한 결과로 매기는 상대 순위 점수로, 높을수록 순위가 높다.
- TabArena: NVIDIA는 ELO 1950으로 종합 1위를 차지했으며, 단일 RTX 6000 Pro를 사용한 통일된 평가 환경에서 LimiX-2보다 실행 속도가 빨랐다고 밝혔다.
- BeyondArena: NVIDIA는 ELO 1418, Improvability 7.78%로 1위를 기록했다고 밝혔다.
- TALENT: NVIDIA는 분류 정확도, 분류 로그 손실, 회귀 RMSE에서 종합 최고 순위를 기록했으며, 평균 순위는 각각 6.67, 3.98, 4.22였다고 밝혔다.
- ScoringBench: NVIDIA는 Large와 Medium 버전이 평균 순위에서 각각 1위와 2위를 차지했다고 밝혔다.
일반 독자에게 미치는 실제 영향
대부분의 사람은 이런 모델을 직접 사용하지 않겠지만, 이탈 예측, 채무 불이행 위험, 수요 예측, 가격 책정 등 일상 속 많은 판단이 표 형식 데이터 예측에 기대고 있다. NVIDIA의 설명이 사실이라면 기업과 연구자가 이런 예측 모델을 구축하는 데 드는 문턱과 시간이 줄어들고, 소규모 팀도 더 쉽게 시도할 수 있을 것이다. 다만 예측을 더 빨리 만들 수 있다고 해서 예측이 반드시 정확한 것은 아니다. 개인의 권익이 걸린 상황에서는 검증, 보정, 사람의 확인이 여전히 중요하다. 이 글은 정보 정리일 뿐이며, 어떤 제품이나 하드웨어의 구매 권유도 아니다.
자주 묻는 질문
Kumo Tabular는 무엇인가요?
NVIDIA에 따르면 표 형식 데이터의 분류와 회귀를 위한 오픈 파운데이션 모델로, NVIDIA Kumo Structured 모델 제품군에 속하며 2026년 9월 29일 Hugging Face에서 공개됐습니다.
정말 학습이 필요 없나요?
NVIDIA에 따르면 사용자가 레이블이 달린 행과 예측할 행을 제공하면 모델이 한 번의 순전파로 예측을 출력하며, 작업별 학습·튜닝·특성 공학이 필요 없습니다. 모델 자체는 인공 합성 표로 사전 학습된 상태입니다.
상업적으로 사용할 수 있나요?
NVIDIA는 모델이 OpenMDW-1.1 라이선스로 배포되어 상업적 이용이 가능하다고 밝혔습니다. 실제로 사용하기 전에는 라이선스 조항을 직접 확인해야 합니다.
벤치마크 1위라는 결과를 믿을 수 있나요?
이 성적은 모두 NVIDIA가 자체 공개한 것이며, 외부 기관의 검증 결과는 함께 제시되지 않았습니다. NVIDIA 스스로도 배포 전에 따로 떼어 둔 자체 데이터로 정확도와 보정을 검증할 것을 권고했습니다.
텍스트나 이미지도 처리할 수 있나요?
NVIDIA에 따르면 모델은 수치형과 범주형 열만 직접 처리합니다. 텍스트, 이미지, 타임스탬프는 라이브러리에 내장된 전처리를 통해 특성으로 변환해야 합니다.
같은 주제의 글
라이프스타일
NVIDIA, DGX Spark 64GB 모델 출시: 10월 23일 판매 시작, 시작가 4,999달러, 두 대 연결 시 128GB
NVIDIA는 2026년 10월 2일 개인용 AI 컴퓨터 DGX Spark에 더 저렴한 64GB 메모리 모델을 추가한다고 발표했다. 10월 23일부터 Acer, ASUS 등 6개 제조사를 통해 공급되며, 주요 대상은 자신의 기기에서 AI 모델을 실행하려는 개발자와 연구자다. NVIDIA가 공개한 사양, 두 대 연결에 관한 설명, 그리고 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
Google Cloud, Spanner queues 정식 출시 발표: 메시지 큐를 데이터베이스 트랜잭션에 통합해 AI 에이전트 신뢰성 겨냥
Google Cloud가 Spanner queues 정식 출시를 발표했다. 메시지 생성을 데이터베이스 트랜잭션의 일부로 만들어 AI 에이전트의 '상태'와 '동작'이 어긋나는 문제를 해결하겠다는 것이다. 공식 설명, 주요 기능, 일반 독자에게 갖는 의미를 정리했다.
라이프스타일
GPT-6.1 Sol 출시: 새 버전 Sol, API·Codex·ChatGPT Work에서 제공, Chat에는 없음
OpenAI는 2026년 9월 29일 GPT-6.1 Sol을 출시했습니다. API 이름은 gpt-6.1-sol이며, Plus, Pro, Business, Enterprise, Edu 요금제의 Codex와 ChatGPT Work가 출시 시 제공 범위에 포함되고(Enterprise와 Edu는 관리자가 켜야 함), Free와 Go는 출시 시 포함되지 않으며, Chat에는 없습니다(2026년 9월 확인).
라이프스타일
Claude Sonnet 5.5 출시: 정가는 Sonnet 5와 같고, API·클라우드 플랫폼·Claude.ai에서 사용 가능
Anthropic은 2026년 9월 28일 Claude Sonnet 5.5를 출시했습니다. API 정가는 Sonnet 5와 같고(100만 tokens당 입력 2달러, 출력 10달러), Claude.ai, API, 여러 클라우드 플랫폼에서 사용할 수 있으며, 위험도가 높은 사이버 보안 요청은 Sonnet 5로 되돌려 처리됩니다(2026년 9월 확인).
최신 여행 소식·가이드

가이드도쿄
도쿄 어디에 묵을까? 신주쿠·우에노·도쿄역·시부야·아사쿠사·이케부쿠로·긴자 일곱 지역 비교: 공항 교통, 숙박세, 짐 배송까지
도쿄 어디에 묵을까? 신주쿠, 우에노, 도쿄역, 시부야, 아사쿠사, 이케부쿠로, 긴자 일곱 지역을 같은 기준으로 비교한다. 나리타·하네다 공항에서 오는 방법, 교통 노선, 주변의 볼거리, 동네 분위기, 적합한 여행자를 비교표와 야마노테선 안내도로 살펴보고, 2026년 9월에 확인한 도쿄도 숙박세(2027년 4월부터 3%)와 공항 택배로 짐을 보내는 규정도 정리했다.
- 예산
- 호텔

가이드도쿄
도쿄 교통패스 선택법: Suica/Welcome Suica, Tokyo Subway Ticket, JR Pass는 살 만할까?
도쿄를 처음 여행한다면 먼저 1인당 IC 카드 한 장으로 탈 때마다 결제한다(Welcome Suica는 보증금이 없고 28일간 유효). 하루에 지하철을 4번 이상 타면 2,000엔짜리 Tokyo Subway Ticket 72시간권을 추가하고, 간사이에 가지 않고 도쿄만 여행한다면 JR Pass는 반드시 손해다. TOURIST PASMO, iPhone의 Suica, 도쿄 Metro 하루권의 이용 가능·불가 범위를 결정도로 비교한다. 가격은 2026년 9월 확인.
- 교통
- 예산

가이드도쿄
도쿄 디즈니랜드·디즈니씨 가이드: 티켓 가격, 판타지 스프링스 Fantasy Springs, 디즈니 프리미어 액세스 DPA와 스탠바이 패스 이용법, 첫 방문에는 어느 파크가 좋을까
도쿄 디즈니 하루짜리 패스포트는 변동 가격제로, 2026년 9월에는 평일 대부분이 9,900엔, 주말이 10,900엔이다. 공식 홈페이지에서 매일 14:00에 두 달 뒤 같은 날짜의 티켓을 판매한다. 무료 프라이오리티 패스는 공식 서비스 목록에서 빠져 대기 시간을 줄이는 방법은 유료 디즈니 프리미어 액세스(한 사람당 한 번 1,000~3,500엔)뿐이다. 운영 시간, 25주년 행사, 스탠바이 패스, 엔트리 리퀘스트, 판타지 스프링스 이용법, 첫 방문 때 디즈니랜드와 디즈니씨 중 어디를 고를지도 담았다. 2026년 9월 공식 홈페이지에서 확인했다.
- 추천 일정
- 가족 여행