NVIDIA випустила Kumo Tabular: відкриті табличні фундаментальні моделі, що прогнозують нові рядки за один прямий прохід
NVIDIA випустила Kumo Tabular — нове сімейство фундаментальних моделей для табличних даних (TFM) для класифікації та регресії. Якщо ви стежили за TabPFN або TabICL, принцип роботи здасться знайомим. Модель отримує розмічені рядки як контекст і прогнозує нові рядки за один прямий прохід. Не потрібні ні навчання, ні налаштування гіперпараметрів, ні конструювання ознак.
Kumo Tabular доступна у версіях Small, Medium і Large, що охоплюють приблизно від 28 млн до 215 млн параметрів. Вона працює через бібліотеку NVIDIA з відкритим вихідним кодом structured-data-models (SDM).
Чи придатна вона для розгортання? Так. Ваги поширюються за ліцензією OpenMDW-1.1, яка дозволяє комерційне використання. Код SDM доступний за ліцензією Apache-2.0, а для роботи потрібні Python 3.11+ і PyTorch 2.7+, причому приклади розраховані на GPU з CUDA.
Що додає бібліотека SDM
SDM — це GPU-нативна бібліотека для фундаментальних моделей структурованих даних і попередньої обробки. Окрім Kumo Tabular, вона містить TabICLv2, TabFM від Google і KumoRelational для багатотабличних даних. Усі моделі використовують єдиний інтерфейс навчання в контексті на основі контейнера TableTensor. Бібліотека також виконує попередню обробку, ансамблювання та передбачення для великої кількості класів.
Як працює Kumo Tabular
Kumo Tabular — це Transformer, побудований з урахуванням структури таблиці. Він використовує увагу до стовпців, рядків і контексту, як у TabICL та TabPFN. Конвеєр має 3 етапи:
- Вбудовування клітинок: Числові та категоріальні значення проходять через навчені ознаки Фур’є, з окремими вагами для кожного типу. Пропущені значення не потребують імпутації.
- Вбудовування рядків: Увага до стовпців використовує індуковану self-attention, тому обчислювальна вартість зростає лінійно з кількістю рядків. Увага до рядків із ротаційними позиціями навчається взаємодій між ознаками. 4 навчувані токени [CLS] стискають кожен рядок.
- Навчання в контексті: Фінальний Transformer працює над вбудовуваннями рядків. Контекстні рядки звертаються один до одного, тоді як рядки запиту звертаються лише до контекстних рядків.
Оскільки контекст не бачить запитів, його ключі та значення обчислюються один раз і повторно використовуються. Вихідний шар повертає ймовірності класів або 999 квантилів для регресії. Це дає точковий прогноз і оцінку невизначеності.
У масштабних сценаріях важлива ще одна деталь. Увага Softmax розподіляється менш концентровано зі збільшенням кількості ключів. Kumo Tabular масштабує кожен запит за допомогою температури, яка зростає разом із логарифмом кількості ключів. Коефіцієнт навчається окремо для кожної голови уваги, тому увага залишається концентрованою у більших таблицях.
Навчання лише на штучних таблицях
Kumo Tabular попередньо навчалася виключно на синтетичних таблицях, згенерованих із структурних причинно-наслідкових моделей (SCM). Випадковий причинно-наслідковий граф пов’язує приховані змінні за допомогою лінійних відображень, невеликих нейронних мереж, дерев або гаусівських процесів. Генератор також додає типові для реального світу недосконалі патерни: пропущені значення, категорії з великою кількістю унікальних значень, цільові змінні з важкими хвостами розподілу та суперечливі дубльовані рядки.
Навчання проходило у 3 етапи, подібно до TabICLv2. Контекст зростав від 1 024 до 60 000 рядків, із максимумом у 100 стовпців. Моделі Small, Medium і Large побачили приблизно 35 млн, 71 млн і 137 млн штучних таблиць відповідно. Класифікація та регресія навчалися як окремі моделі. NVIDIA повідомляє, що рецепт навчання та генератори даних буде опубліковано найближчим часом.
Бенчмарки
За стандартних налаштувань Kumo Tabular посідає перше місце загалом у TabArena з рейтингом Elo 1950. Команда NVIDIA повідомляє, що на одній RTX 6000 Pro модель працює у 17 разів швидше за LimiX-2. Усі 3 розміри перебувають на парето-фронті за точністю та часом виконання інференсу.
- BeyondArena: Перше місце з рейтингом Elo 1418 і показником Improvability 7,78%.
- TALENT: Найвищий загальний рейтинг із середніми місцями 6,67 (точність), 3,98 (log-loss) і 4,22 (RMSE).
- ScoringBench: Large і Medium посідають перше та друге місця за середнім рейтингом.
Kumo Tabular проти найближчих конкурентів
| Характеристика | Kumo Tabular | TabICLv2 | TabPFN-3 | LimiX-2 | TabFM |
|---|---|---|---|---|---|
| Розробник | NVIDIA | Inria SODA | Prior Labs | Stable AI | Google Research |
| Параметри | ~28 млн — 215 млн (3 розміри) | 27,55 млн (cls), 28,54 млн (reg) | Не вказано в документації | 400 млн | ~1,64 млрд |
| Завдання | Класифікація, регресія | Класифікація, регресія | Класифікація, регресія | Класифікація, регресія, імпутація | Класифікація, регресія |
| Власні класи за один прохід | 10 (ECOC для більшої кількості) | 10 (ієрархічний підхід для більшої кількості) | 160 | Не зазначено | 10 (жорстке обмеження) |
| Ліцензія на ваги | OpenMDW-1.1 | BSD-3-Clause | TABPFN-3 License v1.0 | StableAI LimiX Non-Commercial | TabFM Non-Commercial v1.0 |
| Комерційне використання ваг | Так | Так | Потрібна платна ліцензія | Ні | Ні |
| Працює в NVIDIA SDM | Так | Так | Ні | Ні | Так |
Джерела: блог NVIDIA, документація моделей SDM, документація Prior Labs, GitHub LimiX, стаття про TabICLv2. Перевірено 30 вересня 2026 року.
Рядок про ліцензії є головною відмінністю. Ваги TabPFN-3, LimiX-2 і TabFM поширюються на некомерційних умовах. Kumo Tabular і TabICLv2 — варіанти з дозвільними ліцензіями, а Kumo Tabular лідирує в бенчмарках, про які повідомляє NVIDIA.
Початок роботи
Встановіть бібліотеку та передайте DataFrame через TableTensor, дотримуючись інструкцій у картці моделі:
# pip install structured-data-models
from sklearn.datasets import load_breast_cancer
import sdm
df = load_breast_cancer(as_frame=True).frame
table = sdm.TableTensor.from_pandas(
df=df,
stypes=sdm.infer_stypes(df, overrides={"target": "categorical"}),
device="cuda",
)
model = sdm.models.KumoTabular(task="classification", device="cuda")
probs = model(
x_context=table[:300].drop_columns("target"),
y_context=table[:300, "target"],
x_query=table[300:].drop_columns("target"),
num_estimators=8,
)Аргумент size приймає значення "small", "medium" або "large", а за замовчуванням має значення large.
Основні висновки
- Kumo Tabular від NVIDIA прогнозує нові рядки таблиці за 1 прямий прохід без навчання.
- 3 розміри охоплюють приблизно від 28 млн до 215 млн параметрів і попередньо навчені лише на синтетичних таблицях.
- NVIDIA повідомляє про перше місце в TabArena (Elo 1950), BeyondArena, TALENT і ScoringBench.
- Ваги за ліцензією OpenMDW-1.1 можна використовувати комерційно, на відміну від TabPFN-3, LimiX-2 і TabFM.
- Модель працює через GPU-нативну бібліотеку SDM від NVIDIA разом із TabICLv2, TabFM і KumoRelational.
Ознайомтеся з моделлю на HF, репозиторієм на GitHub та технічними деталями. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабредіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.