NVIDIA выпустила Kumo Tabular: открытые табличные фундаментальные модели, предсказывающие новые строки за один прямой проход
NVIDIA выпустила Kumo Tabular — новое семейство табличных базовых моделей (TFM) для классификации и регрессии. Если вы следили за TabPFN или TabICL, принцип работы покажется знакомым. Модель получает размеченные строки в качестве контекста и предсказывает новые строки за один прямой проход. Обучение, настройка гиперпараметров и разработка признаков не требуются.
Kumo Tabular выпускается в версиях Small, Medium и Large, насчитывающих примерно от 28 млн до 215 млн параметров. Модель работает через открытую библиотеку NVIDIA structured-data-models (SDM).
Подходит ли она для развертывания? Да. Веса распространяются по лицензии OpenMDW-1.1, которая разрешает коммерческое использование. Код SDM распространяется по лицензии Apache-2.0, а для его работы требуются Python 3.11+ и PyTorch 2.7+; примеры рассчитаны на GPU с CUDA.
Что добавляет библиотека SDM
SDM — это GPU-нативная библиотека для базовых моделей структурированных данных и предварительной обработки. Помимо Kumo Tabular, в нее входят TabICLv2, TabFM от Google и KumoRelational для многотабличных данных. Все модели используют единый интерфейс обучения в контексте на основе контейнера TableTensor. Библиотека также выполняет предварительную обработку, ансамблирование и предсказание для большого числа классов.
Как работает Kumo Tabular
Kumo Tabular — это трансформер, построенный с учетом структуры таблицы. Он использует внимание к столбцам, строкам и контексту, как это реализовано в TabICL и TabPFN. Конвейер состоит из 3 этапов:
- Встраивание ячеек: числовые и категориальные значения проходят через обучаемые признаки Фурье с отдельными весами для каждого типа. Пропуски не требуют импутации.
- Встраивание строк: внимание к столбцам использует индуцированное self-attention, поэтому затраты растут линейно с числом строк. Внимание к строкам с вращательными позициями обучает взаимодействия признаков. 4 обучаемых токена [CLS] сжимают каждую строку.
- Обучение в контексте: финальный трансформер работает с встраиваниями строк. Контекстные строки обращают внимание друг на друга, тогда как строки-запросы обращают внимание только на контекстные строки.
Поскольку контекст не видит запросы, его ключи и значения вычисляются один раз и используются повторно. Выходной слой выдает вероятности классов или 999 квантилей для регрессии. Это дает точечное предсказание и оценку неопределенности.
При масштабировании важна еще одна деталь. По мере роста числа ключей внимание Softmax становится менее концентрированным. Kumo Tabular масштабирует каждый запрос с помощью температуры, которая растет логарифмически относительно числа ключей. Коэффициент обучается отдельно для каждой головы внимания, благодаря чему внимание остается сфокусированным на больших таблицах.
Обучение только на искусственных таблицах
Kumo Tabular предварительно обучалась исключительно на синтетических таблицах, сгенерированных из структурных причинных моделей (SCM). Случайный причинный граф связывает скрытые переменные посредством линейных отображений, небольших нейронных сетей, деревьев или гауссовских процессов. Генератор также добавляет характерные для реального мира сложные закономерности: пропуски, категории с большим числом уникальных значений, цели с тяжелыми хвостами распределения и противоречивые дублирующиеся строки.
Обучение проходило в 3 этапа, аналогично TabICLv2. Контекст увеличивался с 1 024 до 60 000 строк, а число столбцов достигало 100. На версии Small, Medium и Large пришлось примерно 35 млн, 71 млн и 137 млн искусственных таблиц соответственно. Классификация и регрессия обучаются как отдельные модели. NVIDIA сообщает, что рецепт обучения и генераторы данных будут опубликованы в ближайшее время.
Бенчмарки
При настройках по умолчанию Kumo Tabular занимает первое место в общем рейтинге TabArena с рейтингом Elo 1950. Команда NVIDIA сообщает, что на одной RTX 6000 Pro модель работает в 17 раз быстрее, чем LimiX-2. Все 3 размера находятся на парето-фронте по точности и времени инференса.
- BeyondArena: первое место с рейтингом Elo 1418 и показателем улучшения 7,78%.
- TALENT: высший общий рейтинг со средними позициями 6,67 (точность), 3,98 (log-loss) и 4,22 (RMSE).
- ScoringBench: Large и Medium занимают первое и второе места по средней позиции.
Kumo Tabular и ее ближайшие конкуренты
| Характеристика | Kumo Tabular | TabICLv2 | TabPFN-3 | LimiX-2 | TabFM |
|---|---|---|---|---|---|
| Разработчик | NVIDIA | Inria SODA | Prior Labs | Stable AI | Google Research |
| Параметры | ~28 млн – 215 млн (3 размера) | 27,55 млн (классификация), 28,54 млн (регрессия) | Не указаны в документации | 400 млн | ~1,64 млрд |
| Задачи | Классификация, регрессия | Классификация, регрессия | Классификация, регрессия | Классификация, регрессия, импутация | Классификация, регрессия |
| Нативное число классов за проход | 10 (ECOC для большего числа) | 10 (иерархический режим для большего числа) | 160 | Не указано | 10 (жесткое ограничение) |
| Лицензия на веса | OpenMDW-1.1 | BSD-3-Clause | TABPFN-3 License v1.0 | StableAI LimiX Non-Commercial | TabFM Non-Commercial v1.0 |
| Коммерческое использование весов | Да | Да | Требуется платная лицензия | Нет | Нет |
| Работает в NVIDIA SDM | Да | Да | Нет | Нет | Да |
Источники: блог NVIDIA, документация по моделям SDM, документация Prior Labs, GitHub LimiX, статья о TabICLv2. Проверено 30 сентября 2026 года.
Именно строка о лицензии является главным отличием. На веса TabPFN-3, LimiX-2 и TabFM распространяются условия некоммерческого использования. Kumo Tabular и TabICLv2 предлагают наиболее свободные условия, а Kumo Tabular лидирует в бенчмарках, приведенных NVIDIA.
Начало работы
Установите библиотеку и передайте DataFrame через TableTensor, следуя карточке модели:
# pip install structured-data-models
from sklearn.datasets import load_breast_cancer
import sdm
df = load_breast_cancer(as_frame=True).frame
table = sdm.TableTensor.from_pandas(
df=df,
stypes=sdm.infer_stypes(df, overrides={"target": "categorical"}),
device="cuda",
)
model = sdm.models.KumoTabular(task="classification", device="cuda")
probs = model(
x_context=table[:300].drop_columns("target"),
y_context=table[:300, "target"],
x_query=table[300:].drop_columns("target"),
num_estimators=8,
)Аргумент size принимает значения "small", "medium" или "large", а по умолчанию используется large.
Ключевые выводы
- Kumo Tabular от NVIDIA предсказывает новые строки таблицы за 1 прямой проход без обучения.
- 3 размера охватывают диапазон примерно от 28 млн до 215 млн параметров; предварительное обучение выполнялось только на синтетических таблицах.
- NVIDIA сообщает о первом месте в TabArena (Elo 1950), BeyondArena, TALENT и ScoringBench.
- Веса по лицензии OpenMDW-1.1 допускают коммерческое использование, в отличие от TabPFN-3, LimiX-2 и TabFM.
- Модель работает через GPU-нативную библиотеку SDM от NVIDIA наряду с TabICLv2, TabFM и KumoRelational.
Посмотрите модель на HF, репозиторий на GitHub и технические подробности. Вся заслуга принадлежит исследователям этого проекта. Также подпишитесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория на GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.