Prior Labs випустила TabPFN-3.5: базову модель для табличних даних, яка перевершує переможне рішення Otto на Kaggle з налаштуваннями за замовчуванням
Prior Labs випустила TabPFN-3.5, новітню версію своєї фундаментальної моделі для табличних даних. Вона прогнозує на основі таблиці за один прямий прохід, без навчання чи налаштування для кожного окремого набору даних. Prior Labs повідомляє про перше місце у 7 бенчмарках табличних даних. Окрема демонстрація показує, що модель перевершує переможне рішення відомого змагання Kaggle 2015 року.
Придатна для розгортання? Так, із ліцензією. Відкриті ваги можна запускати локально для досліджень, оцінювання та Kaggle, але для використання у виробничих середовищах потрібен API Prior Labs або комерційна ліцензія.
Результат на Otto
Змагання Otto Group Product Classification Challenge проходило на Kaggle у 2015 році. У ньому взяли участь 3 505 команд, які змагалися за $10 000. Учасники розподіляли товари за 9 категоріями, використовуючи 93 обфусковані ознаки-лічильники. Результати оцінювалися за допомогою логарифмічної втрати для багатокласової класифікації, де нижче значення є кращим.
Переможне рішення належало Жилберто Тітерічу та Станіславу Семенову. Обоє свого часу посідали перше місце у світовому рейтингу гросмейстерів Kaggle. Їхня робота являла собою багаторівневий стек із 36 моделей, побудованих на вручну створених ознаках.
Нік Еріксон, співтворець AutoGluon і дослідник ШІ в Prior Labs, роками намагався перевершити цей результат. За словами Еріксона, AutoGluon посів 23-тє місце у своїй статті 2020 року. AutoGluon 1.0 посів 14-те місце у 2023 році, а AutoGluon 1.6 — 9-те місце в серпні 2026 року.
Останній етап був найскладнішим. Перехід із 50-го на 10-те місце зменшив логарифмічну втрату з 0,41 до 0,40. Щоб із 10-го місця досягти переможного результату 0,382, знадобилося ще 0,018 — майже вдвічі більше.
TabPFN-3.5 набрала 0,375 на приватному лідерборді. Еріксон стверджує, що модель працювала на необроблених даних із налаштуваннями за замовчуванням. На графічному процесорі RTX PRO 6000 це зайняло близько хвилини. Модель попередньо навчали лише на синтетичних даних, і вона ніколи не бачила ні Otto, ні жодного набору даних Kaggle. У відкритому доступі є відтворюваний ноутбук Kaggle.
Результати бенчмарків
У технічному звіті зазначено перше місце на TabArena, BeyondArena, STRABLE, MulTaBench, RelArena-α, TALENT і ScoringBench. Перше місце не завжди посідає базова модель. TabPFN-3.5-Thinking лідирує на TabArena, BeyondArena, STRABLE і MulTaBench. Попередня версія внутрішнього інструменту TabPFN-Rel посідає перше місце на RelArena-α.
На TabArena, актуальному бенчмарку з 51 набором даних, Thinking набирає 1910 Elo. Базова модель отримує 1866, випереджаючи TabFM+ із результатом 1823. Prior Labs стверджує, що базова модель випереджає AutoGluon 1.6 extreme на 130 балів Elo, витрачаючи лише п’яту частину часу.
BeyondArena охоплює 142 набори даних із групованими, часовими, широкими, насиченими текстом даними та даними з високою кардинальністю. TabPFN-3.5 фінішує приблизно на 150 балів Elo попереду попереднього загального лідера. Налаштовані ансамблі MLP і далі лідирують на його зрізах із групованими, часовими даними та великими наборами даних.
Що змінилося під капотом
- Ширша модель: Розмірність трансформера з контекстним навчанням зросла з 512 до 1024. Кількість параметрів збільшилася до 220 млн — із 53 млн у TabPFN-3 для класифікації.
- 1 контрольна точка: Одна багатозадачна контрольна точка тепер охоплює класифікацію та регресію.
- Нові кодування комірок: Значення проходять через навчені ознаки Фур’є та контекстні ранги ECDF. Ранги не змінюються під час монотонних перетворень, таких як логарифмічне масштабування.
- Простіше попереднє оброблення: Квантильні перетворення, робастне масштабування та ознаки SVD вилучено.
- Масштаб: До 1 млн рядків, рекомендовано 6 000 ознак, підтримується 20 000.
- Налаштований апріорний розподіл: Синтетичні дані тепер більше зосереджені на таблицях із високою кардинальністю, широких і групованих таблицях.
Кеш KV залишається приблизно такого самого розміру, як у TabPFN-3, попри приблизно вчетверо більшу кількість параметрів. Кешовані передбачення для одного рядка відповідають швидкості TabPFN-3. Однак на великих навчальних наборах базова модель працює до 2 разів повільніше за TabPFN-3.
Сімейство моделей
- TabPFN-3.5: Відкриті ваги, 220 млн параметрів, 8 оцінювачів за замовчуванням.
- TabPFN-3.5-Fast (альфа): Відкриті ваги, 84 млн параметрів, до 6 разів швидша за базову модель.
- TabPFN-3.5-Plus: Лише API та корпоративне використання. Додає нативну роботу з текстом і увагу FP8.
- TabPFN-3.5-Thinking: Використовує додаткові обчислення під час інференсу, без LLM, реальних даних чи пошуку. Працює до 12 разів швидше за TabPFN-3-Thinking.
Ключові висновки
- TabPFN-3.5 набирає 0,375 на Otto, перевершуючи переможний результат 2015 року — 0,382.
- Запуск на Otto використовував необроблені дані та налаштування за замовчуванням і тривав близько 1 хвилини.
- Prior Labs повідомляє про перше місце у 7 бенчмарках табличних даних.
- Базова модель зросла до 220 млн параметрів і використовує кодування Фур’є та ECDF.
- Відкриті ваги призначені для некомерційного використання; для виробничого застосування потрібен API або ліцензія.
Ознайомтеся з технічним звітом і технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.