IBM випустила передову модель Granite Time Series PatchTST-FM-r2 із ліцензією, сприятливою для комерційного використання
Фундаментальні моделі часових рядів змінюють підхід до створення систем прогнозування. Замість навчання й підтримки окремої моделі для кожного набору даних користувачі можуть застосувати попередньо навчену модель і генерувати прогнози без прикладів.
IBM випустила Granite Time Series PatchTST-FM-r2 — найновішу модель у сімействі Granite TSFM (github, блог). PatchTST-FM-r2, нова версія попередньої моделі PatchTST-FM-r1, поєднує оновлену архітектуру, більший корпус для попереднього навчання, імовірнісне прогнозування, підтримку імпутації пропущених значень і високі результати прогнозування без прикладів у моделі приблизно з 385 млн параметрів.
Станом на 8 вересня 2026 року модель є найрезультативнішою моделлю прогнозування без прикладів, випущеною за сприятливою для комерційного використання дозвільною ліцензією з відкритим кодом (Apache 2.0 і OpenMDW 1.0), серед відтворюваних моделей без прикладів у рейтингу GIFT-Eval. GIFT-Eval — це комплексний бенчмарк прогнозування часових рядів, призначений для оцінювання моделей у різноманітних сценаріях прогнозування; модель посідає 2-ге місце загалом серед відтворюваних моделей без прикладів.
Ваги моделі, архітектура, конвеєр інференсу й код, необхідні для відтворення результатів бенчмарку, доступні.
У цьому блозі ми описуємо модель, детальніше розглядаємо результати бенчмаркінгу й архітектуру моделі, обговорюємо навчальні дані та ліцензування, а також наводимо приклади коду, що демонструють використання моделі. Насамкінець ми також покажемо, як моделі сімейства Granite Time Series можна використовувати в потокових застосунках у виробничому середовищі за допомогою продукту Confluent.
Готові спробувати? Відкрити Granite Time Series PatchTST-FM-r2 на Hugging Face
Коротко
- Універсальне прогнозування без прикладів для попиту, цін, енергетичних навантажень, трафіку, телеметрії та інших часових рядів.
- Приблизно 385 млн параметрів, довжина контексту до 8 192, гнучка довжина прогнозу та імовірнісні прогнози через голову передбачення із 99 квантилями.
- Основа моделі побудована з конформер-блоків, які поєднують багатоголову самоувагу з часовою згорткою для охоплення довго- й короткострокової часової структури.
- Модель із дозвільною ліцензією та найкращими результатами в категорії відтворюваних прогнозів без прикладів у бенчмарку GIFT-Eval (подвійне ліцензування за Apache-2.0 і OpenMDW-1.0; користувачі можуть обрати будь-яку з ліцензій).
- Доступні відкриті ваги, архітектура, конвеєр інференсу та код для відтворення бенчмарку.
Високі результати прогнозування без прикладів у GIFT-Eval
Фундаментальна модель найбільш корисна тоді, коли узагальнює на часові ряди, на яких її спеціально не навчали. Тому спочатку ми зосереджуємося на результатах прогнозування без прикладів.
GIFT-Eval забезпечує широке оцінювання моделей прогнозування на різнорідних наборах даних і в різноманітних сценаріях прогнозування. Якщо обмежити рейтинг моделями, які працюють без прикладів, є відтворюваними та оцінювалися без витоку тестових даних, PatchTST-FM-r2 станом на 8 вересня 2026 року посідає друге місце як за CRPS, так і за MASE, як показано на рисунках 1 і 2 (для обох метрик менші значення кращі). Важливо, що PatchTST-FM-r2 є найрезультативнішою моделлю в цій категорії серед моделей із дозвільним, сприятливим для комерційного використання ліцензуванням.
Рисунок 1. CRPS GIFT-Eval для провідних відтворюваних моделей без прикладів. PatchTST-FM-r2 досягає геометричного середнього CRPS 0,467, посідаючи в цьому порівнянні місце одразу після TimesFM-3 і перше місце серед моделей із дозвільними ліцензіями.
Рисунок 2. MASE GIFT-Eval для провідних відтворюваних моделей без прикладів. PatchTST-FM-r2 досягає геометричного середнього MASE 0,6846. Сині стовпчики позначають моделі, випущені командою IBM, що займається фундаментальними моделями часових рядів.
Конкурентоспроможність навіть порівняно з моделями, яким дозволено використовувати навчальні дані бенчмарку
Деякі моделі в GIFT-Eval класифікуються як попередньо навчені, а не як суто моделі без прикладів. Цим моделям дозволено включати частини для навчання наборів даних оцінювання GIFT-Eval до своїх корпусів попереднього навчання.
Навіть якщо додати ці попередньо навчені моделі до порівняння, PatchTST-FM-r2 залишається близькою до лідерів, як видно на рисунках 3 і 4: 3-тє місце за CRPS і 4-те за MASE серед відтворюваних моделей. Вона перевершує кілька попередньо навчених моделей, зокрема варіанти Chronos-2, Timer-S1 і Toto, попри те, що деякі конкуруючі моделі значно більші.
Рисунок 3. CRPS GIFT-Eval з урахуванням відтворюваних моделей без прикладів і попередньо навчених моделей.
Рисунок 4. MASE GIFT-Eval з урахуванням відтворюваних моделей без прикладів і попередньо навчених моделей.
Архітектура: що змінилося порівняно з PatchTST-FM-r1?
PatchTST-FM-r2 зберігає патч-орієнтоване представлення, яке зробило сімейство PatchTST ефективним, але внутрішню архітектуру перероблено для ефективного охоплення довго- й короткострокових взаємозв’язків і згладжування прогнозів між патчами — обидва ці вдосконалення суттєво покращують показники помилок.
Однією зі змін є перехід від стандартних трансформерних шарів до шарів, які поєднують згортку з багатоголовою самоувагою. Ці шари називаються конформер-шарами й мають своє походження в застосунках обробки мовлення.
Рисунок 5. Еволюція архітектури від PatchTST-FM-r1 до PatchTST-FM-r2 на основі конформера.
Блок PatchTST-FM-r1 поєднує багатоголову самоувагу з мережею прямого поширення. У r2 ми замінили його блоком у стилі конформера, що містить два напівкрокові шари прямого поширення навколо багатоголової самоуваги й часовий згортковий шар.
Це надає моделі два взаємодоповнювальні механізми для міркування над часовим рядом. Самоувага може моделювати далекі взаємозв’язки між патчами, тоді як згортка створює індуктивне упередження на користь локальної часової структури. Отже, згортковий компонент може охоплювати короткострокові взаємодії, дозволяючи механізму уваги зосереджуватися на взаємозв’язках на довших горизонтах. Це явище спостерігається у шаблонах уваги, зафіксованих у версіях із трансформером і конформером (див. приклад на рисунку нижче з використанням реальних зразків із набору даних ETTh1). Значна частина самоуваги трансформера (ліворуч на рисунку) зосереджується біля діагоналі, тобто охоплює локальні взаємозв’язки, тоді як увага в конформер-блоці (праворуч) демонструє фокус на далеких відстанях (далеко від діагоналі) завдяки згортковому шару, який охоплює короткі відстані. Конформер-блоки в основі використовують почергові розміри згорткового ядра 3 і 5 у повторюваній послідовності {5, 5, 3, 3}.
Рисунок 6. Порівняння шаблонів уваги, зафіксованих у версіях із трансформером (ліворуч) і конформером (праворуч), з використанням реальних зразків із набору даних ETTh1.
Крім того, PatchTST-FM-r2 використовує патчі з перекриттям 50% із вагами вікна Геммінга та прогнозуванням методом overlap-and-add, щоб згладжувати межі патчів і підвищувати точність прогнозування. Нарешті, архітектура додає нормалізацію для стабільності та збільшує кількість блоків із 20 до 30.
Завдяки цим змінам отримана модель має приблизно 385 млн параметрів, підтримує дуже довгі контексти до 8 192 кроків і передбачає 99 квантилів для гнучкої довжини прогнозу. Модель надає як точкові прогнози, так і квантильні виходи для прогнозування розподілів та інтервалів невизначеності.
Навчальні дані
Для фундаментальних моделей, призначених для реальних застосувань, якість моделі є лише одним із чинників. Розробникам дедалі частіше потрібно розуміти, які дані використано для створення моделі, чи могли дані бенчмарку просочитися до навчання та які наслідки це має для розгортання моделі.
PatchTST-FM-r2 використовує документований корпус для попереднього навчання, що складається з чотирьох джерел: вибраних наборів даних із GiftEvalPretrain; спеціальних синтетичних даних на основі KernelSynth зі зміненими періодичними ядрами та обмеженою аугментацією; корпусу TSMixup, згенерованого підходом, описаним у Chronos, але обмеженого наборами даних, що не входять до оціночного набору GIFT-Eval; і приблизно 500 000 синтетичних послідовностей CauKer, кожна завдовжки 4 096.
Для корпоративних користувачів така прозорість може бути не менш важливою, ніж ще кілька пунктів у рейтингу. Це не усуває потреби в оцінюванні власного управління моделями та ліцензуванням організації, але надає користувачам значно більше інформації для такого оцінювання, ніж непрозорий корпус попереднього навчання.
Відкрита для дослідницьких експериментів — і комерційного використання
Щоб надати спільноті більше можливостей вибору, Granite Time Series PatchTST-FM-r2 поширюється за подвійною ліцензією Apache 2.0 і OpenMDW 1.0. Користувачі можуть обрати будь-яку ліцензію; обидві надають широкі дозвільні права на використання, зміну та поширення моделей, а OpenMDW Linux Foundation пропонує схему ліцензування, спеціально розроблену для моделей ШІ та пов’язаних матеріалів. Роблячи моделі доступними за дозвільними ліцензіями з відкритим кодом, IBM прагне зменшити бар’єри для впровадження та дати організаціям, дослідникам і розробникам змогу впевнено розвивати цю технологію завдяки ліцензіям, які не обмежують її використання. Реалізація архітектури також доступна в репозиторії Granite-TSFM і має зворотну сумісність із контрольними точками PatchTST-FM-r1.
Спробуйте PatchTST-FM-r2 за допомогою кількох рядків Python
Найпростіший спосіб оцінити фундаментальну модель — використати власні дані часових рядів.
Установіть пакет Granite TSFM:
pip install "granite-tsfm>=0.3.9"
Потім завантажте PatchTST-FM-r2 безпосередньо з Hugging Face Hub:
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512,
prediction_length=64,
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9],
explode_forecasts=True,
freq="1h",
)
forecast = pipe(df.iloc[-512:])
Як бачите, тонке налаштування та підгонка моделі під конкретне завдання не потрібні. Конвеєр використовує лише недавню історію ряду й генерує майбутній прогноз, зокрема запитані квантілі.
Наведений вище приклад використовує загальнодоступні дані — ви можете замінити вхідні дані прикладу власними, зокрема даними про попит, телеметрію датчиків, завантаження ЦП, споживання енергії, обсяг транзакцій, трафік, ціни або інший регулярно дискретизований часовий ряд.
Спробуйте на власних даних: Відкрити PatchTST-FM-r2 на Hugging Face Hub
Від ноутбуків до потокових часових рядів
Цей випуск є частиною ширшої роботи над моделями IBM Granite Time Series, додаючи нову модель до ширшого портфоліо.
Для застосунків, у яких дані надходять безперервно, а не у статичних DataFrame, IBM і Confluent нещодавно зробили кілька моделей Granite Time Series доступними через програму раннього доступу в Confluent Cloud. Початкове портфоліо включає PatchTST-FM-r1, FlowState-r1.1, TTM-r3 і TSPulse.
Інтеграція забезпечує інференс фундаментальних моделей безпосередньо в потокових застосунках через Apache Flink у Confluent Cloud. Прогнози та результати виявлення аномалій можна генерувати з потоків даних у реальному часі, не змушуючи команди налаштовувати окреме середовище машинного навчання й переміщувати туди дані.
Моделі, згадані в цій статті 2
Спільнота
· Зареєструйтеся або увійдіть, щоб коментувати
Моделі, згадані в цій статті 2
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.


