IBM выпустила передовую модель Granite Time Series PatchTST-FM-r2 с лицензией, удобной для коммерческого использования
Фундаментальные модели временных рядов меняют подход к созданию систем прогнозирования. Вместо обучения и поддержки отдельной модели для каждого набора данных пользователи могут применять предварительно обученную модель и получать прогнозы без дополнительного обучения.
IBM выпустила Granite Time Series PatchTST-FM-r2 — новейшую модель семейства Granite TSFM (GitHub, блог). PatchTST-FM-r2, новая версия предшественницы PatchTST-FM-r1, объединяет обновлённую архитектуру, более крупный корпус предварительного обучения, вероятностное прогнозирование, поддержку восстановления пропущенных значений и высокую эффективность при прогнозировании без обучения в модели примерно на 385 млн параметров.
По состоянию на 8 сентября 2026 года эта модель является лучшей среди моделей прогнозирования без обучения, выпущенных под разрешительной открытой лицензией, удобной для коммерческого использования (Apache 2.0 и OpenMDW 1.0), среди воспроизводимых моделей без обучения в рейтинге GIFT-Eval. GIFT-Eval — комплексный тест временных рядов, предназначенный для оценки моделей в различных сценариях прогнозирования; модель занимает второе место в общем рейтинге среди воспроизводимых моделей без обучения.
Веса модели, архитектура, конвейер вывода и код, необходимые для воспроизведения результатов тестирования, доступны всем.
В этой статье мы описываем модель, подробно рассматриваем результаты тестирования и архитектуру модели, обсуждаем обучающие данные и лицензирование, а также приводим примеры кода, демонстрирующие использование модели. Наконец, мы рассказываем о том, как модели семейства Granite Time Series можно применять в потоковых приложениях в рабочей среде с использованием продукта Confluent.
Готовы попробовать? Откройте Granite Time Series PatchTST-FM-r2 на Hugging Face
Кратко
- Универсальное прогнозирование без обучения для спроса, цен, энергопотребления, трафика, телеметрии и других временных рядов.
- Примерно 385 млн параметров, длина контекста до 8192, гибкая длина прогнозов и вероятностные прогнозы благодаря предсказывающей голове на 99 квантилей.
- Основа модели построена из блоков conformer, объединяющих многоголовое самовнимание с временной свёрткой для захвата долгосрочной и краткосрочной временной структуры.
- Модель выпущена под разрешительной лицензией и показывает лучшие результаты в воспроизводимой категории прогнозирования без обучения в тесте GIFT-Eval (двойное лицензирование по Apache-2.0 и OpenMDW-1.0; пользователи могут выбрать любую из лицензий).
- Доступны открытые веса, архитектура, конвейер вывода и код для воспроизведения результатов тестирования.
Высокие результаты прогнозирования без обучения в GIFT-Eval
Фундаментальная модель наиболее полезна, когда обобщается на временные ряды, на которых она специально не обучалась. Поэтому сначала мы сосредоточимся на результатах прогнозирования без обучения.
GIFT-Eval обеспечивает широкую оценку моделей прогнозирования на разнородных наборах данных и в различных сценариях. Если ограничить рейтинг моделями, которые работают без обучения, воспроизводимы и оценивались без утечки тестовых данных, PatchTST-FM-r2 по состоянию на 8 сентября 2026 года занимает второе место как по CRPS, так и по MASE, как показано на рисунках 1 и 2 (для обеих метрик меньшие значения лучше). Важно отметить, что PatchTST-FM-r2 — самая эффективная модель в этой категории среди моделей с разрешительной лицензией, удобной для коммерческого использования.
Рисунок 1. CRPS в GIFT-Eval для ведущих воспроизводимых моделей без обучения. PatchTST-FM-r2 достигает геометрического среднего CRPS, равного 0,467, занимая в этом сравнении место сразу после TimesFM-3 и первое место среди моделей с разрешительными лицензиями.
Рисунок 2. MASE в GIFT-Eval для ведущих воспроизводимых моделей без обучения. PatchTST-FM-r2 достигает геометрического среднего MASE, равного 0,6846. Синие столбцы обозначают модели, выпущенные командой IBM, занимающейся фундаментальными моделями временных рядов.
Конкурентоспособность даже по сравнению с моделями, которым разрешено использовать обучающие данные теста
Некоторые модели в GIFT-Eval относятся к категории предварительно обученных, а не строго к категории моделей без обучения. В их корпусы предварительного обучения разрешено включать обучающие части наборов данных, используемых для оценки в GIFT-Eval.
Даже после добавления этих предварительно обученных моделей в сравнение PatchTST-FM-r2 остаётся среди лидеров, как показано на рисунках 3 и 4: третье место по CRPS и четвёртое по MASE среди воспроизводимых моделей. Она превосходит несколько предварительно обученных моделей, включая варианты Chronos-2, Timer-S1 и Toto, несмотря на то что некоторые конкурирующие модели значительно крупнее.
Рисунок 3. CRPS в GIFT-Eval с учётом воспроизводимых моделей без обучения и предварительно обученных моделей.
Рисунок 4. MASE в GIFT-Eval с учётом воспроизводимых моделей без обучения и предварительно обученных моделей.
Архитектура: что изменилось по сравнению с PatchTST-FM-r1?
PatchTST-FM-r2 сохраняет представление на основе патчей, благодаря которому семейство PatchTST стало эффективным, однако внутренняя архитектура переработана для эффективного захвата долгосрочных и краткосрочных зависимостей и сглаживания прогнозов между патчами — оба изменения существенно улучшают показатели ошибок.
Одно из изменений — переход от стандартных слоёв трансформера к слоям, которые объединяют свёртку с многоголовым самовниманием. Эти слои называются слоями conformer и происходят из приложений обработки речи.
Рисунок 5. Эволюция архитектуры от PatchTST-FM-r1 к PatchTST-FM-r2 на основе Conformer.
Блок PatchTST-FM-r1 объединяет многоголовое самовнимание с сетью прямого распространения. В r2 он заменён блоком в стиле conformer, содержащим два полушаговых слоя прямого распространения по обе стороны от многоголового самовнимания и слой временной свёртки.
Благодаря этому модель получает два взаимодополняющих механизма анализа временного ряда. Самовнимание может моделировать дальние зависимости между патчами, а свёртка создаёт индуктивное смещение в сторону локальной временной структуры. Таким образом, компонент свёртки может захватывать краткосрочные взаимодействия, позволяя механизму внимания сосредотачиваться на зависимостях на более длинных горизонтах. Это явление можно наблюдать в шаблонах внимания, полученных для версий трансформера и conformer (см. пример на рисунке ниже с использованием реальных образцов из набора данных ETTh1). Значительная часть самовнимания трансформера (слева на рисунке) сосредоточена около диагонали, то есть захватывает локальные зависимости, тогда как внимание в блоке conformer (справа) демонстрирует фокус на дальних расстояниях благодаря слою свёртки, покрывающему короткие расстояния. Блоки conformer в основе модели используют чередующиеся размеры ядер свёртки 3 и 5 по повторяющемуся шаблону {5, 5, 3, 3}.
Рисунок 6. Сравнение шаблонов внимания, полученных для трансформера (слева) и conformer (справа) с использованием реальных образцов из набора данных ETTh1.
Кроме того, PatchTST-FM-r2 использует перекрывающиеся на 50% патчи с взвешиванием окном Хэмминга и прогнозированием методом overlap-and-add для сглаживания границ патчей и повышения точности прогнозирования. Наконец, в архитектуру добавлена нормализация для стабильности, а число блоков увеличено с 20 до 30.
После этих изменений получившаяся модель содержит примерно 385 млн параметров, поддерживает очень длинный контекст до 8192 шагов и предсказывает 99 квантилей при гибкой длине прогнозирования. Модель предоставляет как точечные прогнозы, так и квантильные выходы для построения распределений прогнозов и интервалов неопределённости.
Обучающие данные
Для фундаментальных моделей, предназначенных для реальных приложений, качество модели — лишь один из факторов. Разработчикам всё чаще необходимо понимать, какие данные использовались для создания модели, могли ли данные тестов попасть в обучение и каковы последствия развёртывания модели.
PatchTST-FM-r2 использует документированный корпус предварительного обучения, состоящий из четырёх источников: выбранных наборов данных из GiftEvalPretrain; специально созданных синтетических данных на основе KernelSynth с изменёнными периодическими ядрами и ограниченной аугментацией; корпуса TSMixup, созданного с использованием подхода Chronos, но ограниченного наборами данных, не входящими в тестовый набор GIFT-Eval; и примерно 500 000 синтетических последовательностей CauKer длиной 4096 каждая.
Для корпоративных пользователей такая прозрачность может быть не менее важна, чем ещё несколько пунктов в рейтинге. Это не отменяет необходимости собственной проверки управления моделями и лицензирования со стороны организации, но предоставляет пользователям значительно больше информации для такой проверки, чем непрозрачный корпус предварительного обучения.
Открыта для исследовательских экспериментов — и коммерческого использования
Чтобы предоставить сообществу больше возможностей выбора, Granite Time Series PatchTST-FM-r2 распространяется по двум лицензиям: Apache 2.0 и OpenMDW 1.0. Пользователи могут выбрать любую из них; обе предоставляют широкие разрешения на использование, изменение и распространение моделей, при этом OpenMDW Linux Foundation предлагает лицензионную платформу, специально разработанную для моделей ИИ и связанных с ними материалов. Предоставляя модели по разрешительным лицензиям с открытым исходным кодом, IBM стремится снизить барьеры для внедрения и дать организациям, исследователям и разработчикам возможность уверенно развивать эту технологию благодаря лицензиям, не ограничивающим её использование. Реализация архитектуры также доступна в репозитории Granite-TSFM и обратно совместима с контрольными точками PatchTST-FM-r1.
Попробуйте PatchTST-FM-r2 с помощью нескольких строк Python
Проще всего оценить фундаментальную модель на собственных данных временных рядов.
Установите пакет Granite TSFM:
pip install "granite-tsfm>=0.3.9"
Затем загрузите PatchTST-FM-r2 непосредственно из Hugging Face Hub:
import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline
model = PatchTSTFMForPrediction.from_pretrained(
"ibm-granite/granite-timeseries-patchtst-fm-r2"
)
df = pd.read_csv(
"https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
parse_dates=["date"],
)
pipe = TimeSeriesForecastingPipeline(
model=model,
id_columns=[],
timestamp_column="date",
target_columns=["HUFL"],
max_context_length=model.config.context_length,
context_length=512,
prediction_length=64,
impute_method=None,
quantile_levels=[0.1, 0.5, 0.9],
explode_forecasts=True,
freq="1h",
)
forecast = pipe(df.iloc[-512:])
Как видите, тонкая настройка и подгонка модели под конкретную задачу не требуются. Конвейер использует только недавнюю историю ряда и генерирует будущий прогноз, включая запрошенные квантили.
Выше приведён простой пример с общедоступными данными — вы можете заменить входные данные собственными, включая данные о спросе, телеметрию датчиков, загрузку процессора, энергопотребление, объём транзакций, трафик, цены или другой регулярно дискретизируемый временной ряд.
Попробуйте на собственных данных: Откройте PatchTST-FM-r2 на Hugging Face Hub
От ноутбуков к потоковым временным рядам
Этот выпуск связан с более широкой работой над моделями IBM Granite Time Series и добавляет новую модель в обширный портфель.
Для приложений, в которых данные поступают непрерывно, а не в виде статических DataFrame, IBM и Confluent недавно сделали несколько моделей Granite Time Series доступными через программу раннего доступа в Confluent Cloud. Изначальный портфель включает PatchTST-FM-r1, FlowState-r1.1, TTM-r3 и TSPulse.
Интеграция переносит вывод фундаментальных моделей непосредственно в потоковые приложения через Apache Flink в Confluent Cloud. Прогнозы и результаты обнаружения аномалий можно генерировать из потоков данных в реальном времени, не требуя от команд настройки отдельной среды машинного обучения и перемещения туда данных.
Модели, упомянутые в этой статье 2
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 2
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.


