Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

IBM выпустила передовую модель Granite Time Series PatchTST-FM-r2 с лицензией, удобной для коммерческого использования

IBM выпускает модель SOTA Granite Time Series PatchTST-FM-r2 с лицензией, удобной для коммерческого использования
Для предприятий Статья
Опубликовано 9 сентября 2026 года
Высокопроизводительное прогнозирование без обучения с открытой лицензией, удобной для коммерческого использования

Фундаментальные модели временных рядов меняют подход к созданию систем прогнозирования. Вместо обучения и поддержки отдельной модели для каждого набора данных пользователи могут применять предварительно обученную модель и получать прогнозы без дополнительного обучения.

IBM выпустила Granite Time Series PatchTST-FM-r2 — новейшую модель семейства Granite TSFM (GitHub, блог). PatchTST-FM-r2, новая версия предшественницы PatchTST-FM-r1, объединяет обновлённую архитектуру, более крупный корпус предварительного обучения, вероятностное прогнозирование, поддержку восстановления пропущенных значений и высокую эффективность при прогнозировании без обучения в модели примерно на 385 млн параметров.

По состоянию на 8 сентября 2026 года эта модель является лучшей среди моделей прогнозирования без обучения, выпущенных под разрешительной открытой лицензией, удобной для коммерческого использования (Apache 2.0 и OpenMDW 1.0), среди воспроизводимых моделей без обучения в рейтинге GIFT-Eval. GIFT-Eval — комплексный тест временных рядов, предназначенный для оценки моделей в различных сценариях прогнозирования; модель занимает второе место в общем рейтинге среди воспроизводимых моделей без обучения.

Веса модели, архитектура, конвейер вывода и код, необходимые для воспроизведения результатов тестирования, доступны всем.

В этой статье мы описываем модель, подробно рассматриваем результаты тестирования и архитектуру модели, обсуждаем обучающие данные и лицензирование, а также приводим примеры кода, демонстрирующие использование модели. Наконец, мы рассказываем о том, как модели семейства Granite Time Series можно применять в потоковых приложениях в рабочей среде с использованием продукта Confluent.

Готовы попробовать? Откройте Granite Time Series PatchTST-FM-r2 на Hugging Face

Кратко

  • Универсальное прогнозирование без обучения для спроса, цен, энергопотребления, трафика, телеметрии и других временных рядов.
  • Примерно 385 млн параметров, длина контекста до 8192, гибкая длина прогнозов и вероятностные прогнозы благодаря предсказывающей голове на 99 квантилей.
  • Основа модели построена из блоков conformer, объединяющих многоголовое самовнимание с временной свёрткой для захвата долгосрочной и краткосрочной временной структуры.
  • Модель выпущена под разрешительной лицензией и показывает лучшие результаты в воспроизводимой категории прогнозирования без обучения в тесте GIFT-Eval (двойное лицензирование по Apache-2.0 и OpenMDW-1.0; пользователи могут выбрать любую из лицензий).
  • Доступны открытые веса, архитектура, конвейер вывода и код для воспроизведения результатов тестирования.

Высокие результаты прогнозирования без обучения в GIFT-Eval

Фундаментальная модель наиболее полезна, когда обобщается на временные ряды, на которых она специально не обучалась. Поэтому сначала мы сосредоточимся на результатах прогнозирования без обучения.

GIFT-Eval обеспечивает широкую оценку моделей прогнозирования на разнородных наборах данных и в различных сценариях. Если ограничить рейтинг моделями, которые работают без обучения, воспроизводимы и оценивались без утечки тестовых данных, PatchTST-FM-r2 по состоянию на 8 сентября 2026 года занимает второе место как по CRPS, так и по MASE, как показано на рисунках 1 и 2 (для обеих метрик меньшие значения лучше). Важно отметить, что PatchTST-FM-r2 — самая эффективная модель в этой категории среди моделей с разрешительной лицензией, удобной для коммерческого использования.

GIFT-Eval CRPS for leading replicable zero-shot models

Рисунок 1. CRPS в GIFT-Eval для ведущих воспроизводимых моделей без обучения. PatchTST-FM-r2 достигает геометрического среднего CRPS, равного 0,467, занимая в этом сравнении место сразу после TimesFM-3 и первое место среди моделей с разрешительными лицензиями.

GIFT-Eval MASE for leading replicable zero-shot models

Рисунок 2. MASE в GIFT-Eval для ведущих воспроизводимых моделей без обучения. PatchTST-FM-r2 достигает геометрического среднего MASE, равного 0,6846. Синие столбцы обозначают модели, выпущенные командой IBM, занимающейся фундаментальными моделями временных рядов.

Конкурентоспособность даже по сравнению с моделями, которым разрешено использовать обучающие данные теста

Некоторые модели в GIFT-Eval относятся к категории предварительно обученных, а не строго к категории моделей без обучения. В их корпусы предварительного обучения разрешено включать обучающие части наборов данных, используемых для оценки в GIFT-Eval.

Даже после добавления этих предварительно обученных моделей в сравнение PatchTST-FM-r2 остаётся среди лидеров, как показано на рисунках 3 и 4: третье место по CRPS и четвёртое по MASE среди воспроизводимых моделей. Она превосходит несколько предварительно обученных моделей, включая варианты Chronos-2, Timer-S1 и Toto, несмотря на то что некоторые конкурирующие модели значительно крупнее.

GIFT-Eval CRPS with zero-shot and pretrained replicable models

Рисунок 3. CRPS в GIFT-Eval с учётом воспроизводимых моделей без обучения и предварительно обученных моделей.

GIFT-Eval MASE with zero-shot and pretrained replicable models

Рисунок 4. MASE в GIFT-Eval с учётом воспроизводимых моделей без обучения и предварительно обученных моделей.

Архитектура: что изменилось по сравнению с PatchTST-FM-r1?

PatchTST-FM-r2 сохраняет представление на основе патчей, благодаря которому семейство PatchTST стало эффективным, однако внутренняя архитектура переработана для эффективного захвата долгосрочных и краткосрочных зависимостей и сглаживания прогнозов между патчами — оба изменения существенно улучшают показатели ошибок.

Одно из изменений — переход от стандартных слоёв трансформера к слоям, которые объединяют свёртку с многоголовым самовниманием. Эти слои называются слоями conformer и происходят из приложений обработки речи.

Architectural evolution from PatchTST-FM-r1 to Conformer-based PatchTST-FM-r2

Рисунок 5. Эволюция архитектуры от PatchTST-FM-r1 к PatchTST-FM-r2 на основе Conformer.

Блок PatchTST-FM-r1 объединяет многоголовое самовнимание с сетью прямого распространения. В r2 он заменён блоком в стиле conformer, содержащим два полушаговых слоя прямого распространения по обе стороны от многоголового самовнимания и слой временной свёртки.

Благодаря этому модель получает два взаимодополняющих механизма анализа временного ряда. Самовнимание может моделировать дальние зависимости между патчами, а свёртка создаёт индуктивное смещение в сторону локальной временной структуры. Таким образом, компонент свёртки может захватывать краткосрочные взаимодействия, позволяя механизму внимания сосредотачиваться на зависимостях на более длинных горизонтах. Это явление можно наблюдать в шаблонах внимания, полученных для версий трансформера и conformer (см. пример на рисунке ниже с использованием реальных образцов из набора данных ETTh1). Значительная часть самовнимания трансформера (слева на рисунке) сосредоточена около диагонали, то есть захватывает локальные зависимости, тогда как внимание в блоке conformer (справа) демонстрирует фокус на дальних расстояниях благодаря слою свёртки, покрывающему короткие расстояния. Блоки conformer в основе модели используют чередующиеся размеры ядер свёртки 3 и 5 по повторяющемуся шаблону {5, 5, 3, 3}.

Transformer and conformer attention patterns

Рисунок 6. Сравнение шаблонов внимания, полученных для трансформера (слева) и conformer (справа) с использованием реальных образцов из набора данных ETTh1.

Кроме того, PatchTST-FM-r2 использует перекрывающиеся на 50% патчи с взвешиванием окном Хэмминга и прогнозированием методом overlap-and-add для сглаживания границ патчей и повышения точности прогнозирования. Наконец, в архитектуру добавлена нормализация для стабильности, а число блоков увеличено с 20 до 30.

После этих изменений получившаяся модель содержит примерно 385 млн параметров, поддерживает очень длинный контекст до 8192 шагов и предсказывает 99 квантилей при гибкой длине прогнозирования. Модель предоставляет как точечные прогнозы, так и квантильные выходы для построения распределений прогнозов и интервалов неопределённости.

Обучающие данные

Для фундаментальных моделей, предназначенных для реальных приложений, качество модели — лишь один из факторов. Разработчикам всё чаще необходимо понимать, какие данные использовались для создания модели, могли ли данные тестов попасть в обучение и каковы последствия развёртывания модели.

PatchTST-FM-r2 использует документированный корпус предварительного обучения, состоящий из четырёх источников: выбранных наборов данных из GiftEvalPretrain; специально созданных синтетических данных на основе KernelSynth с изменёнными периодическими ядрами и ограниченной аугментацией; корпуса TSMixup, созданного с использованием подхода Chronos, но ограниченного наборами данных, не входящими в тестовый набор GIFT-Eval; и примерно 500 000 синтетических последовательностей CauKer длиной 4096 каждая.

Для корпоративных пользователей такая прозрачность может быть не менее важна, чем ещё несколько пунктов в рейтинге. Это не отменяет необходимости собственной проверки управления моделями и лицензирования со стороны организации, но предоставляет пользователям значительно больше информации для такой проверки, чем непрозрачный корпус предварительного обучения.

Открыта для исследовательских экспериментов — и коммерческого использования

Чтобы предоставить сообществу больше возможностей выбора, Granite Time Series PatchTST-FM-r2 распространяется по двум лицензиям: Apache 2.0 и OpenMDW 1.0. Пользователи могут выбрать любую из них; обе предоставляют широкие разрешения на использование, изменение и распространение моделей, при этом OpenMDW Linux Foundation предлагает лицензионную платформу, специально разработанную для моделей ИИ и связанных с ними материалов. Предоставляя модели по разрешительным лицензиям с открытым исходным кодом, IBM стремится снизить барьеры для внедрения и дать организациям, исследователям и разработчикам возможность уверенно развивать эту технологию благодаря лицензиям, не ограничивающим её использование. Реализация архитектуры также доступна в репозитории Granite-TSFM и обратно совместима с контрольными точками PatchTST-FM-r1.

Попробуйте PatchTST-FM-r2 с помощью нескольких строк Python

Проще всего оценить фундаментальную модель на собственных данных временных рядов.

Установите пакет Granite TSFM:

pip install "granite-tsfm>=0.3.9"

Затем загрузите PatchTST-FM-r2 непосредственно из Hugging Face Hub:

import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline


model = PatchTSTFMForPrediction.from_pretrained(
    "ibm-granite/granite-timeseries-patchtst-fm-r2"
)


df = pd.read_csv(
    "https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
    parse_dates=["date"],
)


pipe = TimeSeriesForecastingPipeline(
    model=model,
    id_columns=[],
    timestamp_column="date",
    target_columns=["HUFL"],
    max_context_length=model.config.context_length,
    context_length=512,
    prediction_length=64,
    impute_method=None,
    quantile_levels=[0.1, 0.5, 0.9],
    explode_forecasts=True,
    freq="1h",
)


forecast = pipe(df.iloc[-512:])

Как видите, тонкая настройка и подгонка модели под конкретную задачу не требуются. Конвейер использует только недавнюю историю ряда и генерирует будущий прогноз, включая запрошенные квантили.

Выше приведён простой пример с общедоступными данными — вы можете заменить входные данные собственными, включая данные о спросе, телеметрию датчиков, загрузку процессора, энергопотребление, объём транзакций, трафик, цены или другой регулярно дискретизируемый временной ряд.

Попробуйте на собственных данных: Откройте PatchTST-FM-r2 на Hugging Face Hub

От ноутбуков к потоковым временным рядам

Этот выпуск связан с более широкой работой над моделями IBM Granite Time Series и добавляет новую модель в обширный портфель.

Для приложений, в которых данные поступают непрерывно, а не в виде статических DataFrame, IBM и Confluent недавно сделали несколько моделей Granite Time Series доступными через программу раннего доступа в Confluent Cloud. Изначальный портфель включает PatchTST-FM-r1, FlowState-r1.1, TTM-r3 и TSPulse.

Интеграция переносит вывод фундаментальных моделей непосредственно в потоковые приложения через Apache Flink в Confluent Cloud. Прогнозы и результаты обнаружения аномалий можно генерировать из потоков данных в реальном времени, не требуя от команд настройки отдельной среды машинного обучения и перемещения туда данных.

Модели, упомянутые в этой статье 2

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 2

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости