Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

IBM представи авангардния модел Granite Time Series PatchTST-FM-r2 с лиценз, благоприятен за търговска употреба

IBM представя SOTA модела Granite Time Series PatchTST-FM-r2 с удобен за комерсиална употреба лиценз
За предприятия Статия
Публикувано 9 септември 2026 г.
Високопроизводително прогнозиране без предварително обучение с отворен лиценз, удобен за комерсиална употреба

Фундаменталните модели за времеви редове променят начина, по който се изграждат системите за прогнозиране. Вместо да обучават и поддържат отделен модел за всеки набор от данни, потребителите могат да използват предварително обучен модел и да генерират прогнози без допълнително обучение.

IBM представи Granite Time Series PatchTST-FM-r2, най-новия модел от семейството Granite TSFM (GitHub, блог). PatchTST-FM-r2, нова версия на своя предшественик PatchTST-FM-r1, съчетава обновена архитектура, по-голям корпус за предварително обучение, вероятностно прогнозиране, поддръжка за импутиране на липсващи стойности и отлична производителност без допълнително обучение в модел с приблизително 385 млн. параметъра.

Към 8 септември 2026 г. моделът е най-добре представящият се модел без допълнително обучение, публикуван под либерален лиценз с отворен код, удобен за комерсиална употреба (Apache 2.0 и OpenMDW 1.0), сред възпроизводимите модели без допълнително обучение в класацията GIFT-Eval. GIFT-Eval е цялостен бенчмарк за прогнозиране на времеви редове, предназначен да оценява модели в разнообразни сценарии за прогнозиране; моделът заема второ място като цяло сред възпроизводимите модели без допълнително обучение.

Теглата на модела, архитектурата, конвейерът за инференция и кодът, необходим за възпроизвеждане на резултатите от бенчмарка, са достъпни.

В тази публикация описваме модела, разглеждаме по-подробно резултатите от бенчмарка и архитектурата на модела, обсъждаме обучаващите данни и лицензирането и предоставяме примери с код, илюстриращи как се използва моделът. Накрая обръщаме внимание и на това как моделите от семейството Granite Time Series могат да се използват в поточни приложения в производствена среда чрез продукт на Confluent.

Готови ли сте да го изпробвате? Отворете Granite Time Series PatchTST-FM-r2 в Hugging Face

Накратко

  • Прогнозиране без допълнително обучение с общо предназначение за търсене, цени, енергийни товари, трафик, телеметрия и други времеви редове.
  • Приблизително 385 млн. параметъра, дължина на контекста до 8 192, гъвкава дължина на прогнозата и вероятностни прогнози чрез предсказваща глава със 99 квантилни нива.
  • Основата на модела е изградена от конформерни блокове, които съчетават многоглаво само-внимание с времева свертка за улавяне на дългосрочна и краткосрочна времева структура.
  • Модел с либерален лиценз и водеща производителност в категорията на възпроизводимите модели без допълнително обучение в бенчмарка GIFT-Eval (двойно лицензиран под Apache-2.0 и OpenMDW-1.0, като потребителите могат да изберат един от двата лиценза).
  • Достъпни са отворените тегла, архитектурата, конвейерът за инференция и кодът за възпроизвеждане на бенчмарка.

Силно прогнозиране без допълнително обучение в GIFT-Eval

Фундаменталният модел е най-полезен, когато се обобщава към времеви редове, върху които не е бил специално обучен. Поради тази причина първо се фокусираме върху производителността без допълнително обучение.

GIFT-Eval предоставя широка оценка на моделите за прогнозиране върху хетерогенни набори от данни и сценарии за прогнозиране. Когато класацията се ограничи до модели, които работят без допълнително обучение, са възпроизводими и са оценени без изтичане на тестови данни, PatchTST-FM-r2 заема второ място както по CRPS, така и по MASE към 8 септември 2026 г., както е показано на фигури 1 и 2 (по-ниските стойности са по-добри и за двата показателя). Важно е, че PatchTST-FM-r2 е най-добре представящият се модел в същата категория сред моделите с либерално лицензиране, удобно за комерсиална употреба.

GIFT-Eval CRPS for leading replicable zero-shot models

Фигура 1. CRPS в GIFT-Eval за водещите възпроизводими модели без допълнително обучение. PatchTST-FM-r2 постига геометрично средно CRPS от 0,467, което го поставя непосредствено зад TimesFM-3 в това сравнение и на първо място сред моделите с либерални лицензи.

GIFT-Eval MASE for leading replicable zero-shot models

Фигура 2. MASE в GIFT-Eval за водещите възпроизводими модели без допълнително обучение. PatchTST-FM-r2 постига геометрично средно MASE от 0,6846. Сините стълбове обозначават модели, публикувани от екипа на IBM за фундаментални модели на времеви редове.

Конкурентен дори спрямо модели, на които е позволено да използват обучаващи данни от бенчмарка

Някои модели в GIFT-Eval са категоризирани като предварително обучени, а не като строго работещи без допълнително обучение. На тези модели е позволено да включват обучаващите части на наборите от данни за оценка на GIFT-Eval в своите корпуси за предварително обучение.

Дори когато тези предварително обучени модели бъдат добавени към сравнението, PatchTST-FM-r2 остава близо до върха, както се вижда на фигури 3 и 4: трети по CRPS и четвърти по MASE сред възпроизводимите модели. Той превъзхожда няколко предварително обучени модела, включително Chronos-2, Timer-S1 и вариантите на Toto, въпреки че някои конкурентни модели са значително по-големи.

GIFT-Eval CRPS with zero-shot and pretrained replicable models

Фигура 3. CRPS в GIFT-Eval, когато се разглеждат както възпроизводими модели без допълнително обучение, така и предварително обучени възпроизводими модели.

GIFT-Eval MASE with zero-shot and pretrained replicable models

Фигура 4. MASE в GIFT-Eval, когато се разглеждат както възпроизводими модели без допълнително обучение, така и предварително обучени възпроизводими модели.

Архитектура: Какво се промени спрямо PatchTST-FM-r1?

PatchTST-FM-r2 запазва представянето, основано на пачове, което направи семейството PatchTST ефективно, но вътрешната архитектура е преработена така, че ефикасно да улавя дългосрочни и краткосрочни зависимости и да изглажда прогнозите между пачовете — и двете промени значително подобряват показателите за грешка.

Една от промените е преминаването от стандартни трансформърни слоеве към слоеве, които включват свертка заедно с многоглавото само-внимание. Тези слоеве се наричат конформерни слоеве и имат своя произход в приложенията за обработка на реч.

Architectural evolution from PatchTST-FM-r1 to Conformer-based PatchTST-FM-r2

Фигура 5. Развитие на архитектурата от PatchTST-FM-r1 до базирания на Conformer PatchTST-FM-r2.

Един блок на PatchTST-FM-r1 съчетава многоглаво само-внимание с мрежа с пряко разпространение. В r2 го заменихме с блок в стил Conformer, съдържащ два наполовина стъпкови слоя с пряко разпространение, разположени от двете страни на многоглавото само-внимание, и слой за времева свертка.

Това предоставя на модела два допълващи се механизма за извеждане на зависимости във времеви ред. Само-вниманието може да моделира дългосрочни зависимости между пачовете, докато свертката осигурява индуктивно предпочитание към локална времева структура. Следователно компонентът на свертка може да улавя краткосрочни взаимодействия, като същевременно позволява на вниманието да се концентрира върху зависимости на по-дълги хоризонти. Това явление се наблюдава в моделите на вниманието, заснети във версиите с трансформър и конформер (вижте примерната фигура по-долу, използваща реални образци от набора от данни ETTh1). Докато значителна част от само-вниманието на трансформъра (вляво на фигурата) се концентрира близо до диагонала, т.е. улавя локални зависимости, вниманието в конформерния блок (вдясно на фигурата) показва фокус върху далечни зависимости (далеч от диагонала), благодарение на слоя за свертка, който обхваща кратките разстояния. Конформерните блокове в основата използват редуващи се размери на ядрото на свертка 3 и 5, в повтарящ се шаблон {5, 5, 3, 3}.

Transformer and conformer attention patterns

Фигура 6. Сравнение на моделите на вниманието, уловени във версиите с трансформър (вляво) и конформер (вдясно), използващи реални образци от набора от данни ETTh1.

Освен това PatchTST-FM-r2 използва 50% припокриващи се пачове с претегляне чрез прозорец на Хаминг и прогнозиране чрез припокриване и събиране, за да изглади границите между пачовете и да подобри точността на прогнозирането. Накрая архитектурата добавя нормализация за стабилност и разширява броя на блоковете от 20 на 30.

С тези промени полученият модел има приблизително 385 млн. параметъра, поддържа много дълги контексти до 8 192 стъпки и предсказва 99 квантилни нива за гъвкави дължини на прогнозата. Моделът предоставя както точкови прогнози, така и квантилни изходи за прогнозиране на разпределения и интервали на неопределеност.

Обучаващи данни

За фундаменталните модели, предназначени за реални приложения, качеството на модела е само един от факторите. Разработчиците все по-често трябва да разбират какви данни са използвани за даден модел, дали в обучението не са изтекли данни от бенчмарка и какви са последиците от внедряването на модела.

PatchTST-FM-r2 използва документиран корпус за предварително обучение, състоящ се от четири източника: избрани набори от данни от GiftEvalPretrain; персонализирани синтетични данни, базирани на KernelSynth с модифицирани периодични ядра и ограничено аугментиране; корпус TSMixup, генериран чрез подхода, описан от Chronos, но ограничен до набори от данни извън оценъчния набор GIFT-Eval; и приблизително 500 000 синтетични последователности CauKer, всяка с дължина 4 096.

За корпоративните потребители този вид прозрачност може да бъде също толкова важен, колкото още няколко точки в класацията. Това не премахва необходимостта от собствен преглед на управлението на моделите и лицензирането от страна на организацията, но предоставя на потребителите значително повече информация за извършването на този преглед, отколкото би предоставил непрозрачен корпус за предварително обучение.

Отворен за изследователски експерименти — и за комерсиална употреба

За да предостави по-голям избор на общността, Granite Time Series PatchTST-FM-r2 е двойно лицензиран под Apache 2.0 и OpenMDW 1.0. Потребителите могат да изберат един от двата лиценза, като и двата предоставят широки, либерални права за използване, промяна и разпространение на моделите, а OpenMDW на Linux Foundation предлага лицензионна рамка, специално предназначена за модели с изкуствен интелект и свързани материали. Като предоставя моделите под либерални лицензи с отворен код, IBM цели да намали бариерите пред внедряването и да даде възможност на организации, изследователи и разработчици да надграждат технологията с увереността, която носят лицензите, не ограничаващи употребата ѝ. Реализацията на архитектурата също е достъпна чрез хранилището Granite-TSFM и е обратно съвместима с чекпойнтите на PatchTST-FM-r1.

Изпробвайте PatchTST-FM-r2 с няколко реда Python

Най-лесният начин да оцените фундаментален модел е върху собствени данни за времеви редове.

Инсталирайте пакета Granite TSFM:

pip install "granite-tsfm>=0.3.9"

След това заредете PatchTST-FM-r2 директно от Hugging Face Hub:

import pandas as pd
from tsfm_public import PatchTSTFMForPrediction, TimeSeriesForecastingPipeline


model = PatchTSTFMForPrediction.from_pretrained(
    "ibm-granite/granite-timeseries-patchtst-fm-r2"
)


df = pd.read_csv(
    "https://raw.githubusercontent.com/zhouhaoyi/ETDataset/main/ETT-small/ETTh1.csv",
    parse_dates=["date"],
)


pipe = TimeSeriesForecastingPipeline(
    model=model,
    id_columns=[],
    timestamp_column="date",
    target_columns=["HUFL"],
    max_context_length=model.config.context_length,
    context_length=512,
    prediction_length=64,
    impute_method=None,
    quantile_levels=[0.1, 0.5, 0.9],
    explode_forecasts=True,
    freq="1h",
)


forecast = pipe(df.iloc[-512:])

Както можете да видите, не са необходими нито фино настройване, нито напасване на модел за конкретна задача. Конвейерът използва само последната история на редицата и генерира бъдещата прогноза, включително заявените квантили.

Горният пример използва публично достъпни данни — можете да замените примерните входни данни със свои, включително търсене, сензорна телеметрия, използване на процесора, потребление на енергия, обем на транзакциите, трафик, цени или друг редовно семплиран времеви ред.

Изпробвайте го върху собствените си данни: Отворете PatchTST-FM-r2 в Hugging Face Hub

От бележници до поточни времеви редове

Това издание е част от по-широките усилия около моделите IBM Granite Time Series, като добавя нов модел към по-широкото портфолио.

За приложения, в които данните пристигат непрекъснато, а не в статични DataFrame обекти, IBM и Confluent наскоро предоставиха няколко модела Granite Time Series чрез програма за ранен достъп в Confluent Cloud. Първоначалното портфолио включва PatchTST-FM-r1, FlowState-r1.1, TTM-r3 и TSPulse.

Интеграцията въвежда инференцията на фундаментални модели директно в поточни приложения чрез Apache Flink в Confluent Cloud. Прогнозите и резултатите от откриването на аномалии могат да се генерират от потоци на живо, без екипите да трябва да настройват и преместват данни към отделна ML среда.

Модели, споменати в тази статия 2

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте, за да коментирате

Модели, споменати в тази статия 2

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини