Google AI выпускает TimesFM-3: базовую модель с 330 млн параметров для zero-shot-прогнозирования многомерных временных рядов
Google Research выпустила TimesFM-3 — базовую модель временных рядов с 330 миллионами параметров, которая прогнозирует несколько связанных рядов за один прямой проход. Все контрольные точки TimesFM вплоть до версии 2.5 были одномерными: один ряд, его собственная история и ничего больше. TimesFM-3 изначально предварительно обучена для многомерного прогнозирования на более чем 1 триллионе временных точек и принимает несколько целевых рядов, прошлые ковариаты и ковариаты, известные для прошлого и будущего, без дообучения под конкретную задачу. Среди предварительно обученных базовых моделей она занимает первое место по среднему рангу на GIFT-Eval, fev-bench и рейтинге TIME как по точечным, так и по вероятностным метрикам.
Можно ли её развернуть?
Частично: код репозитория TimesFM распространяется по лицензии Apache-2.0, однако веса TimesFM 3.0 поставляются по лицензии timesfm-non-commercial-license-v1.0. Их использование ограничено некоммерческими задачами и задачами, не связанными с эксплуатацией в продакшене. Уже сейчас можно провести сравнительное тестирование. Но использовать модель в рабочем API прогнозирования нельзя.
Что изменилось
Все версии TimesFM вплоть до 2.5 были одномерными. Они прогнозировали один ряд на основе его собственной истории. Большинство реальных задач прогнозирования устроено иначе. В качестве примера Google приводит продажи мороженого, на которые влияют продажи связанных продуктов, посещаемость, погода, рекламные акции и праздники.
TimesFM-3 изначально предварительно обучена для многомерного прогнозирования. Она содержит 330 миллионов параметров и была предварительно обучена на более чем 1 триллионе временных точек реальных и синтетических рядов. Три типа входных данных работают без дообучения под конкретную задачу:
- Несколько целевых рядов прогнозируются совместно, с точечными и квантильными результатами для каждого.
- Прошлые ковариаты, известные только за исторический период, например прошлая посещаемость.
- Ковариаты, известные для прошлого и будущего, будущие значения которых известны, например календарь рекламных акций.
Архитектура: сначала патчи, затем два типа внимания
В основе по-прежнему лежит трансформер только с декодером. Последовательные точки группируются в патчи по 32 шага, а затем нормализуются отдельно для каждого ряда, чтобы существенно различающиеся масштабы не доминировали. Токены целевого ряда и прошлых ковариат формируются из одного патча. Для токенов ковариат, известных для прошлого и будущего, используется приём упреждающего просмотра: текущий патч объединяется с будущими патчами, поэтому модель видит запланированные события до их наступления.
Затем токены поступают в двумерную сетку и проходят через два чередующихся механизма внимания:
- Причинное временное внимание работает по горизонтали. Оно строго причинное и ограничено более ранними токенами внутри того же ряда, что предотвращает утечку данных.
- Полное внимание по переменным работает по вертикали. На конкретном временном шаге токен считывает данные всех остальных рядов на этом шаге, обучаясь межрядовым корреляциям.
Один прямой проход вместо множества
Предыдущие версии TimesFM декодировали по одному патчу за раз. Это увеличивает задержку и вычислительные затраты, а также приводит к накоплению ошибок. TimesFM-3 использует Contiguous Patch Masking — стратегию маскирования на этапе обучения, впервые представленную вместе с TiRex. Маскированные токены-заполнители добавляются для всего горизонта. Целевые ряды и прошлые ковариаты маскируются. Ковариаты, известные для прошлого и будущего, остаются видимыми, поэтому известные будущие сигналы по-прежнему достигают модели. Чередующиеся слои внимания одновременно заполняют каждый маскированный патч горизонта. Для каждого целевого ряда на каждом шаге горизонта модель выдаёт 9 квантилей — от 10-го до 90-го процентиля.
Сравнительные тесты
Google провела оценку на GIFT-Eval, fev-bench и рейтинге TIME, сравнив модель с Chronos-2, семейством Toto 2.0 и TimesFM-2.5. Среди предварительно обученных базовых моделей TimesFM-3 занимает первое место по среднему рангу на всех трёх тестах как по точечным, так и по вероятностным метрикам. В примечаниях к выпуску пакета зафиксировано первое место в общем зачёте fev-bench по 100 реальным задачам, первое место в общем зачёте TIME по 50 предметным наборам данных и 98 задачам оценки, а также первое место среди базовых моделей на GIFT-Eval.
Интерактивное объяснение
Основные выводы
- TimesFM-3 — базовая модель временных рядов с 330 миллионами параметров, изначально предназначенная для многомерных данных и предварительно обученная на более чем 1 триллионе временных точек.
- Чередование причинного временного внимания и полного внимания по переменным позволяет ей моделировать межрядовые зависимости без дообучения.
- Contiguous Patch Masking формирует весь горизонт за один прямой проход, выдавая по 9 квантилей на каждый шаг.
- Среди базовых моделей она занимает первое место на GIFT-Eval, fev-bench и TIME в одномерном и многомерном режимах.
- Использование весов разрешено только в некоммерческих задачах и не в продакшене; TimesFM 2.5 остаётся вариантом на Apache-2.0 для развёртывания.
Ознакомьтесь с техническими подробностями, весами модели на Hugging Face и репозиторием на GitHub. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите стать нашим партнёром для продвижения своего репозитория на GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.