Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← Към новините

Google AI пуска TimesFM-3: базов модел с 330 млн. параметъра за zero-shot прогнозиране на многомерни времеви редове

Google Research пусна TimesFM-3, базов модел за времеви редове с 330 милиона параметъра, който прогнозира множество свързани редове в един-единствен преден проход. Всички контролни точки на TimesFM до версия 2.5 включително бяха едномерни: един ред, собствената му история и нищо друго. TimesFM-3 е предварително обучен по естествен начин за многомерно прогнозиране върху повече от 1 трилион времеви точки и приема множество целеви променливи, минали ковариати и ковариати от миналото и бъдещето, без дообучаване, специфично за задачата. Той заема най-високия среден ранг сред предварително обучените базови модели в GIFT-Eval, fev-bench и класацията TIME, както по точкови, така и по вероятностни метрики.

Може ли да бъде внедрен?

Частично, кодът на хранилището на TimesFM е под лиценза Apache-2.0, но теглата на TimesFM 3.0 се разпространяват под timesfm-non-commercial-license-v1.0. Те са ограничени до некомерсиална употреба и употреба извън производствена среда. Можете да го тествате сравнително още днес. Не можете да го внедрите зад производствен API за прогнозиране.

Какво се промени

Всички версии на TimesFM до 2.5 включително бяха едномерни. Те прогнозираха един ред въз основа на собствената му история. Повечето реални задачи за прогнозиране не са устроени по този начин. Примерът на Google е продажбата на сладолед, при която продажбите на свързани продукти, пешеходният трафик, времето, промоциите и празниците влияят върху целевата променлива.

TimesFM-3 е предварително обучен по естествен начин за многомерно прогнозиране. Той разполага с 330 милиона параметъра и е предварително обучен върху повече от 1 трилион времеви точки от реални и синтетични редове. Три типа входове работят без допълнително обучение, специфично за задачата:

  • Множество целеви променливи се прогнозират съвместно, с точкови и квантилни изходи за всяка от тях.
  • Минали ковариати, известни само за историческия период, като например минал пешеходен трафик.
  • Ковариати от миналото и бъдещето, чиито бъдещи стойности са известни, като например календар на промоциите.

Архитектура: пачове, последвани от два вида внимание

Ядрото остава трансформър само с декодер. Последователни точки се групират в пачове от 32 стъпки, след което се нормализират за всеки ред, така че силно различаващите се мащаби да не доминират. Токените за целевите променливи и миналите ковариати произлизат от един пач. Токените за ковариатите от миналото и бъдещето използват трик с поглед напред: текущият пач се конкатенира с бъдещите пачове, така че моделът вижда планираните събития, преди да настъпят.

След това токените се подреждат в двумерна решетка и преминават през два редуващи се механизма за внимание:

  1. Причинно-следственото времево внимание работи хоризонтално. То е строго причинно и е ограничено до по-ранните токени в рамките на същия ред, което предотвратява изтичането на информация.
  2. Пълното внимание върху променливите работи вертикално. В дадена времева стъпка един токен прочита всеки друг ред в тази стъпка, като научава корелациите между редовете.

Един преден проход вместо много

По-ранните версии на TimesFM декодираха по един пач наведнъж. Това увеличава латентността, изчислителните разходи и натрупващата се грешка. TimesFM-3 използва Contiguous Patch Masking, стратегия за маскиране по време на обучението, представена с TiRex. Маскирани токени-пълнители се добавят за целия хоризонт. Целевите променливи и миналите ковариати се маскират там. Ковариатите от миналото и бъдещето остават видими, така че известните бъдещи сигнали все още достигат до модела. Редуващите се слоеве за внимание попълват едновременно всеки маскиран пач от хоризонта. За всяка целева променлива моделът генерира 9 квантилa — от 10-ия до 90-ия персентил — при всяка стъпка от хоризонта.

Бенчмаркове

Google оцени модела в GIFT-Eval, fev-bench и класацията TIME спрямо Chronos-2, семейството Toto 2.0 и TimesFM-2.5. Сред предварително обучените базови модели TimesFM-3 заема най-високия среден ранг и в трите класации, както по точкови, така и по вероятностни метрики. Бележките към изданието на пакета посочват общо първо място във fev-bench при 100 реални задачи, общо първо място в TIME при 50 набора от данни от различни области и 98 задачи за оценка, както и първо място сред базовите модели в GIFT-Eval.

Интерактивно обяснение

Основни изводи

  • TimesFM-3 е базов модел за времеви редове с 330 милиона параметъра, създаден по естествен начин за многомерни данни и предварително обучен върху повече от 1 трилион времеви точки.
  • Редуващото се причинно-следствено времево внимание и пълното внимание върху променливите му позволяват да моделира зависимостите между редовете без допълнително обучение.
  • Contiguous Patch Masking генерира целия хоризонт в един преден проход, с 9 квантилa за всяка стъпка.
  • Той заема първо място сред базовите модели в GIFT-Eval, fev-bench и TIME, както в едномерния, така и в многомерния режим.
  • Теглата са предназначени единствено за некомерсиална употреба и употреба извън производствена среда; TimesFM 2.5 остава опцията с лиценз Apache-2.0 за внедряване.

Разгледайте техническите подробности, теглата на модела в Hugging Face и хранилището в GitHub. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище, страница в Hugging Face, продуктово издание, уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини