Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Google AI випускає TimesFM-3: базову модель із 330 млн параметрів для zero-shot-прогнозування багатовимірних часових рядів

Google Research випустила TimesFM-3 — базову модель часових рядів із 330 мільйонами параметрів, яка прогнозує кілька пов’язаних рядів за один прямий прохід. Усі контрольні точки TimesFM аж до версії 2.5 були одновимірними: один ряд, його власна історія й нічого більше. TimesFM-3 попередньо навчена безпосередньо для багатовимірного прогнозування на понад 1 трильйоні часових точок і приймає кілька цільових змінних, минулі коваріати та коваріати, відомі для минулого й майбутнього, без донавчання під конкретне завдання. Вона посідає найвище середнє місце серед попередньо навчених базових моделей у GIFT-Eval, fev-bench і рейтингу TIME — як за точковими, так і за ймовірнісними метриками.

Чи придатна вона для розгортання?

Частково, код репозиторію TimesFM поширюється за ліцензією Apache-2.0, але ваги TimesFM 3.0 постачаються за ліцензією timesfm-non-commercial-license-v1.0. Вони обмежені некомерційним використанням і використанням поза промисловою експлуатацією. Ви можете протестувати модель уже сьогодні. Але не можете розгорнути її за робочим API прогнозування.

Що змінилося

Усі версії TimesFM аж до 2.5 були одновимірними. Вони прогнозували один ряд на основі його власної історії. Більшість реальних завдань прогнозування влаштовані не так. Приклад Google — це продажі морозива, на які впливають пов’язані продажі товарів, пішохідний трафік, погода, рекламні акції та свята.

TimesFM-3 попередньо навчена безпосередньо для багатовимірного прогнозування. Вона має 330 мільйонів параметрів і була попередньо навчена на понад 1 трильйоні часових точок реальних і синтетичних рядів. Три типи вхідних даних працюють без донавчання, без налаштування під конкретне завдання:

  • Кілька цільових змінних прогнозуються спільно, з точковими та квантильними вихідними даними для кожної.
  • Минулі коваріати, відомі лише з історії, як-от минулий пішохідний трафік.
  • Коваріати, відомі для минулого й майбутнього, майбутні значення яких відомі, як-от календар рекламних акцій.

Архітектура: патчі, а потім два типи уваги

В основі залишається трансформер лише з декодером. Послідовні точки групуються в патчі по 32 кроки, а потім нормалізуються для кожного ряду, щоб дуже різні масштаби не домінували. Токени цільових змінних і минулих коваріат походять з одного патчу. Токени коваріат, відомих для минулого й майбутнього, використовують трюк із випереджувальним переглядом: поточний патч об’єднується з майбутніми патчами, тому модель бачить заплановані події ще до їхнього настання.

Потім токени потрапляють у двовимірну сітку й проходять через два механізми уваги, що чергуються:

  1. Причинно-наслідкова часова увага працює горизонтально. Вона суворо причинна й обмежена попередніми токенами в межах того самого ряду, що запобігає витоку даних.
  2. Повна увага між змінними працює вертикально. На певному часовому кроці токен зчитує всі інші ряди на цьому кроці, навчаючись міжрядкових кореляцій.

Один прямий прохід замість багатьох

Попередні версії TimesFM декодували по одному патчу за раз. Це збільшує затримку, обчислювальні витрати та накопичувальну похибку. TimesFM-3 використовує Contiguous Patch Masking — стратегію маскування під час навчання, представлену разом із TiRex. Замасковані токени-заповнювачі додаються для всього горизонту. Цільові змінні та минулі коваріати маскуються там. Коваріати, відомі для минулого й майбутнього, залишаються видимими, тому відомі майбутні сигнали все ще надходять до моделі. Шари уваги, що чергуються, одночасно заповнюють кожен замаскований патч горизонту. Для кожної цільової змінної модель отримує 9 квантилів — від 10-го до 90-го перцентиля — на кожному кроці горизонту.

Бенчмарки

Google провела оцінювання на GIFT-Eval, fev-bench і в рейтингу TIME, порівнявши модель із Chronos-2, сімейством Toto 2.0 і TimesFM-2.5. Серед попередньо навчених базових моделей TimesFM-3 посідає найвище середнє місце в усіх трьох тестах — як за точковими, так і за ймовірнісними метриками. У примітках до релізу пакета зафіксовано 1-ше місце загалом у fev-bench серед 100 реальних завдань, 1-ше місце загалом у TIME серед 50 доменних наборів даних і 98 оцінювальних завдань, а також 1-ше місце серед базових моделей у GIFT-Eval.

Інтерактивне пояснення

Основні висновки

  • TimesFM-3 — це базова модель часових рядів із 330 мільйонами параметрів, безпосередньо навчена для багатовимірної роботи на понад 1 трильйоні часових точок.
  • Чергування причинно-наслідкової часової уваги та повної уваги між змінними дає змогу моделі без донавчання моделювати залежності між рядами.
  • Contiguous Patch Masking створює весь горизонт за один прямий прохід, генеруючи 9 квантилів на кожному кроці.
  • Серед базових моделей вона посідає 1-ше місце в GIFT-Eval, fev-bench і TIME — в одновимірному та багатовимірному режимах.
  • Ваги призначені лише для некомерційного використання та використання поза промисловою експлуатацією; TimesFM 2.5 залишається варіантом Apache-2.0 для розгортання.

Ознайомтеся з технічними деталями, вагами моделі на Hugging Face і репозиторієм на GitHub. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Потрібне партнерство з нами для просування вашого репозиторію на GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини