Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Дослідник із Princeton пропонує Recurrent Looped Transformer (RLT), який переносить стан декодера через кожен токен, фіксуючи 96 блоків на токен із необмеженою часовою глибиною

У більшості LLM лише з декодером нічого з обчисленого на останньому шарі токена t не передається на перший шар токена t+1; позиції взаємодіють лише через увагу до кешованих ключів і значень. Технічний звіт дослідника Принстонського університету (Yifan Zhang) під назвою Recurrent Looped Transformer (RLT) пропонує замкнути цей цикл. Фінальний прихований стан декодера та його пошаровий кеш уваги зі ковзним вікном (SWA) переносяться до наступного токена — як для промпту, так і для відповіді, без скидання на межі між ними. Запропоноване дослідження є специфікацією дизайну. У ньому визначено архітектуру, розклади виконання та контракт відтворення RL, а також прямо зазначено, що вимірювані результати щодо ефективності, якості міркування чи масштабування не наводяться.

Як побудовано RLT

Recurrent Looped Transformer (RLT) поєднує причинний енкодер із рекурентним декодером. Енкодер обробляє токени паралельно за причинною маскою та створює подання e_t, з яких проєктується пам’ять ключів і значень M≤t; групи пам’яті можуть бути спільними для всіх шарів декодера (G = 1) або окремими для кожного шару (G = L_D).

Рекурентність реалізується в декодері. Його повний стан має вигляд Ht = (st, CtD), де st — фінальний вихід декодера, а CtD містить збережені ключі та значення SWA на кожному шарі декодера. Для кожного токена кероване об’єднання поєднує et з попереднім виходом s{t-1}, після чого кожен блок декодера виконує причинну SWA над активаціями декодера, перехресну увагу до пам’яті енкодера та FFN. Вікно W включає поточний токен, тому на кожному шарі зберігається щонайбільше W – 1 історичних записів. Розподіл для наступного токена зчитується з st, а ініціалізація виконується один раз перед BOS — із навчуваним початковим станом s* та порожнім кешем.

Еталонна конфігурація зі спільними вагами використовує 48 шарів енкодера і 48 шарів декодера зі сумісними вагами уваги та FFN, спільними між ними. Таким чином, кожен токен проходить через 96 логічних блоків, хоча блоки декодера додатково містять перехресну увагу, тому кількість FLOP на блок не є однаковою. Zhang називає це повторним використанням параметрів, а не копіюванням активацій.

3 принципи дизайну

  • Латентне міркування з необмеженою часовою глибиною: після обробки t токенів шлях стану від s0 проходить через t·LD блоків декодера, або через 48t у еталонній конфігурації. Обсяг роботи на токен залишається сталим, тоді як структурна глибина шляху зростає разом із послідовністю. У дослідницькому звіті зазначено, що вентилі та згортання можуть пригнічувати довгі шляхи; структурна глибина не є гарантією міркування.
  • Спільний дизайн моделі та апаратного забезпечення: ознаки енкодера та проєкції пам’яті для відомих токенів використовують токен-паралельні ядра. Переходи декодера залишаються послідовними в межах однієї послідовності, але готові оновлення незалежних послідовностей можуть використовувати одне пакетне ядро. У звіті прямо зазначено, що для нелінійного декодера не передбачається точне паралельне сканування, не заявляється прискорення скороченого префілу, а стандартний паралельний прохід декодера SWA не є еквівалентним рекурентному процесу. Пакетна обробка, злиття ядер і контрольні точки перелічені як цілі реалізації, а не як завершені ядра.
  • Спільний дизайн моделі та алгоритму RL: попереднє навчання, SFT, семплювання та відтворення RL використовують один перехід стану. Для RL семплер записує логарифм імовірності поведінки кожної дії відповідно до фактичного розподілу семплювання, включно з температурою та усіканням. Навчання повторно будує пам’ять енкодера, рекурентний вихід і кожен кеш SWA від початку послідовності за поточними параметрами перед оцінюванням кожної дії; старі стани, отримані під час розгортання, ніколи не використовуються повторно. Твердження 3.1 формалізує наслідок: переміщення межі між промптом і відповіддю не змінює умовний розподіл для фіксованої історії токенів.

Навчання та обслуговування

Попереднє навчання — це передбачення наступного токена для повної послідовності з повним зворотним поширенням у часі. SFT маскує функцію втрат для цільових даних асистента, але ніколи не маскує оновлення стану, тому втрати асистента поширюються назад через токени користувача та інструментів. У додатку B показано, чому часткове від’єднання є ризикованим: якобіан переходу стану до стану містить перехресні члени через KV декодера, тому від’єднання лише st залишає градієнтні шляхи через кеш; будь-яка схема усіченого BPTT має вказувати кожен тензор, що від’єднується.

Для обслуговування багатоходових діалогів точний знімок префікса містить кеш енкодера та пам’ять, повний стан декодера, метадані позицій, домовленість щодо вікна та версію моделі. Знімок із фіксованими вагами можна повторно використовувати, оскільки стан не залежить від розподілу обслуговування; оновлення ваг робить старі стани недійсними, а редагування префікса змушує повторно обчислювати стан із попередньої контрольної точки. Зовнішні токени в багатоходовому RL оновлюють стан, але для них не застосовуються множники відношення важливості.

Зв’язок із попередніми роботами

Пам’ять, отримана від енкодера, наслідує підходи YOCO, який кешує KV один раз для крос-декодера, та DeepSeek-V4.1-Flash, який проєктує глобальні KV декодера з фінальних станів енкодера; RLT зберігає пам’ять, але відмовляється від пропуску декодера для всього промпту. Часовий зворотний зв’язок розвиває ідеї Feedback Transformer та Recurrent Transformer; натомість RLT передає попередній фінальний вихід декодера на вхід наступного декодера та застосовує рекурентність також до промпту. Повторне використання за глибиною пов’язане з Universal Transformers і латентним міркуванням із рекурентною глибиною; аргумент щодо відтворення розширює нотатки Zhang про невідповідність ядер префілу та декодування.

Інтерактивне пояснення

Основні висновки

  • RLT переносить повний стан декодера (фінальний вихід і пошаровий кеш SWA) через кожен токен промпту та відповіді без скидання на межі.
  • Еталонна конфігурація: 48 пов’язаних шарів енкодера та декодера, 96 логічних блоків на токен, шлях стану з 48t блоків після t токенів.
  • Можливості для апаратного забезпечення: паралелізм енкодера та пакетна обробка між послідовностями; паралельне сканування або прискорення скороченого префілу не заявляються.
  • Відтворення RL повторно будує всі стани за поточними параметрами, зберігаючи записані логарифми ймовірностей поведінки як знаменники відношень.
  • Вимірювані результати відсутні: якість міркування, ефективність і масштабування RL залишаються відкритими напрямами для перевірки.

Ознайомтеся з технічним звітом, репозиторієм на GitHub, а також сторінкою проєкту. Усі заслуги належать досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію на GitHub АБО сторінки на Hugging Face, АБО релізу продукту, АБО вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини