Изследовател от Princeton предлага Recurrent Looped Transformer (RLT), който пренася състоянието на декодера през всеки токен, фиксирайки 96 блока на токен с неограничена времева дълбочина
В повечето LLM модели само с декодер нищо, изчислено на последния слой на токен t, не се подава към първия слой на токен t+1; позициите комуникират единствено чрез внимание върху кешираните ключове и стойности. Технически доклад на изследователя от Принстън (Yifan Zhang), Recurrent Looped Transformer (RLT), предлага затваряне на този цикъл. Крайното скрито състояние на декодера и неговият поетапен кеш за внимание с плъзгащ се прозорец (SWA) се пренасят към следващия токен както в подканата, така и в отговора, без нулиране на границата между тях. Представеното изследване е спецификация на архитектура. То определя архитектурата, графиците за изпълнение и договора за възпроизвеждане при RL, като изрично посочва, че няма измерени резултати за ефективност, качество на разсъжденията или мащабиране.
Как е изграден RLT
Recurrent Looped Transformer (RLT) съчетава каузален енкодер с рекурентен декодер. Енкодерът обработва токените паралелно при каузална маска и създава представяния e_t, от които се проектира паметта от ключове и стойности M≤t; групите памет могат да бъдат споделени между слоевете на декодера (G = 1) или да бъдат специфични за всеки слой (G = L_D).
Декодерът поддържа рекурентността. Пълното му състояние е Ht = (st, CtD), където st е крайният изход на декодера, а CtD съдържа запазените SWA ключове и стойности на всеки слой на декодера. За всеки токен смесване с гейт комбинира et с предишния изход s{t-1}, след което всеки блок на декодера изпълнява каузално SWA върху активациите на декодера, кръстосано внимание към паметта на енкодера и FFN. Прозорецът W включва текущия токен, така че за всеки слой се запазват най-много W – 1 исторически записа. Разпределението за следващия токен се извлича от st, а инициализацията се извършва веднъж преди BOS с научено начално състояние s* и празен кеш.
Референтната конфигурация със свързани тегла използва 48 слоя на енкодера и 48 слоя на декодера със съвместими тегла за вниманието и FFN, споделени между тях. Следователно всеки токен изпълнява 96 логически блока, въпреки че блоковете на декодера добавят кръстосано внимание, така че FLOPs на блок не са еднакви. Zhang нарича това повторно използване на параметри, а не копиране на активации.
Трите принципа на дизайна
- Латентно разсъждение с неограничена времева дълбочина: След обработването на t токена пътят на състоянието от s0 преминава през t·LD блока на декодера, или 48t в референтната конфигурация. Работата за токен остава постоянна, докато структурната дълбочина на пътя нараства с последователността. Изследователският доклад предупреждава, че гейтовете и свиването могат да потиснат дългите пътища; структурната дълбочина не е гаранция за разсъждение.
- Съвместен дизайн на модела и хардуера: Характеристиките на енкодера и проекциите на паметта за известни токени използват токен-паралелни ядра. Преходите на декодера остават последователни в рамките на една последователност, но готовите актуализации от независими последователности могат да споделят едно пакетирано ядро. В доклада ясно се посочва, че за нелинейния декодер не се предполага точен паралелен скан, не се заявява ускорение на предварителното запълване и стандартното паралелно преминаване на SWA декодера не е еквивалентно на рекурентността. Пакетирането, сливането на ядра и контролните точки са посочени като цели за реализация, а не като завършени ядра.
- Съвместен дизайн на алгоритъма на модела и RL: Предварителното обучение, SFT, семплирането и RL възпроизвеждането използват един и същ преход на състоянието. При RL семплерът записва логаритъма на вероятността за действие според действителното му разпределение при семплиране, включително температурата и усичането. Обучаващият възстановява паметта на енкодера, рекурентния изход и всеки SWA кеш от началото на последователността с текущите параметри, преди да оцени всяко действие; старите състояния от генерираните траектории никога не се използват повторно. Предложение 3.1 формализира ползата: преместването на разделянето между подканата и отговора не променя условното разпределение при фиксирана история на токените.
Обучение и обслужване
Предварителното обучение представлява предсказване на следващия токен за цялата последователност с пълно обратно разпространение във времето. При SFT загубата се маскира към целите на асистента, но актуализациите на състоянието никога не се маскират, така че загубите на асистента се разпространяват обратно през токените на потребителя и инструментите. Приложение B показва защо частичното отделяне е рисковано: Якобианът от състояние към състояние има кръстосани членове през KV на декодера, така че отделянето само на st оставя пътища на градиента през кеша; всяка схема за усечено BPTT трябва да посочи всеки отделен тензор.
При обслужване с множество ходове точната снимка на префикса включва кеша и паметта на енкодера, пълното състояние на декодера, метаданните за позициите, конвенцията за прозореца и версията на модела. Снимка с фиксирани тегла може да се използва повторно, тъй като състоянието е независимо от разделянето при обслужване; актуализациите на теглата обезсилват старите състояния, а редактирането на префикс налага преизчисляване от по-ранна контролна точка. Външните токени при RL с множество ходове актуализират състоянието, но за тях не се прилагат множители на отношението на важността.
Връзка с предходни разработки
Паметта, извлечена от енкодера, следва YOCO, който кешира KV веднъж за кръстосан декодер, и DeepSeek-V4.1-Flash, който проектира глобалния KV на декодера от крайните състояния на енкодера; RLT запазва паметта, но премахва пропускането на декодера в рамките на цялата подкана. Времевата обратна връзка надгражда Feedback Transformer и Recurrent Transformer; вместо това RLT подава предишния краен изход на декодера към следващия вход на декодера и изпълнява рекурентност и върху подканата. Повторното използване по дълбочина се свързва с Universal Transformers и латентното разсъждение с рекурентна дълбочина; аргументът за възпроизвеждането разширява бележката на Zhang за несъответствието между ядрата за предварително запълване и декодиране.
Интерактивно обяснение
Основни изводи
- RLT пренася пълното състояние на декодера (крайния изход плюс послойния SWA кеш) през всеки токен от подканата и отговора без нулиране на границата.
- Референтна конфигурация: 48 свързани слоя на енкодера и декодера, 96 логически блока на токен и път на състоянието от 48t блока след t токена.
- Възможности за хардуера: паралелизъм на енкодера и пакетиране между последователности; не се заявяват паралелен скан или ускорение на предварителното запълване.
- При RL възпроизвеждането възстановява всички състояния с текущите параметри, като запазва записаните логаритми на вероятностите на действията при поведение като знаменатели на отношенията.
- Няма измерени резултати: качеството на разсъжденията, ефективността и мащабирането на RL остават цели за бъдеща проверка.
Разгледайте техническия доклад, хранилището в GitHub, както и страницата на проекта. Всички заслуги принадлежат на изследователя на този проект. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit за машинно обучение с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктово издание ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.