Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Дослідники Sakana AI представили PC-ALM — пошарову альтернативу зворотному поширенню, що навчає мережі зі 1000 шарами

Зворотне поширення — це глобальний алгоритм: прямий прохід, потім зворотний прохід, а потім оновлення ваг, причому кожен етап заблокований попереднім. У мозку немає відомого механізму для такого мережевого фазового синхронізування, тому локальні альтернативи навчання, як-от предиктивне кодування (PC), і надалі привертають дослідницький інтерес. Дослідники Sakana AI пропонують Predictive Coding з доповненим лагранжіаном (PC-ALM) — варіант PC, у якому кожне оновлення залишається локальним для шару, але відновлюються сигнали призначення внеску, узгоджені зі зворотним поширенням. Дослідницька команда повідомляє про навчання залишкових MLP завглибшки до 1000 шарів із результатом приблизно в межах 2 процентних пунктів від зворотного поширення на MNIST.

Чи придатний він для розгортання? Так, як дослідницький код: довідкова реалізація на JAX з ліцензією MIT працює на CPU і відтворює сітку ширини та глибини з роботи. Це метод навчання, а не модель, і його тестували лише на невеликих наборах даних із зображеннями.

Чому стандартний PC зупиняється в глибоких вузьких мережах

PC розглядає кожну приховану активацію як змінну оптимізації та штрафує квадратичну невідповідність між активацією кожного шару й передбаченням, що надходить із шару нижче. Виведення — це градієнтний спуск за цією енергією; навчання — крок оновлення ваг, подібний до геббівського. Проблема полягає в тому, що сигнал навчання надходить на виході й має поширюватися через ланцюг локальних компромісів. У глибоких вузьких мережах сигнал призначення внеску згасає задовго до того, як досягає входу. Innocenti та співавтори охарактеризували цей розрив між PC і BP як функцію ширини та глибини, причому він найбільший, коли ширина менша за глибину.

Що змінює PC-ALM

PC-ALM починається з обмеженого погляду на навчання: мінімізувати функцію втрат із учителем за умови на кожному шарі. PC є релаксацією цієї задачі з квадратичним штрафом. Натомість PC-ALM використовує доповнений лагранжіан, додаючи множник Лагранжа до кожного обмеження шару, зберігаючи штраф PC. Встановлення λ = 0 точно відновлює PC.

Виведення чергує 2 локальні кроки: первинний градієнтний крок для активацій і подвійний крок , який накопичує помилку передбачення шару. Доповнення до повного квадрата показує, що кожен первинний крок є стандартним кроком PC зі зміщеною ціллю передбачення . Після T кроків оновлення ваг діє на складений сигнал . Дослідницька команда трактує це як PI-регулятор для кожного шару: помилка передбачення є пропорційним складником, а множник — інтегральним складником. α = 0 дає PC; α = ρ, коли внутрішню задачу розв’язано точно, дає класичний метод множників.

Точні градієнти зворотного поширення у лінійному випадку

LeCun зауважив у 1988 році, що множники Лагранжа обмеженої мережі дорівнюють ад’юнктам зворотного поширення в точці KKT. Команда доводить, що в лінійних мережах PC за умови стабільності спектрального радіуса PC-ALM збігається до цієї точки KKT: активації повертаються до своїх значень прямого проходу, а кожен інтегрується до точного ад’юнкта BP. Межа стабільності для кожного режиму має вигляд , що за α = 0 зводиться до умови PC. На відміну від монотонного градієнтного потоку PC, матриця ітерацій PC-ALM має комплексні власні значення, які спричиняють затухаючі коливання; α визначає їхню частоту, але не швидкість затухання.

Результати

Дослідницька команда перебирає залишкові MLP із шириною та глибиною від 8 до 128 на Fashion-MNIST і MNIST відповідно до параметризації середнього поля Innocenti та співавторів, навчаючи їх протягом 1 епохи. За бюджету виведення T = 2L PC-ALM відповідає зворотному поширенню за кожної ширини, глибини й активації (тотожність, tanh, ReLU), тоді як показники PC різко падають у глибоких вузьких комірках. Еталонна комірка з репозиторію (ширина 32, глибина 32, ReLU, Fashion-MNIST) демонструє точність на тестових даних 78,66% для BP, 68,13% для PC і 77,75% для PC-ALM, а косинусна подібність градієнта до BP зростає з 0,604 до 0,909.

Дослідження розширює цю картину: залишкові MLP із 1000 шарами на MNIST (ширина 32, ReLU, 5 епох) залишаються приблизно в межах 2 пунктів від BP, а PC-ALM покращує результати порівняно з PC на кожному випробуваному бенчмарку, зокрема на ResNet-18 для CIFAR-10 і Tiny ImageNet.

Ключові висновки

  • PC-ALM додає множник Лагранжа для кожного шару до предиктивного кодування; кожне оновлення залишається локальним для шару.
  • У лінійних мережах множники збігаються до точних градієнтів зворотного поширення.
  • Відповідає BP на сітці ширини та глибини від 8 до 128 за T = 2L; PC не працює в глибоких вузьких комірках.
  • Навчає залишкові MLP із 1000 шарами на MNIST із результатом приблизно в межах 2 пунктів від BP.
  • Код на JAX із ліцензією MIT відтворює результати на CPU.

Ознайомтеся зі статтею, блогом і репозиторієм на GitHub. Уся заслуга належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників і підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно стати нашим партнером для просування вашого репозиторію на GitHub, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини