Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Изследователи от Sakana AI представят PC-ALM — локална за слоя алтернатива на обратното разпространение, която обучава мрежи с 1000 слоя

Обратното разпространение е глобален алгоритъм: права стъпка, след това обратна стъпка, а после актуализация на теглата, като всяка от тях е блокирана, докато не завърши предишната. Не е известен механизъм в мозъка за подобно фазово синхронизиране в цялата мрежа, поради което алтернативите за локално обучение, като предиктивното кодиране (PC), продължават да привличат изследователски интерес. Изследователи от Sakana AI предлагат предиктивно кодиране с разширен Лагранжиан (PC-ALM) — вариант на PC, при който всяка актуализация остава локална за съответния слой, като същевременно се възстановяват сигналите за приписване на заслугата, съгласувани с обратното разпространение. Изследователският екип съобщава, че е обучил остатъчни MLP мрежи с до 1000 слоя с резултати в рамките на около 2 процентни пункта от обратното разпространение върху MNIST.

Може ли да бъде внедрено? Да, като изследователски код: референтна реализация на JAX с лиценз MIT работи върху CPU и възпроизвежда решетката от експерименти с различни ширини и дълбочини в статията. Това е метод за обучение, а не модел, и е тестван само върху малки набори от изображения.

Защо стандартният PC се затруднява при дълбоки и тесни мрежи

PC разглежда всяка скрита активация като оптимизационна променлива и наказва квадратичната разлика между активацията на всеки слой и предсказанието, идващо от слоя под него. Извеждането е градиентно спускане по тази енергия; обучението е стъпка на актуализация на теглата, подобна на Хебовата. Проблемът е, че обучаващият сигнал постъпва на изхода и трябва да се разпространи през верига от локални компромиси. В дълбоки и тесни мрежи сигналът за приписване на заслугата отслабва много преди да достигне входа. Innocenti и сътр. характеризират тази разлика между PC и обратното разпространение като функция на ширината и дълбочината, като тя е най-голяма, когато ширината е по-малка от дълбочината.

Какво променя PC-ALM

PC-ALM започва от ограничения поглед към обучението: минимизиране на функцията на загубата с учител при условие, че е изпълнено на всеки слой. PC е релаксацията с квадратична санкция на този проблем. Вместо това PC-ALM използва разширения Лагранжиан, като добавя множител на Лагранж към ограничението на всеки слой, запазвайки санкцията на PC. При λ = 0 се възстановява точно PC.

Извеждането редува 2 локални стъпки: примарна градиентна стъпка върху активациите и двойствена стъпка , която акумулира грешката при предсказването на слоя. Допълването на квадрата показва, че всяка примарна стъпка е стандартна PC стъпка с цел за предсказанието, изместена с . След T стъпки актуализацията на теглата действа върху съставния сигнал . Изследователският екип разглежда това като PI контролер за всеки слой: грешката при предсказването е пропорционалният член, а множителят е интегралният член. α = 0 дава PC; α = ρ, когато вътрешният проблем е решен точно, дава класическия метод на множителите.

Точни градиенти на обратното разпространение в линейния случай

Льокюн отбелязва през 1988 г., че множителите на Лагранж на мрежа с ограничения са равни на адюнгираните променливи при обратното разпространение в точка на Каруш–Кун–Такер (KKT). Екипът доказва, че в линейни PC мрежи, при условие за стабилност на спектралния радиус, PC-ALM се сходима към тази KKT точка: активациите се връщат към стойностите си от правата стъпка, докато всеки се интегрира до точния BP адюнгиран сигнал. Границата на стабилност за отделен режим е , което се свежда до условието на PC при α = 0. За разлика от монотонния градиентен поток на PC, итерационната матрица на PC-ALM има комплексни собствени стойности, които пораждат затихващи осцилации; α определя тяхната честота, но не и скоростта им на затихване.

Резултати

Изследователският екип изследва остатъчни MLP мрежи с ширина и дълбочина от 8 до 128 върху Fashion-MNIST и MNIST при параметризацията на средното поле на Innocenti и сътр., като ги обучава в продължение на 1 епоха. При бюджет за извеждане T = 2L PC-ALM съвпада с обратното разпространение при всяка ширина, дълбочина и активация (идентична функция, tanh, ReLU), докато резултатите на PC рязко спадат при дълбоки и тесни конфигурации. Референтната конфигурация в хранилището (ширина 32, дълбочина 32, ReLU, Fashion-MNIST) отчита 78.66% точност върху тестовите данни за BP, 68.13% за PC и 77.75% за PC-ALM, като косинусът на градиента спрямо BP нараства от 0.604 до 0.909.

Изследването разширява картината: остатъчни MLP мрежи с 1000 слоя върху MNIST (ширина 32, ReLU, 5 епохи) остават в рамките на приблизително 2 пункта от BP, а PC-ALM превъзхожда PC на всеки изпробван набор от тестове, включително ResNet-18 върху CIFAR-10 и Tiny ImageNet.

Основни изводи

  • PC-ALM добавя множител на Лагранж за всеки слой към предиктивното кодиране; всяка актуализация остава локална за съответния слой.
  • В линейни мрежи множителите се сходимат към точните градиенти на обратното разпространение.
  • Съвпада с BP при решетката от ширини и дълбочини от 8 до 128 при T = 2L; PC се проваля при дълбоки и тесни конфигурации.
  • Обучава остатъчни MLP мрежи с 1000 слоя с резултати в рамките на около 2 пункта от BP върху MNIST.
  • Кодът на JAX с лиценз MIT възпроизвежда резултатите върху CPU.

Разгледайте статията, блога и GitHub хранилището. Цялата заслуга е за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Почакайте! В Telegram ли сте? сега можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова версия ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини