Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Подрязване на LLM-и като физик: премахването на блокове като оптимизационен проблем на Изинг

Премахване на блокове от LLM като физик: премахването на блокове като задача за оптимизация на Изинг
Екип Статия
Публикувана 21 септември 2026 г.
Един от най-евтините начини да направим голям езиков модел по-бърз е и един от най-грубите: да изтрием цели трансформаторни блокове. Тъй като моделът буквално става по-къс, премахването на блокове (наричано още прореждане по дълбочина) осигурява предвидимо ускоряване на инференцията в допълнение към спестяването на памет, а също така се комбинира безпроблемно с квантизация, нискорангова компресия и други техники. Трудната част е да се реши кои блокове да бъдат премахнати. Ако премахнем грешните, моделът се срива; освен това ефектът от премахването на даден блок зависи от това кои други блокове премахваме заедно с него, така че изборите си взаимодействат. Това превръща задачата в комбинаторен, а не в ранжиращ проблем, а комбинаторните проблеми с взаимодействащи си двоични променливи са точно това, което физиката на спиновите системи е създадена да описва.

Нашата най-нова статия, Компресиране на LLM чрез премахване на блокове с ограничена двоична оптимизация, приема това съответствие буквално. Преформулираме избора на блокове като задача за ограничена двоична оптимизация (CBO), която се преобразува директно в стъкло на Изинг — неупорядочена спинова система с взаимодействия между всички двойки и фиксиран брой спинове, насочени „нагоре“. Енергията на тази спинова система се оказва силен и евтин заместител на реалното представяне на проредения модел при бенчмаркове, което означава, че можем да подредим огромен брой кандидат-конфигурации, без да бенчмаркираме нито една от тях, и да предоставим трудните случаи на същите класически и квантово-вдъхновени решатели, които използваме и другаде в Multiverse. Ползата при дълбока компресия е голяма: при 50% компресия на Llama-3.3-70B-Instruct получаваме почти 23 процентни пункта преднина по MMLU спрямо най-добрия конкуриращ метод за премахване на блокове.

Защо изборът на блокове е многочастичен проблем

Повечето съществуващи методи за премахване на блокове оценяват всеки блок самостоятелно, след което премахват тези, които изглеждат най-малко важни, използвайки евристики, основани на големината, чувствителността или „влиянието на блока“. На езика на физиката това са методи на средното поле: те третират всеки блок така, сякаш приносът му е независим от останалите, подобно на начина, по който теорията на средното поле заменя съседите на даден спин с едно усреднено поле. Друг подобен пряк подход е да се премахва само един последователен набор от блокове, което запазва малкия размер на проблема, но изхвърля по-голямата част от пространството за търсене.

Проблемът е, че блоковете не са независими — не повече, отколкото са независими спиновете в истински магнит. Дали премахването на блок 20 ще навреди на модела зависи от това дали сме премахнали и блок 19 или блок 24 — взаимодействие, или свързване, между двете решения. С нарастването на дълбочината и хетерогенността на моделите пренебрегването на тези свързвания води до загуба на качество, особено когато искаме да премахнем много блокове наведнъж. Всъщност искаме да търсим сред комбинации от блокове, като отчитаме взаимодействията между тях, но броят на комбинациите нараства експоненциално, така че грубата сила изглежда безнадеждна. Именно това е режимът — експоненциално големи конфигурационни пространства с двойкови свързвания — в който инструментите на статистическата физика са най-полезни.

Идеята: превръщане на избора на блокове в задача за минимизиране на енергията

Свързваме двоична променлива с всеки трансформаторен блок: 0 означава да го запазим, а 1 — да го премахнем, точно като спин, който може да сочи надолу или нагоре. След това правим разложение на Тейлър от втори ред на загубата на модела спрямо тези променливи, което дава (приблизителна) матрица на Хесиана. Диагоналът на този Хесиан показва доколко е важен всеки блок сам по себе си; извъндиагоналните елементи са точно двойковите свързвания между блоковете — многочастичната физика, която методите на средното поле изхвърлят.

Тази преформулировка превръща въпроса „кои блокове трябва да премахна?“ в ясна оптимизационна задача: да намерим множеството от M блокове, чието премахване минимизира енергията xᵀH⁰x, при условие че бъдат премахнати точно M от N блока. Математически това е задача за ограничена двоична оптимизация; физически това е стъкло на Изинг — спинова система с взаимодействия между всички двойки и запазена намагнитеност (фиксираният брой премахнати блокове играе ролята на фиксиран общ спин). Ключовото свойство, което установяваме, е, че тази енергия е силен заместител на качеството при последващи задачи: състоянията с ниска енергия на спиновата система съответстват на добре представящи се проредени модели. Минимизирането на енергията и максимизирането на резултата от бенчмарка се превръщат в едно и също търсене.

Sketch of the method: block removal is cast as a constrained binary optimization / Ising problem whose low-energy states correspond to high-performing pruned models.

Изборът на блокове се превръща в задача за ограничена двоична оптимизация, еквивалентна на намирането на състояния с ниска енергия на стъкло на Изинг; всяко решение показва кои M от N блока да бъдат изтрити. Вдясно: променливата на свързване α, която вмъкваме в остатъчния път на всеки блок, за да изградим Хесиана. Източник: Фигура 1 от статията.

Причината това да е практично е цената. Хесианът, тоест пълният набор от свързвания, се изчислява само веднъж чрез проходи напред и назад върху малък набор от калибрационни данни. След това оценяването на всяка кандидат-конфигурация е едно евтино изчисление на енергията — не е необходимо да изпълняваме реалния модел, камо ли да го бенчмаркираме. А тъй като свързванията не зависят от целта за компресия, същият Хесиан може да се използва повторно за решаване на много различни стойности на M.

Решаването: точно, когато е възможно; квантово или квантово-вдъхновено, когато не е

При повечето модели конфигурационното пространство е голямо, но все още проверимо. Тъй като изчисляването на една енергия е толкова евтино, проверяваме всички конфигурации чрез груба сила на един GPU, като достигаме до десетки милиарди спинови конфигурации. Няколко милиона отнемат секунди; най-трудният разрешим случай тук — премахването на 8 от 80-те блока на Llama-3.3-70B (около 29 милиарда конфигурации) — отне приблизително два дни.

Отвъд това точният подход се разпада и именно тук формулирането на проблема като стъкло на Изинг носи втора полза. В еквивалентната му форма QUBO (при която ограничението е включено в наказателен член) същата задача може да бъде предоставена на високо оптимизирани класически, квантови и квантово-вдъхновени решатели, създадени за този клас хамилтониани — инструментариума на квантовото отгряване, QAOA, табу търсенето и специализираните методи с разклоняване и граници. Установяваме, че решателят с отворен код, използващ табу търсене, надеждно достига състоянията с най-ниска енергия за секунди, дори при най-трудните случаи, които можем да проверим чрез груба сила. Така методът се мащабира до модели, при които изброяването на конфигурациите е невъзможно, използвайки решатели, които са изцяло в сферата на компетентност на Multiverse.

Тук има един фин, но важен момент, който противоречи на обичайната логика на оптимизацията. Обикновено един CBO или решател за отгряване се оценява според това дали намира истинското основно състояние. Ние всъщност не се нуждаем от основното състояние. Нужно ни е бързо да генерираме шепа добри състояния с ниска енергия, а това е много по-лесно изискване — затова леките решатели работят толкова добре за нас и можем да си позволим да използваме няколко от тях.

Защо целият спектър с ниска енергия е важен

Енергията е силен заместител на качеството, но не е съвършен, така че състоянието с най-ниска енергия невинаги е най-добрият модел. Това се оказва предимство, а не недостатък: след като хамилтонианът е зададен, извличането както на основното състояние, така и на нискоразположените възбудени състояния е практически безплатно, което ни дава спектър от висококачествени кандидат-прореждания за изпробване, вместо един крехък отговор. Изследването на възбудените състояния, а не само на основното, само по себе си е активна област на физичните изследвания и се съотнася добре към това, от което практикуващите действително се нуждаят тук.

Конкретен пример: при Llama-3.1-8B-Instruct с премахнати 16/32 блока повечето от водещите състояния премахват блокове към края на модела, както би очаквала предишната работа. Но 17-ото възбудено състояние е първото, което предлага премахване на блок близо до началото на модела, а след леко дообучаване тази конфигурация превъзхожда основното състояние на няколко бенчмарка. Това пряко опровергава разпространеното предположение, че най-доброто прореждане представлява един последователен фрагмент от средни или късни блокове, и показва защо отчитането на пълната многочастична структура на проблема дава резултат.

Block-removal map and benchmark scores for the ground state versus the 17th excited state of Llama-3.1-8B-Instruct at 16/32 blocks removed.

Вляво: кои блокове премахва всяко от 20-те състояния с най-ниска енергия (червено = премахнат). Вдясно: 17-ото възбудено състояние, което премахва ранен блок, превъзхожда основното състояние на няколко бенчмарка след дообучаване. Най-добрият модел е възбудено състояние, а не основното състояние. Източник: Фигура 2 от статията.

Резултати

При Llama-3.1-8B-Instruct, Qwen3-14B и Llama-3.3-70B-Instruct нашият метод (CBO) е наравно с най-съвременните базови методи за премахване на блокове или ги превъзхожда, като разликата се увеличава с по-агресивното компресиране.

Най-ясната победа е при дълбоката компресия на Llama-3.3-70B-Instruct, оценен без дообучаване. При премахване на до 24 от 80 блока CBO е приблизително наравно с влиянието на блоковете. Но при 32/80 и 40/80 той се откъсва убедително напред, с почти 23 пункта преднина по MMLU при най-дълбоката настройка, където превъзхожда базовия метод на всеки тестван бенчмарк. При Qwen3-14B с премахнати 12/40 блока CBO води по MMLU с около 10 пункта. При по-лека компресия методите са сравними, което е очаквано: свързванията са най-важни, когато премахването е дълбоко.

Llama-3.3-70B-Instruct, без дообучаване Премахнати блокове MMLU
Оригинален 0 82.2
CBO (нашият метод) 32 / 80 76.6
Влияние на блоковете 32 / 80 59.3
CBO (нашият метод) 40 / 80 76.9
Влияние на блоковете 40 / 80 54.0

При 40/80 (50% дълбочина) CBO запазва MMLU близо до 77, докато най-силният базов метод пада до диапазона около 50. Източник: Таблица 2 от статията.

Методът се обобщава отвъд плътните трансформатори

Премахването на блокове става много по-трудно при съвременни хетерогенни архитектури, където се преплитат различни типове блокове, а формулировката на Изинг не се интересува от това: едно свързване си е свързване, независимо от вида на блока, който се намира на съответната позиция. За да подложим това на стрес тест, приложихме метода към NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 — хибриден модел, който преплита слоеве Mamba2, attention и mixture-of-experts (MoE) в неравномерен модел, без никакво дообучаване.

Нищо във формулировката ни не предполага хомогенен стек, така че тя се пренася директно. При премахване на 2–3 MoE слоя или 2 attention слоя CBO намира конфигурации, които превъзхождат влиянието на блоковете по AIME25 и GPQA. Резултатите също потвърждават, че излишността в тези хибридни модели е реална, но неравномерно разпределена: някои експертни слоеве са много по-лесни за премахване от други, а способността на метода да търси в свързаното конфигурационно пространство е това, което открива добрите изрязвания. Дори тук се запазва моделът от плътните модели — най-добрата конфигурация често е възбудено състояние, а не основното състояние.

Защо това е подходящо за Multiverse Computing

Преформулирането на неструктуриран проблем от машинното обучение като хамилтониан на Изинг, след което решаването му с класическия и квантово-вдъхновения инструментариум за оптимизация, създаден за физиката, е изцяло в сферата на Multiverse — това е същият инстинкт, който пронизва целия ни стек за компресиране. Освен това премахването на блокове се комбинира с останалата част от този стек — квантизация, нискорангова/SVD компресия, прореждане по ширина и възстановяване въз основа на дистилация на знания — така че се вписва в по-голям конвейер, вместо да се конкурира с него.

Искате пълните технически подробности, включително извеждането чрез разложение на Тейлър, преобразуването към QUBO, бенчмарковете на решателите, аблационните изследвания на калибрационния набор от данни и пълните таблици с резултати? Прочетете цялата статия в Hugging Face или се свържете с нашия екип, за да обсъдим прилагането на метода към вашите собствени модели. Кодът е с отворен код на github.com/CompactifAI/Block_removal_through_constrained_binary_optimization.

Статии, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или кликнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Статии, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини