Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Прунинг LLM як у фізика: видалення блоків як задача оптимізації Ізінга

Проріджування LLM як фізик: видалення блоків як задача оптимізації Ізінга
Команда Стаття
Опубліковано 21 вересня 2026 року
Один із найдешевших способів пришвидшити велику мовну модель водночас є одним із найгрубших: видалити цілі блоки трансформера. Оскільки модель буквально стає коротшою, видалення блоків (також зване проріджуванням за глибиною) забезпечує передбачуване прискорення інференсу на додачу до економії пам’яті, а також добре поєднується з квантуванням, низькоранговим стисканням та іншими методами. Складність полягає у визначенні того, які саме блоки видалити. Видаліть неправильні — і модель зруйнується; крім того, ефект від видалення кожного окремого блока залежить від того, які інші блоки видаляються разом із ним, тож ці рішення взаємопов’язані. Це робить задачу комбінаторною, а не задачею ранжування, і саме для комбінаторних задач із взаємодіючими бінарними змінними була створена фізика спінових систем.

У нашій останній статті, Стиснення LLM шляхом видалення блоків за допомогою обмеженої бінарної оптимізації, ми буквально використовуємо цю відповідність. Ми переформульовуємо вибір блоків як задачу обмеженої бінарної оптимізації (CBO), яка безпосередньо відображається на скло Ізінга — невпорядковану спінову систему з взаємодіями між усіма парами та фіксованою кількістю спінів, спрямованих «угору». Енергія цієї спінової системи виявляється сильним і дешевим наближенням того, наскільки добре проріджена модель насправді покаже себе на бенчмарках. Це означає, що ми можемо ранжувати величезну кількість кандидатних конфігурацій, не тестуючи жодну з них на бенчмарках, і передавати складні випадки тим самим класичним та квантово-натхненним розв’язувачам, які ми використовуємо в інших задачах у Multiverse. Перевага в режимі глибокого стиснення значна: за 50% стиснення Llama-3.3-70B-Instruct ми отримуємо майже 23 відсоткові пункти на MMLU порівняно з найкращим конкуруючим методом видалення блоків.

Чому вибір блоків є задачею багатьох тіл

Більшість наявних методів видалення блоків оцінюють кожен блок окремо, а потім видаляють ті, що здаються найменш важливими, використовуючи евристики на основі величини, чутливості або «впливу блока». У термінах фізики це методи середнього поля: вони розглядають кожен блок так, ніби його внесок не залежить від інших, подібно до того, як теорія середнього поля замінює сусідів спіну єдиним усередненим полем. Інший подібний спрощений підхід полягає в тому, щоб видаляти лише один послідовний фрагмент блоків, що зменшує розмір задачі, але відкидає більшу частину простору пошуку.

Проблема в тому, що блоки не є незалежними — так само, як і спіни в реальному магніті. Те, наскільки видалення блока 20 зашкодить моделі, залежить від того, чи видалили ви також блок 19 або 24, тобто від взаємодії, або зв’язку, між цими двома рішеннями. У міру того як моделі стають глибшими й неодноріднішими, ігнорування таких зв’язків призводить до втрати якості, особливо коли потрібно одночасно видалити багато блоків. Насправді потрібно шукати комбінації блоків, враховуючи їхню взаємодію, але кількість комбінацій зростає експоненційно, тому повний перебір здається безнадійним. Саме в цьому режимі — експоненційно великих просторах конфігурацій із попарними зв’язками — інструменти статистичної фізики демонструють свою цінність.

Ідея: перетворити вибір блоків на задачу мінімізації енергії

Ми ставимо у відповідність кожному блоку трансформера бінарну змінну: 0 означає залишити його, 1 — видалити, так само як спін може бути спрямований униз або вгору. Потім ми виконуємо розклад втрат моделі за змінними до другого порядку Тейлора, що дає (наближену) матрицю Гессе. Діагональ цієї матриці показує, наскільки важливим є кожен блок сам по собі; позадіагональні елементи — це саме попарні зв’язки між блоками, тобто фізика багатьох тіл, яку відкидають методи середнього поля.

Це переформулювання перетворює питання «які блоки слід видалити?» на чітку задачу оптимізації: знайти набір із M блоків, видалення яких мінімізує енергію xᵀH⁰x, за умови видалення рівно M із N блоків. Математично це задача обмеженої бінарної оптимізації; фізично — скло Ізінга, спінова система з взаємодією між усіма парами та збережуваною намагніченістю (фіксована кількість видалених блоків відіграє роль фіксованого сумарного спіну). Ключова властивість, яку ми встановлюємо, полягає в тому, що ця енергія є сильним наближенням якості на подальших етапах: стани спінової системи з низькою енергією відповідають високопродуктивним прорідженим моделям. Мінімізація енергії та максимізація результату на бенчмарку стають одним і тим самим пошуком.

Sketch of the method: block removal is cast as a constrained binary optimization / Ising problem whose low-energy states correspond to high-performing pruned models.

Вибір блоків стає задачею обмеженої бінарної оптимізації, еквівалентною пошуку станів скла Ізінга з низькою енергією; кожен розв’язок визначає, які M із N блоків потрібно видалити. Праворуч: змінна зв’язку α, яку ми вставляємо в залишковий шлях кожного блока для побудови матриці Гессе. Джерело: рисунок 1 статті.

Причина практичності цього підходу — його вартість. Матриця Гессе, тобто повний набір зв’язків, обчислюється лише один раз за допомогою прямого й зворотного проходів на невеликому калібрувальному наборі даних. Після цього оцінювання будь-якої кандидатної конфігурації є одним дешевим обчисленням енергії, без потреби запускати саму модель, не кажучи вже про її тестування на бенчмарках. А оскільки зв’язки не залежать від цільового рівня стиснення, ту саму матрицю Гессе можна повторно використовувати для розв’язання задачі для багатьох різних значень M.

Розв’язання: точне, коли це можливо, квантове або квантово-натхненне — коли ні

Для більшості моделей простір конфігурацій великий, але все ще піддається перевірці. Оскільки обчислення однієї енергії є дуже дешевим, ми виконуємо повний перебір на одному GPU, перевіряючи до десятків мільярдів спінових конфігурацій. Кілька мільйонів займають секунди; найскладніший розв’язний випадок тут — видалення 8 із 80 блоків Llama-3.3-70B (приблизно 29 мільярдів конфігурацій) — зайняв близько двох днів.

Після цього точний підхід перестає працювати, і саме тут перетворення задачі на скло Ізінга вдруге приносить користь. В еквівалентній формі QUBO (обмеження поглинається штрафним доданком) абсолютно ту саму задачу можна передати високооптимізованим класичним, квантовим і квантово-натхненним розв’язувачам, створеним для цього класу гамільтоніанів, — інструментам квантового відпалу, QAOA, пошуку з табу та спеціалізованого методу «розгалуження й меж». Ми виявили, що розв’язувач із відкритим кодом на основі пошуку з табу надійно досягає станів із найнижчою енергією за секунди, навіть у найскладніших випадках, які ми можемо перевірити повним перебором. Отже, метод масштабується до моделей, для яких перебір конфігурацій неможливий, використовуючи розв’язувачі, що безпосередньо належать до сфери компетенцій Multiverse.

Тут є важливий нюанс, який суперечить звичному підходу до оптимізації. Зазвичай якість розв’язувача CBO або відпалу оцінюють за тим, чи знаходить він істинний основний стан. Насправді основний стан нам не потрібен. Нам потрібен швидкий спосіб згенерувати кілька хороших станів із низькою енергією, а це значно простіша вимога. Саме тому легковагові розв’язувачі так добре нам підходять і ми можемо дозволити собі запускати кілька з них.

Чому важливий увесь спектр низьких енергій

Енергія є сильним, але не ідеальним наближенням якості, тому стан із найнижчою енергією не завжди дає найкращу модель. Це виявляється перевагою, а не недоліком: після налаштування гамільтоніана отримати основний стан і низьколежачі збуджені стани фактично нічого не коштує, що дає спектр високоякісних кандидатів для проріджування замість однієї крихкої відповіді. Дослідження збуджених станів, а не лише основного, саме по собі є активним напрямом сучасної фізики, і воно добре відповідає тому, що насправді потрібно практикам у цьому випадку.

Конкретний приклад: для Llama-3.1-8B-Instruct за видалення 16 із 32 блоків більшість найкращих станів видаляє блоки ближче до кінця моделі, як і передбачали попередні дослідження. Але 17-й збуджений стан першим пропонує видалити блок поблизу початку моделі, і після легкого донавчання ця конфігурація перевершує основний стан на кількох бенчмарках. Це безпосередньо спростовує поширене припущення, що найкраще проріджування — це один послідовний фрагмент блоків у середині або наприкінці моделі, і показує, чому врахування повної структури задачі багатьох тіл дає переваги.

Block-removal map and benchmark scores for the ground state versus the 17th excited state of Llama-3.1-8B-Instruct at 16/32 blocks removed.

Ліворуч: які блоки видаляє кожен із 20 станів із найнижчою енергією (червоним позначено видалені). Праворуч: 17-й збуджений стан, який видаляє ранній блок, після донавчання перевершує основний стан на кількох бенчмарках. Найкраща модель є збудженим, а не основним станом. Джерело: рисунок 2 статті.

Результати

Для Llama-3.1-8B-Instruct, Qwen3-14B і Llama-3.3-70B-Instruct наш метод (CBO) не поступається найсучаснішим базовим методам видалення блоків або перевершує їх, причому розрив збільшується зі зростанням агресивності стиснення.

Найпереконливіший результат — глибоке стиснення Llama-3.3-70B-Instruct без донавчання. При видаленні до 24 із 80 блоків CBO приблизно відповідає методу впливу блоків. Але за видалення 32/80 і 40/80 він рішуче виходить уперед, демонструючи перевагу майже у 23 пункти на MMLU за найглибшого налаштування, де він перевершує базовий метод на кожному протестованому нами бенчмарку. Для Qwen3-14B при видаленні 12/40 блоків CBO випереджає MMLU приблизно на 10 пунктів. За легшого стиснення методи є співставними, що очікувано: зв’язки мають найбільше значення, коли видалення є глибоким.

Llama-3.3-70B-Instruct, без донавчання Видалені блоки MMLU
Оригінальна 0 82.2
CBO (наш метод) 32 / 80 76.6
Вплив блока 32 / 80 59.3
CBO (наш метод) 40 / 80 76.9
Вплив блока 40 / 80 54.0

За видалення 40/80 (50% глибини) CBO утримує MMLU на рівні близько 77, тоді як найсильніший базовий метод опускається до середини 50-х. Джерело: таблиця 2 статті.

Метод узагальнюється за межі щільних трансформерів

Видалення блоків стає значно складнішим у сучасних неоднорідних архітектурах, де різні типи блоків чергуються, але формулюванню Ізінга це байдуже: зв’язок є зв’язком незалежно від того, який тип блока розташований у кожній позиції. Щоб перевірити це в складних умовах, ми застосували метод до NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 — гібридної моделі, у якій шари Mamba2, уваги та суміші експертів (MoE) чергуються за нерівномірним шаблоном, без жодного донавчання.

Наше формулювання не передбачає однорідності стека, тому переноситься безпосередньо. За видалення 2–3 шарів MoE або 2 шарів уваги CBO знаходить конфігурації, які перевершують метод впливу блоків на AIME25 і GPQA. Результати також підтверджують, що надлишковість у цих гібридних моделях є реальною, але нерівномірно розподіленою: деякі експертні шари можна видалити значно безпечніше за інші, а здатність методу шукати у взаємопов’язаному просторі конфігурацій дає змогу знаходити вдалі варіанти. Навіть тут зберігається закономірність, помічена в щільних моделях: найкраща конфігурація часто є збудженим станом, а не основним.

Чому це відповідає профілю Multiverse Computing

Переформулювання складної задачі машинного навчання як гамільтоніана Ізінга, а потім її розв’язання за допомогою класичних і квантово-натхненних інструментів оптимізації, створених для фізики, повністю відповідає профілю Multiverse — це той самий підхід, який пронизує наш стек стиснення. Видалення блоків також поєднується з іншими компонентами цього стека: квантуванням, низькоранговим/SVD-стисненням, проріджуванням за шириною та відновленням на основі дистиляції знань. Тож воно вбудовується у більший конвеєр, а не конкурує з ним.

Хочете дізнатися всі технічні деталі, зокрема виведення через розклад Тейлора, відображення в QUBO, бенчмарки розв’язувачів, абляції калібрувального набору даних і повні таблиці результатів? Прочитайте повну статтю на Hugging Face або зв’яжіться з нашою командою, щоб обговорити застосування цього підходу до ваших власних моделей. Код опубліковано у відкритому доступі за адресою github.com/CompactifAI/Block_removal_through_constrained_binary_optimization.

Згадані в цій статті статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Згадані в цій статті статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини