Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Прунинг LLM как у физика: удаление блоков как задача оптимизации Изинга

Обрезка больших языковых моделей глазами физика: удаление блоков как задача оптимизации Изинга
Команда Статья
Опубликовано 21 сентября 2026 г.
Один из самых дешёвых способов ускорить большую языковую модель одновременно является и одним из самых грубых: удалить целые блоки трансформера. Поскольку модель буквально становится короче, удаление блоков (также называемое прореживанием по глубине) обеспечивает предсказуемое ускорение вывода вдобавок к экономии памяти и хорошо сочетается с квантизацией, низкоранговым сжатием и другими методами. Сложность заключается в том, чтобы решить, какие блоки удалить. Если удалить не те, модель перестанет работать; кроме того, эффект удаления любого отдельного блока зависит от того, какие другие блоки удаляются вместе с ним, поэтому решения взаимосвязаны. Это делает задачу комбинаторной, а не задачей ранжирования, и именно для комбинаторных задач с взаимодействующими бинарными переменными была создана физика спиновых систем.

В нашей последней статье, Сжатие LLM посредством удаления блоков с помощью ограниченной бинарной оптимизации, это соответствие используется буквально. Мы переформулируем выбор блоков как задачу ограниченной бинарной оптимизации (CBO), которая напрямую отображается на стекло Изинга — неупорядоченную спиновую систему со взаимодействиями всех со всеми и фиксированным числом спинов, направленных «вверх». Энергия этой спиновой системы оказывается сильным и дешёвым приближённым показателем того, насколько хорошо прореженная модель будет показывать себя на бенчмарках. Это позволяет ранжировать огромное число конфигураций-кандидатов, не тестируя ни одну из них на бенчмарках, и передавать сложные задачи тем же классическим и квантово-вдохновлённым решателям, которые мы используем в Multiverse. Выигрыш в режиме глубокого сжатия значителен: при 50%-ном сжатии Llama-3.3-70B-Instruct мы получаем почти на 23 процентных пункта больше на MMLU, чем лучший конкурирующий метод удаления блоков.

Почему выбор блоков — это задача многих тел

Большинство существующих методов удаления блоков оценивают каждый блок отдельно, а затем удаляют те, которые кажутся наименее важными, используя эвристики на основе величины, чувствительности или «влияния блока». В терминах физики это методы среднего поля: они рассматривают каждый блок так, будто его вклад не зависит от остальных, подобно тому как теория среднего поля заменяет соседей спина единым усреднённым полем. Другой похожий упрощённый подход — удалять только один непрерывный фрагмент блоков. Это уменьшает размер задачи, но отбрасывает большую часть пространства поиска.

Проблема в том, что блоки не являются независимыми — так же, как не являются независимыми спины в реальном магните. То, насколько удаление блока 20 навредит модели, зависит от того, удалили ли мы также блок 19 или блок 24: между этими решениями существует взаимодействие, или связь. По мере того как модели становятся глубже и неоднороднее, игнорирование таких связей приводит к потере качества, особенно если нужно одновременно удалить много блоков. На самом деле необходимо искать комбинации блоков с учётом их взаимодействия, но число комбинаций растёт экспоненциально, поэтому полный перебор кажется безнадёжным. Именно в этом режиме — экспоненциально больших пространствах конфигураций с попарными связями — инструменты статистической физики проявляют свою ценность.

Идея: превратить выбор блоков в задачу минимизации энергии

Мы сопоставляем каждому блоку трансформера бинарную переменную: 0 означает оставить его, 1 — удалить, подобно спину, который может быть направлен вниз или вверх. Затем выполняем разложение потерь модели по этим переменным в ряд Тейлора второго порядка, что даёт (приближённую) матрицу Гессе. Диагональные элементы этой матрицы показывают, насколько важен каждый блок сам по себе; внедиагональные элементы — это как раз попарные связи между блоками, то есть физика многих тел, которую отбрасывают методы среднего поля.

Такая переформулировка превращает вопрос «какие блоки следует удалить?» в чёткую задачу оптимизации: найти набор из M блоков, удаление которых минимизирует энергию xᵀH⁰x, при условии, что удаляются ровно M из N блоков. Математически это задача ограниченной бинарной оптимизации; физически — стекло Изинга, спиновая система со взаимодействиями всех со всеми и сохраняющейся намагниченностью (фиксированное число удаляемых блоков играет роль фиксированного полного спина). Ключевое установленное нами свойство заключается в том, что эта энергия является сильным приближённым показателем качества на последующих задачах: состояния спиновой системы с низкой энергией соответствуют хорошо работающим прореженным моделям. Минимизация энергии и максимизация результата на бенчмарке становятся одним и тем же поиском.

Схема метода: удаление блоков представлено как задача ограниченной бинарной оптимизации / задача Изинга, в которой состояния с низкой энергией соответствуют хорошо работающим прореженным моделям.

Выбор блоков становится задачей ограниченной бинарной оптимизации, эквивалентной поиску состояний с низкой энергией в стекле Изинга; каждое решение указывает, какие M из N блоков следует удалить. Справа: переменная связи α, которую мы добавляем в остаточный путь каждого блока для построения матрицы Гессе. Источник: рисунок 1 статьи.

Практичность этого подхода определяется стоимостью вычислений. Матрица Гессе, то есть полный набор связей, вычисляется всего один раз — на основе прямого и обратного проходов по небольшому калибровочному набору данных. После этого оценка любой конфигурации-кандидата сводится к одному дешёвому вычислению энергии: не нужно запускать саму модель, не говоря уже о тестировании на бенчмарках. А поскольку связи не зависят от целевого уровня сжатия, одну и ту же матрицу Гессе можно повторно использовать для разных значений M.

Решение задачи: точное, когда это возможно, квантовое или квантово-вдохновлённое — когда нет

Для большинства моделей пространство конфигураций велико, но всё ещё поддаётся полному перебору. Поскольку вычисление одной энергии очень дёшево, мы выполняем полный перебор на одном GPU, проверяя до десятков миллиардов спиновых конфигураций. Несколько миллионов конфигураций обрабатываются за секунды; самый сложный поддающийся решению случай в нашей работе — удаление 8 из 80 блоков Llama-3.3-70B (около 29 миллиардов конфигураций) — занял примерно два дня.

За этой границей точный подход перестаёт работать, и здесь представление задачи в виде стекла Изинга приносит пользу во второй раз. В эквивалентной форме QUBO (ограничение включается в штрафной член) ту же задачу можно передать высокооптимизированным классическим, квантовым и квантово-вдохновлённым решателям, созданным для такого класса гамильтонианов: механизмам квантового отжига, QAOA, tabu search и специализированным методам ветвей и границ. Мы обнаружили, что решатель tabu с открытым исходным кодом стабильно находит состояния с наименьшей энергией за секунды, даже в самых сложных случаях, которые мы можем проверить полным перебором. Таким образом, метод масштабируется на модели, для которых перечисление конфигураций невозможно, используя решатели, полностью соответствующие профилю Multiverse.

Здесь есть тонкий, но важный момент, противоречащий обычному подходу к оптимизации. Обычно решатель CBO или отжига оценивают по тому, находит ли он истинное основное состояние. Нам на самом деле не нужно основное состояние. Нам нужен быстрый способ получить несколько хороших состояний с низкой энергией, а это значительно более лёгкое требование. Именно поэтому лёгкие решатели так хорошо работают для нас и почему мы можем позволить себе запускать несколько таких решателей.

Почему важен весь спектр состояний с низкой энергией

Энергия является сильным приближённым показателем качества, но не идеальным, поэтому состояние с самой низкой энергией не всегда даёт лучшую модель. Это оказывается преимуществом, а не недостатком: после построения гамильтониана получение основного состояния и низколежащих возбуждённых состояний практически ничего не стоит, что позволяет попробовать целый спектр качественных вариантов прореживания вместо одного хрупкого ответа. Исследование возбуждённых состояний, а не только основного, само по себе является активным направлением физики, и оно хорошо соответствует тому, что в действительности нужно практикам.

Конкретный пример: для Llama-3.1-8B-Instruct при удалении 16 из 32 блоков большинство состояний из верхней части списка удаляет блоки ближе к концу модели, как и можно было ожидать исходя из предыдущих работ. Однако 17-е возбуждённое состояние первым предлагает удалить блок вблизи начала модели, и после лёгкого дообучения эта конфигурация превосходит основное состояние на нескольких бенчмарках. Это напрямую опровергает распространённое предположение, что лучшее прореживание представляет собой один непрерывный фрагмент средних или поздних блоков, и показывает, почему учёт полной структуры задачи многих тел приносит пользу.

Карта удаления блоков и результаты на бенчмарках для основного и 17-го возбуждённого состояния Llama-3.1-8B-Instruct при удалении 16 из 32 блоков.

Слева: какие блоки удаляет каждое из 20 состояний с наименьшей энергией (красным отмечены удалённые). Справа: 17-е возбуждённое состояние, удаляющее ранний блок, после дообучения превосходит основное состояние на нескольких бенчмарках. Лучшая модель является возбуждённым состоянием, а не основным. Источник: рисунок 2 статьи.

Результаты

На моделях Llama-3.1-8B-Instruct, Qwen3-14B и Llama-3.3-70B-Instruct наш метод (CBO) не уступает или превосходит современные базовые методы удаления блоков, причём разрыв увеличивается по мере усиления сжатия.

Наиболее явное преимущество проявляется при глубоком сжатии Llama-3.3-70B-Instruct, оцениваемой без дообучения. При удалении до 24 из 80 блоков CBO примерно соответствует методу влияния блоков. Но при удалении 32 из 80 и 40 из 80 он уверенно выходит вперёд: при максимальном уровне сжатия преимущество на MMLU составляет почти 23 пункта, и CBO превосходит базовый метод на каждом проверенном нами бенчмарке. Для Qwen3-14B при удалении 12 из 40 блоков CBO опережает MMLU примерно на 10 пунктов. При более лёгком сжатии методы сопоставимы, что ожидаемо: связи наиболее важны, когда удаляется большая часть блоков.

Llama-3.3-70B-Instruct, без дообучения Удалённые блоки MMLU
Исходная 0 82.2
CBO (наш метод) 32 / 80 76.6
Влияние блоков 32 / 80 59.3
CBO (наш метод) 40 / 80 76.9
Влияние блоков 40 / 80 54.0

При удалении 40 из 80 блоков (50% глубины) CBO удерживает результат на MMLU около 77, тогда как лучший базовый метод опускается к середине 50-х. Источник: таблица 2 статьи.

Метод обобщается за пределы плотных трансформеров

Удаление блоков становится значительно сложнее в современных неоднородных архитектурах, где чередуются блоки разных типов, однако формулировке Изинга это безразлично: связь остаётся связью независимо от того, какой тип блока находится в соответствующей позиции. Чтобы проверить это в сложных условиях, мы применили метод к NVIDIA-Nemotron-3-Nano-30B-A3B-FP8 — гибридной модели, в которой слои Mamba2, внимания и смеси экспертов (MoE) чередуются в неравномерном порядке, без какого-либо дообучения.

Наша формулировка не предполагает однородности стека, поэтому переносится напрямую. При удалении 2–3 MoE-слоёв или 2 слоёв внимания CBO находит конфигурации, превосходящие влияние блоков на AIME25 и GPQA. Результаты также подтверждают, что избыточность в этих гибридных моделях действительно существует, но распределена неравномерно: некоторые экспертные слои значительно легче удалить, чем другие, и именно способность метода искать в пространстве связанных конфигураций позволяет найти удачные варианты удаления. Даже здесь сохраняется закономерность, наблюдаемая в плотных моделях: лучшая конфигурация часто оказывается возбуждённым состоянием, а не основным.

Почему это соответствует профилю Multiverse Computing

Переформулирование сложной задачи машинного обучения в виде гамильтониана Изинга с последующим решением с помощью классического и квантово-вдохновлённого оптимизационного инструментария, созданного для задач физики, — это полностью соответствует специализации Multiverse. Такой же подход лежит в основе всего нашего стека сжатия. Кроме того, удаление блоков сочетается с остальными компонентами этого стека — квантизацией, низкоранговым/SVD-сжатием, прореживанием по ширине и восстановлением на основе дистилляции знаний, — поэтому оно встраивается в более крупный конвейер, а не конкурирует с ним.

Хотите узнать все технические подробности, включая вывод разложения Тейлора, отображение в QUBO, сравнение решателей, абляционные исследования калибровочного набора данных и полные таблицы результатов? Прочитайте полную статью на Hugging Face или свяжитесь с нашей командой, чтобы обсудить применение этого подхода к вашим моделям. Исходный код опубликован по адресу github.com/CompactifAI/Block_removal_through_constrained_binary_optimization.

Статьи, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Статьи, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости