Sakhanda Wire
NVDA $208.48 -2.91% MSFT $487.31 +0.84% GOOGL $348.06 +0.94% META $559.02 +1.66% AMZN $262.07 +1.33%
← К новостям

Восстановление с учётом квантизации: сжатая 4-битная модель превосходит свой полноточный оригинал

Восстановление с учётом квантования: сжатая 4-битная модель превосходит свой оригинал с полной точностью
Команда Статья
Опубликовано 25 августа 2026 г.
Уменьшение большой языковой модели почти всегда сопряжено с определёнными издержками. Стандартный сегодня рецепт эффективного развёртывания заключается в том, чтобы сначала сжать архитектуру, сократив число параметров за счёт удаления слоёв, голов или нейронов, а затем квантовать оставшиеся веса до 4 бит, чтобы ещё сильнее уменьшить объём памяти и вычислительные затраты. Оба шага позволяют существенно сэкономить ресурсы, но вместе они систематически ухудшают способности, которые действительно важны для пользователей: рассуждение, решение математических задач и генерацию кода. Поэтому серьёзные процессы развёртывания добавляют этап восстановления, обычно называемый healing, прежде чем модель отправляется в производство. Недавние релизы моделей с открытыми весами, такие как gpt-oss, семейство Nemotron от NVIDIA и наша собственная Hypernova 60B, используют ту или иную версию подхода «сжать, затем восстановить».

В нашей последней статье, Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs, рассматривается вопрос, который в основном оставался открытым: насколько хорошо работает восстановление модели, уже прошедшей не только квантование, но и структурное сжатие, и как правильно выполнять эту процедуру? Мы представляем Quantization-Aware Healing (QAH), и при применении к модели GPT-OSS 120B, сжатой до 60 млрд параметров и квантованной в MXFP4, он создаёт модель, превосходящую собственную версию с полной точностью (bfloat16) в 7 из 9 тестов. 4-битная модель в итоге оказывается меньше, дешевле в эксплуатации и точнее чекпойнта, из которого она была получена квантованием. Это меняет привычное соотношение между 4-битной моделью и 16-битной моделью, на основе которой она создана.

Почему обычные методы восстановления здесь не справляются

Большинство процессов повышения эффективности следуют одним и тем же трём шагам: сжать архитектуру, квантовать сжатые веса, а затем восстановить нанесённый ущерб. Методы различаются исключительно на последнем этапе.

Основной рецепт восстановления — обучение с учётом квантования (QAT). В прямой проход добавляются операторы фиктивного квантования, после чего модель продолжает дообучаться на целевой функции задачи, чтобы веса научились работать с представлением низкой точности. На практике это означает повторное выполнение уже дорогостоящего многоэтапного процесса постобучения — дообучения с учителем, RLHF, агентного обучения — через более шумный прямой проход с пониженной точностью. Это дорого, и, как показывают наши результаты, может привести к нестабильности, если продолжать обучение слишком долго после достижения оптимальной точки.

Альтернативный подход — дистилляция с учётом квантования (QAD) — позволяет не повторять эту историю. Вместо целевой функции задачи он напрямую дистиллирует замороженного учителя с полной точностью в квантованного ученика через функцию потерь на основе KL-дивергенции, применяемую к выходным логитам. Это хорошо работает, когда единственным изменением является квантование, поскольку существует настоящая версия той же самой модели с полной точностью, способная выступать в роли учителя. Но после структурного сжатия модели — уменьшения числа слоёв, голов или нейронов, а не только количества битов — это предположение нарушается. Независимо обученной версии с полной точностью для меньшей архитектуры не существует. Единственный кандидат на роль учителя — восстановленный чекпойнт bfloat16, который сам является дистиллированным приближением исходной модели. Дистилляция из него привязывает квантованного ученика к ухудшенной целевой модели и ограничивает его точность потолком, заданным самим восстановленным чекпойнтом.

Таким образом, вопрос о том, как восстанавливать модель, одновременно подвергшуюся структурному сжатию и квантованию, до сих пор действительно оставался открытым.

Наш подход

QAH устраняет это ограничение одним изменением: дистилляция выполняется непосредственно из исходной модели до сжатия, а не из восстановленной. Учитель и ученик даже не имеют общей архитектуры. Учитель полноразмерный и работает с полной точностью, ученик вдвое меньше и использует MXFP4. Поскольку распределение выходов учителя не зависит от архитектуры, различие в размере или форме не препятствует переносу. Ученик никогда не видит жёстких меток — только распределение выходов учителя, сопоставляемое посредством KL-дивергенции логитов.

Это меняет представление о том, что именно делает этап квантования. При QAH он больше не является необратимым этапом постобработки, выполняемым после завершения восстановления. Это второй полный проход дистилляции относительно исходного учителя — обучение, которого чекпойнт bfloat16 не проходил. 4-битный ученик не компенсирует информацию, потерянную при квантовании; он получает информацию, которую предыдущий этап восстановления не успел или не смог перенести из-за недостатка времени или данных.

Сама функция потерь также обеспечивает более высокую стабильность. Поскольку KL-дистилляция привязывает ученика к фиксированному распределению учителя, после того как ученик догоняет учителя, дальнейшего давления на его смещение нет. Напротив, целевая функция перекрёстной энтропии продолжает бесконечно подталкивать ученика к жёстким меткам. Как показывает приведённое ниже сравнение, это различие важно как для точности, так и для стабильности обучения.

Чтобы QAH работал на длинном контексте, где корпус для восстановления включает документы длиной до 32 тысяч токенов, мы повторно используем экономящую память поэтапную функцию потерь на основе KL-дивергенции из нашей сопутствующей статьи об эффективной дистилляции. Эта функция вычисляет KL для одного фрагмента последовательности за раз и не материализует полную матрицу «словарь × последовательность», благодаря чему восстановление на последовательностях длиной 32 тысячи токенов укладывается в фиксированный бюджет памяти GPU. Механика этой функции потерь описана в предыдущей публикации.

QAH overview: after structural compression and quantization, capabilities drop sharply. QAH distills from the original pre-compression model as a frozen teacher, restoring performance without retracing the multi-stage post-training.

Обзор QAH. После структурного сжатия и квантования способности резко ухудшаются. QAH выполняет дистилляцию из исходной модели — замороженного учителя, чьи логиты предварительно вычисляются в автономном режиме, — а не из восстановленного чекпойнта. Источник: рисунок 1 статьи.

Результаты

Мы применили QAH к модели GPT-OSS 120B, сжатой до 60 млрд параметров и восстановленной в bfloat16, а затем повторно квантованной в MXFP4 с использованием QAH. Естественное сравнение проводится с чекпойнтом bfloat16 той же модели на 60 млрд параметров — лучшей существующей версией этой архитектуры с полной точностью. Модель QAH превосходит её в 7 из 9 тестов.

Тест Учитель 120B (MXFP4) 60B BF16 (восстановленная) 60B MXFP4 (QAH) QAH по сравнению с BF16
AA-LCR (рассуждение на длинном контексте) 50.0 35.3 42.7 +7.4
AIME 2025 (математика) 80.0 70.7 76.3 +5.6
Aider (агентное программирование) 45.3 38.2 40.9 +2.7
τ²-bench (использование инструментов) 68.4 59.4 61.7 +2.3
GPQA Diamond (наука) 69.0 65.7 67.4 +1.7
IFBench (следование инструкциям) 63.3 58.4 59.9 +1.5
LiveCodeBench (программирование) 66.0 65.5 66.5 +1.0
MMLU-Pro (знания) 78.0 74.0 73.8 −0.2
SciCode (научное программирование) 37.5 35.6 34.2 −1.4

В двух тестах, где QAH уступает — MMLU-Pro и SciCode, — отставание составляет менее полутора пунктов. Во всех остальных случаях 4-битная модель опережает собственный 16-битный исходный вариант, а наибольший прирост приходится именно на способности, которые обычно сильнее всего страдают от сжатия: рассуждение на длинном контексте (+7.4 в AA-LCR) и математика (+5.6 в AIME 2025).

Сравнение с исходным учителем 120B столь же показательно. Несмотря на вдвое меньшее число параметров и примерно вчетверо меньший объём памяти для весов, модель QAH превосходит полноразмерного учителя в LiveCodeBench (66.5 против 66.0) и отстаёт от него всего на 1.6 пункта в GPQA Diamond (67.4 против 69.0). Наибольший оставшийся разрыв с учителем наблюдается в AA-LCR — экстремальном тесте на длинный контекст, где ёмкость, потерянная при сжатии, принципиально труднее всего поддаётся восстановлению.

Benchmark performance of the three checkpoints: the original GPT-OSS-120B teacher (MXFP4), the compressed and recovered 60B model in bfloat16, and the same 60B model re-quantized to MXFP4 with QAH, across nine benchmarks.

4-битная модель QAH соответствует своему источнику bfloat16 или превосходит его в 7 из 9 тестов, а также превосходит полноразмерного учителя в LiveCodeBench. Источник: рисунок 2 статьи.

QAH против QAT: прямое сравнение

Чтобы отделить влияние функции потерь от всех остальных факторов, мы также напрямую сравнили QAH с QAT в одинаковых условиях: квантовали модель GPT-OSS 9B в MXFP4 и отслеживали среднюю производительность в MMLU-Pro, LiveCodeBench и GPQA Diamond по мере обучения.

Оба метода достигают схожего пика: 54.9 у QAH против 54.6 у QAT, поэтому по максимальной точности они фактически равны. Разница заключается в том, как они достигают этого результата и что происходит после. QAH достигает пика примерно за 100 шагов — примерно в 7 раз быстрее, чем QAT за 700, — а затем до конца обучения остаётся примерно в пределах двух пунктов от этого пика. После прохождения пикового значения QAT резко ухудшается, теряя почти 19 пунктов к 1200-му шагу.

Практическое следствие — реальная разница в рисках при развёртывании. Для чекпойнта QAT требуется тщательная ранняя остановка по отложенному сигналу, чтобы не выпустить модель, которая уже начала деградировать, тогда как достаточно обученный чекпойнт QAH можно безопасно использовать, поскольку он просто не отклоняется от достигнутого уровня. Это согласуется с механизмом: KL-дистилляция с замороженным учителем не даёт ученику стимула двигаться дальше после совпадения с учителем, тогда как целевая функция перекрёстной энтропии продолжает подталкивать модель к жёстким меткам и в итоге разрушает способности, унаследованные моделью от оригинала.

Average performance of QAH and QAT as training progresses, quantizing GPT-OSS 9B to MXFP4. QAH peaks early and stays stable through 1,200 steps; QAT reaches a comparable peak much later, then collapses.

QAH достигает пика 54.9 примерно за 100 шагов и сохраняет результат; QAT достигает сопоставимого пика 54.6 только примерно на 700-м шаге, а затем теряет почти 19 пунктов к 1200-му шагу. Источник: рисунок 3 статьи.

Что это меняет на практике

История с точностью сопровождается историей эффективности, которая изначально и была причиной сжатия. При 4-битной точности модель QAH использует примерно в 4 раза меньше памяти для весов, чем ученик bfloat16, а при вдвое меньшем числе параметров по сравнению с учителем 120B примерно вдвое сокращает вычисления на токен, что позволяет запускать её на значительно менее мощном оборудовании. Для семейств моделей, выпускаемых в bfloat16, а не в 4-битном формате, совокупное сокращение числа параметров и точности дало бы почти 8-кратное уменьшение вычислений на токен.

Главный вывод заключается в том, что сжатая 4-битная модель не обязательно должна быть менее точной версией своего аналога с полной точностью. При использовании этого рецепта восстановления она может одновременно быть меньше, дешевле в обслуживании и точнее, причём достигает этой точки за долю времени, необходимого рецепту QAT. Квантование перестаёт быть платой за эффективность и становится дополнительной возможностью обучить модель.

Эта работа является частью продолжающегося исследования Multiverse Computing, направленного на уменьшение размеров больших моделей и стоимости их запуска без отказа от способностей, делающих их полезными. Она дополняет нашу работу по эффективной дистилляции, которая предоставляет инструменты обучения на длинном контексте, необходимые для QAH.

Хотите ознакомиться с полными техническими подробностями, включая процесс восстановления, поэтапную реализацию KL для восстановления на длинном контексте и результаты распределённого обучения? Прочитайте полную статью или свяжитесь с нашей командой, чтобы обсудить применение сжатия и восстановления к вашим собственным моделям.

Модели, упомянутые в этой статье 2

Статьи, упомянутые в этой статье 1

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 2

Статьи, упомянутые в этой статье 1

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости