Восстановление с учётом квантизации: сжатая 4-битная модель превосходит свой полноточный оригинал
В нашей последней статье, Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs, рассматривается вопрос, который в основном оставался открытым: насколько хорошо работает восстановление модели, уже прошедшей не только квантование, но и структурное сжатие, и как правильно выполнять эту процедуру? Мы представляем Quantization-Aware Healing (QAH), и при применении к модели GPT-OSS 120B, сжатой до 60 млрд параметров и квантованной в MXFP4, он создаёт модель, превосходящую собственную версию с полной точностью (bfloat16) в 7 из 9 тестов. 4-битная модель в итоге оказывается меньше, дешевле в эксплуатации и точнее чекпойнта, из которого она была получена квантованием. Это меняет привычное соотношение между 4-битной моделью и 16-битной моделью, на основе которой она создана.
Почему обычные методы восстановления здесь не справляются
Большинство процессов повышения эффективности следуют одним и тем же трём шагам: сжать архитектуру, квантовать сжатые веса, а затем восстановить нанесённый ущерб. Методы различаются исключительно на последнем этапе.
Основной рецепт восстановления — обучение с учётом квантования (QAT). В прямой проход добавляются операторы фиктивного квантования, после чего модель продолжает дообучаться на целевой функции задачи, чтобы веса научились работать с представлением низкой точности. На практике это означает повторное выполнение уже дорогостоящего многоэтапного процесса постобучения — дообучения с учителем, RLHF, агентного обучения — через более шумный прямой проход с пониженной точностью. Это дорого, и, как показывают наши результаты, может привести к нестабильности, если продолжать обучение слишком долго после достижения оптимальной точки.
Альтернативный подход — дистилляция с учётом квантования (QAD) — позволяет не повторять эту историю. Вместо целевой функции задачи он напрямую дистиллирует замороженного учителя с полной точностью в квантованного ученика через функцию потерь на основе KL-дивергенции, применяемую к выходным логитам. Это хорошо работает, когда единственным изменением является квантование, поскольку существует настоящая версия той же самой модели с полной точностью, способная выступать в роли учителя. Но после структурного сжатия модели — уменьшения числа слоёв, голов или нейронов, а не только количества битов — это предположение нарушается. Независимо обученной версии с полной точностью для меньшей архитектуры не существует. Единственный кандидат на роль учителя — восстановленный чекпойнт bfloat16, который сам является дистиллированным приближением исходной модели. Дистилляция из него привязывает квантованного ученика к ухудшенной целевой модели и ограничивает его точность потолком, заданным самим восстановленным чекпойнтом.
Таким образом, вопрос о том, как восстанавливать модель, одновременно подвергшуюся структурному сжатию и квантованию, до сих пор действительно оставался открытым.
Наш подход
QAH устраняет это ограничение одним изменением: дистилляция выполняется непосредственно из исходной модели до сжатия, а не из восстановленной. Учитель и ученик даже не имеют общей архитектуры. Учитель полноразмерный и работает с полной точностью, ученик вдвое меньше и использует MXFP4. Поскольку распределение выходов учителя не зависит от архитектуры, различие в размере или форме не препятствует переносу. Ученик никогда не видит жёстких меток — только распределение выходов учителя, сопоставляемое посредством KL-дивергенции логитов.
Это меняет представление о том, что именно делает этап квантования. При QAH он больше не является необратимым этапом постобработки, выполняемым после завершения восстановления. Это второй полный проход дистилляции относительно исходного учителя — обучение, которого чекпойнт bfloat16 не проходил. 4-битный ученик не компенсирует информацию, потерянную при квантовании; он получает информацию, которую предыдущий этап восстановления не успел или не смог перенести из-за недостатка времени или данных.
Сама функция потерь также обеспечивает более высокую стабильность. Поскольку KL-дистилляция привязывает ученика к фиксированному распределению учителя, после того как ученик догоняет учителя, дальнейшего давления на его смещение нет. Напротив, целевая функция перекрёстной энтропии продолжает бесконечно подталкивать ученика к жёстким меткам. Как показывает приведённое ниже сравнение, это различие важно как для точности, так и для стабильности обучения.
Чтобы QAH работал на длинном контексте, где корпус для восстановления включает документы длиной до 32 тысяч токенов, мы повторно используем экономящую память поэтапную функцию потерь на основе KL-дивергенции из нашей сопутствующей статьи об эффективной дистилляции. Эта функция вычисляет KL для одного фрагмента последовательности за раз и не материализует полную матрицу «словарь × последовательность», благодаря чему восстановление на последовательностях длиной 32 тысячи токенов укладывается в фиксированный бюджет памяти GPU. Механика этой функции потерь описана в предыдущей публикации.
Обзор QAH. После структурного сжатия и квантования способности резко ухудшаются. QAH выполняет дистилляцию из исходной модели — замороженного учителя, чьи логиты предварительно вычисляются в автономном режиме, — а не из восстановленного чекпойнта. Источник: рисунок 1 статьи.
Результаты
Мы применили QAH к модели GPT-OSS 120B, сжатой до 60 млрд параметров и восстановленной в bfloat16, а затем повторно квантованной в MXFP4 с использованием QAH. Естественное сравнение проводится с чекпойнтом bfloat16 той же модели на 60 млрд параметров — лучшей существующей версией этой архитектуры с полной точностью. Модель QAH превосходит её в 7 из 9 тестов.
| Тест | Учитель 120B (MXFP4) | 60B BF16 (восстановленная) | 60B MXFP4 (QAH) | QAH по сравнению с BF16 |
|---|---|---|---|---|
| AA-LCR (рассуждение на длинном контексте) | 50.0 | 35.3 | 42.7 | +7.4 |
| AIME 2025 (математика) | 80.0 | 70.7 | 76.3 | +5.6 |
| Aider (агентное программирование) | 45.3 | 38.2 | 40.9 | +2.7 |
| τ²-bench (использование инструментов) | 68.4 | 59.4 | 61.7 | +2.3 |
| GPQA Diamond (наука) | 69.0 | 65.7 | 67.4 | +1.7 |
| IFBench (следование инструкциям) | 63.3 | 58.4 | 59.9 | +1.5 |
| LiveCodeBench (программирование) | 66.0 | 65.5 | 66.5 | +1.0 |
| MMLU-Pro (знания) | 78.0 | 74.0 | 73.8 | −0.2 |
| SciCode (научное программирование) | 37.5 | 35.6 | 34.2 | −1.4 |
В двух тестах, где QAH уступает — MMLU-Pro и SciCode, — отставание составляет менее полутора пунктов. Во всех остальных случаях 4-битная модель опережает собственный 16-битный исходный вариант, а наибольший прирост приходится именно на способности, которые обычно сильнее всего страдают от сжатия: рассуждение на длинном контексте (+7.4 в AA-LCR) и математика (+5.6 в AIME 2025).
Сравнение с исходным учителем 120B столь же показательно. Несмотря на вдвое меньшее число параметров и примерно вчетверо меньший объём памяти для весов, модель QAH превосходит полноразмерного учителя в LiveCodeBench (66.5 против 66.0) и отстаёт от него всего на 1.6 пункта в GPQA Diamond (67.4 против 69.0). Наибольший оставшийся разрыв с учителем наблюдается в AA-LCR — экстремальном тесте на длинный контекст, где ёмкость, потерянная при сжатии, принципиально труднее всего поддаётся восстановлению.
4-битная модель QAH соответствует своему источнику bfloat16 или превосходит его в 7 из 9 тестов, а также превосходит полноразмерного учителя в LiveCodeBench. Источник: рисунок 2 статьи.
QAH против QAT: прямое сравнение
Чтобы отделить влияние функции потерь от всех остальных факторов, мы также напрямую сравнили QAH с QAT в одинаковых условиях: квантовали модель GPT-OSS 9B в MXFP4 и отслеживали среднюю производительность в MMLU-Pro, LiveCodeBench и GPQA Diamond по мере обучения.
Оба метода достигают схожего пика: 54.9 у QAH против 54.6 у QAT, поэтому по максимальной точности они фактически равны. Разница заключается в том, как они достигают этого результата и что происходит после. QAH достигает пика примерно за 100 шагов — примерно в 7 раз быстрее, чем QAT за 700, — а затем до конца обучения остаётся примерно в пределах двух пунктов от этого пика. После прохождения пикового значения QAT резко ухудшается, теряя почти 19 пунктов к 1200-му шагу.
Практическое следствие — реальная разница в рисках при развёртывании. Для чекпойнта QAT требуется тщательная ранняя остановка по отложенному сигналу, чтобы не выпустить модель, которая уже начала деградировать, тогда как достаточно обученный чекпойнт QAH можно безопасно использовать, поскольку он просто не отклоняется от достигнутого уровня. Это согласуется с механизмом: KL-дистилляция с замороженным учителем не даёт ученику стимула двигаться дальше после совпадения с учителем, тогда как целевая функция перекрёстной энтропии продолжает подталкивать модель к жёстким меткам и в итоге разрушает способности, унаследованные моделью от оригинала.
QAH достигает пика 54.9 примерно за 100 шагов и сохраняет результат; QAT достигает сопоставимого пика 54.6 только примерно на 700-м шаге, а затем теряет почти 19 пунктов к 1200-му шагу. Источник: рисунок 3 статьи.
Что это меняет на практике
История с точностью сопровождается историей эффективности, которая изначально и была причиной сжатия. При 4-битной точности модель QAH использует примерно в 4 раза меньше памяти для весов, чем ученик bfloat16, а при вдвое меньшем числе параметров по сравнению с учителем 120B примерно вдвое сокращает вычисления на токен, что позволяет запускать её на значительно менее мощном оборудовании. Для семейств моделей, выпускаемых в bfloat16, а не в 4-битном формате, совокупное сокращение числа параметров и точности дало бы почти 8-кратное уменьшение вычислений на токен.
Главный вывод заключается в том, что сжатая 4-битная модель не обязательно должна быть менее точной версией своего аналога с полной точностью. При использовании этого рецепта восстановления она может одновременно быть меньше, дешевле в обслуживании и точнее, причём достигает этой точки за долю времени, необходимого рецепту QAT. Квантование перестаёт быть платой за эффективность и становится дополнительной возможностью обучить модель.
Эта работа является частью продолжающегося исследования Multiverse Computing, направленного на уменьшение размеров больших моделей и стоимости их запуска без отказа от способностей, делающих их полезными. Она дополняет нашу работу по эффективной дистилляции, которая предоставляет инструменты обучения на длинном контексте, необходимые для QAH.
Хотите ознакомиться с полными техническими подробностями, включая процесс восстановления, поэтапную реализацию KL для восстановления на длинном контексте и результаты распределённого обучения? Прочитайте полную статью или свяжитесь с нашей командой, чтобы обсудить применение сжатия и восстановления к вашим собственным моделям.
Модели, упомянутые в этой статье 2
Статьи, упомянутые в этой статье 1
Другие материалы этого автора
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 2
Статьи, упомянутые в этой статье 1
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.



