Sakhanda Wire
NVDA $208.48 -2.91% MSFT $487.31 +0.84% GOOGL $348.06 +0.94% META $559.02 +1.66% AMZN $262.07 +1.33%
← До новин

Відновлення з урахуванням квантизації: стиснена 4-бітна модель перевершує свій повноточний оригінал

З урахуванням квантування під час відновлення: стиснена 4-бітна модель, що перевершує свій повноформатний оригінал
Команда Стаття
Опубліковано 25 серпня 2026 року
Зменшення великої мовної моделі майже завжди має свою ціну. Сьогоднішній стандартний рецепт ефективного розгортання полягає в тому, щоб спочатку стиснути архітектуру, зменшивши кількість параметрів шляхом видалення шарів, голів або нейронів, а потім квантувати ваги, що залишилися, до 4 бітів, щоб іще більше скоротити використання пам’яті та обчислень. Обидва кроки дають значну економію, але разом вони систематично погіршують саме ті можливості, які людей справді цікавлять: міркування, розв’язання математичних задач і генерацію коду. Через це серйозні конвеєри розгортання додають перед запуском моделі у виробництво етап відновлення, який зазвичай називають healing. Нещодавні релізи моделей із відкритими вагами, як-от gpt-oss, сімейство Nemotron від NVIDIA та наша власна модель Hypernova 60B, спираються на певну версію підходу «стиснення, а потім відновлення».

Наша нова стаття, Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs, порушує питання, яке галузь здебільшого залишала відкритим: якщо модель уже пройшла структурне стиснення, а не лише квантування, наскільки добре насправді працює цей етап відновлення і як його правильно виконувати? Ми представляємо Quantization-Aware Healing (QAH), і після застосування до моделі GPT-OSS 120B, стисненої до 60B параметрів і квантизованої до MXFP4, він створює модель, яка перевершує власну повноформатну (bfloat16) версію у 7 з 9 бенчмарків. 4-бітна модель зрештою є меншою, дешевшою в експлуатації та точнішою за контрольну точку, з якої її було квантизовано. Це перевертає звичне співвідношення між 4-бітною моделлю та 16-бітною моделлю, з якої вона походить.

Чому звичайні методи відновлення тут не спрацьовують

Більшість конвеєрів ефективності дотримуються однакових трьох кроків: стиснути архітектуру, квантувати стиснені ваги, а потім відновити завдану шкоду. Різниця між методами полягає цілком в останньому кроці.

Домінуючим рецептом відновлення є навчання з урахуванням квантування (QAT). Воно вставляє оператори фальшивого квантування у прямий прохід і продовжує донавчати модель на цільовій функції, щоб ваги навчилися витримувати низькоточне представлення. На практиці це означає повторний запуск уже дорогого багатоступеневого процесу посттренування — контрольованого донавчання, RLHF, агентного налаштування — через більш зашумлений прямий прохід із нижчою точністю. Це дорого, і, як показують наші результати, процес також може стати нестабільним, якщо навчання триває надто довго після досягнення найкращої точки.

Альтернативний метод — дистиляція з урахуванням квантування (QAD) — уникає повторного відтворення цієї історії. Замість цільової функції він безпосередньо дистилює замороженого повноформатного вчителя у квантизованого учня через функцію втрат на основі KL-дивергенції для вихідних логітів. Це добре працює, коли єдина зміна — квантування, оскільки існує справжня повноформатна версія точно такої самої моделі, яка може виконувати роль учителя. Але після структурного стиснення моделі — зменшення кількості шарів, голів або нейронів, а не лише бітів — це припущення порушується. Незалежно навченої повноформатної версії меншої архітектури не існує. Єдиним кандидатом на роль учителя є відновлена контрольна точка bfloat16, яка сама є дистильованим наближенням до початкової моделі. Дистиляція з неї прив’язує квантизованого учня до погіршеної цілі та обмежує його точність стелею, заданою самою відновленою контрольною точкою.

Отже, питання про те, як відновлювати модель, яка зазнала і структурного стиснення, і квантування, досі залишалося справді відкритим.

Наш підхід

QAH усуває цю стелю однією зміною: він дистилює безпосередньо з початкової моделі до стиснення, а не з відновленої. Учитель і учень навіть не мають спільної архітектури. Учитель є повнорозмірним і повноформатним, тоді як учень удвічі менший і працює в MXFP4. Оскільки розподіл виходів учителя не залежить від архітектури, ні невідповідність розміру, ні невідповідність форми не перешкоджають перенесенню. Учень ніколи не бачить жорстких міток, а лише розподіл виходів учителя, зіставлений через KL-дивергенцію логітів.

Це переосмислює те, що робить етап квантування. За QAH він більше не є втратним етапом постобробки, який застосовується після завершення відновлення. Це другий повний прохід дистиляції щодо початкового вчителя — навчання, якого контрольна точка bfloat16 ніколи не отримувала. 4-бітний учень не компенсує інформацію, втрачену через квантування; він отримує інформацію, яку попередній етап відновлення не мав часу або даних перенести.

Із самої функції втрат випливає також перевага стабільності. Оскільки KL-дистиляція прив’язує учня до фіксованого розподілу вчителя, після того як учень його наздоганяє, подальшого тиску на зміщення немає. Натомість функція втрат перехресної ентропії продовжує безкінечно підштовхувати учня до жорстких міток. Як показує наведене нижче порівняння, ця відмінність має значення і для точності, і для стабільності навчання.

Щоб QAH працював із довгим контекстом, де корпус для відновлення містить документи обсягом до 32 тисяч токенів, ми повторно використовуємо ефективну за пам’яттю фрагментовану функцію втрат на основі KL-дивергенції з нашої супутньої статті про ефективну дистиляцію. Ця функція обчислює KL по одному фрагменту послідовності за раз і ніколи не матеріалізує повну таблицю «словник × послідовність», завдяки чому відновлення для послідовностей із 32 тисяч токенів уміщується в обмежений бюджет пам’яті GPU. Ми описали механіку цієї функції втрат у попередній публікації.

Огляд QAH: після структурного стиснення та квантування можливості різко погіршуються. QAH дистилює початкову модель до стиснення як замороженого вчителя, відновлюючи продуктивність без повторення багатоступеневого посттренування.

Огляд QAH. Після структурного стиснення та квантування можливості різко погіршуються. QAH дистилює з початкової моделі — замороженого вчителя, чиї логіти попередньо обчислюються офлайн, — а не з відновленої контрольної точки. Джерело: рисунок 1 статті.

Результати

Ми застосували QAH до моделі GPT-OSS 120B, стисненої до 60B параметрів і відновленої у форматі bfloat16, а потім повторно квантизованої до MXFP4 за допомогою QAH. Природним об’єктом порівняння є контрольна точка bfloat16 тієї самої моделі 60B — найкраща доступна повноформатна версія цієї архітектури. Модель QAH перемагає у 7 з 9 бенчмарків.

Бенчмарк Учитель 120B (MXFP4) 60B BF16 (відновлена) 60B MXFP4 (QAH) QAH порівняно з BF16
AA-LCR (міркування з довгим контекстом) 50.0 35.3 42.7 +7.4
AIME 2025 (математика) 80.0 70.7 76.3 +5.6
Aider (агентне програмування) 45.3 38.2 40.9 +2.7
τ²-bench (використання інструментів) 68.4 59.4 61.7 +2.3
GPQA Diamond (наука) 69.0 65.7 67.4 +1.7
IFBench (дотримання інструкцій) 63.3 58.4 59.9 +1.5
LiveCodeBench (програмування) 66.0 65.5 66.5 +1.0
MMLU-Pro (знання) 78.0 74.0 73.8 −0.2
SciCode (наукове програмування) 37.5 35.6 34.2 −1.4

У двох бенчмарках, де QAH поступається, — MMLU-Pro та SciCode — відставання становить менш як півтора бала. В усіх інших випадках 4-бітна модель випереджає власне 16-бітне джерело, а найбільші здобутки припадають саме на можливості, які стиснення зазвичай пошкоджує найбільше: міркування з довгим контекстом (+7.4 на AA-LCR) і математика (+5.6 на AIME 2025).

Порівняння з початковим учителем 120B не менш показове. Попри те, що модель QAH працює з удвічі меншою кількістю параметрів учителя та приблизно чвертю його пам’яті для ваг, вона перевершує повнорозмірного учителя на LiveCodeBench (66.5 проти 66.0) і відстає лише на 1.6 бала на GPQA Diamond (67.4 проти 69.0). Найбільший розрив з учителем залишається на AA-LCR — екстремальному бенчмарку для довгого контексту, де втрачену через стиснення місткість найважче відновити.

Продуктивність трьох контрольних точок на бенчмарках: початкового учителя GPT-OSS-120B (MXFP4), стисненої та відновленої моделі 60B у форматі bfloat16 і тієї самої моделі 60B, повторно квантизованої до MXFP4 за допомогою QAH, у дев’яти бенчмарках.

4-бітна модель QAH відповідає або перевершує своє джерело bfloat16 у 7 з 9 бенчмарків і перевершує повнорозмірного учителя на LiveCodeBench. Джерело: рисунок 2 статті.

QAH проти QAT: пряме порівняння

Щоб відокремити вплив функції втрат від усіх інших чинників, ми також безпосередньо порівняли QAH і QAT за однакових умов: квантизували модель GPT-OSS 9B до MXFP4 і відстежували середню продуктивність на MMLU-Pro, LiveCodeBench та GPQA Diamond у міру навчання.

Обидва методи досягають схожого піка: 54.9 для QAH проти 54.6 для QAT, тож за найкращої точності вони фактично рівні. Різниця полягає в тому, як вони цього досягають і що відбувається після цього. QAH досягає піка приблизно за 100 кроків — приблизно у 7 разів швидше, ніж QAT за 700, — а потім протягом решти навчання залишається в межах приблизно двох балів від цього піка. QAT різко руйнується після проходження піка, втрачаючи майже 19 балів до кроку 1200.

Практичним наслідком є реальна різниця в ризиках розгортання. Контрольна точка QAT потребує ретельної ранньої зупинки за сигналом на відкладених даних, щоб не випустити модель, яка вже почала деградувати, тоді як достатньо навчена контрольна точка QAH може безпечно використовуватися, оскільки вона просто не зміщується. Це узгоджується з механізмом: KL-дистиляція щодо замороженого вчителя не дає учневі стимулу рухатися після того, як він зрівнявся з учителем, тоді як цільова функція перехресної ентропії продовжує тиснути на жорсткі мітки й зрештою руйнує можливості, успадковані моделлю від початкової.

Середня продуктивність QAH і QAT у міру навчання під час квантування GPT-OSS 9B до MXFP4. QAH досягає піка на ранньому етапі та залишається стабільним протягом 1200 кроків; QAT досягає порівнянного піка значно пізніше, а потім руйнується.

QAH досягає піка 54.9 приблизно за 100 кроків і втримує його; QAT досягає 54.6 лише приблизно на 700-му кроці, а потім втрачає майже 19 балів до кроку 1200. Джерело: рисунок 3 статті.

Що це змінює на практиці

Історія з точністю супроводжується історією ефективності, яка й була початковою мотивацією для стиснення. За 4-бітної точності модель QAH використовує приблизно в 4 рази менше пам’яті для ваг, ніж учень bfloat16, а за вдвічі меншої кількості параметрів, ніж у вчителя 120B, приблизно вдвічі скорочує обчислення на токен, завдяки чому може працювати на значно менш потужному обладнанні. Для сімейств моделей, що постачаються у форматі bfloat16, а не 4-бітному форматі, сукупне зменшення кількості параметрів і точності дало б приблизно у 8 разів менше обчислень на токен.

Висновок полягає в тому, що стиснена 4-бітна модель не обов’язково має бути менш точною версією свого повноформатного аналога. За допомогою цього рецепта відновлення вона може водночас бути меншою, дешевшою в обслуговуванні та точнішою, причому досягає цього за частину часу навчання, необхідного для рецепта QAT. Квантування перестає бути платою за ефективність і стає додатковою можливістю навчати модель.

Ця робота є частиною поточного дослідження Multiverse Computing, спрямованого на те, щоб зробити великі моделі меншими й дешевшими в експлуатації без відмови від можливостей, які роблять їх корисними. Вона доповнює нашу супутню роботу над ефективною дистиляцією, яка забезпечує механізми навчання з довгим контекстом, від яких залежить QAH.

Хочете ознайомитися з усіма технічними деталями, зокрема з конвеєром відновлення, фрагментованою реалізацією KL для відновлення з довгим контекстом і результатами розподіленого навчання? Прочитайте повну статтю або зв’яжіться з нашою командою, щоб обговорити застосування стиснення та відновлення до ваших власних моделей.

Моделі, згадані в цій статті 2

Статті, згадані в цій статті 1

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у текстове поле, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб коментувати

Моделі, згадані в цій статті 2

Статті, згадані в цій статті 1

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини