Sakhanda Wire
NVDA $208.48 -2.91% MSFT $487.31 +0.84% GOOGL $348.06 +0.94% META $559.02 +1.66% AMZN $262.07 +1.33%
← Към новините

Лечение, съобразено с квантизацията: компресиран 4-битов модел, който превъзхожда оригинала си с пълна точност

Лечение с оглед на квантизацията: компресиран 4-битов модел, който превъзхожда оригинала си с пълна точност
Екип Статия
Публикувана 25 август 2026 г.
Намаляването на голям езиков модел почти винаги е свързано с определена цена. Сега стандартната рецепта за ефективно внедряване е първо архитектурата да се компресира, като броят на параметрите се намали чрез премахване на слоеве, глави или неврони, а след това оставащите тегла да се квантизират до 4 бита, за да се намалят допълнително паметта и изчисленията. И двете стъпки спестяват много ресурси, но заедно системно влошават способностите, които са от значение за хората: разсъждаването, решаването на математически задачи и генерирането на код. Затова сериозните процеси за внедряване добавят стъпка за възстановяване, обикновено наричана лечение, преди моделът да бъде пуснат в продукция. Последните издания с отворени тегла, като gpt-oss, фамилията Nemotron на NVIDIA и нашият собствен Hypernova 60B, разчитат на някаква версия на този подход „компресирай, после лекувай“.

Най-новата ни статия, Лечение с оглед на квантизацията: практическа рецепта за възстановяване на компресирани 4-битови LLM модели, задава въпрос, който досега до голяма степен оставаше без отговор: след като моделът вече е преминал през структурна компресия, а не само през квантизация, доколко всъщност работи тази стъпка за възстановяване и какъв е правилният начин за изпълнението ѝ? Представяме Quantization-Aware Healing (QAH), а приложен към модел GPT-OSS 120B, компресиран до 60B параметъра и квантизиран до MXFP4, той създава модел, който превъзхожда собствената си версия с пълна точност (bfloat16) в 7 от 9 бенчмарка. 4-битовият модел се оказва по-малък, по-евтин за изпълнение и по-точен от чекпойнта, от който е квантизиран. Това обръща обичайната връзка между 4-битовия модел и 16-битовия модел, от който произлиза.

Защо обичайните методи за лечение не са достатъчни тук

Повечето процеси за ефективност следват едни и същи три стъпки: компресиране на архитектурата, квантизация на компресираните тегла и след това лечение на нанесените щети. Разликата между методите е изцяло в последната стъпка.

Доминиращата рецепта за лечение е обучението с оглед на квантизацията (QAT). То вмъква оператори за фалшива квантизация във forward прохода и продължава да дообучава модела върху загуба за дадена задача, така че теглата да се научат да понасят представянето с ниска точност. На практика това означава повторно изпълнение на вече скъпия многоетапен процес след обучението — дообучаване с учител, RLHF, агентно дообучаване — чрез по-шумен forward проход с по-ниска точност. Това е скъпо, а както показват резултатите ни, може да стане и нестабилно, ако обучението продължи твърде дълго след най-добрия си момент.

Алтернативата, дистилацията с оглед на квантизацията (QAD), избягва повторното изпълнение на тази история. Вместо загуба за конкретна задача тя дистилира замразен модел-учител с пълна точност директно в квантизирания ученик чрез загуба от типа KL-дивергенция върху изходните логити. Това работи добре, когато единствената промяна е квантизацията, защото съществува истинска версия с пълна точност на абсолютно същия модел, която да служи като учител. Но след като моделът е преминал през структурна компресия — с по-малко слоеве, глави или неврони, а не само с по-малко битове — това допускане се нарушава. Не съществува независимо обучена версия с пълна точност на по-малката архитектура. Единственият възможен учител е възстановеният чекпойнт bfloat16, който сам по себе си е дистилирано приближение на оригиналния модел. Дистилирането от него обвързва квантизирания ученик с влошена цел и ограничава точността му до собствения таван на този възстановен чекпойнт.

Така въпросът как да се лекува модел, който е бил едновременно структурно компресиран и квантизиран, досега действително оставаше открит.

Нашият подход

QAH премахва този таван с една промяна: дистилира директно от оригиналния модел преди компресията, а не от възстановения модел. Учителят и ученикът дори не споделят една и съща архитектура. Учителят е с пълен размер и пълна точност, докато ученикът е наполовина по-малък и работи в MXFP4. Тъй като изходното разпределение на учителя не зависи от архитектурата, разликата в размера или формата не възпрепятства трансфера. Ученикът никога не вижда твърди етикети, а само изходното разпределение на учителя, съпоставено чрез KL-дивергенция върху логитите.

Това променя разбирането за ролята на етапа на квантизация. При QAH той вече не е губеща стъпка за последваща обработка, приложена след приключването на лечението. Той е втори пълен дистилационен проход спрямо оригиналния учител — надзор, който чекпойнтът bfloat16 никога не е получавал. 4-битовият ученик не компенсира информацията, изгубена при квантизацията; той усвоява информация, която предишният етап на възстановяване не е имал достатъчно време или данни да прехвърли.

От самата загуба произтича и полза за стабилността. Тъй като KL-дистилацията обвързва ученика с фиксирано разпределение на учителя, след като ученикът го настигне, вече няма допълнителен натиск да се отклонява. За разлика от това загубата на кръстосана ентропия продължава безкрайно да тласка ученика към твърдите етикети. Както показва сравнението по-долу, тази разлика се оказва важна както за точността, така и за стабилността на обучението.

За да работи QAH при дълъг контекст, при който корпусът за лечение включва документи с до 32k токена, използваме повторно ефективната по отношение на паметта фрагментирана загуба от KL-дивергенция от съпътстващата ни статия за ефективна дистилация. Тази загуба изчислява KL по един сегмент от последователността наведнъж и никога не материализира пълната решетка речник-последователност, което позволява лечението с 32k токена да се вмести във фиксиран бюджет за GPU памет. Разгледахме механиката на тази загуба в предишна публикация.

Преглед на QAH: след структурна компресия и квантизация способностите спадат рязко. QAH дистилира от оригиналния модел преди компресията като замразен учител, възстановявайки производителността без повторно преминаване през многоетапното обучение след обучението.

Преглед на QAH. След структурна компресия и квантизация способностите спадат рязко. QAH дистилира от оригиналния модел — замразен учител, чиито логити са предварително изчислени офлайн — вместо от възстановения чекпойнт. Източник: фигура 1 от статията.

Резултати

Приложихме QAH към модел GPT-OSS 120B, компресиран до 60B параметъра и възстановен в bfloat16, след което го квантизирахме повторно до MXFP4 с QAH. Естественото сравнение е със същия чекпойнт bfloat16 на модела 60B — най-добрата налична версия с пълна точност на тази архитектура. Моделът с QAH печели в 7 от 9 бенчмарка.

Бенчмарк Учител 120B (MXFP4) 60B BF16 (възстановен) 60B MXFP4 (QAH) QAH спрямо BF16
AA-LCR (разсъждение с дълъг контекст) 50.0 35.3 42.7 +7.4
AIME 2025 (математика) 80.0 70.7 76.3 +5.6
Aider (агентно програмиране) 45.3 38.2 40.9 +2.7
τ²-bench (използване на инструменти) 68.4 59.4 61.7 +2.3
GPQA Diamond (наука) 69.0 65.7 67.4 +1.7
IFBench (следване на инструкции) 63.3 58.4 59.9 +1.5
LiveCodeBench (програмиране) 66.0 65.5 66.5 +1.0
MMLU-Pro (знания) 78.0 74.0 73.8 −0.2
SciCode (научно програмиране) 37.5 35.6 34.2 −1.4

В двата бенчмарка, в които QAH изостава — MMLU-Pro и SciCode — загубата е по-малка от точка и половина. Навсякъде другаде 4-битовият модел е пред собствения си 16-битов източник, а най-големите подобрения са точно при способностите, които компресията обикновено уврежда най-силно: разсъждение с дълъг контекст (+7.4 при AA-LCR) и математика (+5.6 при AIME 2025).

Сравнението с оригиналния учител 120B е също толкова показателно. Въпреки че работи с наполовина по-малко параметри от учителя и приблизително една четвърт от паметта за теглата му, моделът QAH превъзхожда пълноразмерния учител при LiveCodeBench (66.5 спрямо 66.0) и е само на 1.6 точки от него при GPQA Diamond (67.4 спрямо 69.0). Най-голямата оставаща разлика спрямо учителя е при AA-LCR — екстремен бенчмарк за дълъг контекст, при който капацитетът, изгубен при компресията, по същество е най-труден за възстановяване.

Производителност на трите чекпойнта при бенчмарковете: оригиналния учител GPT-OSS-120B (MXFP4), компресирания и възстановен модел 60B в bfloat16 и същия модел 60B, квантизиран повторно до MXFP4 с QAH, при девет бенчмарка.

4-битовият модел QAH се изравнява или надминава своя източник bfloat16 в 7 от 9 бенчмарка и надминава пълноразмерния учител при LiveCodeBench. Източник: фигура 2 от статията.

QAH срещу QAT, пряко сравнение

За да изолираме ефекта на функцията на загубата от всичко останало, сравнихме QAH директно с QAT при съпоставими условия, като квантизирахме модел GPT-OSS 9B до MXFP4 и проследявахме средната производителност при MMLU-Pro, LiveCodeBench и GPQA Diamond с напредването на обучението.

И двата метода достигат сходен пик — 54.9 за QAH спрямо 54.6 за QAT — така че по отношение на най-добрата възможна точност те на практика са равностойни. Разликата е в начина, по който стигат дотам, и в това какво се случва след това. QAH достига пика си за около 100 стъпки, приблизително 7 пъти по-бързо от 700-те стъпки на QAT, а след това остава на около две точки от този пик до края на обучението. QAT се срива рязко след пика си, губейки почти 19 точки до стъпка 1200.

Практическото следствие е реална разлика в риска при внедряване. Чекпойнтът QAT изисква внимателно ранно спиране спрямо сигнал от отделен набор за проверка, за да се избегне пускането на модел, който вече е започнал да се влошава. За разлика от него, достатъчно обучен чекпойнт QAH може да се използва безопасно, защото просто не се отклонява. Това съответства на механизма: KL-дистилацията спрямо замразен учител не дава на ученика стимул да се променя, след като съвпадне с учителя, докато целта с кръстосана ентропия продължава да го тласка към твърдите етикети и в крайна сметка разрушава способностите, наследени от оригинала.

Средна производителност на QAH и QAT с напредването на обучението при квантизация на GPT-OSS 9B до MXFP4. QAH достига пик рано и остава стабилен до 1200 стъпки; QAT достига сравним пик значително по-късно, след което се срива.

QAH достига 54.9 за приблизително 100 стъпки и запазва нивото; QAT достига 54.6 едва около стъпка 700, след което губи почти 19 точки до стъпка 1200. Източник: фигура 3 от статията.

Какво променя това на практика

Историята с точността върви заедно с историята за ефективността, която първоначално мотивира компресията. При 4-битова точност моделът QAH използва приблизително 4 пъти по-малко памет за теглата от ученика bfloat16, а при наполовина по-малък брой параметри спрямо учителя 120B той приблизително намалява наполовина изчисленията за токен, което позволява работа на значително по-малък хардуер. За моделни фамилии, които се доставят в bfloat16, а не в 4 бита, комбинираното намаляване на параметрите и точността би означавало близо 8 пъти по-малко изчисления за токен.

Изводът е, че компресираният 4-битов модел не трябва да бъде версия с по-ниска точност на своя аналог с пълна точност. С тази рецепта за лечение той може едновременно да бъде по-малък, по-евтин за обслужване и по-точен, като достига тази точка за малка част от времето за обучение, необходимо при рецепта QAT. Квантизацията престава да бъде данък, който плащате за ефективност, и се превръща в допълнителна възможност за обучение на модела.

Тази работа е част от текущите изследвания на Multiverse Computing за намаляване на размера на големите модели и поевтиняване на изпълнението им, без да се жертват способностите, които ги правят полезни. Тя допълва съпътстващата ни работа за ефективна дистилация, която осигурява механизмите за обучение с дълъг контекст, от които QAH зависи.

Искате пълните технически подробности, включително процеса на лечение, фрагментираната реализация на KL за лечение с дълъг контекст и изводите от разпределеното обучение? Прочетете пълната статия или се свържете с нашия екип, за да обсъдим прилагането на компресия и лечение към вашите собствени модели.

Модели, споменати в тази статия 2

Статии, споменати в тази статия 1

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или натиснете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 2

Статии, споменати в тази статия 1

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини