Контролни точки LFM2.5 Q4_0 от дистилация с отчитане на квантизацията
- Обучени с дистилация с отчитане на квантизацията (QAD): високоточен модел-учител се дистилира в квантизиран ученически модел
- Същите памет и скорост като при стандартния Q4_0: Те запазват ниския разход на памет и високата пропускателна способност на Q4_0 GGUF файловете
- Възстановяване: Възстановени са 97% от средната точност в BF16, загубена заради квантизацията
Резултати от бенчмарковете
За всичките четири модела сравняваме публикуваните им GGUF файлове, създадени с квантизация след обучението (PTQ), с обучените контролни точки QAD Q4_0 в набор от бенчмаркове, обхващащи разсъждение, следване на инструкции, използване на инструменти и агентни способности: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4. GGUF файлът BF16 служи като горна граница във формата. Добавяме и една математическа оценка, съобразена с мащаба: GSM8K за LFM2.5-230M и LFM2.5-350M и AIME25 за LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Отчитаме средната стойност от пет повторения.
При всичките четири модела QAD значително подобрява контролната точка Q4_0. Контролните точки QAD запазват съответно 97,1%, 96,5%, 97,4% и 96,6% от базовата производителност на BF16.
Скорост и размер на реален периферен хардуер
Измерваме пропускателната способност при декодиране за четирите модела LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B на четири целеви устройства: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. MacBook Pro и NucBox използват инференция върху GPU, докато Samsung и Raspberry Pi използват инференция върху Arm CPU. BF16 и F16 са показани като референции с пълна точност там, където са профилирани.
Контролните точки QAD Q4_0 с 230M и 350M съответстват на качеството на Q5_K_M в рамките на вариацията при оценяването, при 4–33% по-висока пропускателна способност при декодиране. Контролните точки QAD Q4_0 с 1.2B и 2.6B съответстват на качеството на Q4_K_M при 3–14% по-висока пропускателна способност. Контролните точки QAD Q4_0 също съответстват на UD-Q4_K_XL на Unsloth (където е приложимо — за 230M и 1.2B), което е силна външна контролна точка за квантизация след обучението.
Как да използвате QAD GGUF файловете
Използвайте файловете с llama.cpp или всяка среда за изпълнение, която поддържа GGUF Q4_0 артефакти.
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Започнете с QAD GGUF файловете
QAD GGUF файловете са достъпни в Hugging Face още днес: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.
Нямаме търпение да видим какво ще създадете.
Цитиране
За цитиране използвайте следния източник или BibTeX:
Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.
Или използвайте BibTeX цитата
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}
Модели, споменати в тази статия 4
Общност
· Регистрирайте се или влезте, за да коментирате
Модели, споменати в тази статия 4
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.






