Чекпойнти LFM2.5 Q4_0, отримані внаслідок дистиляції з урахуванням квантизації
- Навчені за допомогою дистиляції з урахуванням квантування (QAD): високоточна модель-учитель дистилюється в квантизовану модель-учня
- Такий самий обсяг пам’яті та швидкість, як у нативного Q4_0: вони зберігають низькі вимоги до пам’яті та високу пропускну здатність GGUF Q4_0
- Відновлення: відновлено 97% середньої точності BF16, втраченої через квантування
Результати бенчмарків
Для всіх чотирьох моделей ми порівнюємо випущені GGUF, створені за допомогою посттренувального квантування (PTQ), із навченими контрольними точками QAD Q4_0 у наборі бенчмарків, що охоплює міркування, виконання інструкцій, використання інструментів і агентні можливості: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF і BFCLv4. GGUF BF16 слугує верхньою межею у форматі. Ми також додаємо одну математичну оцінку, що відповідає масштабу: GSM8K для LFM2.5-230M і LFM2.5-350M та AIME25 для LFM2.5-1.2B-Instruct і LFM2.5-2.6B. Ми наводимо середнє значення за п’ятьма повторами.
Для всіх чотирьох моделей QAD суттєво покращує контрольну точку Q4_0. Контрольні точки QAD зберігають 97,1%, 96,5%, 97,4% і 96,6% відповідної базової продуктивності BF16.
Швидкість і розмір на реальному периферійному обладнанні
Ми вимірюємо пропускну здатність декодування для чотирьох моделей LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct і LFM2.5-2.6B на чотирьох платформах: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra і Raspberry Pi 5. MacBook Pro та NucBox використовують інференс на GPU, тоді як Samsung і Raspberry Pi — інференс на Arm CPU. BF16 і F16 показано як еталонні повноточні формати там, де їх було профільовано.
Контрольні точки QAD Q4_0 для 230M і 350M відповідають якості Q5_K_M у межах похибки оцінювання, забезпечуючи на 4–33% вищу пропускну здатність декодування. Контрольні точки QAD Q4_0 для 1.2B і 2.6B відповідають якості Q4_K_M, забезпечуючи на 3–14% вищу пропускну здатність. Контрольні точки QAD Q4_0 також відповідають UD-Q4_K_XL від Unsloth (де застосовно — для 230M і 1.2B), потужній зовнішній контрольній точці посттренувального квантування.
Як використовувати QAD GGUF
Використовуйте файли з llama.cpp або будь-яким середовищем виконання, що підтримує артефакти GGUF Q4_0.
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Початок роботи з QAD GGUF
QAD GGUF уже доступні на Hugging Face: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct і LFM2.5-2.6B.
Ми з нетерпінням чекаємо, що ви створите.
Цитування
Для цитування використовуйте наведене нижче посилання або BibTeX:
Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.
Або скористайтеся цитуванням у форматі BibTeX
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}
Моделі, згадані в цій статті 4
Спільнота
· Зареєструйтеся або увійдіть, щоб залишити коментар
Моделі, згадані в цій статті 4
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.






