Чекпойнты LFM2.5 Q4_0, полученные в результате дистилляции с учетом квантизации
- Обучены с помощью дистилляции с учётом квантования (QAD): высокоточная модель-учитель дистиллируется в квантованную модель-ученика
- Та же память и скорость, что и у нативного Q4_0: они сохраняют небольшой объём используемой памяти и высокую пропускную способность GGUF-файлов Q4_0
- Восстановление: восстановлено 97% средней точности BF16, потерянной из-за квантования
Результаты тестирования
Для всех четырёх моделей мы сравниваем выпущенные GGUF-файлы, полученные с помощью посттренировочного квантования (PTQ), с обученными контрольными точками QAD Q4_0 в рамках набора тестов, охватывающего рассуждение, следование инструкциям, использование инструментов и агентные возможности: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4. GGUF BF16 служит верхней границей в соответствующем формате. Мы также добавляем одну математическую оценку, соответствующую масштабу модели: GSM8K для LFM2.5-230M и LFM2.5-350M и AIME25 для LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Мы приводим среднее значение по пяти повторам.
Во всех четырёх моделях QAD значительно улучшает контрольную точку Q4_0. Контрольные точки QAD сохраняют 97,1%, 96,5%, 97,4% и 96,6% производительности соответствующих базовых моделей BF16.
Скорость и размер на реальном периферийном оборудовании
Мы измеряем пропускную способность декодирования для четырёх моделей — LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B — на четырёх целевых устройствах: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. На MacBook Pro и NucBox используется вывод на GPU, а на Samsung и Raspberry Pi — вывод на процессоре Arm. BF16 и F16 показаны как эталонные значения полной точности там, где проводилось профилирование.
Контрольные точки QAD Q4_0 для 230M и 350M соответствуют качеству Q5_K_M в пределах разброса результатов оценки при на 4–33% более высокой пропускной способности декодирования. Контрольные точки QAD Q4_0 для 1.2B и 2.6B соответствуют качеству Q4_K_M при на 3–14% более высокой пропускной способности. Контрольные точки QAD Q4_0 также соответствуют UD-Q4_K_XL от Unsloth (где применимо — для 230M и 1.2B), сильной внешней контрольной точке посттренировочного квантования.
Как использовать GGUF-файлы QAD
Используйте эти файлы с llama.cpp или любой средой выполнения, поддерживающей артефакты GGUF Q4_0.
llama-cli -hf LiquidAI/LFM2.5-350M \
--hf-file LFM2.5-350M-QAD-Q4_0.gguf \
-p "What is C. elegans?"
Начало работы с GGUF-файлами QAD
GGUF-файлы QAD уже доступны на Hugging Face: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.
Мы с нетерпением ждём, что вы создадите.
Цитирование
Для цитирования используйте следующую ссылку или BibTeX:
Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.
Или используйте цитирование в формате BibTeX
@article{liquidAI2026Q40,
author = {Liquid AI},
title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/qad},
}
Модели, упомянутые в этой статье 4
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 4
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.






