Sakhanda Wire
NVDA $217.56 -0.99% MSFT $484.31 +0.56% GOOGL $344.72 +0.15% META $546.03 +0.43% AMZN $265.84 +2.46%
← К новостям

Чекпойнты LFM2.5 Q4_0, полученные в результате дистилляции с учетом квантизации

Контрольные точки LFM2.5 Q4_0 на основе дистилляции с учётом квантования
Команда Статья
Опубликовано 19 августа 2026 года
Сегодня мы выпускаем GGUF-файлы QAD Q4_0. Это обновлённые 4-битные контрольные точки для LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Они позволяют разработчикам запускать модели LFM2.5 с объёмом памяти и скоростью Q4_0 без обычного снижения качества:
  • Обучены с помощью дистилляции с учётом квантования (QAD): высокоточная модель-учитель дистиллируется в квантованную модель-ученика
  • Та же память и скорость, что и у нативного Q4_0: они сохраняют небольшой объём используемой памяти и высокую пропускную способность GGUF-файлов Q4_0
  • Восстановление: восстановлено 97% средней точности BF16, потерянной из-за квантования

Результаты тестирования

Для всех четырёх моделей мы сравниваем выпущенные GGUF-файлы, полученные с помощью посттренировочного квантования (PTQ), с обученными контрольными точками QAD Q4_0 в рамках набора тестов, охватывающего рассуждение, следование инструкциям, использование инструментов и агентные возможности: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF и BFCLv4. GGUF BF16 служит верхней границей в соответствующем формате. Мы также добавляем одну математическую оценку, соответствующую масштабу модели: GSM8K для LFM2.5-230M и LFM2.5-350M и AIME25 для LFM2.5-1.2B-Instruct и LFM2.5-2.6B. Мы приводим среднее значение по пяти повторам.

lfm25_gguf_eval_scores_2x2_liquid

Во всех четырёх моделях QAD значительно улучшает контрольную точку Q4_0. Контрольные точки QAD сохраняют 97,1%, 96,5%, 97,4% и 96,6% производительности соответствующих базовых моделей BF16.

Скорость и размер на реальном периферийном оборудовании

Мы измеряем пропускную способность декодирования для четырёх моделей — LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B — на четырёх целевых устройствах: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra и Raspberry Pi 5. На MacBook Pro и NucBox используется вывод на GPU, а на Samsung и Raspberry Pi — вывод на процессоре Arm. BF16 и F16 показаны как эталонные значения полной точности там, где проводилось профилирование.

lfm25_230m_decode_throughput_4panel_liquid

lfm25_350m_decode_throughput_4panel_liquid

lfm25_1p2b_decode_throughput_4panel_liquid

lfm25_2p6b_decode_throughput_3panel_liquid

Контрольные точки QAD Q4_0 для 230M и 350M соответствуют качеству Q5_K_M в пределах разброса результатов оценки при на 4–33% более высокой пропускной способности декодирования. Контрольные точки QAD Q4_0 для 1.2B и 2.6B соответствуют качеству Q4_K_M при на 3–14% более высокой пропускной способности. Контрольные точки QAD Q4_0 также соответствуют UD-Q4_K_XL от Unsloth (где применимо — для 230M и 1.2B), сильной внешней контрольной точке посттренировочного квантования.

Как использовать GGUF-файлы QAD

Используйте эти файлы с llama.cpp или любой средой выполнения, поддерживающей артефакты GGUF Q4_0.

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

Начало работы с GGUF-файлами QAD

GGUF-файлы QAD уже доступны на Hugging Face: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct и LFM2.5-2.6B.

Мы с нетерпением ждём, что вы создадите.

Цитирование

Для цитирования используйте следующую ссылку или BibTeX:

Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.

Или используйте цитирование в формате BibTeX

@article{liquidAI2026Q40,
  author = {Liquid AI},
  title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/qad},
}

Модели, упомянутые в этой статье 4

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 4

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости