Sakhanda Wire
NVDA $217.56 -0.99% MSFT $484.31 +0.56% GOOGL $344.72 +0.15% META $546.03 +0.43% AMZN $265.84 +2.46%
← До новин

Чекпойнти LFM2.5 Q4_0, отримані внаслідок дистиляції з урахуванням квантизації

Контрольні точки LFM2.5 Q4_0 з дистиляції з урахуванням квантування
Команда Стаття
Опубліковано 19 серпня 2026 року
Сьогодні ми випускаємо QAD Q4_0 GGUF. Це оновлені 4-бітні контрольні точки для LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct і LFM2.5-2.6B. Вони дають змогу розробникам запускати моделі LFM2.5 із вимогами до пам’яті та швидкістю Q4_0 без звичайного падіння якості:
  • Навчені за допомогою дистиляції з урахуванням квантування (QAD): високоточна модель-учитель дистилюється в квантизовану модель-учня
  • Такий самий обсяг пам’яті та швидкість, як у нативного Q4_0: вони зберігають низькі вимоги до пам’яті та високу пропускну здатність GGUF Q4_0
  • Відновлення: відновлено 97% середньої точності BF16, втраченої через квантування

Результати бенчмарків

Для всіх чотирьох моделей ми порівнюємо випущені GGUF, створені за допомогою посттренувального квантування (PTQ), із навченими контрольними точками QAD Q4_0 у наборі бенчмарків, що охоплює міркування, виконання інструкцій, використання інструментів і агентні можливості: GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF і BFCLv4. GGUF BF16 слугує верхньою межею у форматі. Ми також додаємо одну математичну оцінку, що відповідає масштабу: GSM8K для LFM2.5-230M і LFM2.5-350M та AIME25 для LFM2.5-1.2B-Instruct і LFM2.5-2.6B. Ми наводимо середнє значення за п’ятьма повторами.

lfm25_gguf_eval_scores_2x2_liquid

Для всіх чотирьох моделей QAD суттєво покращує контрольну точку Q4_0. Контрольні точки QAD зберігають 97,1%, 96,5%, 97,4% і 96,6% відповідної базової продуктивності BF16.

Швидкість і розмір на реальному периферійному обладнанні

Ми вимірюємо пропускну здатність декодування для чотирьох моделей LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct і LFM2.5-2.6B на чотирьох платформах: MacBook Pro, NucBox EVO-X2, Samsung Galaxy S26 Ultra і Raspberry Pi 5. MacBook Pro та NucBox використовують інференс на GPU, тоді як Samsung і Raspberry Pi — інференс на Arm CPU. BF16 і F16 показано як еталонні повноточні формати там, де їх було профільовано.

lfm25_230m_decode_throughput_4panel_liquid

lfm25_350m_decode_throughput_4panel_liquid

lfm25_1p2b_decode_throughput_4panel_liquid

lfm25_2p6b_decode_throughput_3panel_liquid

Контрольні точки QAD Q4_0 для 230M і 350M відповідають якості Q5_K_M у межах похибки оцінювання, забезпечуючи на 4–33% вищу пропускну здатність декодування. Контрольні точки QAD Q4_0 для 1.2B і 2.6B відповідають якості Q4_K_M, забезпечуючи на 3–14% вищу пропускну здатність. Контрольні точки QAD Q4_0 також відповідають UD-Q4_K_XL від Unsloth (де застосовно — для 230M і 1.2B), потужній зовнішній контрольній точці посттренувального квантування.

Як використовувати QAD GGUF

Використовуйте файли з llama.cpp або будь-яким середовищем виконання, що підтримує артефакти GGUF Q4_0.

llama-cli -hf LiquidAI/LFM2.5-350M \
  --hf-file LFM2.5-350M-QAD-Q4_0.gguf \
  -p "What is C. elegans?"

Початок роботи з QAD GGUF

QAD GGUF уже доступні на Hugging Face: LFM2.5-230M, LFM2.5-350M, LFM2.5-1.2B-Instruct і LFM2.5-2.6B.

Ми з нетерпінням чекаємо, що ви створите.

Цитування

Для цитування використовуйте наведене нижче посилання або BibTeX:

Liquid AI, "LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment", Liquid AI Blog, Aug 2026.

Або скористайтеся цитуванням у форматі BibTeX

@article{liquidAI2026Q40,
  author = {Liquid AI},
  title = {LFM2.5 Q4_0: Quantization-Aware Distillation for Edge Deployment},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/qad},
}

Моделі, згадані в цій статті 4

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у поле введення тексту, вставляючи або натискаючи тут.
Натисніть або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Моделі, згадані в цій статті 4

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини