Sakhanda Wire
NVDA $216.34 -0.56% MSFT $481.93 -0.30% GOOGL $340.68 -1.17% META $541.95 -0.75% AMZN $261.51 -1.63%
← К новостям

До 3,2 раза более быстрый инференс с LFM2.5-DSpark

До 3,2 раза более быстрый инференс с LFM2.5-DSpark
Команда Статья
Опубликовано 20 августа 2026 года
Сегодня мы выпускаем контрольные точки черновых моделей DSpark для трёх моделей семейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B и LFM2.5-8B-A1B. Они добавляют путь спекулятивного декодирования, который обеспечивает значительное ускорение декодирования при минимальном увеличении объёма памяти и без изменения качества вывода:
  • Более быстрый инференс: ускорение пропускной способности до 3,18 раза на GPU и до 2,87 раза на устройстве.
  • На пути к агентному инференсу на устройстве: в среднем сокращает задержку вызова функций на 57% для LFM2.5-2.6B
  • Поддержка llama.cpp и SGLang с первого дня: интеграция DSpark, совместимая с LFM, опубликована в открытом виде в соответствующих проектах

Как работает DSpark

Фаза декодирования при инференсе больших языковых моделей традиционно ограничена пропускной способностью памяти. Большая часть задержки возникает из-за передачи весов из DRAM в SRAM, а не из-за интенсивных вычислений. Спекулятивное декодирование решает эту проблему, используя лёгкую черновую модель для генерации возможных токенов, после чего целевая модель проверяет их за один прямой проход, распределяя стоимость загрузки весов между всеми проверяемыми токенами.

За прошедшие годы было предложено несколько подходов к спекулятивному декодированию. Наиболее известными являются EAGLE-3, DFlash и, совсем недавно, DSpark, объединяющий три компонента:

  • Параллельная базовая сеть в стиле DFlash, обусловленная контекстными признаками целевой модели и создающая скрытые состояния для всех черновых токенов за один прямой проход.
  • Лёгкая последовательная головка, смоделированная как цепь Маркова между соседними токенами, которая добавляет зависимость между токенами и повышает долю принятых токенов на последующих позициях.
  • Верификатор с планированием по уровню уверенности, предсказывающий вероятность сохранения каждого токена и отбрасывающий суффиксы с низкой уверенностью, если их проверка будет стоить дороже, чем сэкономит.

DSpark

Обучение и архитектура

Мы следуем рецепту DSpark, используя более крупную и разнообразную смесь данных, охватывающую данные SFT, чатов, кода и вызова функций. Согласно нашим абляционным исследованиям, первые версии черновых моделей представляют собой упрощённые черновые модели только с механизмом внимания, состоящие из 5 слоёв и блока из 9 элементов. Для каждой черновой модели мы провели 15 эпох на всём наборе данных и выбрали эпоху с наибольшей долей принятых токенов, а не с наименьшими потерями.

Получившиеся черновые модели относительно малы: каждая содержит около 300 млн параметров.

Компонент LFM2.5-1.2B-Instruct LFM2.5-8B-A1B LFM2.5-2.6B
Стек декодера (5 слоёв) 241.2M 241.2M 241.2M
Проекция скрытого состояния 21.0M 21.0M 21.0M
Головка Маркова 33.6M 65.5M 65.5M
Нормализация + головка уверенности 27.5k 27.5k 27.5k
Всего 295.7M 327.7M 327.7M

Равенство качества

При жадном декодировании черновой токен принимается только в том случае, если он совпадает с распределением целевой модели. При отклонении его место занимает собственный токен целевой модели. Поэтому выдаваемая последовательность по построению идентична базовой жадной, а значит, точность на бенчмарках (pass@1 или точное совпадение) не изменяется.

Ускорение инференса на CPU и GPU

Наши черновые модели DSpark для LFM2.5 с первого дня поддерживают llama.cpp (реализация основана на официальной кодовой базе, которую мы запускаем с использованием экспериментальных ядер Metal) и **SGLang (**реализация основана на официальной реализации DSpark в SGLang).

Мы измеряем пропускную способность на устройстве с помощью llama.cpp и Metal на MacBook Pro с чипом M4 Max, используя веса FP16 GGUF и до 256 выходных токенов. Пропускную способность GPU измеряем с помощью SGLang на одном H100 80 ГБ в BF16. В обеих конфигурациях используются размер блока DSpark, равный 9, размер пакета 1 и температура 0. Мы оцениваем их на пяти наборах данных для бенчмарков.

Все три черновые модели обеспечивают заметное повышение пропускной способности как на крупномасштабном ускорителе (H100), так и на периферийном устройстве (MacBook с M4 Max).

Для LFM2.5-2.6B ускорение на MacBook особенно заметно: оно выводит уровень интерактивности, доступный пользователю, далеко за пределы пропускной способности большинства проприетарных облачных моделей (около 140 токенов/с, в зависимости от набора данных).

Набор данных Принятие (из 10) Ускорение на H100 Ускорение на M4 Max
MATH500 5.42 3.06x 326 → 1000 токенов/с 2.25x 61 → 137 токенов/с
HumanEval 4.54 2.56x 326 → 835 токенов/с 2.63x 61 → 161 токенов/с
MBPP 4.71 2.64x 326 → 861 токенов/с 2.11x 62 → 132 токенов/с
GSM8K 4.32 2.22x 312 → 693 токенов/с 2.36x 60 → 143 токенов/с
MT-Bench 5.07 2.87x 325 → 933 токенов/с 1.99x 62 → 123 токенов/с
Среднее 4.81 2.67x 323 → 864 токенов/с 2.27x 61 → 139 токенов/с

В различных сценариях с несколькими инструментами DSpark в среднем сокращает задержку для LFM2.5-2.6B на 57%.

bfcl_latency_mac

Для LFM2.5-1.2B-Instruct мы наблюдаем гораздо большую вариативность доли принятых токенов в зависимости от набора данных, поэтому ускорение может различаться на величину до 52% в зависимости от распределения исходного текста.

Набор данных Принятие (из 10) Ускорение на H100 Ускорение на M4 Max
MATH500 6.02 2.56x 668 → 1712 токенов/с 2.62x 140 → 366 токенов/с
HumanEval 5.31 2.26x 664 → 1499 токенов/с 2.87x 136 → 389 токенов/с
MBPP 5.52 2.37x 667 → 1578 токенов/с 2.74x 137 → 375 токенов/с
GSM8K 4.34 1.67x 624 → 1041 токенов/с 2.73x 140 → 381 токенов/с
MT-Bench 3.90 1.66x 657 → 1091 токенов/с 1.72x 137 → 237 токенов/с
Среднее 5.02 2.10x 656 → 1384 токенов/с 2.54x 138 → 350 токенов/с

Для LFM2.5-8B-A1B доля принятых токенов увеличивается по сравнению с двумя плотными моделями, однако на устройстве среднее улучшение составляет лишь 18%. Этот разрыв объясняется текущей реализацией MoE в бэкенде Metal для llama.cpp, а также тем, что проверка k токенов активирует больше экспертов и, следовательно, требует большего трафика весов, чем один шаг декодирования.

Набор данных Принятие (из 10) Ускорение на H100 Ускорение на M4 Max
MATH500 8.27 3.18x 428 → 1362 токенов/с 1.21x 93 → 112 токенов/с
HumanEval 7.02 2.58x 426 → 1100 токенов/с 1.12x 91 → 101 токенов/с
MBPP 6.93 2.64x 426 → 1122 токенов/с 1.09x 89 → 97 токенов/с
GSM8K 4.02 1.29x 385 → 496 токенов/с 1.44x 90 → 129 токенов/с
MT-Bench 8.52 3.02x 426 → 1288 токенов/с 1.04x 87 → 90 токенов/с
Среднее 6.95 2.54x 418 → 1074 токенов/с 1.18x 90 → 106 токенов/с

Как использовать LFM2.5-DSpark

Для запуска черновых моделей DSpark с помощью SGLang требуется сборка SGLang с поддержкой DSpark для целей LFM2 (PR #31041). Запустите целевую модель, подключив черновую:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --disable-radix-cache --mem-fraction-static 0.75 --port 30000

Затем отправляйте запросы к совместимой с OpenAI конечной точке http://localhost:30000/v1. Размер блока считывается из config.json черновой модели; базовый вариант использует ту же команду без трёх флагов --speculative-*.

Для запуска с помощью llama.cpp требуется соответствующая сборка llama.cpp (PR#27383).

llama-server -m LFM2.5-2.6B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 10 --spec-draft-n-min 0 \
  -fa on -ngl 99

Размер блока считывается из метаданных дополнительного файла (значение n-max ограничивается этим размером). Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод совпадает с выводом одной целевой модели; в timings каждого ответа указываются draft_n / draft_n_accepted.

Начало работы

Контрольные точки черновых моделей DSpark доступны на Hugging Face в форматах Safetensors и GGUF:

Нам не терпится увидеть, что вы создадите.

Цитирование

Для цитирования используйте следующую ссылку или запись BibTeX:

Liquid AI, «LFM2.5-DSpark: до 3,2 раза более быстрый инференс от H100 до MacBook», блог Liquid AI, август 2026 г.

@article{liquidAI2026dspark,
  author = {Liquid AI},
  title = {LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2.5-dspark},
}

Модели, упомянутые в этой статье 6

Статьи, упомянутые в этой статье 3

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в поле ввода текста, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 6

Статьи, упомянутые в этой статье 3

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости