Ускорение зрительно-языковых моделей с помощью LFM2.5-VL-DSpark
- Более быстрый вывод: ускорение декодирования до 3,13 раза на устройстве и до 2,66 раза на H100, при этом сквозное ускорение достигает 2,62 и 2,27 раза соответственно.
- Небольшие затраты памяти: черновая модель добавляет 280 млн параметров — 8,9% поверх целевой модели с 3 млрд параметров
- Поддержка с первого дня: совместимые с LFM интеграции DSpark для llama.cpp, MLX-VLM и SGLang
Как работает спекулятивное декодирование для VLM
Визуальная черновая модель использует ту же архитектуру, что и наши текстовые черновые модели LFM2.5-DSpark: она извлекает скрытые состояния целевой модели на фиксированном наборе выбранных слоёв и использует их для создания блока из k токенов-кандидатов. Пиксели изображения и текстовые токены проецируются в общее представление перед этими слоями, поэтому черновая модель работает со скрытыми векторами одинаковой размерности независимо от модальности входных данных. Таким образом, алгоритм вывода не отличается от используемого в текстовых моделях.

Обучение и архитектура
Мы следуем рецепту DSpark, используя смесь данных SFT для визуально-языковых моделей с повышенным весом для рабочих нагрузок, которые, как мы ожидаем, будет обслуживать модель. На основе абляций для 3, 4 и 5 слоёв черновая модель представляет собой упрощённую черновую модель только с механизмом внимания, состоящую из 4 слоёв и имеющую размер блока 9. Мы провели 10 эпох на итоговой смеси и измеряли долю принятых токенов после каждой эпохи; этот показатель улучшался с добавлением обучающих токенов, прежде чем достигнуть убывающей отдачи. Во время вывода мы рекомендуем размер блока 8 или 9 в зависимости от оборудования.
Получившаяся черновая модель содержит примерно 280 млн параметров и увеличивает количество параметров развёрнутой модели всего на 8,9%.
| Компонент | LFM2.5-VL-3B |
|---|---|
| Стек декодера (4 слоя) | 193,0 млн |
| Проекция скрытого состояния | 21,0 млн |
| Голова Маркова | 65,5 млн |
| Нормализации + голова уверенности | 6,4 тыс. |
| Итого | 279,5 млн |
Ускорение вывода на CPU и GPU
Черновая модель DSpark для LFM2.5-VL-3B с первого дня поставляется с поддержкой llama.cpp, MLX-VLM и SGLang.
Мы измеряем как вывод на устройстве, так и вывод на GPU. В обеих конфигурациях используется размер блока DSpark 8, а оценка проводится на шести разнообразных задачах, связанных с изображениями, включая общий VQA, VQA по тексту, создание подписей к изображениям, VQA по диаграммам, сложные рассуждения и многоходовой диалог, в соответствии с бенчмарком MMSpec.
Вывод на устройстве. При использовании MLX на M5 Max декодирование выполняется в 2,30–3,13 раза быстрее в зависимости от задачи. Сквозная задержка сокращается в 1,56–2,62 раза. При использовании llama.cpp на M3 Ultra декодирование ускоряется в 1,57–2,14 раза, а сквозной показатель — в 1,30–1,77 раза.
Вывод на GPU. На H100 та же черновая модель обеспечивает декодирование в 20,4–2,66 раза быстрее, а сквозное ускорение составляет 1,64–2,27 раза.
Ограничения спекулятивного декодирования для визуальных задач
В LLM предварительная обработка в основном ограничена вычислительными ресурсами, а её стоимость растёт (суб)квадратично относительно длины запроса. Визуально-языковые модели добавляют к этому обработку изображения: сначала оно проходит через визуальный энкодер, затем языковая основа обрабатывает сотни визуальных токенов вместе с текстовым запросом. Пограничные устройства обладают значительно меньшими вычислительными ресурсами, чем GPU в центрах обработки данных, поэтому предварительная обработка занимает большую долю сквозной задержки, что показывают измерения времени до первого токена и декодирования на Apple Silicon и H100. (Нейроускорители GPU M5 для каждого ядра сокращают этот разрыв).
Спекулятивное декодирование ускоряет только декодирование, но не кодирование изображения и предварительную обработку. Когда эти этапы уже занимают значительную часть общего времени, даже существенное ускорение декодирования даёт лишь умеренное сквозное улучшение. Это закон Амдала: общее ускорение ограничено той частью рабочей нагрузки, которая не ускоряется.
Как использовать LFM2.5-VL-DSpark
Для запуска черновых моделей DSpark с помощью SGLang требуется сборка SGLang с поддержкой DSpark для целевых моделей LFM2 (PR #40651). Запустите целевую модель с подключённой черновой:
python -m sglang.launch_server \
--model-path LiquidAI/LFM2.5-VL-3B \
--speculative-algorithm DSPARK \
--speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
--speculative-draft-attention-backend flashinfer \
--speculative-dspark-block-size 9 \
--disable-radix-cache
Затем отправьте запрос к совместимой с OpenAI конечной точке http://localhost:30000/v1. Размер блока считывается из config.json черновой модели; базовой является та же команда без трёх флагов --speculative-*.
Для запуска с помощью llama.cpp требуется соответствующая сборка llama.cpp (PR#29339).
llama-server -m models/LFM2.5-VL-3B-F16.gguf \
--mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
-md LFM2.5-2.6B-DSpark-F16.gguf \
--spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
-fa on -ngl 99 -c 8192
Для запуска с помощью MLX-VLM требуется соответствующая сборка (PR#2280).
mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark
Размер блока считывается из метаданных сопутствующего файла (значение n-max ограничивается этим размером). Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод совпадает с выводом одной целевой модели; в поле timings каждого ответа указываются draft_n / draft_n_accepted.
Начало работы
Наша визуальная черновая модель DSpark доступна на Hugging Face в форматах Safetensors и GGUF.
С LFM2.5 мы воплощаем наше видение ИИ, который работает где угодно. Эти модели:
- С открытыми весами — скачивайте, дообучайте и разворачивайте без ограничений.
- Быстрые с первого дня — поддержка llama.cpp, MLX и SGLang с первого дня.
- Полное семейство — от базовых моделей для кастомизации до специализированных аудио- и визуальных вариантов: одна архитектура охватывает самые разные сценарии использования
Нам не терпится увидеть, что вы создадите.
Цитирование
Для цитирования используйте следующую ссылку или BibTeX:
Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.
@article{liquidAI2026vldspark,
author = {Liquid AI},
title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
journal = {Liquid AI Blog},
year = {2026},
note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}
Модели, упомянутые в этой статье 1
Статьи, упомянутые в этой статье 2
Сообщество
· Зарегистрируйтесь или войдите, чтобы оставить комментарий
Модели, упомянутые в этой статье 1
Статьи, упомянутые в этой статье 2
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.



