Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Ускорение зрительно-языковых моделей с помощью LFM2.5-VL-DSpark

Ускорение визуально-языковых моделей с помощью LFM2.5-VL-DSpark
Команда Статья
Опубликовано 24 сентября 2026 года
Сегодня мы выпускаем экспериментальную черновую модель DSpark для нашей визуально-языковой модели (VLM) LFM2.5-VL-3B. Как и в случае с нашими недавно выпущенными черновыми моделями LFM2.5-DSpark, она добавляет путь спекулятивного декодирования, который обеспечивает значительное ускорение при минимальном увеличении объёма памяти и без изменения качества вывода.
  • Более быстрый вывод: ускорение декодирования до 3,13 раза на устройстве и до 2,66 раза на H100, при этом сквозное ускорение достигает 2,62 и 2,27 раза соответственно.
  • Небольшие затраты памяти: черновая модель добавляет 280 млн параметров — 8,9% поверх целевой модели с 3 млрд параметров
  • Поддержка с первого дня: совместимые с LFM интеграции DSpark для llama.cpp, MLX-VLM и SGLang

Как работает спекулятивное декодирование для VLM

Визуальная черновая модель использует ту же архитектуру, что и наши текстовые черновые модели LFM2.5-DSpark: она извлекает скрытые состояния целевой модели на фиксированном наборе выбранных слоёв и использует их для создания блока из k токенов-кандидатов. Пиксели изображения и текстовые токены проецируются в общее представление перед этими слоями, поэтому черновая модель работает со скрытыми векторами одинаковой размерности независимо от модальности входных данных. Таким образом, алгоритм вывода не отличается от используемого в текстовых моделях. DSpark-Vision

Обучение и архитектура

Мы следуем рецепту DSpark, используя смесь данных SFT для визуально-языковых моделей с повышенным весом для рабочих нагрузок, которые, как мы ожидаем, будет обслуживать модель. На основе абляций для 3, 4 и 5 слоёв черновая модель представляет собой упрощённую черновую модель только с механизмом внимания, состоящую из 4 слоёв и имеющую размер блока 9. Мы провели 10 эпох на итоговой смеси и измеряли долю принятых токенов после каждой эпохи; этот показатель улучшался с добавлением обучающих токенов, прежде чем достигнуть убывающей отдачи. Во время вывода мы рекомендуем размер блока 8 или 9 в зависимости от оборудования.

Получившаяся черновая модель содержит примерно 280 млн параметров и увеличивает количество параметров развёрнутой модели всего на 8,9%.

Компонент LFM2.5-VL-3B
Стек декодера (4 слоя) 193,0 млн
Проекция скрытого состояния 21,0 млн
Голова Маркова 65,5 млн
Нормализации + голова уверенности 6,4 тыс.
Итого 279,5 млн

Ускорение вывода на CPU и GPU

Черновая модель DSpark для LFM2.5-VL-3B с первого дня поставляется с поддержкой llama.cpp, MLX-VLM и SGLang.

Мы измеряем как вывод на устройстве, так и вывод на GPU. В обеих конфигурациях используется размер блока DSpark 8, а оценка проводится на шести разнообразных задачах, связанных с изображениями, включая общий VQA, VQA по тексту, создание подписей к изображениям, VQA по диаграммам, сложные рассуждения и многоходовой диалог, в соответствии с бенчмарком MMSpec.

Вывод на устройстве. При использовании MLX на M5 Max декодирование выполняется в 2,30–3,13 раза быстрее в зависимости от задачи. Сквозная задержка сокращается в 1,56–2,62 раза. При использовании llama.cpp на M3 Ultra декодирование ускоряется в 1,57–2,14 раза, а сквозной показатель — в 1,30–1,77 раза.

Screenshot 2026-09-24 at 15.49.03

Вывод на GPU. На H100 та же черновая модель обеспечивает декодирование в 20,4–2,66 раза быстрее, а сквозное ускорение составляет 1,64–2,27 раза.

Screenshot 2026-09-24 at 15.49.27

Ограничения спекулятивного декодирования для визуальных задач

В LLM предварительная обработка в основном ограничена вычислительными ресурсами, а её стоимость растёт (суб)квадратично относительно длины запроса. Визуально-языковые модели добавляют к этому обработку изображения: сначала оно проходит через визуальный энкодер, затем языковая основа обрабатывает сотни визуальных токенов вместе с текстовым запросом. Пограничные устройства обладают значительно меньшими вычислительными ресурсами, чем GPU в центрах обработки данных, поэтому предварительная обработка занимает большую долю сквозной задержки, что показывают измерения времени до первого токена и декодирования на Apple Silicon и H100. (Нейроускорители GPU M5 для каждого ядра сокращают этот разрыв).

Спекулятивное декодирование ускоряет только декодирование, но не кодирование изображения и предварительную обработку. Когда эти этапы уже занимают значительную часть общего времени, даже существенное ускорение декодирования даёт лишь умеренное сквозное улучшение. Это закон Амдала: общее ускорение ограничено той частью рабочей нагрузки, которая не ускоряется.

Как использовать LFM2.5-VL-DSpark

Для запуска черновых моделей DSpark с помощью SGLang требуется сборка SGLang с поддержкой DSpark для целевых моделей LFM2 (PR #40651). Запустите целевую модель с подключённой черновой:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

Затем отправьте запрос к совместимой с OpenAI конечной точке http://localhost:30000/v1. Размер блока считывается из config.json черновой модели; базовой является та же команда без трёх флагов --speculative-*.

Для запуска с помощью llama.cpp требуется соответствующая сборка llama.cpp (PR#29339).

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

Для запуска с помощью MLX-VLM требуется соответствующая сборка (PR#2280).

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

Размер блока считывается из метаданных сопутствующего файла (значение n-max ограничивается этим размером). Спекулятивное декодирование является точным: целевая модель проверяет каждый предложенный токен, поэтому жадный вывод совпадает с выводом одной целевой модели; в поле timings каждого ответа указываются draft_n / draft_n_accepted.

Начало работы

Наша визуальная черновая модель DSpark доступна на Hugging Face в форматах Safetensors и GGUF.

С LFM2.5 мы воплощаем наше видение ИИ, который работает где угодно. Эти модели:

  • С открытыми весами — скачивайте, дообучайте и разворачивайте без ограничений.
  • Быстрые с первого дня — поддержка llama.cpp, MLX и SGLang с первого дня.
  • Полное семейство — от базовых моделей для кастомизации до специализированных аудио- и визуальных вариантов: одна архитектура охватывает самые разные сценарии использования

Нам не терпится увидеть, что вы создадите.

Цитирование

Для цитирования используйте следующую ссылку или BibTeX:
Liquid AI, "LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond", Liquid AI Blog, Sep 2026.

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Модели, упомянутые в этой статье 1

Статьи, упомянутые в этой статье 2

Сообщество

Загружайте изображения, аудио и видео, перетаскивая их в текстовое поле, вставляя или нажимая здесь.
Нажмите или вставьте сюда, чтобы загрузить изображения

· Зарегистрируйтесь или войдите, чтобы оставить комментарий

Модели, упомянутые в этой статье 1

Статьи, упомянутые в этой статье 2

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием Hugging Face

Читать оригинал на Hugging Face ↗

Текст и изображения принадлежат Hugging Face и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости