Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Ускоряване на зрително-езиковите модели с LFM2.5-VL-DSpark

Ускоряване на зрително-езиковите модели с LFM2.5-VL-DSpark
Екип Статия
Публикувана 24 септември 2026 г.
Днес пускаме експериментален DSpark чернови модел за нашия зрително-езиков модел (VLM) LFM2.5-VL-3B. Както при наскоро пуснатите ни чернови модели LFM2.5-DSpark, той добавя път за спекулативно декодиране, който заменя минимално увеличение на използваната памет за по-голямо ускорение, без да променя качеството на изхода.
  • По-бърза инференция: ускорение на декодирането до 3,13 пъти на устройство и 2,66 пъти на H100, с цялостни подобрения до 2,62 и 2,27 пъти.
  • Малка цена от гледна точка на паметта: черновият модел добавя 280 млн. параметъра, или 8,9% към целевия модел с 3 млрд. параметъра
  • Поддръжка от първия ден: DSpark интеграции, съвместими с LFM, за llama.cpp, MLX-VLM и SGLang

Как работи спекулативното декодиране при VLM

Зрителният чернови модел използва същата архитектура като текстовите ни чернови модели LFM2.5-DSpark: той извлича скритите състояния на целевия модел от фиксиран набор слоеве и ги използва за генериране на блок от k кандидат-токени. Пикселните блокове на изображенията и текстовите токени се проектират в споделено представяне преди тези слоеве, така че черновият модел работи с вектори на скритите състояния с еднаква размерност, независимо от модалността на входа. Следователно алгоритъмът за инференция е непроменен спрямо текстовите модели. DSpark-Vision

Обучение и архитектура

Следваме рецептата на DSpark със смес от данни за SFT на зрително-езикови модели, претеглена към работните натоварвания, за които очакваме моделът да се използва. Въз основа на аблации с 3, 4 и 5 слоя черновият модел е опростен чернови модел само с внимание, с 4 слоя и размер на блока 9. Проведохме 10 епохи върху финалната смес и измервахме приемането след всяка от тях, като резултатите се подобряваха с добавянето на още обучаващи токени, преди да достигнат намаляваща възвръщаемост. При инференция препоръчваме размер на блока 8 или 9 в зависимост от хардуера.

Полученият чернови модел има приблизително 280 млн. параметъра и увеличава броя на параметрите на внедрения модел само с 8,9%.

Компонент LFM2.5-VL-3B
Стек на декодера (4 слоя) 193,0 млн.
Проекция на скритото състояние 21,0 млн.
Марковска глава 65,5 млн.
Норми + глава за увереност 6,4 хил.
Общо 279,5 млн.

Ускорение на инференцията върху CPU и GPU

Черновият модел DSpark за LFM2.5-VL-3B се предлага с поддръжка от първия ден за llama.cpp, MLX-VLM и SGLang.

Измерваме както инференцията на устройство, така и инференцията върху GPU. И двете конфигурации използват размер на DSpark блока 8 и се оценяват върху шест разнообразни задачи, базирани на изображения, включително обща VQA, текстова VQA, надписване на изображения, VQA на диаграми, сложно разсъждение и многостранен разговор, в съответствие с бенчмарка MMSpec.

Инференция на устройство. С MLX на M5 Max декодирането работи от 2,30 до 3,13 пъти по-бързо в зависимост от задачата. Латентността от край до край се подобрява от 1,56 до 2,62 пъти. С llama.cpp на M3 Ultra декодирането се подобрява от 1,57 до 2,14 пъти, а от край до край — от 1,30 до 1,77 пъти.

Screenshot 2026-09-24 at 15.49.03

GPU инференция. На H100 същият чернови модел осигурява декодиране от 20,4 до 2,66 пъти по-бързо, с подобрения от край до край от 1,64 до 2,27 пъти.

Screenshot 2026-09-24 at 15.49.27

Ограничения на спекулацията при зрителни работни натоварвания

При LLM предварителното запълване е предимно ограничено от изчислителните ресурси, а цената му нараства (суб)квадратично спрямо дължината на подканата. VLM добавят още един фактор, тъй като изображението първо преминава през зрителен енкодер, след което езиковият гръбнак обработва стотици зрителни токени заедно с текстовата подкана. Периферните устройства разполагат с много по-малко изчислителна мощност от GPU в центровете за данни, така че предварителното запълване заема по-голяма част от цялостната латентност, както показват измерванията на времето до първия токен и декодирането върху Apple silicon и H100. (Невронните ускорители на GPU за всяко ядро на M5 намаляват тази разлика).

Спекулативното декодиране ускорява само декодирането, но не и кодирането на изображението или предварителното запълване. Когато тези етапи вече заемат голяма част от общото време, дори значително ускорение на декодирането води само до умерено подобрение от край до край. Това е законът на Амдал, според който цялостното ускорение е ограничено от частта на работното натоварване, която не е ускорена.

Как да използвате LFM2.5-VL-DSpark

Стартирането на черновите модели DSpark със SGLang изисква компилация на SGLang с поддръжка на DSpark за целеви модели LFM2 (PR #40651). Стартирайте целевия модел с прикачен чернови модел:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

След това направете заявка към съвместимата с OpenAI крайна точка на http://localhost:30000/v1. Размерът на блока се прочита от config.json на черновия модел; базовата конфигурация е същата команда без трите флага --speculative-*.

Стартирането им с llama.cpp изисква съответната компилация на llama.cpp (PR#29339).

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

Стартирането им с MLX-VLM изисква съответната компилация (PR#2280).

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

Размерът на блока се прочита от метаданните на страничния модел (n-max се ограничава до него). Спекулативното декодиране е точно: целевият модел проверява всеки предложен токен, така че алчният изход съвпада с този само на целевия модел; timings за всеки отговор отчитат draft_n / draft_n_accepted.

Първи стъпки

Нашият зрителен чернови модел DSpark е достъпен в Hugging Face във формат Safetensors и формати GGUF.

С LFM2.5 реализираме визията си за изкуствен интелект, който работи навсякъде. Тези модели са:

  • С отворени тегла — Изтегляйте, дообучавайте и внедрявайте без ограничения.
  • Бързи от първия ден — Поддръжка от първия ден за llama.cpp, MLX и SGLang.
  • Пълно семейство — От базови модели за персонализиране до специализирани аудио и зрителни варианти, една архитектура обхваща разнообразни случаи на употреба

Нямаме търпение да видим какво ще създадете.

Цитиране

За цитирания използвайте следната препратка или BibTeX:
Liquid AI, „LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond“, Liquid AI Blog, Sep 2026.

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Модели, споменати в тази статия 1

Научни статии, споменати в тази статия 2

Общност

Качвайте изображения, аудио и видеоклипове, като ги плъзнете в текстовото поле, поставите ги или щракнете тук.
Докоснете или поставете тук, за да качите изображения

· Регистрирайте се или влезте в профила си, за да коментирате

Модели, споменати в тази статия 1

Научни статии, споменати в тази статия 2

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от Hugging Face на

Прочетете оригинала в Hugging Face ↗

Текстът и изображенията са собственост на Hugging Face и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини