Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Прискорення візуально-мовних моделей за допомогою LFM2.5-VL-DSpark

Прискорення моделей «бачення—мовлення» за допомогою LFM2.5-VL-DSpark
Команда Стаття
Опубліковано 24 вересня 2026 року
Сьогодні ми випускаємо експериментальну чернеткову модель DSpark для нашої моделі «бачення—мовлення» (VLM) LFM2.5-VL-3B. Як і у випадку з нашими нещодавно випущеними чернетковими моделями LFM2.5-DSpark, вона додає шлях спекулятивного декодування, який обмінює мінімальне збільшення обсягу пам’яті на значно більше прискорення без зміни якості результатів.
  • Швидший вивід: прискорення декодування до 3,13 раза на пристрої та 2,66 раза на H100, із загальним прискоренням до 2,62 та 2,27 раза відповідно.
  • Невеликі витрати пам’яті: чернеткова модель додає 280 млн параметрів — 8,9% від цільової моделі на 3 млрд параметрів
  • Підтримка з першого дня: сумісні з LFM інтеграції DSpark для llama.cpp, MLX-VLM і SGLang

Як працює спекулятивне декодування для VLM

Чернеткова модель для обробки зображень використовує ту саму архітектуру, що й наші текстові чернеткові моделі LFM2.5-DSpark: вона отримує приховані стани цільової моделі у фіксованому наборі вибраних шарів і використовує їх для створення блоку з k токенів-кандидатів. Фрагменти зображення та текстові токени проєктуються у спільне представлення перед цими шарами, тому чернеткова модель працює з векторами прихованих станів однакової розмірності незалежно від модальності вхідних даних. Отже, алгоритм виводу не відрізняється від алгоритму текстових моделей. DSpark-Vision

Навчання та архітектура

Ми дотримуємося рецепта DSpark, використовуючи суміш даних SFT для моделей «бачення—мовлення», зосереджену на робочих навантаженнях, для яких, як ми очікуємо, використовуватиметься модель. На основі абляційних досліджень із 3, 4 і 5 шарами чернеткова модель є спрощеною моделлю на основі уваги з 4 шарами та розміром блоку 9. Ми виконали 10 епох на фінальній суміші й вимірювали прийняття після кожної з них; показник зростав із додаванням навчальних токенів, перш ніж досягти спадної віддачі. Під час виводу ми рекомендуємо розмір блоку 8 або 9 залежно від апаратного забезпечення.

Отримана чернеткова модель має приблизно 280 млн параметрів і збільшує кількість параметрів розгорнутої моделі лише на 8,9%.

Компонент LFM2.5-VL-3B
Стек декодера (4 шари) 193,0 млн
Проєкція прихованого стану 21,0 млн
Голова Маркова 65,5 млн
Нормалізації + голова впевненості 6,4 тис.
Усього 279,5 млн

Прискорення виводу на CPU та GPU

Чернеткова модель DSpark для LFM2.5-VL-3B із першого дня постачається з підтримкою llama.cpp, MLX-VLM і SGLang.

Ми вимірюємо як вивід на пристрої, так і вивід на GPU. В обох конфігураціях використовується розмір блоку DSpark 8, а оцінювання проводиться на шести різноманітних завданнях, пов’язаних із баченням, зокрема загальному VQA, текстовому VQA, створенні підписів до зображень, VQA за діаграмами, складному міркуванні та багатотуровій розмові, відповідно до бенчмарку MMSpec.

Вивід на пристрої. З MLX на M5 Max декодування залежно від завдання відбувається у 2,30–3,13 раза швидше. Наскрізна затримка покращується у 1,56–2,62 раза. З llama.cpp на M3 Ultra декодування прискорюється у 1,57–2,14 раза, а наскрізний показник — у 1,30–1,77 раза.

Screenshot 2026-09-24 at 15.49.03

Вивід на GPU. На H100 та сама чернеткова модель забезпечує декодування у 2,04–2,66 раза швидше, із наскрізним прискоренням у 1,64–2,27 раза.

Screenshot 2026-09-24 at 15.49.27

Обмеження спекулятивного декодування для завдань із баченням

У LLM етап попереднього заповнення здебільшого обмежений обчислювальними ресурсами, а його вартість зростає (суб)квадратично зі збільшенням довжини запиту. У VLM до цього додається те, що зображення спочатку проходить через візуальний енкодер, після чого мовний модуль обробляє сотні візуальних токенів разом із текстовим запитом. Граничні пристрої мають значно менші обчислювальні можливості, ніж серверні GPU, тому попереднє заповнення займає більшу частину наскрізної затримки, як показують вимірювання часу до першого токена та декодування на Apple silicon і H100. (Нейронні прискорювачі GPU M5 на рівні окремих ядер скорочують цей розрив).

Спекулятивне декодування прискорює лише декодування, але не кодування зображення чи попереднє заповнення. Коли ці етапи вже займають значну частину загального часу, навіть суттєве прискорення декодування дає лише помірний наскрізний виграш. Це закон Амдала, відповідно до якого загальне прискорення обмежується частиною робочого навантаження, яку не було прискорено.

Як використовувати LFM2.5-VL-DSpark

Для запуску чернеткових моделей DSpark за допомогою SGLang потрібна збірка SGLang із підтримкою DSpark для цілей LFM2 (PR #40651). Запустіть цільову модель із підключеною чернетковою:

python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-VL-3B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-VL-3B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --speculative-dspark-block-size 9 \
  --disable-radix-cache

Потім надсилайте запити до сумісної з OpenAI кінцевої точки за адресою http://localhost:30000/v1. Розмір блоку зчитується з config.json чернеткової моделі; базовою є та сама команда без трьох прапорців --speculative-*.

Для запуску за допомогою llama.cpp потрібна відповідна збірка llama.cpp (PR#29339).

llama-server -m models/LFM2.5-VL-3B-F16.gguf \
  --mmproj models/mmproj-LFM2.5-VL-3B-F16.gguf \
  -md LFM2.5-2.6B-DSpark-F16.gguf \
  --spec-type draft-dspark --spec-draft-n-max 8 --spec-draft-n-min 0 \
  -fa on -ngl 99 -c 8192

Для запуску за допомогою MLX-VLM потрібна відповідна збірка (PR#2280).

mlx_vlm.server --model LiquidAI/LFM2.5-VL-3B --draft-model LiquidAI/LFM2.5-VL-3B-DSpark

Розмір блоку зчитується з метаданих супровідного файлу (n-max обмежується цим значенням). Спекулятивне декодування є точним: цільова модель перевіряє кожен запропонований токен, тому жадібний результат збігається з результатом самої цільової моделі; у timings кожної відповіді вказуються draft_n / draft_n_accepted.

Початок роботи

Наша чернеткова модель DSpark для бачення доступна на Hugging Face у форматі Safetensors і форматі GGUF.

З LFM2.5 ми втілюємо наше бачення ШІ, який працює будь-де. Ці моделі:

  • Відкриті ваги — завантажуйте, донавчайте та розгортайте без обмежень.
  • Швидкі з першого дня — підтримка llama.cpp, MLX і SGLang із першого дня.
  • Повне сімейство — від базових моделей для налаштування до спеціалізованих аудіо- та візуальних варіантів: одна архітектура охоплює різноманітні сценарії використання

Ми не можемо дочекатися, щоб побачити, що ви створите.

Цитування

Для цитування використовуйте таке посилання або BibTeX:
Liquid AI, «LFM2.5-VL-DSpark: прискорення моделей “бачення—мовлення” на периферійних пристроях і не тільки», блог Liquid AI, вересень 2026 року.

@article{liquidAI2026vldspark,
  author = {Liquid AI},
  title = {LFM2.5-VL-DSpark: Accelerating vision-language models on edge and beyond},
  journal = {Liquid AI Blog},
  year = {2026},
  note = {www.liquid.ai/blog/lfm2-5-vl-dspark},
}

Моделі, згадані в цій статті 1

Статті, згадані в цій статті 2

Спільнота

Завантажуйте зображення, аудіо та відео, перетягуючи їх у текстове поле, вставляючи або натискаючи тут.
Торкніться або вставте сюди, щоб завантажити зображення

· Зареєструйтеся або увійдіть, щоб залишити коментар

Моделі, згадані в цій статті 1

Статті, згадані в цій статті 2

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням Hugging Face

Читати оригінал на Hugging Face ↗

Текст і зображення належать Hugging Face і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини