Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Liquid AI випустила LFM2.5-VL-3B-DSpark: спекулятивне декодування для візуально-мовних моделей із прискоренням до 3,13 раза

Liquid AI оголосила про LFM2.5-VL-3B-DSpark, експериментальну чернеткову модель для спекулятивного декодування її моделі бачення й мови LFM2.5-VL-3B. Чернеткова модель додає близько 280 млн параметрів і прискорює декодування без зміни вихідних даних моделі. Команда Liquid AI повідомляє про прискорення декодування до 3,13 раза на Apple silicon і до 2,66 раза на NVIDIA H100.

Чи придатна вона для розгортання? Так. Ваги доступні на Hugging Face у форматах Safetensors і GGUF, із підтримкою з першого дня в SGLang, MLX-VLM і llama.cpp. Команда Liquid AI називає реліз експериментальним; він поширюється за умовами LFM Open License v1.0, яка дозволяє безкоштовне комерційне використання лише компаніям із річним доходом менше ніж 10 млн доларів.

Що змінює спекулятивне декодування для VLM

Стандартна модель генерує один токен за один прямий прохід. Спекулятивне декодування додає невелику чернеткову модель, яка заздалегідь пропонує кілька токенів. Потім велика цільова модель перевіряє весь блок за один прохід і зберігає токени, з якими вона погоджується.

DSpark використовує підхід із чернеткових моделей DSpark для текстових моделей Liquid AI, описаний у статті про DSpark. Чернеткова модель зчитує приховані стани цільової моделі з кількох шарів і прогнозує наступні k токенів.

Ключовий принцип конструкції: модальність не має значення для чернеткової моделі. Коли токени досягають прихованих шарів, текст і фрагменти зображення є просто тензорами. Тому команда Liquid AI повторно використовує абсолютно той самий алгоритм інференсу для своєї моделі бачення й мови.

Архітектура та навчання чернеткової моделі

Чернеткова модель є спрощеною моделлю, що використовує лише механізм уваги. У результаті абляцій було обрано 4 шари та розмір блока 9. Liquid AI рекомендує використовувати під час інференсу розмір блока 8 або 9 залежно від апаратного забезпечення. На Apple silicon використовується розмір 8.

КомпонентПараметри
Стек декодера (4 шари)193,0 млн
Проєкція прихованого стану21,0 млн
Голова Маркова65,5 млн
Нормалізації + голова впевненості6,4 тис.
Усього279,5 млн

Вбудовування та голова LM пов’язані з цільовою моделлю, тому чернеткова модель не містить їх. Liquid AI зазначає, що це збільшує кількість параметрів розгорнутої моделі на 8,9%. Для навчання протягом 10 епох використовувалися дані контрольованого донавчання, що охоплювали поширені завдання бачення й мови. Усі абляційні дослідження та навчання проводилися виключно на обладнанні AMD.

Результати бенчмарків

Оцінювання проводилося відповідно до бенчмарку MMSpec за 6 типами завдань: загальні VQA, Text VQA, створення підписів до зображень, Chart VQA, складне міркування та багатотурова розмова. Усі запуски використовували розмір пакета 1, температуру 0 і 16-бітні ваги для енкодера зображень та основної моделі. Дані збиралися на платформі Pipette — загальнодоступній інфраструктурі Liquid AI для бенчмаркінгу пристроїв.

СтекПрискорення декодуванняПрискорення від початку до кінцяПрийнятих токенів за прохід
MLX-VLM, M5 Max MacBook Pro (блок 8)від 2,30 до 3,13 разавід 1,56 до 2,62 разавід 3,24 до 4,34
llama.cpp, M3 Ultra (блок 8)від 1,57 до 2,14 разавід 1,30 до 1,77 разавід 3,31 до 4,50
SGLang, 1x H100 80GB (блок 9)від 2,04 до 2,66 разавід 1,64 до 2,27 разавід 3,46 до 4,57

Максимальні показники прискорення декодування та роботи від початку до кінця часто отримані на різних завданнях. На M5 Max прискорення декодування у 3,13 раза зафіксували під час створення підписів до зображень COCO, тоді як прискорення від початку до кінця у 2,62 раза — на MMMU-Pro.

На обох стеках Apple рівень прийняття був подібним. Liquid AI вважає, що прийняття залежить від чернеткової моделі та робочого навантаження, а не від середовища виконання.

За вищої паралельності DSpark зберігав перевагу в пропускній здатності на кожному виміряному рівні на одній H100 у SGLang. Із зростанням паралельності розрив звужується.

Якість вихідних даних і температура

За жадібного декодування цільова модель перевіряє кожен запропонований токен, тому вихідні дані ідентичні базовій моделі. За ненульових температур із узгодженим семплюванням спекулятивне декодування зберігає розподіл вихідних даних цільової моделі, як довели Leviathan та ін.

Температура впливає на швидкість. Вищі температури розподіляють імовірність між більшою кількістю кандидатних токенів, тому чернеткова та цільова моделі частіше не погоджуються. У тестах Liquid AI це знижувало рівень прийняття та пропускну здатність.

Чому приріст показників від початку до кінця менший на периферійних пристроях

Спекулятивне декодування прискорює лише декодування. Кодування зображення та попереднє заповнення виконуються з тією самою швидкістю. VLM має закодувати зображення, а потім обробити сотні візуальних токенів разом із запитом.

На периферійних пристроях із меншою обчислювальною потужністю, ніж у серверних GPU, попереднє заповнення займає більшу частку затримки. Liquid AI пояснює це законом Амдала: загальне прискорення обмежене частиною, яка не була прискорена. Це пояснює такі випадки, як TextVQA на M5 Max, де декодування, прискорене у 2,69 раза, дає приріст від початку до кінця лише у 1,56 раза.

Як запустити модель

SGLang потребує версії v0.5.19 або новішої. Запустіть LiquidAI/LFM2.5-VL-3B із параметром --speculative-algorithm DSPARK і вкажіть шлях до чернеткової моделі через --speculative-draft-model-path. На Apple silicon MLX-VLM версії 0.7.2 або новішої приймає чернеткову модель через --draft-model. DSpark у MLX-VLM наразі підтримує лише жадібне семплювання, тому встановіть температуру 0. Для llama.cpp використовуйте чернеткову модель GGUF разом із цільовою моделлю LFM2.5-VL-3B-GGUF.

Робота над інтеграцією доступна публічно в запитах на внесення змін для llama.cpp, SGLang і MLX-VLM. Прискорення квантизованих моделей не входить до сфери цього релізу.

Основні висновки

  • Чернеткова модель на 279,5 млн параметрів додає 8,9% параметрів до LFM2.5-VL-3B.
  • Декодування працює до 3,13 раза швидше на M5 Max і до 2,66 раза — на H100.
  • За жадібного декодування вихідні дані ідентичні; під час семплювання розподіл зберігається.
  • Попереднє заповнення та кодування зображень обмежують приріст показників від початку до кінця, особливо на периферійних пристроях.
  • Тестування проводилося лише з 16-бітними вагами; прискорення квантизованих моделей поки не охоплено.

Ознайомтеся з технічними деталями. Усі заслуги належать досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібна допомога в просуванні вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини