Liquid AI выпустила LFM2.5-VL-3B-DSpark: спекулятивное декодирование для зрительно-языковых моделей с ускорением до 3,13 раза
Liquid AI объявила о выпуске LFM2.5-VL-3B-DSpark — экспериментальной черновой модели для спекулятивного декодирования своей мультимодальной модели LFM2.5-VL-3B. Черновая модель добавляет около 280 млн параметров и ускоряет декодирование, не изменяя выходные данные модели. Команда Liquid AI сообщает об ускорении декодирования до 3,13 раза на Apple Silicon и до 2,66 раза на NVIDIA H100.
Можно ли её развернуть? Да. Веса уже доступны на Hugging Face в форматах Safetensors и GGUF, а с первого дня поддерживаются в SGLang, MLX-VLM и llama.cpp. Команда Liquid AI помечает выпуск как экспериментальный; он распространяется по лицензии LFM Open License v1.0, которая разрешает бесплатное коммерческое использование только компаниям с годовой выручкой менее 10 млн долларов.
Что меняет спекулятивное декодирование для VLM
Стандартная модель генерирует один токен за один проход. Спекулятивное декодирование добавляет небольшую черновую модель, которая заранее предлагает несколько токенов. Затем большая целевая модель проверяет весь блок за один проход и сохраняет согласующиеся с ней токены.
DSpark использует методику из черновых моделей DSpark для текстовых моделей Liquid AI, описанную в статье о DSpark. Черновая модель считывает скрытые состояния целевой модели из нескольких слоёв и предсказывает следующие k токенов.
Ключевой принцип конструкции: модальность не имеет значения для черновой модели. К тому времени, когда токены достигают скрытых слоёв, текст и фрагменты изображений представляют собой просто тензоры. Поэтому команда Liquid AI повторно использует тот же алгоритм вывода для своей мультимодальной модели.
Архитектура и обучение черновой модели
Черновая модель представляет собой упрощённую модель только с механизмом внимания. В результате абляционных исследований были выбраны 4 слоя и размер блока 9. Liquid AI рекомендует при выводе использовать размер блока 8 или 9 в зависимости от оборудования. На Apple Silicon используется размер 8.
| Компонент | Параметры |
|---|---|
| Стек декодера (4 слоя) | 193,0 млн |
| Проекция скрытых состояний | 21,0 млн |
| Голова Маркова | 65,5 млн |
| Нормализации + голова уверенности | 6,4 тыс. |
| Всего | 279,5 млн |
Слой эмбеддингов и LM-голова связаны с целевой моделью, поэтому черновая модель их не содержит. Liquid AI заявляет, что это увеличивает количество параметров развёрнутой модели на 8,9%. Для обучения использовались данные контролируемой тонкой настройки, охватывающие распространённые задачи компьютерного зрения и обработки языка, в течение 10 эпох. Все абляционные исследования и обучение проводились исключительно на оборудовании AMD.
Результаты бенчмарков
Оценка проводилась в соответствии с бенчмарком MMSpec по 6 типам задач: общие вопросы и ответы по изображениям, вопросы и ответы по тексту на изображениях, создание подписей к изображениям, вопросы и ответы по диаграммам, сложное рассуждение и многораундовый диалог. Во всех запусках использовались размер пакета 1, температура 0 и 16-битные веса для кодировщика изображений и основной модели. Данные собирались на платформе Pipette — общедоступной инфраструктуре Liquid AI для бенчмаркинга устройств.
| Стек | Ускорение декодирования | Сквозное ускорение | Принятые токены за проход |
|---|---|---|---|
| MLX-VLM, M5 Max MacBook Pro (блок 8) | от 2,30 до 3,13 раза | от 1,56 до 2,62 раза | от 3,24 до 4,34 |
| llama.cpp, M3 Ultra (блок 8) | от 1,57 до 2,14 раза | от 1,30 до 1,77 раза | от 3,31 до 4,50 |
| SGLang, 1x H100 80GB (блок 9) | от 2,04 до 2,66 раза | от 1,64 до 2,27 раза | от 3,46 до 4,57 |
Максимальные значения ускорения декодирования и сквозного ускорения часто относятся к разным задачам. На M5 Max ускорение декодирования в 3,13 раза получено при создании подписей к изображениям COCO, а сквозное ускорение в 2,62 раза — в MMMU-Pro.
На обеих системах Apple показатель принятия находился примерно в одном диапазоне. Liquid AI интерпретирует это как зависимость принятия от черновой модели и рабочей нагрузки, а не от среды выполнения.
При более высокой степени параллелизма DSpark сохраняла преимущество по пропускной способности на каждом измеренном уровне на одной H100 в SGLang. По мере роста параллелизма разрыв сокращается.
Качество вывода и температура
При жадном декодировании целевая модель проверяет каждый предложенный токен, поэтому вывод идентичен базовой модели. При ненулевых температурах и согласованной выборке спекулятивное декодирование сохраняет распределение выходных данных целевой модели, что доказано в работе Leviathan и соавторов.
Температура влияет на скорость. Более высокие температуры распределяют вероятность между большим числом токенов-кандидатов, поэтому черновая и целевая модели чаще расходятся. В тестах Liquid AI это снижало показатель принятия и пропускную способность.
Почему сквозной прирост меньше на периферийных устройствах
Спекулятивное декодирование ускоряет только декодирование. Кодирование изображений и предварительное заполнение выполняются с прежней скоростью. VLM должна закодировать изображение, а затем обработать сотни визуальных токенов вместе с запросом.
На периферийных устройствах с меньшей вычислительной мощностью, чем у серверных GPU, предварительное заполнение занимает большую долю задержки. Liquid AI объясняет это законом Амдала: общее ускорение ограничено частью, которая не подвергается ускорению. Это объясняет такие случаи, как TextVQA на M5 Max, где ускорение декодирования в 2,69 раза даёт сквозное ускорение лишь в 1,56 раза.
Как запустить модель
Для SGLang требуется v0.5.19 или новее. Запустите LiquidAI/LFM2.5-VL-3B с параметром --speculative-algorithm DSPARK и укажите путь к черновой модели через --speculative-draft-model-path. На Apple Silicon MLX-VLM версии 0.7.2 или новее принимает черновую модель через --draft-model. DSpark в MLX-VLM в настоящее время поддерживает только жадную выборку, поэтому установите температуру 0. Для llama.cpp используйте черновую модель GGUF вместе с целевой моделью LFM2.5-VL-3B-GGUF.
Работа по интеграции открыта в запросах на включение изменений для llama.cpp, SGLang и MLX-VLM. Ускорение квантованных моделей не входит в рамки этого выпуска.
Основные выводы
- Черновая модель с 279,5 млн параметров добавляет 8,9% параметров к LFM2.5-VL-3B.
- Декодирование выполняется до 3,13 раза быстрее на M5 Max и до 2,66 раза быстрее на H100.
- При жадном декодировании вывод идентичен; при выборке распределение сохраняется.
- Предварительное заполнение и кодирование изображений ограничивают сквозной прирост, особенно на периферийных устройствах.
- Тестирование проводилось только в 16-битном режиме; ускорение квантованных моделей пока не рассматривалось.
Ознакомьтесь с техническими подробностями. Все заслуги принадлежат исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы на Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.