Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Liquid AI випускає моделі-чернетки LFM2.5-DSpark, які забезпечують до 3,18 раза швидше декодування без зміни вихідних даних моделі

Liquid AI випустила чекпоїнти чернеткових моделей DSpark для трьох моделей із сімейства LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B і LFM2.5-8B-A1B. Кожен драфтер додає шлях спекулятивного декодування до наявної цільової моделі. Чернетка приблизно на 300 млн параметрів пропонує блок із дев’яти кандидатів на токени, а цільова модель перевіряє весь блок за один прямий прохід. Компроміс полягає в невеликому збільшенні використання пам’яті заради значного прискорення декодування: до 3.18x на H100 і до 2.87x на MacBook Pro з M4 Max. Результат не змінюється. За жадібного декодування послідовність, що генерується, ідентична послідовності цільової моделі, яка працює самостійно, тому точність на бенчмарках не змінюється. І llama.cpp, і SGLang мають підтримку з першого дня.

Чи придатне це до розгортання?

Так, якщо ви розгортаєте систему самостійно. Ваги постачаються у форматах Safetensors і GGUF, а чекпоїнти драфтерів наразі не обслуговуються жодним провайдером хостованого інференсу на Hugging Face. Для їх запуску потрібна збірка SGLang або llama.cpp із підтримкою DSpark для цільових моделей LFM2.

  • Рівень компанії: LFM Open License v1.0 дозволяє безкоштовне комерційне використання лише за умови, що річний дохід вашої організації не перевищує $10 млн. На інді-розробників, стартапи та малий і середній бізнес ліцензія поширюється; більші підприємства мають спочатку зв’язатися з Liquid AI для отримання комерційної ліцензії.
  • Галузі: інструменти для розробників, споживчі застосунки, що працюють локально, робототехніка та вбудовані системи, а також робочі навантаження у сфері охорони здоров’я, фінансів і оборони, які зберігають дані локально або на пристрої.
  • Застосування: локальні помічники для програмування, агенти на пристрої, які виконують міркування перед кожним викликом інструмента, чати для одного користувача з розміром пакета 1 і офлайнкопілоти на апаратному забезпеченні рівня ноутбука.

Що таке драфтери?

Спекулятивне декодування використовує малу модель для пропонування токенів, які перевіряє більша модель. Кожен драфтер LFM2.5 має приблизно 300 млн параметрів: 295.7 млн для цільової моделі 1.2B-Instruct і 327.7 млн для цільових моделей 2.6B та 8B-A1B. Основу становлять 5 шарів із повною увагою, hidden_size=2048, intermediate_size=6144, GQA із 32 головами та 8 KV-головами, а також розмір блока 9. Драфтер не містить ваг словника; під час завантаження embedding і LM head прив’язуються до цільової моделі. Репозиторій драфтера 2.6B займає 655 МБ у BF16 — саме стільки пам’яті ви фактично додаєте.

DSpark поєднує три компоненти. Паралельна основа в стилі DFlash, обумовлена контекстними ознаками цільової моделі, за один прямий прохід створює приховані стани для всіх чернеткових токенів. Легковагова послідовна голова, змодельована як ланцюг Маркова між сусідніми токенами на ранзі 256, відновлює залежність між токенами та підвищує рівень прийняття на пізніших позиціях блока. Верифікатор із плануванням за рівнем впевненості передбачає ймовірність збереження кожного токена та відсікає суфікси з низькою впевненістю, коли перевірка коштувала б більше, ніж заощаджує.

Виміряні результати

Liquid AI повідомляє про пропускну здатність на 1xH100 у BF16 через SGLang, а також на MacBook Pro з M4 Max через llama.cpp із Metal і вагами FP16 GGUF. В обох випадках використовувалися розмір блока 9, розмір пакета 1 і температура 0 на наборах MATH500, HumanEval, MBPP, GSM8K та MT-Bench.

Цільова модельСереднє на H100Найкращий результат на H100Середнє на M4 MaxНайкращий результат на M4 Max
LFM2.5-1.2B-Instruct2.10x (656 → 1384 ток./с)2.56x на MATH5002.54x (138 → 350 ток./с)2.87x на HumanEval (136 → 389)
LFM2.5-2.6B2.67x (323 → 864 ток./с)3.06x на MATH5002.27x (61 → 139 ток./с)2.63x на HumanEval
LFM2.5-8B-A1B2.54x (418 → 1074 ток./с)3.18x на MATH500 (428 → 1362)1.18x (90 → 106 ток./с)1.44x на GSM8K

Прискорення відповідає рівню прийняття, який, своєю чергою, залежить від передбачуваності результату. LFM2.5-8B-A1B приймає 8.27 із 10 токенів за крок на MATH500 і лише 4.02 на GSM8K, тому та сама модель на тому самому GPU демонструє результат від 3.18x до 1.29x. Для моделі 1.2B рівень прийняття на MT-Bench знижується до 3.90, а приріст на H100 падає до 1.66x.

Результат MoE на кремнії Apple є найочевиднішим застереженням: LFM2.5-8B-A1B у середньому отримує лише 1.18x на M4 Max. Liquid AI пояснює це поточною реалізацією MoE у бекенді Metal для llama.cpp, а також тим, що перевірка k токенів активує більше експертів і, відповідно, потребує більшого переміщення ваг, ніж один крок декодування.

Агентний сценарій

Найбільший виграш спостерігається там, де користувач очікує завершення міркувань перед кожним викликом інструмента. У сценаріях із викликом кількох інструментів Liquid AI повідомляє, що DSpark у середньому скорочує затримку на 57% для LFM2.5-2.6B. Перевірте це на власних трасуваннях: агент, який планує, викликає інструменти та повторно планує, кілька разів за один запит користувача сплачує вартість декодування.

У SGLang запустіть цільову модель із підключеним драфтером:

Копіювати кодСкопійованоВикористати інший браузер
python -m sglang.launch_server \
  --model-path LiquidAI/LFM2.5-2.6B \
  --speculative-algorithm DSPARK \
  --speculative-draft-model-path LiquidAI/LFM2.5-2.6B-DSpark \
  --speculative-draft-attention-backend flashinfer \
  --disable-radix-cache --mem-fraction-static 0.75 --port 30000

Розмір блока зчитується з config.json драфтера, а базовим варіантом є та сама команда без трьох прапорців --speculative-*.

Основні висновки

  • Драфтери DSpark додають приблизно 300 млн параметрів і забезпечують до 3.18x швидше декодування на H100.
  • Результат жадібного декодування ідентичний базовому, тому точність на бенчмарках не змінюється.
  • Прискорення залежить від рівня прийняття та змінюється залежно від робочого навантаження — від 1.04x до 3.18x.
  • MoE на пристрої є слабким місцем: LFM2.5-8B-A1B отримує лише 1.18x на M4 Max.
  • Виклик кількох інструментів дає найбільший практичний виграш: затримка для LFM2.5-2.6B зменшується на 57%.

Ознайомтеся з карткою моделі 8B-A1B і повним технічним описом. Уся заслуга за це дослідження належить дослідникам цього проєкту.

Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тис.+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.

Хочете стати нашим партнером для просування вашого репозиторію GitHub, сторінки на Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини