Meta AI випустила Muse Glimmer: агентну модель із відкритими вагами 30B, що працює на одній споживчій відеокарті
Meta випустила Muse Glimmer, мультимодальну модель із 30 мільярдами параметрів, дистильовану з Muse Spark. Вона налаштована для локальних агентних робочих процесів, що працюють постійно, і поширюється за ліцензією Apache 2.0. Моделі на 30B зазвичай потрібно понад 55 ГБ пам’яті за повної точності. Meta стискає її приблизно до 4 біт, а потім додає спекулятивне декодування на рівні блоків, щоб вона відповідала достатньо швидко для роботи в реальному агентному циклі. У результаті модель працює на одному споживчому GPU або Mac без мережевого виклику.
Чи придатна вона для розгортання?
Так, ваги відкриті за ліцензією Apache 2.0. Колекція на Hugging Face містить ваги BF16, GGUF k-кванти, збірки ExecuTorch і DFlash-драфтер. Самостійне розгортання доступне від першого дня.
- Які компанії: Окремі розробники та стартапи можуть запускати її на одному GPU із 24 ГБ або Mac із чипом M4/M5 Max. Команди середнього бізнесу отримують локальний висновок без оплати за кожен токен. Регульовані підприємства отримують агента, здатного працювати в ізольованому середовищі. Meta радить додавати системні захисні механізми, а не постачати модель як необроблений endpoint.
- Галузі: Охорона здоров’я, юриспруденція, фінансові послуги, оборона та державний сектор, виробництво й польове обслуговування. Це середовища, де вимоги до локалізації даних, автономної роботи або затримки виключають хмарний виклик.
- Застосування: Десктопні агенти, які читають знімки екрана, агенти для програмування та виклик функцій на основі схем. Також розуміння документів і графіків, генерація синтетичних даних та оцінювання LLM у ролі судді.
Модель і навчання
Muse Glimmer — це щільний каузальний трансформер із виділеним енкодером сприйняття. Загальна кількість параметрів становить приблизно 30B, включно з візуальною вежею. Увага з групованими запитами використовує 32 голови запитів і 2 голови KV. У механізмі уваги повторюється шаблон [Local, Local, Local, Global] із ковзним вікном 2 048. RoPE застосовується лише до локальних шарів, із theta 500 000. Візуальна частина — це енкодер сприйняття ViT-G/14 обсягом приблизно 1,8B, який підтримує до 4 096 візуальних токенів на зображення. Довжина контексту становить 131 072+, словник — 202 048 токенів, а дата завершення навчальних даних — 4 січня 2026 року. Вхідні дані — текст і зображення; вихідні — текст. Аудіо не підтримується, а відео обробляється як окремі кадри.
Навчання проходило у три етапи:
- Під час попереднього навчання використовувалася дистиляція логітів із виходів Muse Spark.
- На етапі проміжного навчання було додано дані з довшим контекстом, орієнтовані на агентів, із більш насиченими трасуваннями міркувань.
- Післянавчання поєднувало кероване донавчання з дистиляцією на основі поточної політики та навчанням із підкріпленням у загальних, логічних, програмувальних і агентних сферах.
Розміщення моделі 30B на споживчому обладнанні
За повної точності моделі потрібно понад 55 ГБ пам’яті. Meta стискає ваги приблизно до 4-бітної точності, що зменшує обсяг мовної моделі до менш ніж 20 ГБ. Це залишає запас у межах 24 або 32 ГБ. Кеш KV, енкодер сприйняття та драфтер використовують цей самий ресурс. Доступні дві квантизовані збірки. K-Quant-Dynamic розрахована на 32 ГБ VRAM із середнім погіршенням на 0,2%. K-Quant-17GB розрахована на 24 ГБ VRAM із показником 1,0%. Погіршення усереднене за метриками точності на 15 поширених бенчмарках.
Швидкість генерації забезпечує DFlash — драфтер на основі блокової дифузії, який прогнозує 16 токенів за один прямий прохід. Основна модель перевіряє блок паралельно. Драфтер використовує 5 шарів, увагу з ковзним вікном 2 048 і 32 голови запитів / 8 голів KV. Meta виміряла K-Quant-17GB за розміру пакета 1 із жадібним декодуванням. На RTX 5090 пропускна здатність зростає з 74,9 до 233,4 токена/с — прискорення у 3,1 раза. Apple M5 Max переходить із 26,6 до 50,2 токена/с, а M4 Max — із 23,7 до 37,8 токена/с.
Бенчмарки
Meta порівнює Muse Glimmer із Gemma4-31B і Qwen3.6-27B у режимі міркування. Вона лідирує в MCP Atlas із результатом 75,5 проти 54,2 і 62,5. Також вона випереджає конкурентів у DeepSearch QA із 74,6, Gaia2 із 43,3 і SWE-Bench Pro із 51,2. Результати в завданнях на міркування такі: AIME 2026 — 94,7, IFBench — 77,0, AA-LCR — 80,0. Qwen3.6-27B зберігає перевагу в OSWorld-Verified: 75,6 проти 65,9. Вона також лідирує в TerminalBench 2.1 із 60,7 і SWE-Bench Verified із 77,2. Картина послідовна. Muse Glimmer перемагає в агентній оркестрації та міркуваннях. Вона поступається в роботі з комп’ютером і терміналом.
У сфері безпеки показник успішності атак Siren AgentDojo становить 28,4, а корисності — 94,2. Meta заявляє, що модель не відповідає визначенню Frontier AI у її Advanced AI Scaling Framework. Ризики в хімічній/біологічній сфері, кібербезпеці та втрати контролю оцінюються як помірні або нижчі.
Основні висновки
- Агентна модель із 30B відкритих ваг, Apache 2.0, дистильована з Muse Spark.
- 4-бітне квантування дає змогу розмістити її у VRAM обсягом 24 ГБ із погіршенням на 1,0%.
- Спекулятивне декодування блоками по 16 токенів за допомогою DFlash забезпечує прискорення декодування у 3,1 раза на RTX 5090.
- Перевершує обидві моделі для порівняння в MCP Atlas, DeepSearch QA та SWE-Bench Pro.
- Поступається Qwen3.6-27B в OSWorld-Verified і TerminalBench 2.1.
Перегляньте ваги моделі на HF, подробиці і блог Meta. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого субреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно стати нашим партнером для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.