Meta AI выпустила Muse Glimmer: агентную модель с открытыми весами 30B, работающую на одной пользовательской видеокарте
Meta выпустила Muse Glimmer — мультимодальную модель с 30 миллиардами параметров, дистиллированную из Muse Spark. Она оптимизирована для постоянно работающих локальных агентных процессов и распространяется под лицензией Apache 2.0. Модели 30B обычно требуется более 55 ГБ памяти при полной точности. Meta сжимает её примерно до 4-битного представления, а затем добавляет спекулятивное декодирование на уровне блоков, чтобы модель отвечала достаточно быстро для работы внутри реального агентного цикла. В результате она работает на одном потребительском GPU или Mac без сетевых запросов.
Можно ли её развернуть?
Да, веса открыты под лицензией Apache 2.0. В коллекции на Hugging Face доступны веса BF16, GGUF k-quants, сборки ExecuTorch и DFlash drafter. Самостоятельный хостинг доступен с первого дня.
- Для каких компаний: отдельные разработчики и стартапы могут запускать её на одном GPU с 24 ГБ памяти или Mac с M4/M5 Max. Команды среднего бизнеса получают локальный инференс без оплаты за каждый токен. Регулируемые предприятия — агентную систему, работающую в полностью изолированной среде. Meta рекомендует добавлять системные ограничения безопасности, а не предоставлять модель как необработанную конечную точку.
- Отрасли: здравоохранение, юриспруденция, финансовые услуги, оборонный и государственный секторы, производство и выездное обслуживание. Это сферы, где требования к локализации данных, автономной работе или задержке исключают облачные запросы.
- Применения: настольные агенты, которые анализируют скриншоты, агенты для программирования и вызов функций на основе схем. Также понимание документов и графиков, генерация синтетических данных и оценка по принципу LLM-as-a-judge.
Модель и обучение
Muse Glimmer — это плотный каузальный трансформер с отдельным энкодером восприятия. Общее количество параметров составляет примерно 30B, включая зрительный модуль. Внимание с группированными запросами использует 32 головы запросов и 2 головы KV. В механизме внимания повторяется шаблон [Local, Local, Local, Global] с окном скользящего внимания размером 2 048. RoPE применяется только к локальным слоям, с theta 500 000. Зрительная часть представляет собой энкодер восприятия ViT-G/14 примерно с 1,8B параметров, принимающий до 4 096 визуальных токенов на изображение. Длина контекста составляет 131 072 и более, словарь — 202 048 токенов, а дата отсечения знаний — 4 января 2026 года. На вход подаются текст и изображение, на выходе получается текст. Аудио не поддерживается, а видео обрабатывается как отдельные кадры.
Обучение проходило в три этапа:
- Предварительное обучение использовало дистилляцию логитов на выходах Muse Spark.
- На этапе промежуточного обучения были добавлены данные с более длинным контекстом и большим количеством агентных задач, а также более подробными цепочками рассуждений.
- На этапе постобучения контролируемая тонкая настройка сочеталась с дистилляцией на основе текущей политики и обучением с подкреплением в общих, логических, программных и агентных областях.
Размещение модели 30B на потребительском оборудовании
При полной точности модели требуется более 55 ГБ памяти. Meta сжимает веса примерно до 4-битной точности, что позволяет уменьшить объём языковой модели до менее чем 20 ГБ. Это оставляет запас в пределах 24 или 32 ГБ. Кэш KV, энкодер восприятия и drafter используют общую память. Доступны две квантованные сборки. K-Quant-Dynamic рассчитана на 32 ГБ видеопамяти при среднем снижении качества на 0,2%. K-Quant-17GB рассчитана на 24 ГБ видеопамяти при снижении на 1,0%. Снижение усреднено по метрикам точности на 15 распространённых бенчмарках.
Скорость генерации обеспечивается технологией DFlash — drafter на основе блочной диффузии, который предсказывает 16 токенов за один прямой проход. Основная модель параллельно проверяет блок. Drafter использует 5 слоёв, скользящее внимание с окном 2 048 и 32 головы запросов / 8 голов KV. Meta измерила показатели K-Quant-17GB при размере пакета 1 и жадном декодировании. На RTX 5090 пропускная способность возрастает с 74,9 до 233,4 токена/с — ускорение в 3,1 раза. На Apple M5 Max показатель увеличивается с 26,6 до 50,2 токена/с, а на M4 Max — с 23,7 до 37,8 токена/с.
Бенчмарки
Meta сравнивает Muse Glimmer с Gemma4-31B и Qwen3.6-27B в режиме рассуждений. Она лидирует в MCP Atlas с результатом 75,5 против 54,2 и 62,5. Также модель опережает конкурентов в DeepSearch QA с результатом 74,6, Gaia2 — 43,3 и SWE-Bench Pro — 51,2. Результаты по рассуждениям следующие: AIME 2026 — 94,7, IFBench — 77,0, AA-LCR — 80,0. Qwen3.6-27B сохраняет лидерство в OSWorld-Verified: 75,6 против 65,9. Она также лидирует в TerminalBench 2.1 с результатом 60,7 и SWE-Bench Verified — 77,2. Картина последовательна. Muse Glimmer превосходит конкурентов в агентной оркестрации и рассуждениях, но уступает в задачах компьютерного управления и работы с терминалом.
В области безопасности показатель успешности атак Siren AgentDojo составляет 28,4, а полезности — 94,2. Meta заявляет, что модель не соответствует определению Frontier AI в своей Advanced AI Scaling Framework. Риски в химической и биологической сферах, кибербезопасности и потери контроля оцениваются как умеренные или более низкие.
Ключевые выводы
- Агентная модель с открытыми весами и 30B параметров, Apache 2.0, дистиллированная из Muse Spark.
- 4-битное квантование позволяет разместить её в 24 ГБ видеопамяти при снижении качества на 1,0%.
- Блочная спекуляция DFlash на 16 токенов обеспечивает ускорение декодирования в 3,1 раза на RTX 5090.
- Превосходит обе сравниваемые модели в MCP Atlas, DeepSearch QA и SWE-Bench Pro.
- Уступает Qwen3.6-27B в OSWorld-Verified и TerminalBench 2.1.
Ознакомьтесь с весами модели на HF, подробностями и блогом Meta. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.