Meta AI пуска Muse Glimmer: агентен модел с отворени тегла 30B, който работи на една потребителска видеокарта
Meta пусна Muse Glimmer, мултимодален модел с 30 милиарда параметъра, дистилиран от Muse Spark. Той е настроен за локални агентни работни процеси, които работят постоянно, и се разпространява под лиценза Apache 2.0. Модел с 30 милиарда параметъра обикновено се нуждае от над 55 GB памет при пълна точност. Meta го компресира до приблизително 4-битова точност, след което добавя спекулативно декодиране на блокове, така че да отговаря достатъчно бързо, за да работи в реален агентен цикъл. Резултатът работи на един потребителски графичен процесор или Mac, без мрежова връзка.
Може ли да бъде внедрен?
Да, теглата са отворени под лиценза Apache 2.0. Колекцията в Hugging Face включва BF16 тегла, GGUF k-кванти, компилации за ExecuTorch и DFlash предиктора. Самостоятелното хостване е възможно още от първия ден.
- Кои компании: Самостоятелни разработчици и стартъпи могат да го изпълняват на един графичен процесор с 24 GB или на Mac с M4/M5 Max. Средните компании получават локално изпълнение без такса за всеки токен. Регулираните предприятия получават агент, който може да работи напълно изолиран от мрежата. Meta препоръчва добавянето на системни предпазни механизми, вместо моделът да се предоставя като необработена крайна точка.
- Индустрии: Здравеопазване, право, финансови услуги, отбрана и публичен сектор, производство и теренни услуги. Това са среди, в които изискванията за локализация на данните, офлайн работа или латентност изключват облачното извикване.
- Приложения: Настолни агенти, които четат екранни снимки, агенти за програмиране и извикване на функции въз основа на схеми. Също така разбиране на документи и диаграми, генериране на синтетични данни и оценяване от типа LLM-as-a-judge.
Модел и обучение
Muse Glimmer е плътен каузален трансформатор със специализиран енкодер за възприятие. Общият брой параметри е приблизително 30 милиарда, включително визуалната кула. Вниманието с групирани заявки използва 32 глави за заявки и 2 KV глави. Вниманието повтаря модел [Локално, Локално, Локално, Глобално] с плъзгащ се прозорец от 2 048. RoPE се прилага само към локалните слоеве, с theta 500 000. Визуалната част представлява енкодер за възприятие ViT-G/14 с приблизително 1,8 милиарда параметъра, който приема до 4 096 визуални токена на изображение. Дължината на контекста е 131 072+, речникът съдържа 202 048 токена, а крайната дата на познанията е 4 януари 2026 г. Входът е текст и изображение, а изходът е текст. Аудио не се поддържа, а видеото се обработва като отделни кадри.
Обучението протече в три фази:
- Предварителното обучение използва дистилация на логитите от изходите на Muse Spark.
- При междинното обучение бяха добавени данни с по-дълъг контекст и силен акцент върху агентите, с по-богати следи на разсъждение.
- Последващото обучение комбинира контролирано донастройване с дистилация на базата на текущата политика и обучение с подсилване в общи, логически, програмни и агентни области.
Побиране на 30B върху потребителски хардуер
При пълна точност моделът се нуждае от над 55 GB памет. Meta компресира теглата до приблизително 4-битова точност, което намалява езиковия модел до под 20 GB. Това оставя свободно пространство в конфигурация с 24 GB или 32 GB. KV кешът, енкодерът за възприятие и предикторът го споделят. Предлагат се две квантизирани компилации. K-Quant-Dynamic е предназначена за 32 GB VRAM при средно влошаване от 0,2%. K-Quant-17GB е предназначена за 24 GB VRAM при 1,0%. Влошаването е осреднено по показателите за точност в 15 широко използвани бенчмарка.
Скоростта на генериране идва от DFlash, предиктор с блокова дифузия, който предсказва 16 токена с един преден проход. Основният модел проверява блока паралелно. Предикторът използва 5 слоя, внимание с плъзгащ се прозорец от 2 048 и 32 глави за заявки / 8 KV глави. Meta измерва K-Quant-17GB при размер на партидата 1 и алчно декодиране. На RTX 5090 пропускателната способност нараства от 74,9 до 233,4 токена/сек., което е 3,1-кратно ускорение. Apple M5 Max се увеличава от 26,6 до 50,2 токена/сек., а M4 Max — от 23,7 до 37,8 токена/сек.
Бенчмаркове
Meta сравнява Muse Glimmer с Gemma4-31B и Qwen3.6-27B в режим на разсъждение. Той води в MCP Atlas със 75,5 спрямо 54,2 и 62,5. Води също в DeepSearch QA със 74,6, Gaia2 с 43,3 и SWE-Bench Pro с 51,2. Резултатите при разсъждение са следните: AIME 2026 — 94,7, IFBench — 77,0, AA-LCR — 80,0. Qwen3.6-27B остава напред в OSWorld-Verified — 75,6 спрямо 65,9. Той води и в TerminalBench 2.1 с 60,7 и SWE-Bench Verified със 77,2. Моделът е последователен. Muse Glimmer печели при агентната оркестрация и разсъжденията. Изостава при използването на компютър и работата с терминал.
По отношение на безопасността процентът на успеваемост при атаките в Siren AgentDojo е 28,4, а полезността — 94,2. Meta посочва, че моделът не отговаря на дефиницията за Frontier AI в нейната рамка Advanced AI Scaling Framework. Тя оценява риска в областите химия/биология, киберсигурност и загуба на контрол като умерен или по-нисък.
Основни изводи
- Агентен модел с отворени тегла и 30 милиарда параметъра, Apache 2.0, дистилиран от Muse Spark.
- 4-битовото квантизиране го побира в 24 GB VRAM при влошаване от 1,0%.
- Спекулацията на DFlash с блокове от 16 токена осигурява 3,1-кратно ускорение на декодирането при RTX 5090.
- Побеждава и двата сравнявани модела в MCP Atlas, DeepSearch QA и SWE-Bench Pro.
- Изостава от Qwen3.6-27B в OSWorld-Verified и TerminalBench 2.1.
Разгледайте теглата на модела в HF, подробностите и блога на Meta. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Сега можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ продуктово представяне, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.