Sakhanda Wire
NVDA $223.96 +2.27% MSFT $499.99 +0.03% GOOGL $354.30 -0.96% META $592.10 +0.37% AMZN $274.48 +0.82%
← До новин

Meta Muse Glimmer переносить локальних ШІ-агентів на споживчі GPU

Meta випускає Muse Glimmer за ліцензією Apache 2.0 для локальних ШІ-агентів, які можуть працювати на споживчому графічному процесорі.

Підрозділ компанії Superintelligence Labs опублікував ваги моделі з 30 мільярдами параметрів на Hugging Face. Meta заявляє, що розробники можуть використовувати її для локального написання коду, виклику функцій, локальних агентів і оцінювання за принципом LLM-as-a-judge.

Реліз спрямований на операційне обмеження, з яким стикаються команди ШІ: моделі, розміщені у хмарі, потребують доступу до мережі та централізованої інфраструктури. Натомість Meta позиціонує Muse Glimmer для робочих навантажень, які потребують моделі на пристрої, зокрема персональних агентів із доступом до розкладів, повідомлень, файлів та іншого приватного контексту.

Meta Muse Glimmer лідирує в кількох тестах агентських завдань

Тести Meta показали, що Muse Glimmer випереджає Gemma4-31B і Qwen3.6-27B у п’яти з восьми загальних агентських тестів. Модель отримала 75,5 бала в MCP Atlas. Gemma4-31B набрала 54,2, а Qwen3.6-27B — 62,5.

DeepSearch QA демонструє схожу картину. Meta повідомляє про результат 74,6 для Muse Glimmer проти 61,7 для Gemma4-31B і 71,1 для Qwen3.6-27B. У наданому анонсі зазначено, що обидва тести оцінюють здатність агента працювати в межах каркасів і виконувати багатокрокові запити.

Модель отримала 23,5 бала в τ²-Banking. Gemma4-31B набрала 15,1. Qwen3.6-27B досягла 16,7.

Muse Glimmer також отримала 47,6 у WildClawBench, випередивши результат Gemma4-31B у 37,6 і Qwen3.6-27B у 43,2. Її результат у GAIA2 сягнув 43,3 проти 36,4 і 40,0 відповідно.

В інших агентських тестах перевагу має Qwen3.6-27B. У таблиці Meta ця модель набрала 1 141 бал у GDPval-AA проти 953 у Muse Glimmer і 811 у Gemma4-31B. Qwen3.6-27B також очолила SkillsBench with Skills із результатом 46,6, тоді як Muse Glimmer набрала 44,3.

OSWorld-Verified продемонстрував найбільший розрив у цій групі. Meta повідомляє про результат 75,6 для Qwen3.6-27B. Muse Glimmer набрала 65,9, а Gemma4-31B — 58,5.

Ці тести вимірюють результати в умовах обмежених завдань. Вони не демонструють, як поводитиметься локальний агент після підключення організацією до власних файлів, календарів, систем обміну повідомленнями або внутрішніх інструментів.

Результати в написанні коду розділилися між Muse Glimmer і Qwen

Результати Muse Glimmer у написанні коду демонструють більш вузьке порівняння. Модель очолила SWE-Bench Pro із результатом 51,2. Meta повідомляє про 36,9 для Gemma4-31B і 50,2 для Qwen3.6-27B.

SciCode продемонстрував близькі результати. Muse Glimmer набрала 43,6, незначно випередивши Gemma4-31B із результатом 43,4. Qwen3.6-27B отримала 39,8.

Qwen3.6-27B очолила ще два тести з написання коду. Вона набрала 77,2 у SWE-Bench Verified проти 76,0 у Muse Glimmer. У TerminalBench 2.1 Qwen3.6-27B отримала 60,7; Muse Glimmer набрала 51,7, а Gemma4-31B — 43,4.

Локальний агент для написання коду робить більше, ніж просто створює код. Йому потрібен каркас, який визначає, до яких репозиторіїв, терміналів, тестових середовищ і команд модель може отримати доступ. Meta заявляє, що Muse Glimmer підтримує OpenClaw та інші шаблони оркестрації агентів, а спеціальні каркаси описані в документації для розробників.

Організація, яка оцінює модель для роботи з програмним забезпеченням, має визначити доступні агенту команди й репозиторії до вимірювання успішності виконання завдань. У наданих матеріалах описано навчання повторним спробам у разі невдалих викликів інструментів. Така поведінка потребує контролю повторних спроб, особливо коли інструмент може змінювати вихідний код або викликати зовнішню систему.

У більшості мультимодальних тестів перевагу має Qwen

Muse Glimmer приймає текст і зображення, що чергуються, через спеціальний енкодер сприйняття. Meta заявляє, що така конструкція дає агентам змогу інтерпретувати знімки екрана, діаграми та документи як частину розмови.

За даними діаграми тестів, Muse Glimmer випереджає конкурентів у Charxiv Reasoning. Її результат сягнув 78,8 проти 77,7 у Gemma4-31B і 78,4 у Qwen3.6-27B.

Qwen3.6-27B очолила ScreenSpot Pro із результатом 76,1. Muse Glimmer набрала 75,4, а Gemma4-31B — 75,9. Ця сама модель очолила OmniDocBench v1.5 із результатом 77,8 проти 75,8 у Muse Glimmer і 72,5 у Gemma4-31B.

MMMU Pro продемонстрував менші відмінності. Meta вказує для Muse Glimmer результат 74. Qwen3.6-27B набрала 75, а Gemma4-31B — 73.

Ці результати важливі для команд, які розглядають агентів, що взаємодіють із візуальними інтерфейсами. Модель, здатна читати знімки екрана, може інтерпретувати побачене, однак локальне тестування все одно має охоплювати дозволи, макети екранів, формати документів і помилки, які повертають підключені інструменти.

Показники безпеки демонструють нижчий заявлений рівень успішності атак порівняно з Qwen

Meta також повідомляє про два оцінювання, пов’язані з безпекою: CI Memories і Siren AgentDojo. Для кожного тесту на діаграмі використовуються різні показники.

У CI Memories Meta вказує для Muse Glimmer рівень порушень 26,4 і показник охоплення 64,8. Gemma4-31B продемонструвала рівень порушень 12,1 за охоплення 53,0. Qwen3.6-27B отримала рівень порушень 53,4 і охоплення 66,9.

Результат у Siren AgentDojo використовує показники успішності атак і корисності. Meta наводить для Muse Glimmer рівень успішності атак 28,4 і показник корисності 94,2. Gemma4-31B отримала 25,6 за успішністю атак, а її корисність становила 90,8. Qwen3.6-27B продемонструвала результати 40,3 і 92,7.

Результати загального міркування додають контекст до заяв про агентів

Muse Glimmer очолила чотири з шести тестів загальних здібностей і міркування в порівнянні Meta. Вона набрала 77,0 у IFBench. Gemma4-31B отримала 76,0, а Qwen3.6-27B — 70,8.

Результат AIME 2026 для Muse Glimmer становив 94,7. Meta повідомляє про 89,2 для Gemma4-31B і 94,1 для Qwen3.6-27B. У AA-LCR Muse Glimmer набрала 80,0, випередивши результати 68,3 і 73,3.

Модель також очолила Beam 128K із результатом 65,1. Qwen3.6-27B набрала 63,0. Gemma4-31B отримала 58,2.

Gemma4-31B очолила GPQA Diamond із результатом 85,7. Muse Glimmer набрала 83,5, а Qwen3.6-27B — 84,2. Gemma4-31B також отримала найвищий результат у Humanity’s Last Exam, Text No Tools, — 23,6; Muse Glimmer набрала 22,0.

Жодна модель не очолює всі тести. Натомість результати Meta демонструють, що Muse Glimmer конкурує на близькому рівні з двома моделями подібного розміру в різноманітному наборі оцінювань агентських, програмувальних, візуальних, безпекових і логічних можливостей.

Обмеження пам’яті визначають дизайн локального розгортання

Meta заявляє, що повноформатна модель із 30 мільярдами параметрів потребувала б понад 55 ГБ пам’яті. Натомість Muse Glimmer використовує приблизно 4-бітове квантування ваг, зменшуючи мовну модель до менш ніж 20 ГБ.

Цей розподіл залишає пам’ять для кешу KV. Моделі також потрібен простір для енкодера сприйняття та механізму спекулятивного декодування. Meta орієнтується на обсяг пам’яті 24 або 32 ГБ для цих компонентів.

Компанія заявляє, що механізм на основі DFlash пропонує блоки токенів для паралельної перевірки основною моделлю. Meta стверджує, що це пришвидшує генерацію порівняно зі стандартним виведенням токен за токеном і зберігає ідентичну якість результату. У наданій публікації немає даних про кількість токенів за секунду, розміри запитів, енергоспоживання або результати роботи в умовах одночасного виконання.

Meta протестувала свою версію K-Quant-17GB із квантизованим механізмом DFlash на обладнанні MacBook M4-Max, MacBook M5-Max і RTX-5090. Компанія описує отриманий досвід як придатний для плавного спілкування та взаємодії з агентом у реальному часі.

Публічні ваги доступні через Hugging Face. Meta заявляє, що інтеграції з llama.cpp, MLX і ExecuTorch з’являться найближчими днями.

Дивіться також: Alibaba тестує нову бізнес-модель для відкритого ШІ Qwen

Хочете дізнатися більше про ШІ та великі дані від лідерів галузі? Відвідайте AI & Big Data Expo, що відбудеться в Амстердамі, Каліфорнії та Лондоні. Комплексний захід є частиною TechEx і проходитиме одночасно з іншими провідними технологічними заходами, зокрема Cyber Security & Cloud Expo. Натисніть тут для отримання додаткової інформації.

AI News працює на базі TechForge Media. Перегляньте інформацію про інші майбутні заходи та вебінари у сфері корпоративних технологій тут.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням AI News

Читати оригінал на AI News ↗

Текст і зображення належать AI News і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини