Meta приближается к лидерам с Muse Spark 1.3 и снижает цену по сравнению с конкурентами
Ключевые моменты
- Meta выпустила Muse Spark 1.3. Уровень xhigh уже доступен, а более мощная версия max пока работает в режиме ограниченного предварительного просмотра.
- Модель больше всего улучшилась в агентских задачах, но по-прежнему уступает лидерам вроде Claude Fable 5.1 в большинстве бенчмарков.
- При цене 0,55 доллара за задачу это сейчас самая дешёвая модель в своём классе производительности. Meta также заявляет, что готовит версию с открытыми весами.
Meta выпустила Muse Spark 1.3 — свою четвёртую модель за пять месяцев. Независимое тестирование показывает заметный прогресс в агентских задачах, но отставание от лидеров сохраняется. Главное преимущество модели — цена.
Meta выпустила Muse Spark 1.3 через Muse Code и Meta Model API. Серия стартовала в апреле, в июле последовала версия 1.1, а в августе — 1.2. Уровень xhigh уже доступен, тогда как требующий больших вычислительных ресурсов уровень max появится только после дополнительных проверок безопасности и пока работает в режиме ограниченного предварительного просмотра для партнёров, сообщает Artificial Analysis.
При неизменной цене в 1,25 и 4,25 доллара за миллион входных и выходных токенов соответственно одна задача из индекса стоит 0,55 доллара. Ни одна модель с результатом 59 баллов или выше не стоит дешевле, а конкуренты с тем же уровнем индекса стоят от 0,94 до 1,23 доллара. Muse Spark 1.3 всё же дороже версии 1.2, которая стоила 0,40 доллара.
Прогресс сосредоточен там, где индекс учитывает его сильнее всего
В Индексе интеллекта версия max набирает 62 балла, а xhigh — 61, по сравнению с 57 в августе и 53 в июле. Такой скачок объясняется тем, как индекс взвешивает свои тесты. GDPval-AA v2 составляет 20 процентов, Terminal-Bench 2.1 — 16 процентов, а τ³-Bench Banking — 14 процентов, причём наибольший прогресс Meta пришёлся именно на эти три теста.
В τ³-Banking, где агенты используют инструменты в симулированном банковском сценарии, версия max достигает 52 процентов. По данным Artificial Analysis, это первое место на данный момент и единственное безоговорочное лидерство модели. Доступная версия xhigh достигает 47 процентов, деля результат с Claude Fable 5.1 (max) и GLM-5.3-Flash, а не опережая их. Предшественница 1.2 набрала 35 процентов.
Terminal-Bench 2.1, проверяющий навыки программирования в терминале, повышается с 80 до 85 процентов у xhigh и до 86 у max, но Claude Fable 5.1 по-прежнему занимает первое место: 91,4 процента в версии max, 91,0 в xhigh и 89,9 в high. В тесте GDPval-AA v2, имеющем наибольший вес в индексе, Meta улучшает результат с 1 615 до 1 709 и 1 754 по шкале, откалиброванной по уровню экспертов-людей на отметке 1 000, на основе 220 реальных профессиональных задач. Claude Fable 5.1 (max) набирает 1 853. Своё преимущество версия max получает за счёт вычислительных ресурсов, расходуя на 62 процента больше токенов рассуждений, чем xhigh.

За пределами агентских тестов модель держится в середине рейтинга
В GPQA Diamond, где задаются научные вопросы экспертного уровня, Muse Spark повышает результат с 90 до 94 процентов. Это верхняя группа, но всё ещё ниже Gemini 3.8 Flash (high) с 95,3 и Grok 4.6 (high) с 94,9. CritPt, охватывающий исследовательскую физику, поднимается с 18 до 26 процентов, значительно отставая от GPT-5.6 Sol (max) с 32,3 и Claude Fable 5.1 (xhigh) с 31,1 процента.
Два показателя по сравнению с версией 1.2 фактически снизились. AA-LCR опустился с 83 до 79 процентов. Фактическая точность в AA-Omniscience снизилась максимум на три пункта, поскольку модель чаще отказывается отвечать, когда не уверена.
Ни Meta, ни Artificial Analysis пока не назвали цену версии max. Более крупные модели и выпуск версии с открытыми весами уже готовятся.
Новости ИИ без шумихи — отобрано людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный годовой отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.