Meta AI выпустила Muse Spark 1.3: агентную модель для программирования, которая использует примерно на 20% меньше вызовов инструментов и на 25% меньше токенов, чем Muse Spark 1.2
На этой неделе Meta Superintelligence Labs выпустила Muse Spark 1.3. Это уже четвертый релиз Muse Spark за пять месяцев, ориентированный не на генерацию в рамках одного запроса, а на агентскую работу с долгим горизонтом планирования и задачи программирования. В публикации Meta основной акцент сделан на удобстве использования: поддержании длинной цепочки взаимодействия, совместной работе с пользователем и понимании того, когда модель зашла в тупик.
Можно ли развернуть модель? Да, но с двумя ограничениями. Muse Spark 1.3 уже доступна в Muse Code и Meta Model API, поэтому сейчас ее можно вызывать в продакшене. Самостоятельно разместить ее нельзя, поскольку веса закрыты, а режим рассуждений max по-прежнему доступен только после прохождения дополнительного тестирования безопасности.
Что именно изменилось для агентов
Meta обучала Muse Spark 1.3 с использованием нескольких агентских сред, чтобы поведение модели обобщалось за пределами одной среды. Модель предназначена для ведения нескольких рабочих процессов в рамках одной длинной цепочки взаимодействия. Получив открытую цель, она самостоятельно собирает контекст из неструктурированных и противоречивых источников, а затем устраняет пробелы в своем плане.
Изменения в совместной работе имеют более практическое значение. Muse Spark 1.3 задает уточняющие вопросы при неоднозначных запросах, подключает пользователя, когда заходит в тупик, и запрашивает подтверждение перед важными действиями. В ходе длительных запусков она адаптируется к предпочтениям пользователя: может часто сообщать о статусе или выполнять задачу незаметно в фоновом режиме. Meta также сообщает о более точной оценке собственных ограничений моделью: она обозначает препятствия, а не выдумывает результат.
Многозадачность также улучшилась. По словам Meta, модель сопоставляет входящий запрос с правильной задачей внутри перегруженной единой цепочки, независимо от того, направляет ли пользователь ее работу или прерывает ее.
Программирование и эффективность
Muse Spark 1.3 обучалась на большем количестве задач программирования с длительным горизонтом планирования. По сравнению с Muse Spark 1.2 Meta отмечает меньшее количество ненужных шагов, меньшую многословность и более чистый стиль кода. Во внутренних сравнениях, проведенных инженерами Meta, модель использовала примерно на 20% меньше вызовов инструментов и примерно на 25% меньше токенов. Для агентских рабочих нагрузок именно эти показатели определяют стоимость: меньше циклов обмена данными и меньше оплачиваемых токенов на выполненную задачу.
Бенчмарки
Согласно собственным показателям Meta, Muse Spark 1.3 набрала 75,4 балла на DeepSWE v1.1, опередив Claude Opus 5 с результатом 74,0 и GPT-5.6 Sol с результатом 72,7. На SWE-Atlas Codebase QnA она набрала 59,4 балла, а на Terminal-Bench 2.1 разделила с GPT-5.6 Sol результат 88,8, тогда как Opus 5 набрала 86,7. Наиболее заметный разрыв наблюдается в извлечении данных из длинного контекста: результаты MRCR v2 составили 98,5 (256K–512K) и 98,1 (512K–1M) против 91,5 и 73,8 у GPT-5.6 Sol.
Разница между режимами имеет значение в агентских тестах. Meta сообщает о результатах OSWorld 2.0 на уровне 66,9 для max против 57,2 для xhigh, рейтинге Elo GDPval-AA v2 — 1 754 против 1 709, а также 64,9 против 61,2 на JobBench. На DeepSearchQA оба режима набрали по 89,4. Поскольку Muse Spark 1.2 оценивалась в режиме xhigh, часть скачка между поколениями объясняется изменением уровня рассуждений.
Artificial Analysis оценила доступную версию xhigh в 61 балл по своему индексу интеллекта, а предварительную версию max — в 62. Это ставит xhigh на один уровень с GPT-5.6 Sol (max) и Grok 4.6 (high), но ниже Claude Opus 5 (max, 63) и Claude Fable 5.1 (max, 66). Artificial Analysis также измерила результат Tau3-Bench Banking на уровне 47% для xhigh и 52% для max — это наивысший результат, зафиксированный ею в этой оценке.
Основные выводы
- Muse Spark 1.3 доступна в Muse Code и Meta Model API, с контекстным окном на 1 млн токенов.
- Инженеры Meta измерили примерно на 20% меньше вызовов инструментов и примерно на 25% меньше токенов по сравнению с Muse Spark 1.2.
- В оценочной таблице запуска Meta используется режим
max, который разработчики пока не могут вызывать. - Цена не изменилась и составляет $1.25 за миллион входных токенов и $4.25 за миллион выходных токенов, а для уровня contributors действует тариф $0.10/$0.20.
- Веса остаются закрытыми, хотя Meta указывает выпуск Muse Spark с открытыми весами в своей дорожной карте.
Ознакомьтесь с полной публикацией о релизе и отчетом о методологии оценки. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы в Telegram? теперь к нам можно присоединиться и в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.