Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Meta AI выпустила Muse Spark 1.3: агентную модель для программирования, которая использует примерно на 20% меньше вызовов инструментов и на 25% меньше токенов, чем Muse Spark 1.2

На этой неделе Meta Superintelligence Labs выпустила Muse Spark 1.3. Это уже четвертый релиз Muse Spark за пять месяцев, ориентированный не на генерацию в рамках одного запроса, а на агентскую работу с долгим горизонтом планирования и задачи программирования. В публикации Meta основной акцент сделан на удобстве использования: поддержании длинной цепочки взаимодействия, совместной работе с пользователем и понимании того, когда модель зашла в тупик.

Можно ли развернуть модель? Да, но с двумя ограничениями. Muse Spark 1.3 уже доступна в Muse Code и Meta Model API, поэтому сейчас ее можно вызывать в продакшене. Самостоятельно разместить ее нельзя, поскольку веса закрыты, а режим рассуждений max по-прежнему доступен только после прохождения дополнительного тестирования безопасности.

Что именно изменилось для агентов

Meta обучала Muse Spark 1.3 с использованием нескольких агентских сред, чтобы поведение модели обобщалось за пределами одной среды. Модель предназначена для ведения нескольких рабочих процессов в рамках одной длинной цепочки взаимодействия. Получив открытую цель, она самостоятельно собирает контекст из неструктурированных и противоречивых источников, а затем устраняет пробелы в своем плане.

Изменения в совместной работе имеют более практическое значение. Muse Spark 1.3 задает уточняющие вопросы при неоднозначных запросах, подключает пользователя, когда заходит в тупик, и запрашивает подтверждение перед важными действиями. В ходе длительных запусков она адаптируется к предпочтениям пользователя: может часто сообщать о статусе или выполнять задачу незаметно в фоновом режиме. Meta также сообщает о более точной оценке собственных ограничений моделью: она обозначает препятствия, а не выдумывает результат.

Многозадачность также улучшилась. По словам Meta, модель сопоставляет входящий запрос с правильной задачей внутри перегруженной единой цепочки, независимо от того, направляет ли пользователь ее работу или прерывает ее.

Программирование и эффективность

Muse Spark 1.3 обучалась на большем количестве задач программирования с длительным горизонтом планирования. По сравнению с Muse Spark 1.2 Meta отмечает меньшее количество ненужных шагов, меньшую многословность и более чистый стиль кода. Во внутренних сравнениях, проведенных инженерами Meta, модель использовала примерно на 20% меньше вызовов инструментов и примерно на 25% меньше токенов. Для агентских рабочих нагрузок именно эти показатели определяют стоимость: меньше циклов обмена данными и меньше оплачиваемых токенов на выполненную задачу.

Бенчмарки

Согласно собственным показателям Meta, Muse Spark 1.3 набрала 75,4 балла на DeepSWE v1.1, опередив Claude Opus 5 с результатом 74,0 и GPT-5.6 Sol с результатом 72,7. На SWE-Atlas Codebase QnA она набрала 59,4 балла, а на Terminal-Bench 2.1 разделила с GPT-5.6 Sol результат 88,8, тогда как Opus 5 набрала 86,7. Наиболее заметный разрыв наблюдается в извлечении данных из длинного контекста: результаты MRCR v2 составили 98,5 (256K–512K) и 98,1 (512K–1M) против 91,5 и 73,8 у GPT-5.6 Sol.

Разница между режимами имеет значение в агентских тестах. Meta сообщает о результатах OSWorld 2.0 на уровне 66,9 для max против 57,2 для xhigh, рейтинге Elo GDPval-AA v2 — 1 754 против 1 709, а также 64,9 против 61,2 на JobBench. На DeepSearchQA оба режима набрали по 89,4. Поскольку Muse Spark 1.2 оценивалась в режиме xhigh, часть скачка между поколениями объясняется изменением уровня рассуждений.

Artificial Analysis оценила доступную версию xhigh в 61 балл по своему индексу интеллекта, а предварительную версию max — в 62. Это ставит xhigh на один уровень с GPT-5.6 Sol (max) и Grok 4.6 (high), но ниже Claude Opus 5 (max, 63) и Claude Fable 5.1 (max, 66). Artificial Analysis также измерила результат Tau3-Bench Banking на уровне 47% для xhigh и 52% для max — это наивысший результат, зафиксированный ею в этой оценке.

Основные выводы

  • Muse Spark 1.3 доступна в Muse Code и Meta Model API, с контекстным окном на 1 млн токенов.
  • Инженеры Meta измерили примерно на 20% меньше вызовов инструментов и примерно на 25% меньше токенов по сравнению с Muse Spark 1.2.
  • В оценочной таблице запуска Meta используется режим max, который разработчики пока не могут вызывать.
  • Цена не изменилась и составляет $1.25 за миллион входных токенов и $4.25 за миллион выходных токенов, а для уровня contributors действует тариф $0.10/$0.20.
  • Веса остаются закрытыми, хотя Meta указывает выпуск Muse Spark с открытыми весами в своей дорожной карте.




Ознакомьтесь с полной публикацией о релизе и отчетом о методологии оценки. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Постойте! Вы в Telegram? теперь к нам можно присоединиться и в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости