Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Meta AI випустила Muse Spark 1.3: агентну модель для програмування, яка використовує приблизно на 20% менше викликів інструментів і на 25% менше токенів, ніж Muse Spark 1.2

Цього тижня Meta Superintelligence Labs випустила Muse Spark 1.3. Це четвертий реліз Muse Spark за п’ять місяців, і він орієнтований на агентну роботу та програмування з довгим горизонтом, а не на генерацію в межах одного запиту. У дописі Meta акцент зроблено на зручності використання: підтримці тривалої гілки, співпраці з користувачем і розумінні того, коли модель застрягла.

Чи можна його розгорнути? Так, але є два обмеження. Muse Spark 1.3 уже доступний у Muse Code і Meta Model API, тож його вже можна викликати у production. Самостійно розмістити його неможливо, оскільки ваги закриті, а режим міркування max усе ще обмежений і потребує додаткового тестування безпеки.

Що насправді змінилося для агентів

Meta навчала Muse Spark 1.3 у кількох агентних середовищах, щоб його поведінка узагальнювалася за межами одного середовища. Модель розроблено для підтримки кількох робочих процесів в одній довгій гілці. Отримавши відкриту за змістом мету, вона самостійно збирає контекст із неструктурованих і суперечливих джерел, а потім усуває прогалини у своєму плані.

Зміни у співпраці є практичнішою частиною оновлення. Muse Spark 1.3 ставить уточнювальні запитання щодо неоднозначних запитів, залучає користувача, коли зупиняється, і запитує підтвердження перед важливими діями. Під час тривалих запусків вона адаптується до уподобань: може часто повідомляти про стан або мовчки працювати у фоновому режимі. Meta також повідомляє про краще калібрування власних обмежень моделі, тож вона позначає перешкоди замість того, щоб вигадувати результат.

Багатозадачність також покращилася. Meta стверджує, що модель зіставляє вхідний запит із правильним завданням у захаращеній єдиній гілці, незалежно від того, чи керує користувач процесом, чи перериває його.

Програмування та ефективність

Muse Spark 1.3 навчали на більшій кількості завдань із програмування з довгим горизонтом. Порівняно з Muse Spark 1.2 Meta відзначає менше непотрібних ходів, меншу багатослівність і чистіший стиль коду. У внутрішніх порівняннях, проведених інженерами Meta, модель використовувала приблизно на 20% менше викликів інструментів і приблизно на 25% менше токенів. Для агентних робочих навантажень саме це визначає вартість: менше обмінів даними та менше оплачуваних токенів на виконане завдання.

Бенчмарки

Згідно з власними показниками Meta, Muse Spark 1.3 набирає 75.4 у DeepSWE v1.1, випереджаючи Claude Opus 5 із результатом 74.0 і GPT-5.6 Sol із 72.7. У SWE-Atlas Codebase QnA вона досягає 59.4, а в Terminal-Bench 2.1 зрівнюється з GPT-5.6 Sol із результатом 88.8; Opus 5 набирає 86.7. Найбільший розрив спостерігається в пошуку інформації в довгому контексті: результати MRCR v2 становлять 98.5 (256K–512K) і 98.1 (512K–1M), тоді як у GPT-5.6 Sol — 91.5 і 73.8.

Розподіл за режимами має значення для агентних показників. Meta повідомляє, що в OSWorld 2.0 результат становить 66.9 для max проти 57.2 для xhigh, показник GDPval-AA v2 Elo — 1,754 проти 1,709, а JobBench — 64.9 проти 61.2. У DeepSearchQA обидва режими мають однаковий результат — 89.4. Оскільки Muse Spark 1.2 оцінювали в режимі xhigh, частково стрибок між поколіннями пояснюється зміною рівня міркування.

Artificial Analysis оцінює доступний варіант xhigh у 61 бал за своїм Intelligence Index, а попередній варіант max — у 62. Це ставить xhigh на один рівень із GPT-5.6 Sol (max) і Grok 4.6 (high), позаду Claude Opus 5 (max, 63) і Claude Fable 5.1 (max, 66). Artificial Analysis також виміряла результат Tau3-Bench Banking на рівні 47% для xhigh і 52% для max — це найвищий результат, зафіксований нею в цій оцінці.

Ключові висновки

  • Muse Spark 1.3 доступний у Muse Code і Meta Model API, із контекстним вікном на 1 млн токенів.
  • Інженери Meta виміряли приблизно на 20% менше викликів інструментів і приблизно на 25% менше токенів порівняно з Muse Spark 1.2.
  • У таблиці результатів запуску Meta використовується режим max, який наразі недоступний для викликів розробниками.
  • Ціни не змінилися: $1.25 за 1 млн вхідних токенів і $4.25 за 1 млн вихідних, а для рівня contributor діють ціни $0.10/$0.20.
  • Ваги залишаються закритими, хоча Meta зазначає випуск Muse Spark із відкритими вагами у своїй дорожній карті.




Ознайомтеся з повним дописом про реліз і звітом про методологію оцінювання. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини