Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Meta AI пусна Muse Spark 1.3: агентен модел за програмиране, който използва с ~20% по-малко извиквания на инструменти и ~25% по-малко токени от Muse Spark 1.2

Тази седмица Meta Superintelligence Labs представи Muse Spark 1.3. Това е четвъртото издание на Muse Spark за пет месеца, като целта е дългосрочна агентна и програмна работа, а не генериране в рамките на един ход. Акцентът в публикацията на Meta е върху използваемостта: поддържане на дълга нишка, сътрудничество с потребителя и разпознаване на моментите, в които моделът е блокирал.

Може ли да бъде внедрен? Да, но с две ограничения. Muse Spark 1.3 е достъпен днес в Muse Code и Meta Model API, така че можете да го използвате в продукционна среда още сега. Не можете да го хоствате самостоятелно, тъй като теглата са затворени, а режимът за разсъждение max все още е ограничен до допълнителни тестове за безопасност.

Какво всъщност се промени за агентите

Meta обучи Muse Spark 1.3 в множество агентни среди, така че поведението му да се обобщава отвъд една-единствена среда. Моделът е създаден да поддържа няколко работни процеса в рамките на една дълга нишка. При отворена цел той сам събира контекст от разхвърляни и противоречиви източници, след което запълва пропуските в плана си.

Промените в сътрудничеството са по-практичната част. Muse Spark 1.3 задава уточняващи въпроси при неясни заявки, включва потребителя, когато блокира, и иска потвърждение преди действия с последици. При дълги задачи той се адаптира към предпочитанията: чести актуализации на статуса или тихо изпълнение във фонов режим. Meta също така съобщава за по-добра преценка на собствените ограничения на модела, така че той посочва препятствията, вместо да халюцинира резултат.

Многозадачността също се е подобрила. Meta твърди, че моделът насочва входящата заявка към правилната задача в рамките на претрупана единствена нишка, независимо дали потребителят задава посоката или прекъсва.

Програмиране и ефективност

Muse Spark 1.3 е обучен с повече задачи за програмиране с дълъг хоризонт. В сравнение с Muse Spark 1.2 Meta описва по-малко ненужни ходове, по-малка многословност и по-чист стил на кода. При вътрешни сравнения, проведени от инженерите на Meta, моделът е използвал приблизително 20% по-малко извиквания на инструменти и приблизително 25% по-малко токени. За агентните работни натоварвания именно това се отразява на разходите: по-малко обменени заявки и по-малко таксувани токени за изпълнена задача.

Бенчмаркове

Според собствените данни на Meta Muse Spark 1.3 постига 75.4 на DeepSWE v1.1, пред Claude Opus 5 със 74.0 и GPT-5.6 Sol със 72.7. Той достига 59.4 на SWE-Atlas Codebase QnA и изравнява GPT-5.6 Sol с 88.8 на Terminal-Bench 2.1, докато Opus 5 има 86.7. Извличането от дълъг контекст показва най-голямата разлика: резултати на MRCR v2 от 98.5 (256K–512K) и 98.1 (512K–1M), спрямо 91.5 и 73.8 за GPT-5.6 Sol.

Разделението по режими има значение при агентните показатели. Meta отчита OSWorld 2.0 с 66.9 за max спрямо 57.2 за xhigh, Elo рейтинг на GDPval-AA v2 от 1,754 спрямо 1,709 и 64.9 спрямо 61.2 на JobBench. DeepSearchQA е равен — 89.4 и за двата режима. Тъй като Muse Spark 1.2 е бил оценяван в режим xhigh, част от поколенческия скок се дължи на промяната в нивото на разсъждение.

Artificial Analysis оценява достъпния вариант xhigh с 61 в своя Intelligence Index, а предварителния вариант max с 62. Това поставя xhigh на едно ниво с GPT-5.6 Sol (max) и Grok 4.6 (high), зад Claude Opus 5 (max, 63) и Claude Fable 5.1 (max, 66). Artificial Analysis също така е измерил 47% на Tau3-Bench Banking за xhigh и 52% за max — най-високия резултат, който е регистрирал в тази оценка.

Основни изводи

  • Muse Spark 1.3 е достъпен в Muse Code и Meta Model API, с контекстен прозорец от 1 милион токена.
  • Инженерите на Meta са измерили приблизително 20% по-малко извиквания на инструменти и приблизително 25% по-малко токени в сравнение с Muse Spark 1.2.
  • Оценката на Meta при представянето използва режима max, който не е режимът, достъпен за извикване от разработчиците днес.
  • Цените остават непроменени — $1.25/M за вход и $4.25/M за изход, с ниво за принос от $0.10/$0.20.
  • Теглата остават затворени, макар че Meta включва пускането на Muse Spark с отворени тегла в своята пътна карта.




Вижте пълната публикация за представянето и доклада за методологията на оценяването. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини