Meta AI пусна Muse Spark 1.3: агентен модел за програмиране, който използва с ~20% по-малко извиквания на инструменти и ~25% по-малко токени от Muse Spark 1.2
Тази седмица Meta Superintelligence Labs представи Muse Spark 1.3. Това е четвъртото издание на Muse Spark за пет месеца, като целта е дългосрочна агентна и програмна работа, а не генериране в рамките на един ход. Акцентът в публикацията на Meta е върху използваемостта: поддържане на дълга нишка, сътрудничество с потребителя и разпознаване на моментите, в които моделът е блокирал.
Може ли да бъде внедрен? Да, но с две ограничения. Muse Spark 1.3 е достъпен днес в Muse Code и Meta Model API, така че можете да го използвате в продукционна среда още сега. Не можете да го хоствате самостоятелно, тъй като теглата са затворени, а режимът за разсъждение max все още е ограничен до допълнителни тестове за безопасност.
Какво всъщност се промени за агентите
Meta обучи Muse Spark 1.3 в множество агентни среди, така че поведението му да се обобщава отвъд една-единствена среда. Моделът е създаден да поддържа няколко работни процеса в рамките на една дълга нишка. При отворена цел той сам събира контекст от разхвърляни и противоречиви източници, след което запълва пропуските в плана си.
Промените в сътрудничеството са по-практичната част. Muse Spark 1.3 задава уточняващи въпроси при неясни заявки, включва потребителя, когато блокира, и иска потвърждение преди действия с последици. При дълги задачи той се адаптира към предпочитанията: чести актуализации на статуса или тихо изпълнение във фонов режим. Meta също така съобщава за по-добра преценка на собствените ограничения на модела, така че той посочва препятствията, вместо да халюцинира резултат.
Многозадачността също се е подобрила. Meta твърди, че моделът насочва входящата заявка към правилната задача в рамките на претрупана единствена нишка, независимо дали потребителят задава посоката или прекъсва.
Програмиране и ефективност
Muse Spark 1.3 е обучен с повече задачи за програмиране с дълъг хоризонт. В сравнение с Muse Spark 1.2 Meta описва по-малко ненужни ходове, по-малка многословност и по-чист стил на кода. При вътрешни сравнения, проведени от инженерите на Meta, моделът е използвал приблизително 20% по-малко извиквания на инструменти и приблизително 25% по-малко токени. За агентните работни натоварвания именно това се отразява на разходите: по-малко обменени заявки и по-малко таксувани токени за изпълнена задача.
Бенчмаркове
Според собствените данни на Meta Muse Spark 1.3 постига 75.4 на DeepSWE v1.1, пред Claude Opus 5 със 74.0 и GPT-5.6 Sol със 72.7. Той достига 59.4 на SWE-Atlas Codebase QnA и изравнява GPT-5.6 Sol с 88.8 на Terminal-Bench 2.1, докато Opus 5 има 86.7. Извличането от дълъг контекст показва най-голямата разлика: резултати на MRCR v2 от 98.5 (256K–512K) и 98.1 (512K–1M), спрямо 91.5 и 73.8 за GPT-5.6 Sol.
Разделението по режими има значение при агентните показатели. Meta отчита OSWorld 2.0 с 66.9 за max спрямо 57.2 за xhigh, Elo рейтинг на GDPval-AA v2 от 1,754 спрямо 1,709 и 64.9 спрямо 61.2 на JobBench. DeepSearchQA е равен — 89.4 и за двата режима. Тъй като Muse Spark 1.2 е бил оценяван в режим xhigh, част от поколенческия скок се дължи на промяната в нивото на разсъждение.
Artificial Analysis оценява достъпния вариант xhigh с 61 в своя Intelligence Index, а предварителния вариант max с 62. Това поставя xhigh на едно ниво с GPT-5.6 Sol (max) и Grok 4.6 (high), зад Claude Opus 5 (max, 63) и Claude Fable 5.1 (max, 66). Artificial Analysis също така е измерил 47% на Tau3-Bench Banking за xhigh и 52% за max — най-високия резултат, който е регистрирал в тази оценка.
Основни изводи
- Muse Spark 1.3 е достъпен в Muse Code и Meta Model API, с контекстен прозорец от 1 милион токена.
- Инженерите на Meta са измерили приблизително 20% по-малко извиквания на инструменти и приблизително 25% по-малко токени в сравнение с Muse Spark 1.2.
- Оценката на Meta при представянето използва режима
max, който не е режимът, достъпен за извикване от разработчиците днес. - Цените остават непроменени — $1.25/M за вход и $4.25/M за изход, с ниво за принос от $0.10/$0.20.
- Теглата остават затворени, макар че Meta включва пускането на Muse Spark с отворени тегла в своята пътна карта.
Вижте пълната публикация за представянето и доклада за методологията на оценяването. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ представяне на продукт ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.