Meta се приближава до върха с Muse Spark 1.3 и предлага по-ниска цена от конкурентите
Основни точки
- Meta пусна Muse Spark 1.3. Нивото xhigh е достъпно сега, докато по-мощната версия max засега се предлага като ограничен предварителен преглед.
- Моделът се подобрява най-вече при агентни задачи, но все още изостава от водещи модели като Claude Fable 5.1 в повечето бенчмаркове.
- При цена от 0,55 долара на задача това в момента е най-евтиният модел в своя клас по производителност. Meta също така казва, че предстои версия с отворени тегла.
Meta пусна Muse Spark 1.3, четвъртия си модел за пет месеца. Независими тестове показват солидни подобрения при агентните задачи, но разликата спрямо лидерите остава. Това, което продава модела, е цената.
Meta пусна Muse Spark 1.3 чрез Muse Code и Meta Model API. Серията стартира през април, като версия 1.1 последва през юли, а 1.2 — през август. Нивото xhigh е достъпно сега, докато изискващото повече изчислителни ресурси ниво max ще се появи едва след допълнителни тестове за безопасност и понастоящем се предлага като ограничен предварителен преглед за партньори, според Artificial Analysis.
При непроменена цена от 1,25 и 4,25 долара за милион входни и изходни токени една индексна задача струва 0,55 долара. Няма модел с резултат от 59 точки или повече, който да е по-евтин, а конкурентите на същото ниво в индекса струват между 0,94 и 1,23 долара. Muse Spark 1.3 все пак е по-скъп от версия 1.2, която струваше 0,40 долара.
Подобренията са концентрирани там, където индексът ги оценява
В Intelligence Index max получава 62 точки, а xhigh — 61, спрямо 57 през август и 53 през юли. Скокът се дължи на начина, по който индексът претегля тестовете си. GDPval-AA v2 носи 20 процента, Terminal-Bench 2.1 — 16 процента, а τ³-Bench Banking — 14 процента, като най-големите подобрения на Meta са именно в тези три теста.
В τ³-Banking, където агентите използват инструменти в симулиран банков сценарий, max достига 52 процента. Това е номер едно в момента, според Artificial Analysis, и е единственото безспорно лидерство на модела. Достъпното ниво xhigh достига 47 процента, изравнявайки се с Claude Fable 5.1 (max) и GLM-5.3-Flash, вместо да ги изпреварва. Предшественикът 1.2 беше на 35 процента.
Terminal-Bench 2.1, който тества програмиране в терминала, се покачва от 80 на 85 процента при xhigh и на 86 при max, но Claude Fable 5.1 все още заема първото място с 91,4 процента в своето ниво max, 91,0 при xhigh и 89,9 при high. В теста с най-голяма тежест в индекса, GDPval-AA v2, Meta подобрява резултата си от 1 615 на 1 709 и 1 754 по скала, калибрирана спрямо представянето на човешки експерти на ниво 1 000 при 220 реални професионални задачи. Claude Fable 5.1 (max) е на 1 853. Meta купува предимството на варианта max с изчислителни ресурси, изразходвайки 62 процента повече токени за разсъждение от xhigh.

Извън агентните тестове моделът остава в средата на класацията
В GPQA Diamond, който поставя научни въпроси на експертно ниво, Muse Spark се покачва от 90 на 94 процента. Това го поставя в челната група, но все още под Gemini 3.8 Flash (high) с 95,3 и Grok 4.6 (high) с 94,9. CritPt, обхващащ изследователска физика, се покачва от 18 на 26 процента — доста зад GPT-5.6 Sol (max) с 32,3 и Claude Fable 5.1 (xhigh) с 31,1 процента.
Два резултата всъщност спадат спрямо 1.2. AA-LCR се понижава от 83 на 79 процента. Фактическата точност в AA-Omniscience намалява с до три пункта, тъй като моделът по-често отказва да отговори, когато не е сигурен.
Нито Meta, нито Artificial Analysis все още са обявили цена за варианта max. По-големи модели и версия с отворени тегла предстоят.
AI новини без сензации — подбрани от хора
Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен AI бюлетин, нашия ексклузивен шест пъти годишно доклад за водещите разработки „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.