Claude Sonnet 5.5 на Anthropic почти достига Opus 5.5 в бенчмарковете, като струва до 30% по-малко за задача
Основни точки
- Anthropic пусна Claude Sonnet 5.5, който генерира резултати с над 30 процента по-висока скорост и намалява разходите за задача с до 30 процента чрез по-ефективно използване на токени.
- Sonnet 5.5 показва значителни подобрения при тестовете за програмиране и работа със знания, като в някои тестове почти се изравнява с Opus 5.5 от най-висок клас, но на част от цената.
- Моделът вече е достъпен в AWS, Google Cloud и Azure. Anthropic е добавила нови защити срещу рискове за киберсигурността и атаки за дистилация.
Anthropic пусна Claude Sonnet 5.5, втория модел от семейството Claude 5.5. Той генерира резултати с над 30 процента по-висока скорост, струва до 30 процента по-малко на задача и почти се изравнява с Opus 5.5 в няколко бенчмарка.
Opus 5.5 е създаден за сложни задачи, изискващи внимателна преценка. Sonnet 5.5 е насочен към добре дефинирана ежедневна работа като отстраняване на грешки, писане на документация, създаване на презентации и електронни таблици. Anthropic също обяви Claude Haiku 5.5, който ще излезе през следващите седмици. Този модел ще се фокусира върху случаи на употреба с висок обем и ниска цена.
С Fable, Opus и Sonnet Anthropic вече разполага с аналози на GPT-6 Astra на OpenAI, Sol и Luna, които поставиха началото на последната ценова война. Най-общо казано, Opus е малко над Sol, Sonnet е над Luna, а Fable е над Astra, макар че Anthropic таксува повече на всички нива. Разликите в производителността между съответстващите нива са достатъчно малки, така че цената може да се окаже решаващият фактор. Haiku би могъл да помогне на Anthropic да намали тази разлика.
Производителността при програмиране скача рязко
Според Anthropic разликата в производителността между Sonnet 5.5 и предшественика му е най-значителна при програмирането. При Terminal-Bench 4.0, тест за агентно програмиране, Sonnet 5.5 достига 70,6 процента в сравнение с 10,3 процента за Sonnet 5. При CursorBench 4.0, който пресъздава реални сесии за програмиране от редактора Cursor, Sonnet 5.5 получава 55,5 процента спрямо 34,1 процента, като остава само на два пункта зад Opus 5.5 (57,8 процента).
При FrontierCode 1.1 с настройка „High“ Sonnet 5.5 получава десет пункта повече от Sonnet 5 при приблизително една петнадесета от разходите за задача, твърди Anthropic. Ранните тестери похвалиха колко бързо моделът разбира дадена кодова база. Sonnet 5.5 също така групира извикванията на инструменти по-често от предшественика си, което намалява необходимия брой стъпки.
Интензивността на разсъждението има една странна особеност. При най-високото ниво на усилие, „Max“, Sonnet 5.5 всъщност получава по-слаб резултат във FrontierCode, отколкото при „Xhigh“. Anthropic казва, че при максимално усилие моделът по-често задейства функция за преглед на кода, която разделя работата между няколко подагента. В някои случаи това е довело до изтичане на времето или до промени извън обхвата на задачата, като и двете се санкционират от FrontierCode.
При работа със знания почти се изравнява с Opus 5.5
При GDPval-AA, бенчмарк за работа със знания, разработен от OpenAI и обхващащ задачи от 44 професии и девет индустрии, Sonnet 5.5 получава 1844 точки. Това почти се изравнява с Opus 5.5 (1846) и е с около 400 точки над Sonnet 5 (1449). GPT-6 Sol на OpenAI достига 1487 според данните на Anthropic. При Chartography, тест за разпознаване на визуални диаграми, Sonnet 5.5 се повишава от 15,6 на 61,6 процента.
| Категория | Бенчмарк | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| Програмиране с агенти | Terminal-Bench 4.0 | 70,6% | 10,3% | 66,4%¹ | — |
| Програмиране с агенти | FrontierCode 1.1 (Main) | 46,2% (Max); 52,1% (Xhigh)² | 42,4% | 54,4% | 49,3% |
| Програмиране с агенти | CursorBench 4.0 | 55,5% | 34,1% | 57,8% | — |
| Работа със знания | GDPval-AA v2.1³ | 1844 | 1449 | 1846 | 1487 |
| Работа със знания | AA Briefcase v1.1³ | 1811 | 1359 | 1822 | 1483 |
| Интердисциплинарно мислене | Humanity's Last Exam (с инструменти) | 64,5% | 54,9% | 67,7% | — |
| Компютърни умения | OSWorld 2.1 (частична оценка) | 80,1% | 57,0% | 81,8% | — |
| Разпознаване на визуални диаграми | Chartography (без инструменти) | 61,6% | 15,6% | 64,4% | 53,6% |
¹ За Opus 5.5 Terminal-Bench 4.0 показва най-високия резултат при настройката „Xhigh“. ² Sonnet 5.5 получава по-нисък резултат във FrontierCode при „Max“, отколкото при „Xhigh“. ³ Стойностите за Sonnet 5.5 са взети от версия преди официалното пускане, при която възможно отстранена впоследствие грешка е могла да повлияе на структурираните резултати.
Ранните тестери описаха Sonnet 5.5 като по-естествен събеседник с усет към дизайна. Според Anthropic моделът може да преработва потребителски интерфейси и да изпълнява шаблони за слайдове толкова добре, че резултатите почти не се нуждаят от допълнителна обработка.
Anthropic също твърди, че Sonnet 5.5 е първият модел Sonnet, който може да изиграе Pokémon Red, използвайки само екранни снимки. Astra на OpenAI наскоро показа подобен напредък при бенчмарковете за игри. Само преди няколко години подобни задачи се смятаха за трудни и често изискваха специално създадени алгоритми. Сега дори моделите от среден клас в рамките на едно продуктово семейство могат да се справят с тях.
Същата цена на токен, но по-малко токени на задача
Sonnet 5.5 струва същото на милион токени като Sonnet 5: 2 долара за входни токени, 10 долара за изходни токени и 0,20 долара за четене на кеша. Тъй като моделът използва по-малко токени на задача, ефективните разходи намаляват с до 30 процента, твърди Anthropic. Генерирането на резултати също е с над 30 процента по-бързо. Независими тестове все още трябва да потвърдят тези твърдения.
| Цена на милион токени | Claude Opus 5.5 | GPT-6 Sol | Claude Sonnet 5.5 | GPT-6 Luna |
|---|---|---|---|---|
| Входни токени | 4 $ | 2 $ | $2 | $0.10 |
| Изходни токени | $20 | $10 | $10 | $0.50 |
| Достъпи за четене на кеша | $0.20 | $0.20 | $0.20 | $0.01 |
| Достъпи за запис в кеша | $5 | $2.50 | $2.50 | $0.125 |
Подобно на останалите модели на Anthropic и аналозите им на OpenAI, Sonnet 5.5 предлага регулируема настройка за усилие, която позволява на потребителите да балансират разходите и скоростта спрямо качеството на резултата. При ниски или средни настройки Sonnet 5.5 вече надминава най-добрите резултати на Sonnet 5 в няколко бенчмарка при приблизително една десета от разходите на задача, твърди Anthropic. Намирането на правилното ниво на усилие за всяка задача обаче все още е по-скоро изкуство, отколкото наука.
Нови защити за киберсигурност за по-способен модел
Claude Sonnet 5.5 вече е достъпен във всички основни облачни платформи, включително Amazon Web Services, Google Cloud и Microsoft Azure. Подобно на Opus 5.5 и Sonnet 5, Anthropic предлага модела без съхранение на данни. Разработчиците могат да получат достъп до него чрез Claude Platform, използвайки идентификатора на модела „claude-sonnet-5-5“.
Тъй като Sonnet 5.5 е значително по-способен в областта на киберсигурността от предшественика си, Anthropic за първи път добавя защити към модел Sonnet. Заявките, свързани с високорискови задачи в областта на киберсигурността, видимо се пренасочват към Sonnet 5. Чрез разширената Програма за киберверификация квалифицирани специалисти могат да кандидатстват за достъп на различни нива.
Anthropic също така е добавила класификатори за безопасност срещу атаки за дистилация, същите като използваните в най-мощните ѝ модели. Дали тези мерки действително работят, трябва да стане ясно през следващите месеци. Ако китайски лаборатории са се възползвали от такива атаки, затварянето на този вектор може отново да увеличи разликата със западните лаборатории.
Новини за изкуствения интелект без сензации – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен бюлетин за изкуствения интелект, нашия ексклузивен шест пъти годишно доклад за най-новите разработки „AI Radar“, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.