Anthropic пуска Claude Sonnet 5.5: 70,6% в Terminal-Bench 4.0 при същата цена от $2/$10
Anthropic току-що пусна Claude Sonnet 5.5. Това е вторият модел в семейството Claude 5.5, след Claude Opus 5.5. Anthropic го позиционира като по-бързо и по-евтино допълнение към Opus 5.5. Той е предназначен за добре дефинирани ежедневни задачи, поправяне на грешки и създаване на завършени документи, презентации и електронни таблици.
Може ли да бъде внедрен? Да. Той е наличен в Claude Platform под името claude-sonnet-5-5, както и в AWS, Google Cloud и Microsoft Azure. Това е модел със затворени тегла, така че самостоятелното му хостване не е възможно.
Какво се промени спрямо Sonnet 5
Anthropic съобщава за 4 основни подобрения спрямо Sonnet 5:
- Скорост: генерирането на изход е с над 30% по-бързо, което го прави най-бързия Sonnet досега.
- Цена на задача: до 30% по-ниска, тъй като са му необходими по-малко токени и извиквания на инструменти.
- Писане: по-ясна проза, като ранните тестери го определят като по-добър партньор за съвместна работа.
- Компютърно зрение и дългосрочна работа: това е първият Sonnet, който побеждава Pokémon Red, използвайки само екранни снимки.
Спецификации от прегледа на моделите: контекст от 1 млн. токена, максимален изход от 128 хил. токена и надежден праг на знанията от юни 2026 г. Адаптивното мислене е включено по подразбиране. Усилието се предлага на 5 нива: ниско, средно, високо, xhigh и максимално.
Бенчмаркове
Всички резултати по-долу са докладвани от доставчика в публикацията за пускането. Методологията е описана в системната карта на Sonnet 5.5.
- Terminal-Bench 4.0: 70,6% спрямо 10,3% за Sonnet 5 и 66,4% за Opus 5.5 при Xhigh.
- CursorBench 4.0: 55,5%, с около 2 пункта по-малко от Opus 5.5 (57,8%).
- FrontierCode 1.1: 52,1% при Xhigh и 46,2% при Max. GPT-6 Sol е постигнал 49,3%.
- GDPval-AA v2.1: 1844 спрямо 1846 за Opus 5.5 и 1449 за Sonnet 5.
- OSWorld 2.1: 80,1% при използване на компютър, близо до Opus 5.5 (81,8%).
- Humanity’s Last Exam: 64,5% с инструменти спрямо 54,9% преди.
Резултатът при Max е по-нисък от този при Xhigh по конкретна причина. При Max моделът по-често е извършвал многоагентен преглед на кода. Това понякога е водело до изтичане на времето или промени извън обхвата, което FrontierCode санкционира. Anthropic също посочва, че Opus 5.5 остава ясно по-силен при сложна и отворена работа.
Ценообразуване и ефективност
Цените в списъка са непроменени спрямо Sonnet 5: $2 за милион входни токени и $10 за милион изходни токени. Четенето на кеширани данни струва $0,20, а записът в кеша — $2,50 за милион. Това е наполовина по-евтино от Opus 5.5 ($4/$20). Спестяванията идват от ефективността при използването на токени, а не от намаление на цената.
Данните от клиентите потвърждават това. Balyasny Asset Management е измерила около 121 хил. токена на отговор спрямо 497 хил. при Sonnet 5. Base44 е отчела 3,6 итерации на изграждане на приложение, докато при Opus 5 са били необходими 7,7. Zendesk е обработвал тикети с 20% по-бързо.
Стойностите по подразбиране за усилието се различават според интерфейса. Claude Code и приложенията на Claude използват по подразбиране „Средно“. Claude Platform използва по подразбиране „Високо“.
Как се сравнява
| Функция | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| Разработчик | Anthropic | OpenAI | Anthropic | |
| Цена за 1 млн. токена (вход/изход) | $2 / $10 | $2 / $10 (подкани до 272 хил.) | $2 / $12 (подкани до 200 хил.) | $4 / $20 |
| Контекстен прозорец | 1 млн. токена | 1 050 000 токена | 1 048 576 токена | 1 млн. токена |
| Максимален изход | 128 хил. токена | 128 хил. токена | 65 536 токена | 128 хил. токена |
| Праг на знанията | юни 2026 г. | 20 април 2026 г. | Не е посочен | юни 2026 г. |
| Контрол на разсъжденията | Адаптивно мислене, 5 нива на усилие | 6 нива на усилие (от никакво до максимално) | Поддържа се мислене | Адаптивно мислене (винаги включено) |
| Входове | Текст, изображение | Текст, изображение | Текст, изображение, видео, аудио, PDF | Текст, изображение |
| FrontierCode 1.1 | 52,1% (Xhigh) | 49,3% | Не е докладван | 54,4% |
| GDPval-AA v2.1 | 1844 | 1487 | Не е докладван | 1846 |
| Chartography (без инструменти) | 61,6% | 53,6% | Не е докладван | 64,4% |
| Етап на пускане | Общодостъпен | Общодостъпен | Предварителна версия | Общодостъпен |
| Отворени тегла | Не | Не | Не | Не |
Резултатите от бенчмарковете са докладвани от Anthropic; изпълненията на GDPval-AA са на Artificial Analysis. Цените са стандартните тарифи в API списъка, проверени на 28 септември 2026 г.
Интерактивно обяснение
Claude Sonnet 5.5, обяснен интерактивно
Прегледайте бенчмарковете, нивата на усилие, цената на задачите и инструмента за проверка на миграцията към API.
Измервателните уреди са илюстративни за посоката, описана от Anthropic (при по-високо усилие моделът разсъждава по-дълго и проверява работата по-задълбочено). Препоръките са взети от ръководството за миграция към Sonnet 5.5.
Спестяванията идват от по-малко токени и извиквания на инструменти, а не от по-ниска номинална цена. Реалното ви съотношение зависи от работното натоварване.
Основни изводи
- Sonnet 5.5 постига 70,6% на Terminal-Bench 4.0 спрямо 10,3% преди.
- Цената остава $2/$10, но цената на задача спада с до 30%.
- Той е в рамките на 2 пункта от Opus 5.5 при GDPval-AA.
- Първият Sonnet с киберзащитни механизми и класификатори за извличане на разсъждения.
- Може да бъде внедрен незабавно чрез API, AWS, Google Cloud и Azure.
Вижте официалното съобщение, ръководството за миграция и системната карта. Цялата заслуга е за изследователя на този проект. Също така, можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия 150k+ ML SubReddit и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ пускане на продукт, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.