Anthropic выпустила Claude Sonnet 5.5: 70,6% в Terminal-Bench 4.0 по той же цене $2/$10
Anthropic только что выпустила Claude Sonnet 5.5. Это вторая модель в семействе Claude 5.5 после Claude Opus 5.5. Anthropic позиционирует её как более быстрое и доступное дополнение к Opus 5.5. Модель ориентирована на чётко определённые повседневные задачи, исправление ошибок, а также подготовку качественных документов, презентаций и электронных таблиц.
Готова ли она к развёртыванию? Да, она уже доступна на Claude Platform под именем claude-sonnet-5-5, а также в AWS, Google Cloud и Microsoft Azure. Это модель с закрытыми весами, поэтому самостоятельный хостинг невозможен.
Что изменилось по сравнению с Sonnet 5
Anthropic сообщает о 4 основных улучшениях по сравнению с Sonnet 5:
- Скорость: генерация вывода стала более чем на 30% быстрее, что делает модель самым быстрым Sonnet на сегодняшний день.
- Стоимость задачи: снизилась до 30%, поскольку модели требуется меньше токенов и вызовов инструментов.
- Письмо: более ясная проза; первые тестировщики называют модель лучшим партнёром для совместной работы.
- Работа с изображениями и долгосрочные задачи: это первый Sonnet, которому удалось пройти Pokémon Red, используя только скриншоты.
Характеристики из обзора моделей: контекст объёмом 1 млн токенов, максимальный вывод — 128 тыс. токенов, надёжная отсечка знаний — июнь 2026 года. Адаптивное рассуждение включено по умолчанию. Уровень усилий имеет 5 значений: низкий, средний, высокий, xhigh и максимальный.
Бенчмарки
Все приведённые ниже результаты опубликованы поставщиком в публикации о запуске. Методология описана в системной карте Sonnet 5.5.
- Terminal-Bench 4.0: 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 при уровне Xhigh.
- CursorBench 4.0: 55,5%, примерно на 2 пункта ниже Opus 5.5 (57,8%).
- FrontierCode 1.1: 52,1% при уровне Xhigh и 46,2% при максимальном уровне. GPT-6 Sol набрала 49,3%.
- GDPval-AA v2.1: 1844 против 1846 у Opus 5.5 и 1449 у Sonnet 5.
- OSWorld 2.1: 80,1% в задачах компьютерного взаимодействия, близко к Opus 5.5 (81,8%).
- Humanity’s Last Exam: 64,5% с инструментами против 54,9% ранее.
Результат на уровне Max ниже, чем на Xhigh, по определённой причине. На уровне Max модель чаще выполняла многоагентную проверку кода. Иногда это приводило к тайм-аутам или правкам за пределами области задачи, за что FrontierCode снижает оценку. Anthropic также заявляет, что Opus 5.5 по-прежнему явно сильнее в сложной и открытой работе.
Цены и эффективность
Публичные цены не изменились по сравнению с Sonnet 5: 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Чтение кэша стоит 0,20 доллара, а запись в кэш — 2,50 доллара за миллион токенов. Это вдвое дешевле Opus 5.5 (4/20 долларов). Экономия достигается за счёт эффективности использования токенов, а не снижения цены.
Данные клиентов это подтверждают. Balyasny Asset Management зафиксировала около 121 тыс. токенов на ответ против 497 тыс. у Sonnet 5. Base44 сообщила о 3,6 итерации на сборку приложения против 7,7 у Opus 5. Zendesk обрабатывала тикеты на 20% быстрее.
Значения уровня усилий по умолчанию различаются в зависимости от интерфейса. В Claude Code и приложениях Claude по умолчанию используется средний уровень. На Claude Platform по умолчанию используется высокий уровень.
Сравнение
| Функция | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| Разработчик | Anthropic | OpenAI | Anthropic | |
| Цена за 1 млн токенов (ввод/вывод) | $2 / $10 | $2 / $10 (запросы до 272 тыс.) | $2 / $12 (запросы до 200 тыс.) | $4 / $20 |
| Контекстное окно | 1 млн токенов | 1 050 000 токенов | 1 048 576 токенов | 1 млн токенов |
| Максимальный вывод | 128 тыс. токенов | 128 тыс. токенов | 65 536 токенов | 128 тыс. токенов |
| Отсечка знаний | Июнь 2026 года | 20 апреля 2026 года | Не указана | Июнь 2026 года |
| Управление рассуждением | Адаптивное рассуждение, 5 уровней усилий | 6 уровней усилий (от отсутствия до максимального) | Поддерживается рассуждение | Адаптивное рассуждение (всегда включено) |
| Входные данные | Текст, изображения | Текст, изображения | Текст, изображения, видео, аудио, PDF | Текст, изображения |
| FrontierCode 1.1 | 52,1% (Xhigh) | 49,3% | Не сообщается | 54,4% |
| GDPval-AA v2.1 | 1844 | 1487 | Не сообщается | 1846 |
| Chartography (без инструментов) | 61,6% | 53,6% | Не сообщается | 64,4% |
| Стадия выпуска | Общедоступная версия | Общедоступная версия | Предварительная версия | Общедоступная версия |
| Открытые веса | Нет | Нет | Нет | Нет |
Результаты бенчмарков предоставлены Anthropic; запуски GDPval-AA выполнены Artificial Analysis. Цены являются стандартными тарифами API и проверены 28 сентября 2026 года.
Интерактивное объяснение
Claude Sonnet 5.5: интерактивное объяснение
Просматривайте бенчмарки, уровни усилий, стоимость задач и проверку миграции API.
Индикаторы иллюстрируют направление, описанное Anthropic (при более высоком уровне усилий модель рассуждает дольше и тщательнее проверяет работу). Рекомендации взяты из руководства по миграции на Sonnet 5.5.
Экономия достигается за счёт меньшего количества токенов и вызовов инструментов, а не снижения публичной цены. Фактическое соотношение зависит от рабочей нагрузки.
Основные выводы
- Sonnet 5.5 набрала 70,6% в Terminal-Bench 4.0 против 10,3% ранее.
- Цена остаётся на уровне 2/10 долларов, но стоимость задачи снижается до 30%.
- По GDPval-AA модель отстаёт от Opus 5.5 менее чем на 2 пункта.
- Первый Sonnet с киберзащитой и классификаторами извлечения рассуждений.
- Уже доступна для развёртывания через API, AWS, Google Cloud и Azure.
Ознакомьтесь с официальным объявлением, руководством по миграции и системной картой. Все права на этот проект принадлежат его исследователю. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.