Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Anthropic выпустила Claude Sonnet 5.5: 70,6% в Terminal-Bench 4.0 по той же цене $2/$10

Anthropic только что выпустила Claude Sonnet 5.5. Это вторая модель в семействе Claude 5.5 после Claude Opus 5.5. Anthropic позиционирует её как более быстрое и доступное дополнение к Opus 5.5. Модель ориентирована на чётко определённые повседневные задачи, исправление ошибок, а также подготовку качественных документов, презентаций и электронных таблиц.

Готова ли она к развёртыванию? Да, она уже доступна на Claude Platform под именем claude-sonnet-5-5, а также в AWS, Google Cloud и Microsoft Azure. Это модель с закрытыми весами, поэтому самостоятельный хостинг невозможен.

Что изменилось по сравнению с Sonnet 5

Anthropic сообщает о 4 основных улучшениях по сравнению с Sonnet 5:

  • Скорость: генерация вывода стала более чем на 30% быстрее, что делает модель самым быстрым Sonnet на сегодняшний день.
  • Стоимость задачи: снизилась до 30%, поскольку модели требуется меньше токенов и вызовов инструментов.
  • Письмо: более ясная проза; первые тестировщики называют модель лучшим партнёром для совместной работы.
  • Работа с изображениями и долгосрочные задачи: это первый Sonnet, которому удалось пройти Pokémon Red, используя только скриншоты.

Характеристики из обзора моделей: контекст объёмом 1 млн токенов, максимальный вывод — 128 тыс. токенов, надёжная отсечка знаний — июнь 2026 года. Адаптивное рассуждение включено по умолчанию. Уровень усилий имеет 5 значений: низкий, средний, высокий, xhigh и максимальный.

Бенчмарки

Все приведённые ниже результаты опубликованы поставщиком в публикации о запуске. Методология описана в системной карте Sonnet 5.5.

  • Terminal-Bench 4.0: 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5 при уровне Xhigh.
  • CursorBench 4.0: 55,5%, примерно на 2 пункта ниже Opus 5.5 (57,8%).
  • FrontierCode 1.1: 52,1% при уровне Xhigh и 46,2% при максимальном уровне. GPT-6 Sol набрала 49,3%.
  • GDPval-AA v2.1: 1844 против 1846 у Opus 5.5 и 1449 у Sonnet 5.
  • OSWorld 2.1: 80,1% в задачах компьютерного взаимодействия, близко к Opus 5.5 (81,8%).
  • Humanity’s Last Exam: 64,5% с инструментами против 54,9% ранее.

Результат на уровне Max ниже, чем на Xhigh, по определённой причине. На уровне Max модель чаще выполняла многоагентную проверку кода. Иногда это приводило к тайм-аутам или правкам за пределами области задачи, за что FrontierCode снижает оценку. Anthropic также заявляет, что Opus 5.5 по-прежнему явно сильнее в сложной и открытой работе.

Цены и эффективность

Публичные цены не изменились по сравнению с Sonnet 5: 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Чтение кэша стоит 0,20 доллара, а запись в кэш — 2,50 доллара за миллион токенов. Это вдвое дешевле Opus 5.5 (4/20 долларов). Экономия достигается за счёт эффективности использования токенов, а не снижения цены.

Данные клиентов это подтверждают. Balyasny Asset Management зафиксировала около 121 тыс. токенов на ответ против 497 тыс. у Sonnet 5. Base44 сообщила о 3,6 итерации на сборку приложения против 7,7 у Opus 5. Zendesk обрабатывала тикеты на 20% быстрее.

Значения уровня усилий по умолчанию различаются в зависимости от интерфейса. В Claude Code и приложениях Claude по умолчанию используется средний уровень. На Claude Platform по умолчанию используется высокий уровень.

Сравнение

ФункцияClaude Sonnet 5.5GPT-6 SolGemini 3.1 Pro PreviewClaude Opus 5.5
РазработчикAnthropicOpenAIGoogleAnthropic
Цена за 1 млн токенов (ввод/вывод)$2 / $10$2 / $10 (запросы до 272 тыс.)$2 / $12 (запросы до 200 тыс.)$4 / $20
Контекстное окно1 млн токенов1 050 000 токенов1 048 576 токенов1 млн токенов
Максимальный вывод128 тыс. токенов128 тыс. токенов65 536 токенов128 тыс. токенов
Отсечка знанийИюнь 2026 года20 апреля 2026 годаНе указанаИюнь 2026 года
Управление рассуждениемАдаптивное рассуждение, 5 уровней усилий6 уровней усилий (от отсутствия до максимального)Поддерживается рассуждениеАдаптивное рассуждение (всегда включено)
Входные данныеТекст, изображенияТекст, изображенияТекст, изображения, видео, аудио, PDFТекст, изображения
FrontierCode 1.152,1% (Xhigh)49,3%Не сообщается54,4%
GDPval-AA v2.118441487Не сообщается1846
Chartography (без инструментов)61,6%53,6%Не сообщается64,4%
Стадия выпускаОбщедоступная версияОбщедоступная версияПредварительная версияОбщедоступная версия
Открытые весаНетНетНетНет

Результаты бенчмарков предоставлены Anthropic; запуски GDPval-AA выполнены Artificial Analysis. Цены являются стандартными тарифами API и проверены 28 сентября 2026 года.

Интерактивное объяснение

Claude Sonnet 5.5: интерактивное объяснение

Просматривайте бенчмарки, уровни усилий, стоимость задач и проверку миграции API.

Выберите уровень усилий. Sonnet 5.5 предлагает 5 уровней.
Глубина рассуждения
Скорость и экономия токенов

Индикаторы иллюстрируют направление, описанное Anthropic (при более высоком уровне усилий модель рассуждает дольше и тщательнее проверяет работу). Рекомендации взяты из руководства по миграции на Sonnet 5.5.

Иллюстративная оценка по публичной цене (2 доллара за входные и 10 долларов за выходные токены на 1 млн; цена одинакова для Sonnet 5 и 5.5).
Входные токены на задачу: Выходные токены на задачу в Sonnet 5: Сокращение токенов в Sonnet 5.5: % (Anthropic: стоимость задачи снижается до 30%)
Sonnet 5, на задачу
Sonnet 5.5, на задачу
При 10 000 задачах в месяц вы экономите

Экономия достигается за счёт меньшего количества токенов и вызовов инструментов, а не снижения публичной цены. Фактическое соотношение зависит от рабочей нагрузки.

Выберите настройку из кода эпохи Sonnet 5, чтобы увидеть, что вернёт Sonnet 5.5.
Источники: публикация Anthropic о запуске и документация Claude Platform, 28 сентября 2026 года© Marktechpost

Основные выводы

  • Sonnet 5.5 набрала 70,6% в Terminal-Bench 4.0 против 10,3% ранее.
  • Цена остаётся на уровне 2/10 долларов, но стоимость задачи снижается до 30%.
  • По GDPval-AA модель отстаёт от Opus 5.5 менее чем на 2 пункта.
  • Первый Sonnet с киберзащитой и классификаторами извлечения рассуждений.
  • Уже доступна для развёртывания через API, AWS, Google Cloud и Azure.

Ознакомьтесь с официальным объявлением, руководством по миграции и системной картой. Все права на этот проект принадлежат его исследователю. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения вашего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости