Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Claude Sonnet 5.5 от Anthropic почти сравнялся с Opus 5.5 в бенчмарках, при этом его стоимость за задачу до 30% ниже

Anthropic's Claude Sonnet 5.5 nearly matches Opus 5.5 on benchmarks while costing up to 30 percent less per task
Matthias Bastian
28 сен. 2026
Nano Banana Pro по запросу THE DECODER

Ключевые моменты

  • Anthropic выпустила Claude Sonnet 5.5, который генерирует ответы более чем на 30 процентов быстрее и снижает стоимость одной задачи до 30 процентов благодаря более эффективному использованию токенов.
  • Sonnet 5.5 демонстрирует значительный прогресс в тестах на программирование и интеллектуальную работу, а в некоторых испытаниях почти сравнивается с топовой моделью Opus 5.5 при существенно меньшей стоимости.
  • Модель уже доступна в AWS, Google Cloud и Azure. Anthropic добавила новые меры защиты от рисков кибербезопасности и атак дистилляции.

Anthropic выпустила Claude Sonnet 5.5, вторую модель в семействе Claude 5.5. Она генерирует ответы более чем на 30 процентов быстрее, стоит до 30 процентов дешевле за задачу и почти сравнивается с Opus 5.5 в нескольких тестах.

Opus 5.5 создана для сложных задач, требующих взвешенных решений. Sonnet 5.5 ориентирована на чётко определённую повседневную работу: исправление ошибок, написание документации, создание презентаций и электронных таблиц. Anthropic также анонсировала Claude Haiku 5.5, которая выйдет в ближайшие недели. Эта модель будет ориентирована на сценарии с высокой производительностью и низкой стоимостью.

Благодаря моделям Fable, Opus и Sonnet у Anthropic уже есть аналоги GPT-6 Astra от OpenAI, Sol и Luna, с которых началась последняя ценовая война. В общих чертах Opus немного превосходит Sol, Sonnet — Luna, а Fable — Astra, хотя Anthropic устанавливает более высокие цены по всем направлениям. Различия в производительности между сопоставимыми уровнями достаточно малы, поэтому решающим фактором может оказаться стоимость. Haiku может помочь Anthropic сократить этот разрыв.

Резкий рост производительности в программировании

По данным Anthropic, разрыв в производительности между Sonnet 5.5 и её предшественницей особенно заметен в программировании. В Terminal-Bench 4.0, тесте агентного программирования, Sonnet 5.5 набирает 70,6 процента против 10,3 процента у Sonnet 5. В CursorBench 4.0, который воспроизводит реальные сеансы программирования в редакторе Cursor, Sonnet 5.5 получает 55,5 процента против 34,1 процента, отставая от Opus 5.5 всего на два пункта (57,8 процента).

В FrontierCode 1.1 с настройкой «High» Sonnet 5.5 набирает на десять пунктов больше Sonnet 5 при примерно в 15 раз меньшей стоимости одной задачи, утверждает Anthropic. Ранние тестировщики отмечали, насколько быстро модель понимает структуру кодовой базы. Sonnet 5.5 также чаще объединяет вызовы инструментов, чем её предшественница, что сокращает необходимое количество шагов.

Интенсивность рассуждений имеет одну странную особенность. При максимальном уровне усилий «Max» Sonnet 5.5 фактически набирает в FrontierCode меньше, чем при «Xhigh». Anthropic объясняет это тем, что при максимальном уровне усилий модель чаще запускает функцию проверки кода, которая распределяет работу между несколькими субагентами. В некоторых случаях это приводило к тайм-аутам или изменениям за пределами задачи — оба фактора FrontierCode штрафует.

Интеллектуальная работа почти на уровне Opus 5.5

В GDPval-AA, тесте интеллектуальной работы, разработанном OpenAI и охватывающем задачи 44 профессий и девяти отраслей, Sonnet 5.5 набирает 1844 балла. Это почти соответствует Opus 5.5 (1846) и примерно на 400 баллов выше результата Sonnet 5 (1449). GPT-6 Sol от OpenAI набирает 1487 баллов по данным Anthropic. В Chartography, тесте распознавания визуальных диаграмм, результат Sonnet 5.5 вырос с 15,6 до 61,6 процента.

Категория Тест Sonnet 5.5 Sonnet 5 Opus 5.5 GPT-6 Sol
Агентное программирование Terminal-Bench 4.0 70.6% 10.3% 66.4%¹ —
Агентное программирование FrontierCode 1.1 (основной тест) 46.2% (Max); 52.1% (Xhigh)² 42.4% 54.4% 49.3%
Агентное программирование CursorBench 4.0 55.5% 34.1% 57.8% —
Интеллектуальная работа GDPval-AA v2.1³ 1,844 1,449 1,846 1,487
Интеллектуальная работа AA Briefcase v1.1³ 1,811 1,359 1,822 1,483
Междисциплинарное мышление Humanity's Last Exam (с инструментами) 64.5% 54.9% 67.7% —
Навыки работы с компьютером OSWorld 2.1 (частичная оценка) 80.1% 57.0% 81.8% —
Распознавание визуальных диаграмм Chartography (без инструментов) 61.6% 15.6% 64.4% 53.6%

¹ Для Opus 5.5 в Terminal-Bench 4.0 указано наивысшее значение при настройке «Xhigh». ² В FrontierCode результат Sonnet 5.5 при «Max» ниже, чем при «Xhigh». ³ Значения для Sonnet 5.5 получены на предварительной версии, в которой на структурированные ответы могла повлиять ошибка, уже исправленная к настоящему моменту.

Ранние тестировщики описывали Sonnet 5.5 как более естественного собеседника с хорошим чувством дизайна. По утверждению Anthropic, модель может перерабатывать пользовательские интерфейсы и настолько хорошо выполнять шаблоны слайдов, что результаты почти не требуют доработки.

Anthropic также утверждает, что Sonnet 5.5 стала первой моделью Sonnet, способной пройти Pokémon Red, используя только скриншоты. Недавно Astra от OpenAI продемонстрировала аналогичный прогресс в игровых тестах. Ещё несколько лет назад такие задачи считались сложными и часто требовали специальных алгоритмов. Теперь с ними справляются даже модели среднего уровня внутри одного продуктового семейства.

Та же цена токенов, но меньше токенов на задачу

Sonnet 5.5 стоит столько же за миллион токенов, сколько и Sonnet 5: 2 доллара за входные токены, 10 долларов за выходные токены и 0,20 доллара за чтение из кэша. Поскольку модель использует меньше токенов на задачу, фактические затраты снижаются до 30 процентов, утверждает Anthropic. Генерация ответов также стала более чем на 30 процентов быстрее. Эти заявления ещё должны подтвердить независимые тесты.

Цена за миллион токенов Claude Opus 5.5 GPT-6 Sol Claude Sonnet 5.5 GPT-6 Luna
Входные токены 4 $ 2 $ $2 $0.10
Выходные токены $20 $10 $10 $0.50
Чтение из кэша $0.20 $0.20 $0.20 $0.01
Запись в кэш $5 $2.50 $2.50 $0.125

Как и другие модели Anthropic и аналоги OpenAI, Sonnet 5.5 предлагает настраиваемый уровень усилий, позволяющий пользователям выбирать между стоимостью и скоростью, с одной стороны, и качеством ответа — с другой. По данным Anthropic, при низком или среднем уровне Sonnet 5.5 уже превосходит лучшие результаты Sonnet 5 в нескольких тестах при стоимости одной задачи примерно в десять раз ниже. Однако поиск подходящего уровня усилий для каждой задачи по-прежнему остаётся скорее искусством, чем наукой.

Новые меры кибербезопасности для более мощной модели

Claude Sonnet 5.5 уже доступна на всех основных облачных платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure. Как и для Opus 5.5 и Sonnet 5, Anthropic предлагает модель с нулевым хранением данных. Разработчики могут получить к ней доступ через Claude Platform, используя идентификатор модели «claude-sonnet-5-5».

Поскольку Sonnet 5.5 значительно превосходит предшественницу в области кибербезопасности, Anthropic впервые добавляет меры защиты в модель Sonnet. Запросы, связанные с высокорисковыми задачами кибербезопасности, получают заметное перенаправление на Sonnet 5. Благодаря расширенной программе киберпроверки квалифицированные специалисты могут подать заявку на доступ соответствующего уровня.

Anthropic также добавила классификаторы безопасности против атак дистилляции — такие же, как в её самых мощных моделях. Насколько эти меры действительно эффективны, должно стать ясно в ближайшие месяцы. Если китайские лаборатории действительно извлекали выгоду из таких атак, закрытие этого вектора может снова увеличить отрыв западных лабораторий.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчёт о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и возможность оставлять комментарии.

Источник: Anthropic

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости