Anthropic випустила Claude Sonnet 5.5: 70,6% у Terminal-Bench 4.0 за тією самою ціною $2/$10
Anthropic щойно випустила Claude Sonnet 5.5. Це друга модель у сімействі Claude 5.5 після Claude Opus 5.5. Anthropic позиціонує її як швидше та дешевше доповнення до Opus 5.5. Модель призначена для чітко окреслених повсякденних завдань, виправлення помилок, а також підготовки якісних документів, презентацій і таблиць.
Чи придатна вона для розгортання? Так. Вона вже доступна на платформі Claude під назвою claude-sonnet-5-5, а також через AWS, Google Cloud і Microsoft Azure. Це модель із закритими вагами, тому самостійне розгортання неможливе.
Що змінилося порівняно із Sonnet 5
Anthropic повідомляє про 4 основні вдосконалення порівняно із Sonnet 5:
- Швидкість: генерація результатів більш ніж на 30% швидша, що робить модель найшвидшою Sonnet на сьогодні.
- Вартість завдання: до 30% нижча, оскільки модель потребує менше токенів і викликів інструментів.
- Письмо: чіткіший текст; перші тестувальники називають модель кращим партнером для спільної роботи.
- Зір і довготривала робота: це перша Sonnet, яка перемогла в Pokémon Red, використовуючи лише знімки екрана.
Характеристики з огляду моделей: контекст на 1 млн токенів, максимальний результат на 128 тис. токенів і надійна дата відсікання знань — червень 2026 року. Адаптивне мислення ввімкнено за замовчуванням. Рівень зусиль має 5 значень: низький, середній, високий, xhigh і максимальний.
Бенчмарки
Усі наведені нижче оцінки оприлюднені постачальником у публікації про запуск. Методологія описана в системній картці Sonnet 5.5.
- Terminal-Bench 4.0: 70,6% проти 10,3% у Sonnet 5 і 66,4% у Opus 5.5 на рівні Xhigh.
- CursorBench 4.0: 55,5%, приблизно на 2 пункти нижче за Opus 5.5 (57,8%).
- FrontierCode 1.1: 52,1% на Xhigh і 46,2% на Max. GPT-6 Sol набрала 49,3%.
- GDPval-AA v2.1: 1844 проти 1846 у Opus 5.5 і 1449 у Sonnet 5.
- OSWorld 2.1: 80,1% у використанні комп’ютера, близько до Opus 5.5 (81,8%).
- Humanity’s Last Exam: 64,5% з інструментами проти 54,9% раніше.
Результат Max нижчий за Xhigh не випадково. На Max модель частіше запускала перевірку коду кількома агентами. Іноді це спричиняло перевищення часу очікування або редагування за межами завдання, що враховується як помилка у FrontierCode. Anthropic також зазначає, що Opus 5.5 залишається явно сильнішою в складній роботі з відкритим результатом.
Ціни та ефективність
Прайсинг не змінився порівняно із Sonnet 5: $2 за мільйон вхідних токенів і $10 за мільйон вихідних токенів. Читання кешу коштує $0,20, а запис у кеш — $2,50 за мільйон. Це вдвічі дешевше за Opus 5.5 ($4/$20). Економія досягається завдяки ефективнішому використанню токенів, а не зниженню ціни.
Дані клієнтів це підтверджують. Balyasny Asset Management зафіксувала близько 121 тис. токенів на відповідь проти 497 тис. у Sonnet 5. Base44 повідомила про 3,6 ітерації на створення застосунку, тоді як Opus 5 потребувала 7,7. Zendesk обробляла тікети на 20% швидше.
Значення рівня зусиль за замовчуванням відрізняються залежно від середовища. Claude Code і застосунки Claude за замовчуванням використовують середній рівень. Платформа Claude за замовчуванням використовує високий рівень.
Порівняння
| Функція | Claude Sonnet 5.5 | GPT-6 Sol | Gemini 3.1 Pro Preview | Claude Opus 5.5 |
|---|---|---|---|---|
| Розробник | Anthropic | OpenAI | Anthropic | |
| Ціна за 1 млн токенів (вхідні/вихідні) | $2 / $10 | $2 / $10 (запити до 272 тис.) | $2 / $12 (запити до 200 тис.) | $4 / $20 |
| Контекстне вікно | 1 млн токенів | 1 050 000 токенів | 1 048 576 токенів | 1 млн токенів |
| Максимальний результат | 128 тис. токенів | 128 тис. токенів | 65 536 токенів | 128 тис. токенів |
| Дата відсікання знань | червень 2026 року | 20 квітня 2026 року | Не вказано | червень 2026 року |
| Керування міркуваннями | Адаптивне мислення, 5 рівнів зусиль | 6 рівнів зусиль (від відсутнього до максимального) | Підтримується мислення | Адаптивне мислення (завжди ввімкнене) |
| Вхідні дані | Текст, зображення | Текст, зображення | Текст, зображення, відео, аудіо, PDF | Текст, зображення |
| FrontierCode 1.1 | 52,1% (Xhigh) | 49,3% | Не повідомляється | 54,4% |
| GDPval-AA v2.1 | 1844 | 1487 | Не повідомляється | 1846 |
| Chartography (без інструментів) | 61,6% | 53,6% | Не повідомляється | 64,4% |
| Етап випуску | Загальнодоступна | Загальнодоступна | Попередня версія | Загальнодоступна |
| Відкриті ваги | Ні | Ні | Ні | Ні |
Оцінки в бенчмарках надані Anthropic; запуски GDPval-AA виконані Artificial Analysis. Ціни — стандартні тарифи API, перевірені 28 вересня 2026 року.
Інтерактивне пояснення
Claude Sonnet 5.5: інтерактивне пояснення
Перегляньте бенчмарки, рівні зусиль, вартість завдань і перевірку міграції API.
Індикатори ілюструють напрямок, описаний Anthropic (за вищого рівня зусиль модель довше міркує і ретельніше перевіряє роботу). Рекомендації взято з посібника з міграції на Sonnet 5.5.
Економія досягається завдяки меншій кількості токенів і викликів інструментів, а не зниженню ціни. Ваше фактичне співвідношення залежить від робочого навантаження.
Основні висновки
- Sonnet 5.5 набирає 70,6% у Terminal-Bench 4.0 проти 10,3% раніше.
- Ціна залишається на рівні $2/$10, але вартість завдання знижується до 30%.
- За GDPval-AA модель відстає від Opus 5.5 менш ніж на 2 пункти.
- Перша Sonnet із кіберзахисними засобами та класифікаторами вилучення міркувань.
- Вже доступна для розгортання через API, AWS, Google Cloud і Azure.
Ознайомтеся з офіційним оголошенням, посібником із міграції і системною карткою. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого 150-тисячного ML SubReddit та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібна співпраця з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.