Claude Sonnet 5.5 від Anthropic майже зрівнявся з Opus 5.5 у бенчмарках, коштуючи до 30% дешевше за завдання
Ключові моменти
- Anthropic випустила Claude Sonnet 5.5, який генерує відповіді більш ніж на 30 відсотків швидше та скорочує вартість одного завдання до 30 відсотків завдяки ефективнішому використанню токенів.
- Sonnet 5.5 демонструє значний прогрес у програмуванні та бенчмарках інтелектуальної роботи, а в деяких тестах майже зрівнюється з топовою моделлю Opus 5.5 за частку її вартості.
- Модель уже доступна в AWS, Google Cloud та Azure. Anthropic додала нові засоби захисту від кібербезпекових ризиків і атак дистиляції.
Anthropic випустила Claude Sonnet 5.5, другу модель у сімействі Claude 5.5. Вона генерує відповіді більш ніж на 30 відсотків швидше, коштує до 30 відсотків менше за завдання та майже зрівнюється з Opus 5.5 у кількох бенчмарках.
Opus 5.5 створена для складних завдань, які потребують ретельного оцінювання. Sonnet 5.5 орієнтована на чітко визначену повсякденну роботу: виправлення помилок, написання документації, створення презентацій і електронних таблиць. Anthropic також анонсувала Claude Haiku 5.5, яка вийде найближчими тижнями. Ця модель зосередиться на сценаріях використання з високою пропускною здатністю та низькою вартістю.
З Fable, Opus і Sonnet Anthropic уже має аналоги GPT-6 Astra від OpenAI, а також Sol і Luna, які започаткували останню цінову війну. Якщо говорити приблизно, Opus трохи перевершує Sol, Sonnet перевершує Luna, а Fable — Astra, хоча Anthropic загалом встановлює вищі ціни. Відмінності в продуктивності між відповідними рівнями достатньо малі, щоб вирішальним фактором зрештою могла стати вартість. Haiku може допомогти Anthropic скоротити цей розрив.
Різкий стрибок продуктивності в програмуванні
За даними Anthropic, розрив у продуктивності між Sonnet 5.5 та її попередницею найбільш помітний у програмуванні. У Terminal-Bench 4.0 — тесті агентного програмування — Sonnet 5.5 набирає 70,6 відсотка порівняно з 10,3 відсотка у Sonnet 5. У CursorBench 4.0, який відтворює реальні сеанси програмування в редакторі Cursor, Sonnet 5.5 отримує 55,5 відсотка проти 34,1 відсотка, відстаючи від Opus 5.5 лише на два пункти (57,8 відсотка).
У FrontierCode 1.1 на рівні «High» Sonnet 5.5 набирає на десять пунктів більше за Sonnet 5, при цьому вартість одного завдання приблизно в п'ятнадцять разів нижча, стверджує Anthropic. Перші тестувальники високо оцінили, наскільки швидко модель опановує кодову базу. Sonnet 5.5 також частіше об'єднує виклики інструментів, ніж її попередниця, що скорочує кількість необхідних кроків.
Інтенсивність міркування має одну дивну особливість. На найвищому рівні зусиль «Max» Sonnet 5.5 насправді показує гірший результат у FrontierCode, ніж на рівні «Xhigh». Anthropic пояснює, що за максимального рівня зусиль модель частіше запускає функцію перевірки коду, яка розподіляє роботу між кількома субагентами. У деяких випадках це призводило до перевищення часу очікування або змін за межами завдання — за обидва результати FrontierCode знижує оцінку.
В інтелектуальній роботі майже зрівнялася з Opus 5.5
У GDPval-AA — розробленому OpenAI бенчмарку інтелектуальної роботи, що охоплює завдання з 44 професій і дев'яти галузей — Sonnet 5.5 набирає 1 844 бали. Це майже відповідає результату Opus 5.5 (1 846) і приблизно на 400 балів більше за Sonnet 5 (1 449). GPT-6 Sol від OpenAI набирає 1 487 балів за даними Anthropic. У Chartography, тесті розпізнавання візуальних діаграм, результат Sonnet 5.5 зріс із 15,6 до 61,6 відсотка.
| Категорія | Бенчмарк | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|---|
| Агентне програмування | Terminal-Bench 4.0 | 70,6% | 10,3% | 66,4%¹ | — |
| Агентне програмування | FrontierCode 1.1 (Main) | 46,2% (Max); 52,1% (Xhigh)² | 42,4% | 54,4% | 49,3% |
| Агентне програмування | CursorBench 4.0 | 55,5% | 34,1% | 57,8% | — |
| Інтелектуальна робота | GDPval-AA v2.1³ | 1 844 | 1 449 | 1 846 | 1 487 |
| Інтелектуальна робота | AA Briefcase v1.1³ | 1 811 | 1 359 | 1 822 | 1 483 |
| Міждисциплінарне мислення | Humanity's Last Exam (з інструментами) | 64,5% | 54,9% | 67,7% | — |
| Комп'ютерні навички | OSWorld 2.1 (часткове оцінювання) | 80,1% | 57,0% | 81,8% | — |
| Розпізнавання візуальних діаграм | Chartography (без інструментів) | 61,6% | 15,6% | 64,4% | 53,6% |
¹ Для Opus 5.5 у Terminal-Bench 4.0 наведено найвищий результат на рівні «Xhigh». ² Sonnet 5.5 показує нижчий результат у FrontierCode на рівні «Max», ніж на рівні «Xhigh». ³ Значення для Sonnet 5.5 отримано з передрелізної версії, на результати структурованого виведення якої могла вплинути помилка, яку вже виправили.
Перші тестувальники описували Sonnet 5.5 як природнішого співрозмовника з відчуттям дизайну. За твердженням Anthropic, модель може переробляти інтерфейси користувача та настільки добре виконувати шаблони слайдів, що результати майже не потребують доопрацювання.
Anthropic також стверджує, що Sonnet 5.5 стала першою моделлю Sonnet, здатною пройти Pokémon Red, використовуючи лише скриншоти. Нещодавно Astra від OpenAI продемонструвала схожий прогрес у бенчмарках ігор. Ще кілька років тому такі завдання вважалися складними й часто вимагали спеціальних алгоритмів. Тепер із ними можуть впоратися навіть моделі середнього рівня в межах одного сімейства продуктів.
Та сама ціна токенів, але менше токенів на завдання
Sonnet 5.5 коштує стільки ж за мільйон токенів, як і Sonnet 5: 2 долари за вхідні токени, 10 доларів за вихідні токени та 0,20 долара за читання кешу. Оскільки модель використовує менше токенів на завдання, фактична вартість знижується до 30 відсотків, стверджує Anthropic. Генерація відповідей також відбувається більш ніж на 30 відсотків швидше. Незалежне тестування ще має підтвердити ці твердження.
| Ціна за мільйон токенів | Claude Opus 5.5 | GPT-6 Sol | Claude Sonnet 5.5 | GPT-6 Luna |
|---|---|---|---|---|
| Вхідні токени | 4 $ | 2 $ | $2 | $0.10 |
| Вихідні токени | $20 | $10 | $10 | $0.50 |
| Доступ до читання кешу | $0.20 | $0.20 | $0.20 | $0.01 |
| Доступ до запису в кеш | $5 | $2.50 | $2.50 | $0.125 |
Як і інші моделі Anthropic та аналоги OpenAI, Sonnet 5.5 пропонує налаштування рівня зусиль, яке дає змогу користувачам балансувати між вартістю та швидкістю, з одного боку, і якістю відповіді — з іншого. За низького або середнього рівня Sonnet 5.5 уже перевершує найкращі результати Sonnet 5 у кількох бенчмарках, витрачаючи приблизно вдесятеро менше на одне завдання, стверджує Anthropic. Однак пошук правильного рівня зусиль для кожного завдання все ще більше нагадує мистецтво, ніж науку.
Нові засоби захисту кібербезпеки для потужнішої моделі
Claude Sonnet 5.5 уже доступна на всіх основних хмарних платформах, зокрема Amazon Web Services, Google Cloud і Microsoft Azure. Як і для Opus 5.5 та Sonnet 5, Anthropic пропонує цю модель із нульовим зберіганням даних. Розробники можуть отримати до неї доступ через Claude Platform, використовуючи ідентифікатор моделі «claude-sonnet-5-5».
Оскільки Sonnet 5.5 значно перевершує свою попередницю в кібербезпеці, Anthropic уперше додає засоби захисту до моделі Sonnet. Запити, що стосуються високоризикових завдань із кібербезпеки, помітно перенаправляються до Sonnet 5. Через розширену програму кіберперевірки кваліфіковані фахівці можуть подати заявку на доступ відповідного рівня.
Anthropic також додала класифікатори безпеки проти атак дистиляції — такі самі, як у її найпотужніших моделях. Чи справді ці заходи працюють, має стати зрозуміло протягом найближчих місяців. Якщо китайські лабораторії отримували переваги від таких атак, перекриття цього вектора може знову збільшити розрив із західними лабораторіями.
Новини ШІ без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневу розсилку про ШІ, ексклюзивний звіт про передові технології «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.