Anthropic випускає Claude Opus 5.5: продуктивність на рівні Fable 5.1 за вартості роботи на 40% нижчої, ніж у Opus 5
Anthropic випустила Claude Opus 5.5 — першу модель у своєму новому сімействі Claude 5.5. Команда заявляє, що за більшістю робочих завдань вона працює на рівні Claude Fable 5.1. Водночас її запуск на типових робочих навантаженнях із налаштуваннями за замовчуванням коштує на 40% дешевше, ніж Opus 5. За власними тестами Anthropic, модель лідирує в агентному програмуванні, роботі з комп’ютером і розумовій праці.
Чи придатна вона для розгортання? Так, як керована модель API. Anthropic не випустила ваги моделі, тому самостійне розгортання неможливе. Розробники можуть викликати claude-opus-5-5 через Claude Platform, Amazon Web Services, Google Cloud і Microsoft Azure. Як і для попередніх моделей Opus, доступне нульове зберігання даних.
Тести: значна перевага, але не повна перемога
Результати Opus 5.5 отримано з використанням адаптивного мислення на максимальному рівні з увімкненими виробничими запобіжниками.
| Тест | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | н/д |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | н/д |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
Для Opus 5.5 показник Terminal-Bench 4.0 наведено за максимального рівня зусиль. GPT-6 Astra все ще лідирує в Terminal-Bench-Science та AutomationBench. Zapier проводила AutomationBench без резервних моделей, тому втручання запобіжників зараховувалися як невдачі. Anthropic також застерігає, що перевага в тестах стає менш надійним орієнтиром. За власним досвідом компанії, розрив із Fable 5.1 вужчий, ніж свідчать результати.
Показники з урахуванням вартості є більш промовистими. За стандартного (середнього) рівня зусиль Opus 5.5 набирає 54.6% у FrontierCode. Це перевищує найкращий результат GPT-6 Astra — 53.3% — приблизно за п’яту частину вартості одного завдання. У CursorBench результат за середнього рівня зусиль становить 52.5%. Це на 11 пунктів вище за найкращий показник GPT-5.6 Sol і коштує приблизно третину від його вартості.
Ціни та швидкість
Для обслуговування Opus 5.5 потребує менше обчислювальних ресурсів, ніж Opus 5, що відображено в ціні.
| За 1 млн токенів | Opus 5.5 | Opus 5 |
|---|---|---|
| Вхідні дані | $4 | $5 |
| Вихідні дані | $20 | $25 |
| Читання кешу | $0.20 | $0.50 |
| Запис у кеш | $5 | $6.25 |
На читання кешу припадає більша частина витрат на агентні завдання та програмування, і ці витрати знижуються на 60%. Opus 5.5 також використовує менше токенів на завдання. Разом це дає зниження вартості на 40%. Генерування вихідних даних відбувається більш ніж на 30% швидше, ніж в Opus 5. Швидкий режим у Claude Code і Claude Platform забезпечує швидкість до 2,5 раза вищу за ціною $8 за вхідні та $40 за вихідні дані на мільйон токенів.
Anthropic також підвищує п’ятигодинні ліміти використання для тарифних планів Pro, Max, Team і Enterprise із оплатою за місця. Передплатники отримують скидання ліміту швидкості, яке можна зберегти та використати пізніше.
Що повідомили перші тестувальники
- Один тестувальник завершив міграцію коду обсягом 680 000 рядків менш ніж за день.
- Інший перевірив і виправив кодову базу обсягом 200 000 рядків менш ніж за 3 години. Opus 5 витратив понад 20 годин і в 2,5 раза більше токенів.
- Під час внутрішнього перенесення HAProxy з C на Rust Opus 5.5 завершила роботу за 9,5 години. Fable 5.1 знадобилося 12 годин, а Opus 5.5 коштувала на 51% дешевше.
- Deloitte повідомляє, що Opus 5.5 на найнижчому рівні зусиль виявила 72% відомих помилок під час перевірки. Opus 5 на високому рівні зусиль виявила 56%.
- У тесті зі звітом про прибутки, який було складно отримати, 16 із 18 звітів Opus 5.5 відповідали стандартам якості Anthropic. Fable 5.1 і Opus 5 не змогли цього зробити жодного разу.
Змінився також стиль написання. Opus 5.5 подає ключову інформацію на початку, використовує менше жаргону й дотримується правил написання, які ви їй задаєте.
Безпека, запобіжники та зміни API
Opus 5.5 — перший реліз Anthropic після того, як генеральний директор Даріо Амодеї закликав до стримування розвитку передових технологій. До релізу її протестували зовнішні оцінювачі, зокрема METR і Frontier Design. Модель показала найкращий на сьогодні результат в автоматизованому поведінковому аудиті Anthropic, який охоплює майже 2 000 сценаріїв. У новому тесті на стримування вона приблизно на 85% рідше намагалася обходити встановлені межі, ніж Opus 5. Anthropic також зазначає, що модель часто підозрює, що її оцінюють.
Її можливості в біології та кібербезпеці можна порівняти з Claude Mythos 5.1. Тож Opus 5.5 виходить із запобіжниками, подібними до Fable 5.1:
- Кібербезпека: Пошук і виправлення звичайних помилок працюють. Більшість інших завдань із кібербезпеки перенаправляються до Opus 4.8. Програма верифікації кібербезпеки буде розширена на Opus 5.5.
- Біологія: Перевірені організації можуть подати заявку до Програми верифікації наук про життя.
- Дистиляція: Збережене мислення не дозволяє користувачам API редагувати попередній контекст для вилучення міркувань. Це стосується облікових записів API, створених 31 серпня 2026 року або пізніше.
Ще дві зміни впливають на інтеграції. Мислення більше не можна вимкнути. Вихідні дані також містять водяні знаки для дотримання вимог Закону ЄС про штучний інтелект. Повну інформацію наведено в системній картці Opus 5.5.
Інтерактивне пояснення
Ключові висновки
- Opus 5.5 відповідає Fable 5.1 за більшістю завдань і перевершує як Opus 5, так і Fable 5.1 майже в кожному опублікованому тесті.
- Ціна API знижується до $4/$20 за 1 млн токенів, а вартість читання кешу падає на 60% — до $0,20.
- Anthropic оцінює економію на типових робочих навантаженнях у 40%, а генерування вихідних даних відбувається більш ніж на 30% швидше, ніж в Opus 5.
- Для запитів із кібербезпеки та біології застосовуються запобіжники рівня Fable 5.1, а мислення не можна вимкнути.
- Закриті ваги:
claude-opus-5-5працює через Claude Platform, AWS, Google Cloud і Azure.
Ознайомтеся з технічними деталями тут. Уся подяка досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання зі 150 тисячами+ учасників та підписатися на нашу розсилку. Стривайте! Ви користуєтеся Telegram? Тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.