Anthropic выпускает Claude Opus 5.5: производительность на уровне Fable 5.1 при эксплуатационных расходах на 40% ниже, чем у Opus 5
Anthropic выпустила Claude Opus 5.5 — первую модель в новом семействе Claude 5.5. Команда заявляет, что по большинству задач она работает на уровне Claude Fable 5.1. При стандартных настройках её эксплуатация также обходится на 40% дешевле, чем Opus 5, при типичных рабочих нагрузках. В собственных тестах Anthropic модель лидирует в агентском программировании, работе с компьютером и интеллектуальной деятельности.
Можно ли её развернуть? Да, в качестве управляемой API-модели. Anthropic не выпустила веса, поэтому самостоятельное размещение невозможно. Разработчики могут вызывать claude-opus-5-5 через Claude Platform, Amazon Web Services, Google Cloud и Microsoft Azure. Как и для предыдущих моделей Opus, доступно хранение данных с нулевым сроком хранения.
Тесты: уверенное лидерство, но не абсолютная победа
Результаты Opus 5.5 получены с использованием адаптивного рассуждения при максимальном уровне усилий и включённых производственных средствах защиты.
| Тест | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | н/д |
| GDPval-AA v2.1 (Elo) | 1846 | 1735 | 1708 | 1542 |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | н/д |
| Terminal-Bench-Science 0.1 | 58.7% | 52.6% | 29.0% | 64.6% |
| AutomationBench | 40.0% | 31.4% | 26.9% | 41.4% |
Для Opus 5.5 результат Terminal-Bench 4.0 указан при максимальном уровне усилий. GPT-6 Astra по-прежнему лидирует в Terminal-Bench-Science и AutomationBench. Zapier запускала AutomationBench без резервных моделей, поэтому вмешательства средств защиты засчитывались как ошибки. Anthropic также предупреждает, что разрыв в результатах тестов становится менее надёжным ориентиром. При собственном использовании разница с Fable 5.1 оказывается меньше, чем предполагают показатели.
Результаты с учётом стоимости более показательны. При стандартном (среднем) уровне усилий Opus 5.5 набирает 54.6% во FrontierCode. Это выше максимального результата GPT-6 Astra — 53.3%, при этом стоимость одной задачи примерно в пять раз ниже. В CursorBench результат при среднем уровне усилий составляет 52.5%. Это на 11 пунктов выше лучшего результата GPT-5.6 Sol при стоимости примерно в три раза ниже.
Стоимость и скорость
Для обслуживания Opus 5.5 требуется меньше вычислительных ресурсов, чем для Opus 5, что отражается и в тарифах.
| За 1 млн токенов | Opus 5.5 | Opus 5 |
|---|---|---|
| Ввод | $4 | $5 |
| Вывод | $20 | $25 |
| Чтение кэша | $0.20 | $0.50 |
| Запись в кэш | $5 | $6.25 |
На чтение кэша приходится большая часть затрат на агентские задачи и программирование, и теперь они снизились на 60%. Opus 5.5 также использует меньше токенов на задачу. В совокупности это даёт снижение стоимости на 40%. Генерация вывода более чем на 30% быстрее, чем у Opus 5. Быстрый режим в Claude Code и Claude Platform обеспечивает скорость до 2,5 раза выше по цене $8 за ввод и $40 за вывод на миллион токенов.
Anthropic также повышает лимиты использования в течение пяти часов для тарифов Pro, Max, Team и Enterprise с оплатой за места. Подписчики получают сброс лимита запросов, который можно сохранить и использовать позднее.
Что сообщили первые тестировщики
- Один из тестировщиков завершил миграцию кода объёмом 680 000 строк менее чем за день.
- Другой проверил и исправил кодовую базу из 200 000 строк менее чем за 3 часа. Opus 5 потребовалось более 20 часов и в 2,5 раза больше токенов.
- Во время внутреннего переноса HAProxy с C на Rust Opus 5.5 завершила работу за 9,5 часа. Fable 5.1 потребовалось 12 часов, а стоимость использования Opus 5.5 была на 51% ниже.
- Deloitte сообщает, что Opus 5.5 при минимальном уровне усилий обнаружила 72% известных ошибок при проверке. Opus 5 при высоком уровне усилий обнаружила 56%.
- В тесте отчётов о доходах, для которого сложно найти исходные данные, 16 из 18 отчётов Opus 5.5 соответствовали стандартам качества Anthropic. Fable 5.1 и Opus 5 не смогли этого сделать ни разу.
Стиль письма также изменился. Opus 5.5 помещает ключевую информацию в начало, использует меньше жаргона и соблюдает заданные вами правила написания.
Безопасность, средства защиты и изменения API
Opus 5.5 — первый релиз Anthropic после призыва генерального директора Дарио Амодеи к сдерживанию развития передовых технологий. Перед выпуском модель протестировали внешние оценщики, включая METR и Frontier Design. Она показала лучший на сегодняшний день результат в автоматизированном поведенческом аудите Anthropic, охватывающем почти 2 000 сценариев. В новом тесте на соблюдение ограничений модель примерно на 85% реже пыталась обходить установленные границы, чем Opus 5. Anthropic также отмечает, что модель часто подозревает, что её оценивают.
Её возможности в биологии и кибербезопасности сопоставимы с Claude Mythos 5.1. Поэтому Opus 5.5 поставляется со средствами защиты, аналогичными Fable 5.1:
- Кибербезопасность: обычный поиск и исправление ошибок работает. Большинство других задач в области кибербезопасности перенаправляется в Opus 4.8. Программа проверки кибербезопасности будет расширена на Opus 5.5.
- Биология: проверенные организации могут подать заявку в Программу проверки в области наук о жизни.
- Дистилляция: Сохранённое рассуждение не позволяет пользователям API редактировать предыдущий контекст для извлечения цепочки рассуждений. Это относится к API-аккаунтам, созданным 31 августа 2026 года или позднее.
Ещё два изменения затрагивают интеграции. Рассуждение больше нельзя отключить. Выводы также содержат водяные знаки для соблюдения требований Закона ЕС об искусственном интеллекте. Полная информация приведена в системной карте Opus 5.5.
Интерактивное объяснение
Основные выводы
- Opus 5.5 сопоставима с Fable 5.1 по большинству задач и превосходит Opus 5 и Fable 5.1 почти во всех опубликованных тестах.
- Стоимость API снижается до $4/$20 за 1 млн токенов, а чтение кэша дешевеет на 60% — до $0.20.
- Anthropic оценивает экономию при типичных рабочих нагрузках в 40%, а скорость вывода более чем на 30% выше, чем у Opus 5.
- Запросы в области кибербезопасности и биологии получают средства защиты уровня Fable 5.1, а рассуждение нельзя отключить.
- Закрытые веса:
claude-opus-5-5работает через Claude Platform, AWS, Google Cloud и Azure.
Ознакомьтесь с техническими подробностями здесь. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.