Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Anthropic выпускает Claude Opus 5.5: производительность на уровне Fable 5.1 при эксплуатационных расходах на 40% ниже, чем у Opus 5

Anthropic выпустила Claude Opus 5.5 — первую модель в новом семействе Claude 5.5. Команда заявляет, что по большинству задач она работает на уровне Claude Fable 5.1. При стандартных настройках её эксплуатация также обходится на 40% дешевле, чем Opus 5, при типичных рабочих нагрузках. В собственных тестах Anthropic модель лидирует в агентском программировании, работе с компьютером и интеллектуальной деятельности.

Можно ли её развернуть? Да, в качестве управляемой API-модели. Anthropic не выпустила веса, поэтому самостоятельное размещение невозможно. Разработчики могут вызывать claude-opus-5-5 через Claude Platform, Amazon Web Services, Google Cloud и Microsoft Azure. Как и для предыдущих моделей Opus, доступно хранение данных с нулевым сроком хранения.

Тесты: уверенное лидерство, но не абсолютная победа

Результаты Opus 5.5 получены с использованием адаптивного рассуждения при максимальном уровне усилий и включённых производственных средствах защиты.

ТестOpus 5.5Fable 5.1Opus 5GPT-6 Astra
Terminal-Bench 4.066.4%55.8%52.3%57.9%
FrontierCode v1.154.4%50.3%48.0%53.3%
CursorBench 4.057.8%51.8%46.6%н/д
GDPval-AA v2.1 (Elo)1846173517081542
OSWorld 2.081.8%80.7%74.0%н/д
Terminal-Bench-Science 0.158.7%52.6%29.0%64.6%
AutomationBench40.0%31.4%26.9%41.4%

Для Opus 5.5 результат Terminal-Bench 4.0 указан при максимальном уровне усилий. GPT-6 Astra по-прежнему лидирует в Terminal-Bench-Science и AutomationBench. Zapier запускала AutomationBench без резервных моделей, поэтому вмешательства средств защиты засчитывались как ошибки. Anthropic также предупреждает, что разрыв в результатах тестов становится менее надёжным ориентиром. При собственном использовании разница с Fable 5.1 оказывается меньше, чем предполагают показатели.

Результаты с учётом стоимости более показательны. При стандартном (среднем) уровне усилий Opus 5.5 набирает 54.6% во FrontierCode. Это выше максимального результата GPT-6 Astra — 53.3%, при этом стоимость одной задачи примерно в пять раз ниже. В CursorBench результат при среднем уровне усилий составляет 52.5%. Это на 11 пунктов выше лучшего результата GPT-5.6 Sol при стоимости примерно в три раза ниже.

Стоимость и скорость

Для обслуживания Opus 5.5 требуется меньше вычислительных ресурсов, чем для Opus 5, что отражается и в тарифах.

За 1 млн токеновOpus 5.5Opus 5
Ввод$4$5
Вывод$20$25
Чтение кэша$0.20$0.50
Запись в кэш$5$6.25

На чтение кэша приходится большая часть затрат на агентские задачи и программирование, и теперь они снизились на 60%. Opus 5.5 также использует меньше токенов на задачу. В совокупности это даёт снижение стоимости на 40%. Генерация вывода более чем на 30% быстрее, чем у Opus 5. Быстрый режим в Claude Code и Claude Platform обеспечивает скорость до 2,5 раза выше по цене $8 за ввод и $40 за вывод на миллион токенов.

Anthropic также повышает лимиты использования в течение пяти часов для тарифов Pro, Max, Team и Enterprise с оплатой за места. Подписчики получают сброс лимита запросов, который можно сохранить и использовать позднее.

Что сообщили первые тестировщики

  • Один из тестировщиков завершил миграцию кода объёмом 680 000 строк менее чем за день.
  • Другой проверил и исправил кодовую базу из 200 000 строк менее чем за 3 часа. Opus 5 потребовалось более 20 часов и в 2,5 раза больше токенов.
  • Во время внутреннего переноса HAProxy с C на Rust Opus 5.5 завершила работу за 9,5 часа. Fable 5.1 потребовалось 12 часов, а стоимость использования Opus 5.5 была на 51% ниже.
  • Deloitte сообщает, что Opus 5.5 при минимальном уровне усилий обнаружила 72% известных ошибок при проверке. Opus 5 при высоком уровне усилий обнаружила 56%.
  • В тесте отчётов о доходах, для которого сложно найти исходные данные, 16 из 18 отчётов Opus 5.5 соответствовали стандартам качества Anthropic. Fable 5.1 и Opus 5 не смогли этого сделать ни разу.

Стиль письма также изменился. Opus 5.5 помещает ключевую информацию в начало, использует меньше жаргона и соблюдает заданные вами правила написания.

Безопасность, средства защиты и изменения API

Opus 5.5 — первый релиз Anthropic после призыва генерального директора Дарио Амодеи к сдерживанию развития передовых технологий. Перед выпуском модель протестировали внешние оценщики, включая METR и Frontier Design. Она показала лучший на сегодняшний день результат в автоматизированном поведенческом аудите Anthropic, охватывающем почти 2 000 сценариев. В новом тесте на соблюдение ограничений модель примерно на 85% реже пыталась обходить установленные границы, чем Opus 5. Anthropic также отмечает, что модель часто подозревает, что её оценивают.

Её возможности в биологии и кибербезопасности сопоставимы с Claude Mythos 5.1. Поэтому Opus 5.5 поставляется со средствами защиты, аналогичными Fable 5.1:

Ещё два изменения затрагивают интеграции. Рассуждение больше нельзя отключить. Выводы также содержат водяные знаки для соблюдения требований Закона ЕС об искусственном интеллекте. Полная информация приведена в системной карте Opus 5.5.

Интерактивное объяснение

Основные выводы

  • Opus 5.5 сопоставима с Fable 5.1 по большинству задач и превосходит Opus 5 и Fable 5.1 почти во всех опубликованных тестах.
  • Стоимость API снижается до $4/$20 за 1 млн токенов, а чтение кэша дешевеет на 60% — до $0.20.
  • Anthropic оценивает экономию при типичных рабочих нагрузках в 40%, а скорость вывода более чем на 30% выше, чем у Opus 5.
  • Запросы в области кибербезопасности и биологии получают средства защиты уровня Fable 5.1, а рассуждение нельзя отключить.
  • Закрытые веса: claude-opus-5-5 работает через Claude Platform, AWS, Google Cloud и Azure.

Ознакомьтесь с техническими подробностями здесь. Вся благодарность — исследователю этого проекта. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему сабреддиту по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости