Claude Opus 5.5 сравнялся с Fable 5.1 по производительности при меньшей стоимости и обещает меньше текста в стиле «Claudish»
Anthropic выпускает Claude Opus 5.5 — первую модель нового семейства. Компания заявляет, что она обеспечивает производительность уровня Claude Fable 5.1, при этом обходится значительно дешевле и работает быстрее предшественницы.
По данным Anthropic, Opus 5.5 сопоставим с Claude Fable 5.1 «в большинстве задач», а его эксплуатация примерно на 40 процентов дешевле, чем у Opus 5. Claude Sonnet 5.5 и Haiku 5.5 ожидаются в ближайшие недели и должны продемонстрировать аналогичный прирост производительности, эффективности и безопасности. Согласно тестам Anthropic, новая модель Opus опережает Fable 5.1 и гораздо более дорогую GPT-6 Astra от OpenAI в большинстве задач.
| Тест / способность | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Агентное программирование Terminal-Bench 4.0[1] |
66.4% | 55.8% | 52.3% | 57.9% | 37.3% |
| Агентное программирование FrontierCode v1.1 (Main) |
54.4% | 50.3% | 48.0% | 53.3% | 47.5% |
| Агентное программирование CursorBench 4.0 |
57.8% | 51.8% | 46.6% | N/A | 41.7% |
| Интеллектуальная работа GDPval-AA v2.1 |
1,846 | 1,735 | 1,708 | 1,542 | 1,588 |
| Бизнес-процессы AutomationBench[1] |
40.0% | 31.4% | 26.9% | 41.4% | 28.8% |
| Междисциплинарное рассуждение Humanity's Last Exam |
67.7% (с инструментами) |
65.6% (с инструментами) |
63.6% (с инструментами) |
57.2% (с инструментами) |
N/A |
| Агентное научное исследование Terminal-Bench-Science 0.1[1] |
58.7% | 52.6% | 29.0% | 64.6% | 22.4% |
| Работа с компьютером OSWorld 2.0 |
81.8% (частично) |
80.7% (частично) |
74.0% (частично) |
N/A | N/A |
| Распознавание визуальных графиков Chartography |
89.0% (с инструментами) |
88.4% (с инструментами) |
83.4% (с инструментами) |
N/A | N/A |
Anthropic заявляет, что новая серия прежде всего учитывает отзывы клиентов о стоимости, эффективности и качестве коммуникации, особенно в сфере финансовых услуг, права и разработки программного обеспечения.
Более низкие цены и расход токенов сокращают эксплуатационные затраты
Anthropic установила для Opus 5.5 цену в 4 доллара за миллион входных токенов и 20 долларов за миллион выходных токенов — против 5 и 25 долларов соответственно для Opus 5. Это означает снижение цен на токены на 20 процентов. Компания также сократила стоимость чтения кэша на 60 процентов.
Anthropic заявляет, что общие эксплуатационные затраты, учитывающие как цены на токены, так и их расход, должны быть примерно на 40 процентов ниже, чем у Opus 5. Модель использует меньше токенов и генерирует ответы более чем на 30 процентов быстрее.
| Цены за 1 млн токенов | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| Чтение кэша | $0.20 | $0.50 |
| Входные токены | $4 | $5 |
| Выходные токены | $20 | $25 |
| Запись в кэш | $5 | $6.25 |
Пятчасовые лимиты использования для подписчиков увеличатся на 20 процентов. С учетом более низкой стоимости модели Anthropic заявляет, что в целом эти лимиты позволят выполнять на 25 процентов больше работы. Пользователи также смогут сохранить сброс лимита на случай, когда он понадобится больше всего.
Anthropic использует тесты программирования, чтобы обосновать соотношение цены и производительности. В FrontierCode компания заявляет, что Opus 5.5 превосходит GPT-6 Astra от OpenAI примерно при 20 процентах стоимости одной задачи. В Terminal-Bench 4.0, по ее утверждению, модель демонстрирует такую же производительность, как Astra, при 40 процентах ее стоимости. В CursorBench, как утверждает Anthropic, Opus 5.5 опережает GPT-5.6 Sol на 11 пунктов, обходясь в три раза дешевле.
Снижение цены стало ответом на давление со стороны OpenAI и особенно китайских моделей ИИ, которые обеспечивают более низкую производительность, но стоят лишь малую долю этой суммы.
Anthropic обещает меньше «клавдистости»
Opus 5.5 также должен общаться естественнее, чем предыдущие модели. Anthropic заявляет, что он выносит наиболее важную информацию на первое место, использует меньше жаргона и точнее следует инструкциям по стилю письма. Первые тестировщики описывали его тексты как более ясные и понятные, что, по словам Anthropic, делает модель лучшим партнером для длительных рабочих сессий. Текущие модели Claude подвергались многочисленной критике за их шаблонный, запутанный стиль, который иногда называют «клавдистым».

Opus 5.5 также стала первой моделью Opus с мерами защиты для кибербезопасности, биологии и разработки передовых больших языковых моделей, соответствующими мерам Fable 5.1. Когда эти меры защиты срабатывают, Anthropic заявляет, что запросы прозрачно перенаправляются к другой модели.
Пользователи по-прежнему смогут находить и исправлять ошибки в своем коде, но большинство задач по кибербезопасности будет передаваться более старой модели Opus 4.8. Запросы, помеченные классификаторами как связанные с биологией или разработкой передовых больших языковых моделей, будут направляться в Opus 5.
Подтвержденные организации могут подать заявку на использование модели для биологических исследований через программу проверки организаций в сфере наук о жизни. Anthropic планирует в ближайшие недели распространить свою существующую программу проверки в сфере кибербезопасности на Opus 5.5.
Claude Opus 5.5 уже доступен на всех платформах, включая Amazon Web Services, Google Cloud и Microsoft Azure. Разработчики, использующие Claude Platform, могут получить к нему доступ по идентификатору модели claude-opus-5-5.
Anthropic призывает повысить стандарты безопасности по мере роста возможностей моделей
Anthropic планирует ужесточить проверку сред обучения с подкреплением. Компания заявляет, что несовершенные среды обучения являются основным источником несогласованного поведения моделей. Компания также работает над улучшением вознаграждений за согласованность, автоматизированными способами создания сценариев обучения безопасности, а также усилением мер безопасности и мониторинга.
Лаборатории ИИ обсуждают, насколько быстро следует выпускать более мощные модели. Недавно OpenAI призвала установить международные стандарты для систем ИИ, способных самостоятельно совершенствоваться, тогда как несколько исследователей публично призвали лаборатории замедлить выпуск моделей, пока методы согласования не поспеют за их развитием. Anthropic занимает аналогичную позицию, призывая установить более высокий стандарт безопасности для моделей, способных полностью автоматизировать исследования в области ИИ. Компания считает, что государственная политика должна играть более значительную роль в установлении этого стандарта. Внешние организации Frontier Design и METR протестировали Opus 5.5 до его выпуска.
Новые ограничения направлены против дистилляции и помогают соблюдать Закон ЕС об ИИ
Anthropic также вводит меры против так называемых атак дистилляции. Компания заявляет, что злоумышленники используют тысячи поддельных аккаунтов, чтобы в промышленном масштабе извлекать возможности модели и создавать высокоэффективные модели без предусмотренных в ней мер защиты. Anthropic ссылается на отчет об угрозах за сентябрь 2026 года, в котором задокументирована выявленная и пресеченная на данный момент незаконная деятельность по дистилляции.
Opus 5.5 запускается с функцией «Preserved Thinking» — мерой против дистилляции, впервые представленной в Fable 5.1. Она не позволяет пользователям API редактировать предыдущий контекст Claude, чтобы извлекать ход его рассуждений. Эта мера распространяется на Fable 5.1 и Opus 5.5 для учетных записей API, созданных 31 августа 2026 года или позднее.
Opus 5.5 также включает меры по нанесению водяных знаков для соблюдения Закона ЕС об ИИ. Модель больше нельзя запускать с отключенным режимом «Thinking», и она доступна с нулевым хранением данных.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный отраслевой отчет «AI Radar» шесть раз в год, иметь полный доступ к архиву и возможность оставлять комментарии.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.