Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1: 52,6% в Terminal-Bench-Science и чтение из кэша на 75% дешевле

Anthropic выпустила Claude Fable 5.1 и Claude Mythos 5.1 через три месяца после выхода линейки Fable 5 в июне 2026 года. Это одна и та же базовая модель, работающая с разными уровнями защитных ограничений. Fable 5.1 доступна всем в виде claude-fable-5-1; Mythos 5.1 по-прежнему доступна только проверенным организациям. Обе модели имеют контекстное окно на 1 млн токенов и максимальный объём вывода в 128 тыс. токенов, при этом адаптивное рассуждение всегда включено. Главный показатель возможностей — 52,6% в Terminal-Bench-Science 0.1 против 24,7% у Fable 5 и 29,0% у Opus 5. Главный коммерческий показатель — снижение стоимости чтения кэша на 75%: с $1,00 до $0,25 за миллион токенов; по оценке Anthropic, это означает примерно на 25% меньшую стоимость типичных рабочих нагрузок и до 45% — агентских. Базовые цены на ввод и вывод не изменились и составляют $10 и $50 за миллион токенов.

Можно ли её развернуть?

Да, Claude Fable 5.1 доступна всем в виде claude-fable-5-1 через Claude API, Amazon Bedrock, Claude Platform на AWS, Google Cloud и Microsoft Foundry. Claude Mythos 5.1 — нет: она доступна только проверенным организациям в США в рамках Project Glasswing.

Показатели бенчмарков

В Terminal-Bench-Science 0.1, агентском бенчмарке для научных исследований, Fable 5.1 набирает 52,6% против 29,0% у Opus 5, 24,7% у Fable 5 и 22,4% у GPT-5.6 Sol. Anthropic сообщает о стандартной ошибке от 3,5 до 4,5 процентного пункта для каждой модели, поэтому к разнице, а не к самому рейтингу, следует относиться с осторожностью.

В Terminal-Bench 4.0 Fable 5.1 достигает 55,8%, а Mythos 5.1 — 60,9%. Разница между двумя идентичными моделями — это цена защитных вмешательств, что является необычно честным раскрытием информации. Другие результаты: 73,4% в CursorBench 3.2.0, 60,9% в Humanity’s Last Exam без инструментов и 65,0% с инструментами, 31,4% в AutomationBench, 41,7% в OSWorld 2.0 при строгой оценке и 1853 в GDPval-AA v2.

Откуда берётся снижение стоимости

Базовые цены на ввод и вывод не изменились. Стоимость чтения кэша снизилась на 75% — с $1,00 до $0,25 за миллион токенов, что составляет 0,025 от базовой цены ввода против 0,1 у всех остальных моделей Claude. По оценке Anthropic, стоимость типичных рабочих нагрузок снижается примерно на 25%, а контекстно-зависимых агентских — примерно до 45%. Пакетная обработка стоит $5 и $25 за миллион токенов.

Три критических изменения, с которыми столкнутся команды

  1. Принудительное использование инструментов отменено: значение tool_choice, установленное в any или tool, возвращает ошибку 400. Вместо этого используйте auto со строгим применением инструментов или структурированным выводом.
  2. Блоки рассуждений привязаны к модели: Fable 5.1 читает блоки рассуждений более ранних моделей, но ни одна более ранняя модель не читает собственные блоки рассуждений. При переключении на резервную модель или маршрутизации на более раннюю модель конфигурации теряют рассуждения.
  3. Изменение предыдущих сообщений делает блоки рассуждений недействительными: добавление и удаление напоминаний для отдельных сообщений или перестроение массива system или tools в ходе разговора теперь приводит к ошибке. Эта проверка применяется к аккаунтам, созданным 31 августа 2026 года или позже. Решения — системные сообщения, ограниченные рамками отдельного сообщения, и редактирование контекста на стороне сервера.

Дополнительные изменения: усилие для каждого сообщения, системные сообщения, ограниченные рамками отдельного сообщения, и thinking.display: "updates" доступны в бета-версии через заголовки. Происхождение контента не является необязательным: весь вывод содержит статистический текстовый водяной знак, а файлы — учётные данные C2PA.

Anthropic также документирует реальные ухудшения. Параллельный вызов инструментов стал более вариативным, поэтому агентские циклы могут выполнять по одному вызову за ход, тогда как Fable 5 объединяла несколько вызовов. Модель меньше описывает свои действия, чаще отвечает по памяти при низком уровне усилий и предпочитает переписывать целые файлы точечным изменениям.

Защитные ограничения и наука

Киберзащитные ограничения теперь разрешают поиск уязвимостей, но не разработку эксплойтов, что примерно на 60% сокращает количество вмешательств в Claude Code за сеанс. Биологические защитные ограничения срабатывают на 85% реже при безопасных запросах. Тестирование на проникновение, создание эксплойтов и сканирование уязвимостей на основе бинарных файлов по-прежнему перенаправляются в Opus.

В исследовательской сфере Mythos 5.1 разработала белковые связывающие молекулы с частотой успешных результатов примерно 50% для 12 мишеней против стандартного показателя в 10–15%, Fable 5.1 создала карту высот Венеры с разрешением от 2 до 3 км, а пользовательские ядра GPU ускорили семь геномных моделей с открытым исходным кодом максимум в 2,5 раза.

Основные выводы

  • Fable 5.1 и Mythos 5.1 — это одна модель с двумя уровнями защитных ограничений; только Fable доступна всем.
  • 52,6% в Terminal-Bench-Science 0.1 — примерно вдвое больше, чем 24,7% у Fable 5.
  • Стоимость чтения кэша снижается на 75% — до $0,25 за миллион токенов; базовые тарифы не меняются.
  • Три критических изменения API затронут любого агента, который редактирует историю разговора.
  • Применяется хранение данных в течение 30 дней; для нулевого хранения данных требуется специальное разрешение.

Ознакомьтесь с техническими подробностями. Также подписывайтесь на нас в Twitter и не забудьте присоединиться к нашему SubReddit по машинному обучению с более чем 150 тыс. участников и подписаться на нашу рассылку. Постойте! Вы пользуетесь Telegram? теперь вы также можете присоединиться к нам в Telegram.

Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости