Anthropic пусна Claude Fable 5.1 и Claude Mythos 5.1: 52,6% в Terminal-Bench-Science и 75% по-евтино четене от кеша
Anthropic пусна Claude Fable 5.1 и Claude Mythos 5.1, три месеца след като линията Fable 5 излезе през юни 2026 г. Двата модела са един и същ базов модел, но с различни слоеве за защита. Fable 5.1 е общодостъпен като claude-fable-5-1; Mythos 5.1 остава ограничен до проверени организации. И двата разполагат с контекстен прозорец от 1 млн. токена и максимален изход от 128 хил. токена, като адаптивното мислене е винаги включено. Основният показател за възможностите е 52,6% в Terminal-Bench-Science 0.1 спрямо 24,7% за Fable 5 и 29,0% за Opus 5. Основният търговски показател е намаление със 75% на четенето от кеша — от $1,00 на $0,25 за милион токена, което според измерванията на Anthropic означава приблизително 25% по-ниска цена при типични натоварвания и до 45% при агентни натоварвания. Базовите цени за вход и изход остават непроменени — $10 и $50 за милион токена.
Може ли да бъде внедрен?
Да, Claude Fable 5.1 е общодостъпен като claude-fable-5-1 в Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud и Microsoft Foundry. Claude Mythos 5.1 не е: той е ограничен до проверени организации в САЩ в рамките на Project Glasswing.
Резултатите от бенчмарковете
В Terminal-Bench-Science 0.1, агентен бенчмарк за научни изследвания, Fable 5.1 постига 52,6% спрямо 29,0% за Opus 5, 24,7% за Fable 5 и 22,4% за GPT-5.6 Sol. Anthropic отчита стандартна грешка от 3,5 до 4,5 пункта за всеки модел, така че разликата, а не класирането, трябва да се разглежда внимателно.
В Terminal-Bench 4.0 Fable 5.1 достига 55,8%, а Mythos 5.1 — 60,9%. Разликата между двата идентични модела е цената на защитните интервенции, което е необичайно честно разкритие. На други места: CursorBench 3.2.0 с 73,4%, Humanity’s Last Exam с 60,9% без инструменти и 65,0% с инструменти, AutomationBench с 31,4%, OSWorld 2.0 с 41,7% при стриктна оценка и GDPval-AA v2 с 1853.
Откъде идва намалението на разходите
Базовите цени за вход и изход остават непроменени. Четенето от кеша поевтинява със 75% — от $1,00 на $0,25 за милион токена, което е 0,025 пъти базовата цена за вход спрямо 0,1 при всички останали модели Claude. Anthropic измерва приблизително 25% по-ниска цена при типични натоварвания и до около 45% при агентни натоварвания с интензивно използване на контекста. Пакетната обработка струва $5 и $25 за милион токена.
Три съществени промени, с които екипите ще се сблъскат
- Принудителното използване на инструменти отпада:
tool_choice, зададено наanyилиtool, връща 400. Вместо това използвайтеautoсъс стриктно използване на инструменти или структурирани изходи. - Блоковете за мислене са обвързани с модела: Fable 5.1 прочита блокове за мислене от по-ранни модели, но нито един по-ранен модел не прочита неговите. Конфигурациите с рутер и резервен модел губят разсъжденията, когато преминат към по-слаб модел.
- Редактирането на по-ранни ходове обезсилва блоковете за мислене: Вмъкването и изтриването на напомняния за отделни ходове или възстановяването на масива
systemилиtoolsпо средата на разговор вече води до грешка. Проверката се прилага за акаунти, създадени на или след 31 август 2026 г. Решенията са системни съобщения, обхващащи конкретния ход, и редактиране на контекста от страна на сървъра.
Допълнителните промени включват усилие за отделно съобщение, системни съобщения за конкретен ход и thinking.display: "updates", като всички те са в бета версия и са достъпни чрез заглавки. Произходът на съдържанието не е опционален — целият изход съдържа статистически текстов воден знак, а файловете имат идентификационни данни C2PA.
Anthropic също така документира реални регресии. Паралелното извикване на инструменти е по-непредвидимо, така че агентните цикли може да изпращат по едно извикване на ход, докато Fable 5 е групирал няколко. Моделът разказва по-малко, по-често отговаря от паметта си при ниско усилие и предпочита пренаписването на целия файл пред целенасочени редакции.
Защити и наука
Киберзащитите вече позволяват откриване на уязвимости, но не и разработване на експлойти, което намалява интервенциите в Claude Code с приблизително 60% на сесия. Биологичните защити се задействат с 85% по-рядко при безобидни заявки. Тестването за проникване, генерирането на експлойти и сканирането за уязвимости въз основа на двоичен код все още се пренасочват към Opus.
В областта на изследванията Mythos 5.1 е проектирал протеинови свързващи молекули с приблизително 50% успеваемост при 12 мишени спрямо обичайните 10–15%, Fable 5.1 е създал карта на релефа на Венера с резолюция от 2 до 3 км, а персонализирани GPU ядра са ускорили седем геномни модела с отворен код до 2,5 пъти.
Основни изводи
- Fable 5.1 и Mythos 5.1 са един модел с два слоя за защита; само Fable е общодостъпен.
- 52,6% в Terminal-Bench-Science 0.1 — приблизително двойно повече от 24,7% на Fable 5.
- Четенето от кеша поевтинява със 75% до $0,25 за милион токена; базовите цени не се променят.
- Три съществени промени в API засягат всеки агент, който редактира историята на разговора.
- Прилага се 30-дневно съхранение; нулево съхранение на данни изисква изрично разрешение.
Разгледайте техническите подробности. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия SubReddit с над 150 хил. членове за машинно обучение и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Искате да си партнирате с нас за популяризиране на вашето GitHub хранилище ИЛИ страница в Hugging Face, ИЛИ представяне на продукт, ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.