Anthropic випустила Claude Fable 5.1 і Claude Mythos 5.1: 52,6% у Terminal-Bench-Science і читання з кешу на 75% дешевше
Anthropic випустила Claude Fable 5.1 і Claude Mythos 5.1 через три місяці після виходу лінійки Fable 5 у червні 2026 року. Це одна й та сама базова модель із різними рівнями захисних обмежень. Fable 5.1 загальнодоступна як claude-fable-5-1; Mythos 5.1 залишається доступною лише перевіреним організаціям. Обидві моделі мають контекстне вікно на 1 млн токенів і максимальний обсяг вихідних даних у 128 тис. токенів, а адаптивне мислення завжди ввімкнене. Головний показник можливостей — 52,6% у Terminal-Bench-Science 0.1 проти 24,7% у Fable 5 і 29,0% у Opus 5. Головний комерційний показник — зниження вартості читання кешу на 75%: з $1,00 до $0,25 за мільйон токенів. За оцінкою Anthropic, це означає приблизно на 25% нижчу вартість типових робочих навантажень і до 45% — агентних. Базові тарифи на введення та виведення не змінилися й становлять $10 і $50 за мільйон токенів.
Чи можна її розгортати?
Так, Claude Fable 5.1 загальнодоступна як claude-fable-5-1 у Claude API, Amazon Bedrock, Claude Platform на AWS, Google Cloud і Microsoft Foundry. Claude Mythos 5.1 — ні: вона доступна лише перевіреним організаціям зі США в межах Project Glasswing.
Показники бенчмарків
У Terminal-Bench-Science 0.1, агентному бенчмарку наукових досліджень, Fable 5.1 набирає 52,6% проти 29,0% у Opus 5, 24,7% у Fable 5 і 22,4% у GPT-5.6 Sol. Anthropic повідомляє про стандартну похибку від 3,5 до 4,5 пункта для кожної моделі, тож до різниці, а не до самого рейтингу, слід ставитися обережно.
У Terminal-Bench 4.0 Fable 5.1 досягає 55,8%, а Mythos 5.1 — 60,9%. Різниця між двома ідентичними моделями є ціною втручань захисних механізмів, що є незвично чесним розкриттям інформації. В інших тестах: CursorBench 3.2.0 — 73,4%, Humanity’s Last Exam — 60,9% без інструментів і 65,0% з інструментами, AutomationBench — 31,4%, OSWorld 2.0 — 41,7% за суворими критеріями, а GDPval-AA v2 — 1853.
Звідки береться зниження вартості
Базові тарифи на введення та виведення не змінилися. Вартість читання кешу знижується на 75% — з $1,00 до $0,25 за мільйон токенів, тобто становить 0,025 базового тарифу на введення проти 0,1 у всіх інших моделях Claude. За оцінкою Anthropic, вартість типових робочих навантажень знижується приблизно на 25%, а для агентних сценаріїв із великим обсягом контексту — до 45%. Пакетна обробка коштує $5 і $25 за мільйон токенів.
Три критичні зміни, з якими зіткнуться команди
- Примусове використання інструментів скасовано:
tool_choice, встановлений уanyабоtool, повертає помилку 400. Натомість використовуйтеautoіз суворим використанням інструментів або структурованими вихідними даними. - Блоки мислення прив’язані до моделі: Fable 5.1 читає блоки мислення попередніх моделей, але жодна попередня модель не читає блоки власного мислення. У конфігураціях із маршрутизацією та резервними моделями під час переходу на нижчу модель міркування втрачаються.
- Редагування попередніх повідомлень робить блоки мислення недійсними: додавання й видалення нагадувань для окремих повідомлень або перебудова масиву
systemчиtoolsпосеред розмови тепер спричиняє помилку. Ця перевірка застосовується до облікових записів, створених 31 серпня 2026 року або пізніше. Рішення — системні повідомлення, обмежені окремими ходами, і редагування контексту на стороні сервера.
Додаткові зміни: параметр зусиль для кожного повідомлення, системні повідомлення, обмежені окремими ходами, і thinking.display: "updates" доступні в бета-версії через заголовки. Походження контенту не є необов’язковим: усі вихідні дані містять статистичний текстовий водяний знак, а файли — облікові дані C2PA.
Anthropic також документує реальні регресії. Паралельні виклики інструментів стали менш стабільними, тому агентні цикли можуть виконувати по одному виклику за хід, тоді як Fable 5 виконувала кілька за раз. Модель менше описує свої дії, частіше відповідає з пам’яті за низького рівня зусиль і віддає перевагу переписуванню всього файлу замість цільових редагувань.
Захисні механізми та наука
Захисні механізми кібербезпеки тепер дозволяють виявляти вразливості, але не розробляти експлойти, що скорочує кількість втручань у Claude Code приблизно на 60% за сеанс. Захисні механізми біобезпеки спрацьовують на 85% рідше під час виконання нешкідливих запитів. Тестування на проникнення, генерація експлойтів і сканування вразливостей на основі бінарних файлів і надалі перенаправляються до Opus.
У дослідницькій сфері Mythos 5.1 розробила білки-зв’язувачі з приблизно 50% частотою успішних результатів для 12 мішеней проти стандартного показника 10–15%, Fable 5.1 побудувала карту висот Венери з роздільною здатністю 2–3 км, а спеціалізовані GPU-ядра прискорили сім геномних моделей із відкритим кодом до 2,5 раза.
Ключові висновки
- Fable 5.1 і Mythos 5.1 — це одна модель із двома рівнями захисних механізмів; загальнодоступною є лише Fable.
- 52,6% у Terminal-Bench-Science 0.1 — приблизно вдвічі більше, ніж 24,7% у Fable 5.
- Вартість читання кешу знижується на 75% — до $0,25 за мільйон токенів; базові тарифи не змінюються.
- Три критичні зміни API впливають на будь-якого агента, який редагує історію розмови.
- Застосовується 30-денне зберігання даних; для нульового зберігання даних потрібен прямий дозвіл.
Ознайомтеся з технічними деталями. Також стежте за нами у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно співпрацювати з нами для просування вашого GitHub Repo, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.