Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Anthropic випустила Claude Fable 5.1 і Claude Mythos 5.1: 52,6% у Terminal-Bench-Science і читання з кешу на 75% дешевше

Anthropic випустила Claude Fable 5.1 і Claude Mythos 5.1 через три місяці після виходу лінійки Fable 5 у червні 2026 року. Це одна й та сама базова модель із різними рівнями захисних обмежень. Fable 5.1 загальнодоступна як claude-fable-5-1; Mythos 5.1 залишається доступною лише перевіреним організаціям. Обидві моделі мають контекстне вікно на 1 млн токенів і максимальний обсяг вихідних даних у 128 тис. токенів, а адаптивне мислення завжди ввімкнене. Головний показник можливостей — 52,6% у Terminal-Bench-Science 0.1 проти 24,7% у Fable 5 і 29,0% у Opus 5. Головний комерційний показник — зниження вартості читання кешу на 75%: з $1,00 до $0,25 за мільйон токенів. За оцінкою Anthropic, це означає приблизно на 25% нижчу вартість типових робочих навантажень і до 45% — агентних. Базові тарифи на введення та виведення не змінилися й становлять $10 і $50 за мільйон токенів.

Чи можна її розгортати?

Так, Claude Fable 5.1 загальнодоступна як claude-fable-5-1 у Claude API, Amazon Bedrock, Claude Platform на AWS, Google Cloud і Microsoft Foundry. Claude Mythos 5.1 — ні: вона доступна лише перевіреним організаціям зі США в межах Project Glasswing.

Показники бенчмарків

У Terminal-Bench-Science 0.1, агентному бенчмарку наукових досліджень, Fable 5.1 набирає 52,6% проти 29,0% у Opus 5, 24,7% у Fable 5 і 22,4% у GPT-5.6 Sol. Anthropic повідомляє про стандартну похибку від 3,5 до 4,5 пункта для кожної моделі, тож до різниці, а не до самого рейтингу, слід ставитися обережно.

У Terminal-Bench 4.0 Fable 5.1 досягає 55,8%, а Mythos 5.1 — 60,9%. Різниця між двома ідентичними моделями є ціною втручань захисних механізмів, що є незвично чесним розкриттям інформації. В інших тестах: CursorBench 3.2.0 — 73,4%, Humanity’s Last Exam — 60,9% без інструментів і 65,0% з інструментами, AutomationBench — 31,4%, OSWorld 2.0 — 41,7% за суворими критеріями, а GDPval-AA v2 — 1853.

Звідки береться зниження вартості

Базові тарифи на введення та виведення не змінилися. Вартість читання кешу знижується на 75% — з $1,00 до $0,25 за мільйон токенів, тобто становить 0,025 базового тарифу на введення проти 0,1 у всіх інших моделях Claude. За оцінкою Anthropic, вартість типових робочих навантажень знижується приблизно на 25%, а для агентних сценаріїв із великим обсягом контексту — до 45%. Пакетна обробка коштує $5 і $25 за мільйон токенів.

Три критичні зміни, з якими зіткнуться команди

  1. Примусове використання інструментів скасовано: tool_choice, встановлений у any або tool, повертає помилку 400. Натомість використовуйте auto із суворим використанням інструментів або структурованими вихідними даними.
  2. Блоки мислення прив’язані до моделі: Fable 5.1 читає блоки мислення попередніх моделей, але жодна попередня модель не читає блоки власного мислення. У конфігураціях із маршрутизацією та резервними моделями під час переходу на нижчу модель міркування втрачаються.
  3. Редагування попередніх повідомлень робить блоки мислення недійсними: додавання й видалення нагадувань для окремих повідомлень або перебудова масиву system чи tools посеред розмови тепер спричиняє помилку. Ця перевірка застосовується до облікових записів, створених 31 серпня 2026 року або пізніше. Рішення — системні повідомлення, обмежені окремими ходами, і редагування контексту на стороні сервера.

Додаткові зміни: параметр зусиль для кожного повідомлення, системні повідомлення, обмежені окремими ходами, і thinking.display: "updates" доступні в бета-версії через заголовки. Походження контенту не є необов’язковим: усі вихідні дані містять статистичний текстовий водяний знак, а файли — облікові дані C2PA.

Anthropic також документує реальні регресії. Паралельні виклики інструментів стали менш стабільними, тому агентні цикли можуть виконувати по одному виклику за хід, тоді як Fable 5 виконувала кілька за раз. Модель менше описує свої дії, частіше відповідає з пам’яті за низького рівня зусиль і віддає перевагу переписуванню всього файлу замість цільових редагувань.

Захисні механізми та наука

Захисні механізми кібербезпеки тепер дозволяють виявляти вразливості, але не розробляти експлойти, що скорочує кількість втручань у Claude Code приблизно на 60% за сеанс. Захисні механізми біобезпеки спрацьовують на 85% рідше під час виконання нешкідливих запитів. Тестування на проникнення, генерація експлойтів і сканування вразливостей на основі бінарних файлів і надалі перенаправляються до Opus.

У дослідницькій сфері Mythos 5.1 розробила білки-зв’язувачі з приблизно 50% частотою успішних результатів для 12 мішеней проти стандартного показника 10–15%, Fable 5.1 побудувала карту висот Венери з роздільною здатністю 2–3 км, а спеціалізовані GPU-ядра прискорили сім геномних моделей із відкритим кодом до 2,5 раза.

Ключові висновки

  • Fable 5.1 і Mythos 5.1 — це одна модель із двома рівнями захисних механізмів; загальнодоступною є лише Fable.
  • 52,6% у Terminal-Bench-Science 0.1 — приблизно вдвічі більше, ніж 24,7% у Fable 5.
  • Вартість читання кешу знижується на 75% — до $0,25 за мільйон токенів; базові тарифи не змінюються.
  • Три критичні зміни API впливають на будь-якого агента, який редагує історію розмови.
  • Застосовується 30-денне зберігання даних; для нульового зберігання даних потрібен прямий дозвіл.

Ознайомтеся з технічними деталями. Також стежте за нами у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Зачекайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Потрібно співпрацювати з нами для просування вашого GitHub Repo, сторінки Hugging Face, релізу продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини