Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← До новин

GPT-6 Astra проти GPT-6.1 Sol проти Gemini 4 Argon проти Claude Fable 5.1: Яка передова модель для якого завдання

Anthropic, OpenAI і Google DeepMind випустили 4 моделі передового класу протягом 30 днів. Claude Fable 5.1 вийшла 1 вересня. GPT-6 Astra з’явилася 3 вересня. GPT-6.1 Sol і Gemini 4 Argon вийшли в останні дні вересня.

Ми висвітлювали кожен запуск окремо. У цьому матеріалі ми порівнюємо їх безпосередньо. Результати тестів виявилися більш схожими, ніж можна було припустити з окремих матеріалів про запуски. А от ціни, правила доступу та вартість виконання завдань суттєво відрізняються.

Одна зміна визначає нинішню картину. OpenAI скасувала GPT-6.1 Astra 28 вересня після того, як модель не пройшла внутрішні перевірки меж застосування та авторизації. Наразі GPT-6 Astra залишається найпотужнішою моделлю OpenAI.

Характеристики, ціни та доступ

Astra і Fable 5.1 мають однакову базову ціну: $10 за вхідні та $50 за вихідні токени. Sol і Argon коштують одну п’яту від цієї суми. Ціна Argon є вступною і згодом подвоїться.

ХарактеристикаGPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
РозробникOpenAIOpenAIGoogle DeepMindAnthropic
Випуск3 вересня 2026 року29 вересня 2026 рокуАнонсовано 30 вересня 2026 року1 вересня 2026 року
ДоступOpenAI API, ChatGPT, CodexOpenAI API, ChatGPT Work, CodexЛише програма FairwindClaude API, Bedrock, Google Cloud, Microsoft Foundry
Вхідні / вихідні токени (за 1 млн)$10 / $50$2 / $10$2 / $10 на старті, потім $4 / $20$10 / $50
Кешовані вхідні токени (за 1 млн)$1.00$0.10$0.10 на старті$0.25
Ціни для довгих запитівПонад 272 тис.: $20 / $75Понад 272 тис.: 2× за вхідні, 1,5× за вихідніНе розкритоФіксована ціна до 1 млн
Контекстне вікно1,05 млн1,05 млнНе розкрито1 млн
Максимальний обсяг відповіді128 тис.128 тис.1 млн128 тис.
Керування міркуваннями5 рівнів зусиль: від низького до максимального5 рівнів зусиль: від низького до максимальногоНе розкритоРівні зусиль, зокрема низький, середній і високий
Відкриті вагиНіНіНіНі

Джерела: матеріал OpenAI про GPT-6.1 Sol, матеріал про Gemini 4 Argon, ціни GPT-6 Astra для довгого контексту, характеристики Claude Fable 5.1. Стандартні базові ціни безпосередньо від розробників для короткого контексту.

Рядок із кешованими вхідними даними має найбільше значення для агентів. Агенти повторно надсилають системні підказки, схеми інструментів та історію на кожному кроці. Читання кешу Astra за $1.00 коштує в 4 рази дорожче, ніж у Fable 5.1, і в 10 разів дорожче, ніж у Sol.

Ліміт у 1 млн вихідних токенів Argon — єдина суттєва структурна відмінність. Інші 3 моделі обмежені 128 тис. токенів на відповідь.

Тести: у чому кожна модель лідирує

Жодна модель не перемагає в усіх категоріях. Argon лідирує у завданнях, пов’язаних із роботою зі знаннями, та в довготривалому програмуванні. Astra лідирує у розробці програмного забезпечення передового рівня та роботі з комп’ютером. Opus 5.5, якого немає в цьому порівнянні, очолює Terminal-Bench 4.0.

ТестЩо перевіряєGemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1Довготривала розробка програмного забезпечення77,9%74,1%67,4%
Vals IndexФінансові, програмні, юридичні та податкові завдання68,9%63,1%65,8%
FrontierSWE v2Розробка програмного забезпечення передового рівня55,0%65,5%56,3%
Terminal-Bench 4.0Агентна робота в терміналі57,4%58,2%57,9%
CWE-bench v1Усунення вразливостей68% (нічия)68% (нічия)58%
OSWorld-2.0Робота з комп’ютером69,2%72,6%Не вказано в таблиці Google

Джерело: опубліковане Google DeepMind порівняння, як повідомлялося в нашому матеріалі про Gemini 4 Argon. Дані, надані розробниками.

GPT-6.1 Sol відсутня в таблиці Google. Власні показники OpenAI свідчать, що вона близька до Astra:

  • DeepSWE v1.1: Sol показує результат на рівні Astra приблизно за одну п’яту вартості.
  • Офлайн-набір OSWorld 2.0: Sol відстає від Astra менш ніж на 2,1 бала, коштуючи приблизно в сім разів дешевше за завдання.
  • AutomationBench 1.0.6: Sol набирає на 2,2 бала більше, ніж Claude Opus 5.5, за середнього рівня зусиль.
  • Terminal-Bench Science 0.1: Astra все ще лідирує з результатом 68,1%. OpenAI рекомендує Astra для найскладніших досліджень.

Незалежні показники дають іншу картину щодо «сирого» інтелекту. В Artificial Analysis в індексі інтелекту Astra набирає 61 бал. Fable 5.1 набирає на 5 балів більше. У власному індексі агентів для програмування Fable 5.1 у Claude Code отримує 70 балів проти 67 у Astra. Artificial Analysis також повідомляє, що Argon дорівнює Astra в індексі інтелекту.

В ARC-AGI-2 Astra набирає 95%, а Fable 5.1 — 90%.

Вартість виконання завдання: однакова базова ціна, але різний рахунок

Artificial Analysis оцінює вартість одного завдання для Claude Fable 5.1 у $9.18 проти $4.72 для GPT-6 Astra. Це приблизно в 1,9 раза більше за однакових базових цін.

Різниця виникає через обсяг токенів, а не тарифи. Вартість завдання — це добуток ціни та кількості витрачених токенів. За однакових тарифів така різниця означає, що під час цього запуску Fable 5.1 витратила більше токенів на завдання. Anthropic також зазначає, що її новіший токенізатор генерує приблизно на 30% більше токенів для того самого тексту.

Дві дешевші моделі ще більше змінюють картину:

  • Gemini 4 Argon: Artificial Analysis повідомляє, що Argon дорівнює Astra в індексі інтелекту, але коштує 60% від вартості Astra за завдання, якщо використовувати вступні ціни.
  • GPT-6.1 Sol: У Terminal-Bench Science OpenAI вказує вартість $5.47 за завдання для Sol проти $23.80 для Astra.

Кешування може змінити рейтинг для агентів. Наведені вище показники вартості завдання не враховують інтенсивне повторне використання кешу. Довготривалий агент повторно читає той самий контекст на кожному кроці. Ось розрахунок для кешованого контексту обсягом 200 тис. токенів без урахування вихідних токенів:

МодельТариф за кешовані дані (за 1 млн)За крокЗа 100 кроків
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (на старті)$0.10$0.02$2.00

Показовий розрахунок за базовими тарифами кешу. Контекст Astra обсягом 200 тис. токенів не перевищує поріг довгого запиту в 272 тис. токенів.

У циклах з інтенсивним використанням кешу Fable 5.1 читає контекст за чверть тарифу Astra. Перед тим як робити висновки за показниками вартості завдання, виміряйте обидві моделі на власних трасуваннях.

Яку модель обрати для якого завдання

Обирайте за робочим навантаженням, а не за місцем у рейтингу. GPT-6.1 Sol є стандартним вибором для більшості команд. Інші 3 моделі виправдовують свою ціну у вузьких завданнях.

ЗавданняВибірЧомуАльтернатива
Високопродуктивні агенти програмування, CI-боти, перевірка PRGPT-6.1 SolВідповідає Astra у DeepSWE v1.1 за ціною $2 / $10 і $0.10 за кешовані даніGemini 4 Argon після відкриття доступу
Найскладніша відкрита інженерна роботаGPT-6 AstraЛідирує у FrontierSWE v2 з результатом 65,5%Claude Fable 5.1
Робота з комп’ютером і браузерні агентиGPT-6 AstraЛідирує в OSWorld-2.0 з результатом 72,6%GPT-6.1 Sol, відставання в межах 2,1 бала
Тривалі сеанси програмування всередині робочого середовищаClaude Fable 5.1Найвищий результат у індексі агентів програмування Artificial Analysis (70) у Claude Code; $0.25 за читання кешуGPT-6 Astra (67)
Складні наукові завдання та дослідженняGPT-6 AstraЛідирує в Terminal-Bench Science з результатом 68,1%GPT-6.1 Sol за $5.47 за завдання
Юридична, фінансова та бізнес-автоматизаціяGemini 4 ArgonЛідирує у Vals Index (68,9%), AutomationBench (51,3%) і Harvey Legal (19,6%)GPT-6.1 Sol; Claude Fable 5.1
Дуже довгі окремі результати: масштабний рефакторинг, повні звітиGemini 4 ArgonЄдина модель із 1 млн вихідних токенів на відповідьБудь-яка з 3 інших, розбивши відповідь на кілька кроків
Пошук і виправлення вразливостейGemini 4 Argon або GPT-6 AstraНічия — 68% у CWE-bench v1Claude Fable 5.1 (58%)
Найсуворіші бюджетні обмеження за якості передового рівняGPT-6.1 SolНайнижча публічна ціна; Argon відповідає їй лише в межах FairwindGemini 4 Argon

Доступ визначає результат у 2 із цих категорій. Сьогодні Argon доступна лише фахівцям із кіберзахисту в межах Fairwind. Повні можливості Astra для наступальних кібероперацій доступні через програму OpenAI Daybreak; публічна версія відмовляється виконувати складні завдання з наступальної кібербезпеки. Anthropic надає доступ до своєї необмеженої версії Claude Mythos 5.1 лише через програми для перевірених користувачів.

Що перевірити перед переходом

Більшість наведених тут показників надані розробниками, і в деталях їхні дані відрізняються. OpenAI вказує для Astra 57,9% у Terminal-Bench 4.0. У порівняльній таблиці Google зазначено 58,2%.

  • Захисні механізми впливають на результати Fable 5.1: Anthropic проводила тести з увімкненими виробничими захисними механізмами. Позначені завдання з кібербезпеки та біології передавалися іншим моделям Claude, що, ймовірно, знизило результати в OSWorld і AutomationBench.
  • Ціна Argon тимчасова: $2 / $10 — це вступна ціна. Згодом вона зросте до $4 / $20, але дату завершення дії поточних тарифів не оголошено.
  • Контекстне вікно Argon не розкрито: Google опублікувала ліміт у 1 млн вихідних токенів, але не вказала обмеження для вхідних даних.
  • Вартість завдання — це моментальний знімок: Показники $9.18 і $4.72 отримано під час запуску Astra на початку вересня, проведеного Artificial Analysis. Налаштування рівня зусиль можуть суттєво їх змінити.
  • В Anthropic є дешевший варіант: У нашому матеріалі про Argon наведено повідомлення, що Claude Opus 5.5 перевершує Fable 5.1 у ключових агентних тестах за нижчою ціною API. Вона також лідирує в Terminal-Bench 4.0 з результатом 66,4%.

Основні висновки

  • GPT-6.1 Sol відповідає Astra у DeepSWE v1.1 за одну п’яту ціни.
  • GPT-6 Astra лідирує у FrontierSWE v2 (65,5%) та OSWorld-2.0 (72,6%).
  • Gemini 4 Argon лідирує в DeepSWE, Vals Index і AutomationBench, але лише в межах Fairwind.
  • Fable 5.1 коштує $9.18 за завдання проти $4.72 у Astra за однакових базових цін.
  • Для агентів із великим використанням кешу читання кешу Fable 5.1 за $0.25 у 4 рази дешевше, ніж у Astra за $1.00.

Поширені запитання

  • Яка модель найдешевша? GPT-6.1 Sol: $2 за вхідні, $10 за вихідні та $0.10 за кешовані токени на 1 млн токенів. Argon відповідає цій ціні лише за вступним тарифом і в межах Fairwind.
  • Яка модель найкраща для програмування? Sol — для великих обсягів роботи. Astra — для найскладніших завдань. Fable 5.1 очолює індекс агентів програмування Artificial Analysis у Claude Code.
  • Чи можна користуватися Gemini 4 Argon уже сьогодні? Лише через програму Google Fairwind для фахівців із кіберзахисту.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини