GPT-6 Astra проти GPT-6.1 Sol проти Gemini 4 Argon проти Claude Fable 5.1: Яка передова модель для якого завдання
Anthropic, OpenAI і Google DeepMind випустили 4 моделі передового класу протягом 30 днів. Claude Fable 5.1 вийшла 1 вересня. GPT-6 Astra з’явилася 3 вересня. GPT-6.1 Sol і Gemini 4 Argon вийшли в останні дні вересня.
Ми висвітлювали кожен запуск окремо. У цьому матеріалі ми порівнюємо їх безпосередньо. Результати тестів виявилися більш схожими, ніж можна було припустити з окремих матеріалів про запуски. А от ціни, правила доступу та вартість виконання завдань суттєво відрізняються.
Одна зміна визначає нинішню картину. OpenAI скасувала GPT-6.1 Astra 28 вересня після того, як модель не пройшла внутрішні перевірки меж застосування та авторизації. Наразі GPT-6 Astra залишається найпотужнішою моделлю OpenAI.
Характеристики, ціни та доступ
Astra і Fable 5.1 мають однакову базову ціну: $10 за вхідні та $50 за вихідні токени. Sol і Argon коштують одну п’яту від цієї суми. Ціна Argon є вступною і згодом подвоїться.
| Характеристика | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| Розробник | OpenAI | OpenAI | Google DeepMind | Anthropic |
| Випуск | 3 вересня 2026 року | 29 вересня 2026 року | Анонсовано 30 вересня 2026 року | 1 вересня 2026 року |
| Доступ | OpenAI API, ChatGPT, Codex | OpenAI API, ChatGPT Work, Codex | Лише програма Fairwind | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Вхідні / вихідні токени (за 1 млн) | $10 / $50 | $2 / $10 | $2 / $10 на старті, потім $4 / $20 | $10 / $50 |
| Кешовані вхідні токени (за 1 млн) | $1.00 | $0.10 | $0.10 на старті | $0.25 |
| Ціни для довгих запитів | Понад 272 тис.: $20 / $75 | Понад 272 тис.: 2× за вхідні, 1,5× за вихідні | Не розкрито | Фіксована ціна до 1 млн |
| Контекстне вікно | 1,05 млн | 1,05 млн | Не розкрито | 1 млн |
| Максимальний обсяг відповіді | 128 тис. | 128 тис. | 1 млн | 128 тис. |
| Керування міркуваннями | 5 рівнів зусиль: від низького до максимального | 5 рівнів зусиль: від низького до максимального | Не розкрито | Рівні зусиль, зокрема низький, середній і високий |
| Відкриті ваги | Ні | Ні | Ні | Ні |
Джерела: матеріал OpenAI про GPT-6.1 Sol, матеріал про Gemini 4 Argon, ціни GPT-6 Astra для довгого контексту, характеристики Claude Fable 5.1. Стандартні базові ціни безпосередньо від розробників для короткого контексту.
Рядок із кешованими вхідними даними має найбільше значення для агентів. Агенти повторно надсилають системні підказки, схеми інструментів та історію на кожному кроці. Читання кешу Astra за $1.00 коштує в 4 рази дорожче, ніж у Fable 5.1, і в 10 разів дорожче, ніж у Sol.
Ліміт у 1 млн вихідних токенів Argon — єдина суттєва структурна відмінність. Інші 3 моделі обмежені 128 тис. токенів на відповідь.
Тести: у чому кожна модель лідирує
Жодна модель не перемагає в усіх категоріях. Argon лідирує у завданнях, пов’язаних із роботою зі знаннями, та в довготривалому програмуванні. Astra лідирує у розробці програмного забезпечення передового рівня та роботі з комп’ютером. Opus 5.5, якого немає в цьому порівнянні, очолює Terminal-Bench 4.0.
| Тест | Що перевіряє | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | Довготривала розробка програмного забезпечення | 77,9% | 74,1% | 67,4% |
| Vals Index | Фінансові, програмні, юридичні та податкові завдання | 68,9% | 63,1% | 65,8% |
| FrontierSWE v2 | Розробка програмного забезпечення передового рівня | 55,0% | 65,5% | 56,3% |
| Terminal-Bench 4.0 | Агентна робота в терміналі | 57,4% | 58,2% | 57,9% |
| CWE-bench v1 | Усунення вразливостей | 68% (нічия) | 68% (нічия) | 58% |
| OSWorld-2.0 | Робота з комп’ютером | 69,2% | 72,6% | Не вказано в таблиці Google |
Джерело: опубліковане Google DeepMind порівняння, як повідомлялося в нашому матеріалі про Gemini 4 Argon. Дані, надані розробниками.
GPT-6.1 Sol відсутня в таблиці Google. Власні показники OpenAI свідчать, що вона близька до Astra:
- DeepSWE v1.1: Sol показує результат на рівні Astra приблизно за одну п’яту вартості.
- Офлайн-набір OSWorld 2.0: Sol відстає від Astra менш ніж на 2,1 бала, коштуючи приблизно в сім разів дешевше за завдання.
- AutomationBench 1.0.6: Sol набирає на 2,2 бала більше, ніж Claude Opus 5.5, за середнього рівня зусиль.
- Terminal-Bench Science 0.1: Astra все ще лідирує з результатом 68,1%. OpenAI рекомендує Astra для найскладніших досліджень.
Незалежні показники дають іншу картину щодо «сирого» інтелекту. В Artificial Analysis в індексі інтелекту Astra набирає 61 бал. Fable 5.1 набирає на 5 балів більше. У власному індексі агентів для програмування Fable 5.1 у Claude Code отримує 70 балів проти 67 у Astra. Artificial Analysis також повідомляє, що Argon дорівнює Astra в індексі інтелекту.
В ARC-AGI-2 Astra набирає 95%, а Fable 5.1 — 90%.
Вартість виконання завдання: однакова базова ціна, але різний рахунок
Artificial Analysis оцінює вартість одного завдання для Claude Fable 5.1 у $9.18 проти $4.72 для GPT-6 Astra. Це приблизно в 1,9 раза більше за однакових базових цін.
Різниця виникає через обсяг токенів, а не тарифи. Вартість завдання — це добуток ціни та кількості витрачених токенів. За однакових тарифів така різниця означає, що під час цього запуску Fable 5.1 витратила більше токенів на завдання. Anthropic також зазначає, що її новіший токенізатор генерує приблизно на 30% більше токенів для того самого тексту.
Дві дешевші моделі ще більше змінюють картину:
- Gemini 4 Argon: Artificial Analysis повідомляє, що Argon дорівнює Astra в індексі інтелекту, але коштує 60% від вартості Astra за завдання, якщо використовувати вступні ціни.
- GPT-6.1 Sol: У Terminal-Bench Science OpenAI вказує вартість $5.47 за завдання для Sol проти $23.80 для Astra.
Кешування може змінити рейтинг для агентів. Наведені вище показники вартості завдання не враховують інтенсивне повторне використання кешу. Довготривалий агент повторно читає той самий контекст на кожному кроці. Ось розрахунок для кешованого контексту обсягом 200 тис. токенів без урахування вихідних токенів:
| Модель | Тариф за кешовані дані (за 1 млн) | За крок | За 100 кроків |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon (на старті) | $0.10 | $0.02 | $2.00 |
Показовий розрахунок за базовими тарифами кешу. Контекст Astra обсягом 200 тис. токенів не перевищує поріг довгого запиту в 272 тис. токенів.
У циклах з інтенсивним використанням кешу Fable 5.1 читає контекст за чверть тарифу Astra. Перед тим як робити висновки за показниками вартості завдання, виміряйте обидві моделі на власних трасуваннях.
Яку модель обрати для якого завдання
Обирайте за робочим навантаженням, а не за місцем у рейтингу. GPT-6.1 Sol є стандартним вибором для більшості команд. Інші 3 моделі виправдовують свою ціну у вузьких завданнях.
| Завдання | Вибір | Чому | Альтернатива |
|---|---|---|---|
| Високопродуктивні агенти програмування, CI-боти, перевірка PR | GPT-6.1 Sol | Відповідає Astra у DeepSWE v1.1 за ціною $2 / $10 і $0.10 за кешовані дані | Gemini 4 Argon після відкриття доступу |
| Найскладніша відкрита інженерна робота | GPT-6 Astra | Лідирує у FrontierSWE v2 з результатом 65,5% | Claude Fable 5.1 |
| Робота з комп’ютером і браузерні агенти | GPT-6 Astra | Лідирує в OSWorld-2.0 з результатом 72,6% | GPT-6.1 Sol, відставання в межах 2,1 бала |
| Тривалі сеанси програмування всередині робочого середовища | Claude Fable 5.1 | Найвищий результат у індексі агентів програмування Artificial Analysis (70) у Claude Code; $0.25 за читання кешу | GPT-6 Astra (67) |
| Складні наукові завдання та дослідження | GPT-6 Astra | Лідирує в Terminal-Bench Science з результатом 68,1% | GPT-6.1 Sol за $5.47 за завдання |
| Юридична, фінансова та бізнес-автоматизація | Gemini 4 Argon | Лідирує у Vals Index (68,9%), AutomationBench (51,3%) і Harvey Legal (19,6%) | GPT-6.1 Sol; Claude Fable 5.1 |
| Дуже довгі окремі результати: масштабний рефакторинг, повні звіти | Gemini 4 Argon | Єдина модель із 1 млн вихідних токенів на відповідь | Будь-яка з 3 інших, розбивши відповідь на кілька кроків |
| Пошук і виправлення вразливостей | Gemini 4 Argon або GPT-6 Astra | Нічия — 68% у CWE-bench v1 | Claude Fable 5.1 (58%) |
| Найсуворіші бюджетні обмеження за якості передового рівня | GPT-6.1 Sol | Найнижча публічна ціна; Argon відповідає їй лише в межах Fairwind | Gemini 4 Argon |
Доступ визначає результат у 2 із цих категорій. Сьогодні Argon доступна лише фахівцям із кіберзахисту в межах Fairwind. Повні можливості Astra для наступальних кібероперацій доступні через програму OpenAI Daybreak; публічна версія відмовляється виконувати складні завдання з наступальної кібербезпеки. Anthropic надає доступ до своєї необмеженої версії Claude Mythos 5.1 лише через програми для перевірених користувачів.
Що перевірити перед переходом
Більшість наведених тут показників надані розробниками, і в деталях їхні дані відрізняються. OpenAI вказує для Astra 57,9% у Terminal-Bench 4.0. У порівняльній таблиці Google зазначено 58,2%.
- Захисні механізми впливають на результати Fable 5.1: Anthropic проводила тести з увімкненими виробничими захисними механізмами. Позначені завдання з кібербезпеки та біології передавалися іншим моделям Claude, що, ймовірно, знизило результати в OSWorld і AutomationBench.
- Ціна Argon тимчасова: $2 / $10 — це вступна ціна. Згодом вона зросте до $4 / $20, але дату завершення дії поточних тарифів не оголошено.
- Контекстне вікно Argon не розкрито: Google опублікувала ліміт у 1 млн вихідних токенів, але не вказала обмеження для вхідних даних.
- Вартість завдання — це моментальний знімок: Показники $9.18 і $4.72 отримано під час запуску Astra на початку вересня, проведеного Artificial Analysis. Налаштування рівня зусиль можуть суттєво їх змінити.
- В Anthropic є дешевший варіант: У нашому матеріалі про Argon наведено повідомлення, що Claude Opus 5.5 перевершує Fable 5.1 у ключових агентних тестах за нижчою ціною API. Вона також лідирує в Terminal-Bench 4.0 з результатом 66,4%.
Основні висновки
- GPT-6.1 Sol відповідає Astra у DeepSWE v1.1 за одну п’яту ціни.
- GPT-6 Astra лідирує у FrontierSWE v2 (65,5%) та OSWorld-2.0 (72,6%).
- Gemini 4 Argon лідирує в DeepSWE, Vals Index і AutomationBench, але лише в межах Fairwind.
- Fable 5.1 коштує $9.18 за завдання проти $4.72 у Astra за однакових базових цін.
- Для агентів із великим використанням кешу читання кешу Fable 5.1 за $0.25 у 4 рази дешевше, ніж у Astra за $1.00.
Поширені запитання
- Яка модель найдешевша? GPT-6.1 Sol: $2 за вхідні, $10 за вихідні та $0.10 за кешовані токени на 1 млн токенів. Argon відповідає цій ціні лише за вступним тарифом і в межах Fairwind.
- Яка модель найкраща для програмування? Sol — для великих обсягів роботи. Astra — для найскладніших завдань. Fable 5.1 очолює індекс агентів програмування Artificial Analysis у Claude Code.
- Чи можна користуватися Gemini 4 Argon уже сьогодні? Лише через програму Google Fairwind для фахівців із кіберзахисту.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.