GPT-6 Astra против GPT-6.1 Sol против Gemini 4 Argon против Claude Fable 5.1: Какая передовая модель подходит для какой задачи
Anthropic, OpenAI и Google DeepMind выпустили 4 модели передового класса за 30 дней. Claude Fable 5.1 появилась 1 сентября. GPT-6 Astra последовала 3 сентября. GPT-6.1 Sol и Gemini 4 Argon вышли в последние дни сентября.
Мы освещали каждый запуск отдельно. В этой статье мы сопоставляем их. Результаты бенчмарков совпадают сильнее, чем можно было предположить по материалам о запусках. А вот цены, правила доступа и стоимость задачи — нет.
Расстановку сил определяет одно изменение. 28 сентября OpenAI отменила выпуск GPT-6.1 Astra после того, как модель не прошла внутренние тесты на соответствие области применения и авторизацию. GPT-6 Astra пока остаётся топовой моделью OpenAI.
Характеристики, цены и доступ
Astra и Fable 5.1 имеют одинаковую заявленную цену: $10 за входные и $50 за выходные токены. Для Sol и Argon эти цены в пять раз ниже. Цена Argon является вводной и позже удвоится.
| Характеристика | GPT-6 Astra | GPT-6.1 Sol | Gemini 4 Argon | Claude Fable 5.1 |
|---|---|---|---|---|
| Разработчик | OpenAI | OpenAI | Google DeepMind | Anthropic |
| Выпуск | 3 сентября 2026 г. | 29 сентября 2026 г. | Анонсирована 30 сентября 2026 г. | 1 сентября 2026 г. |
| Доступ | OpenAI API, ChatGPT, Codex | OpenAI API, ChatGPT Work, Codex | Только программа Fairwind | Claude API, Bedrock, Google Cloud, Microsoft Foundry |
| Входные / выходные (на 1 млн) | $10 / $50 | $2 / $10 | $2 / $10 в качестве вводной цены, затем $4 / $20 | $10 / $50 |
| Кэшированные входные (на 1 млн) | $1.00 | $0.10 | $0.10 в качестве вводной цены | $0.25 |
| Цены для длинных запросов | Свыше 272 тыс.: $20 / $75 | Свыше 272 тыс.: 2-кратная цена входных, 1,5-кратная — выходных | Не раскрыты | Фиксированные до 1 млн |
| Контекстное окно | 1,05 млн | 1,05 млн | Не раскрыто | 1 млн |
| Максимальный объём выходных данных за ответ | 128 тыс. | 128 тыс. | 1 млн | 128 тыс. |
| Управление рассуждениями | 5 уровней усилий — от низкого до максимального | 5 уровней усилий — от низкого до максимального | Не раскрыто | Уровни усилий, включая низкий, средний и высокий |
| Открытые веса | Нет | Нет | Нет | Нет |
Источники: материал о GPT-6.1 Sol от OpenAI, материал о Gemini 4 Argon, цены GPT-6 Astra для длинного контекста, характеристики Claude Fable 5.1. Стандартные цены первого поставщика для короткого контекста.
Строка с кэшированными входными данными важнее всего для агентов. Агенты повторно отправляют системные подсказки, схемы инструментов и историю на каждом шаге. Чтение кэша Astra за $1.00 в 4 раза дороже, чем у Fable 5.1, и в 10 раз дороже, чем у Sol.
Лимит Argon в 1 млн выходных токенов — единственное существенное исключение. Остальные 3 модели останавливаются на 128 тыс. токенов за ответ.
Бенчмарки: в чём лидирует каждая модель
Ни одна модель не выигрывает по всем направлениям. Argon лидирует в задачах, связанных с интеллектуальной работой, и в долгосрочном программировании. Astra лидирует в передовой разработке ПО и работе с компьютером. Opus 5.5, не вошедшая в это сравнение, лидирует в Terminal-Bench 4.0.
| Бенчмарк | Что проверяет | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|---|---|
| DeepSWE v1.1 | Долгосрочная разработка ПО | 77,9% | 74,1% | 67,4% |
| Vals Index | Финансовые, программистские, юридические и налоговые задачи | 68,9% | 63,1% | 65,8% |
| FrontierSWE v2 | Передовая разработка ПО | 55,0% | 65,5% | 56,3% |
| Terminal-Bench 4.0 | Агентная работа в терминале | 57,4% | 58,2% | 57,9% |
| CWE-bench v1 | Устранение уязвимостей | 68% (ничья) | 68% (ничья) | 58% |
| OSWorld-2.0 | Работа с компьютером | 69,2% | 72,6% | В таблице Google не указана |
Источник: опубликованное сравнение Google DeepMind, приведённое в нашем материале о Gemini 4 Argon. Данные предоставлены поставщиком.
GPT-6.1 Sol отсутствует в таблице Google. Собственные показатели OpenAI ставят её близко к Astra:
- DeepSWE v1.1: Sol показывает результат на уровне Astra примерно за пятую часть стоимости.
- Офлайн-набор OSWorld 2.0: Sol отстаёт от Astra менее чем на 2,1 пункта при стоимости задачи примерно в семь раз ниже.
- AutomationBench 1.0.6: Sol набирает на 2,2 пункта больше, чем Claude Opus 5.5, при среднем уровне усилий.
- Terminal-Bench Science 0.1: Astra по-прежнему лидирует с результатом 68,1%. OpenAI рекомендует Astra для самых сложных исследований.
Независимые данные указывают на иную картину в отношении общего интеллекта. В Artificial Analysis Astra набирает 61 балл в индексе интеллекта. Fable 5.1 получает на 5 пунктов больше. В индексе агентов-программистов Fable 5.1 в Claude Code набирает 70 против 67 у Astra. Artificial Analysis также сообщает, что Argon сравнялась с Astra в индексе интеллекта.
В ARC-AGI-2 Astra набирает 95%, а Fable 5.1 — 90%.
Стоимость задачи: одинаковая заявленная цена, разные счета
Artificial Analysis оценивает стоимость одной задачи для Claude Fable 5.1 в $9.18 против $4.72 для GPT-6 Astra. Это примерно в 1,9 раза больше при одинаковых заявленных ценах.
Разница обусловлена объёмом токенов, а не тарифами. Стоимость задачи рассчитывается как цена, умноженная на количество использованных токенов. При одинаковых тарифах разница означает, что в этом запуске Fable 5.1 потратила больше токенов на задачу. Anthropic также отмечает, что её новый токенизатор генерирует примерно на 30% больше токенов для того же текста.
Две более дешёвые модели меняют картину ещё сильнее:
- Gemini 4 Argon: Artificial Analysis сообщает, что Argon сравнивается с Astra по индексу интеллекта при стоимости задачи, составляющей 60% от стоимости Astra, с использованием вводных цен.
- GPT-6.1 Sol: В Terminal-Bench Science OpenAI указывает стоимость задачи $5.47 для Sol против $23.80 для Astra.
Кэширование может изменить расстановку сил для агентов. Приведённые выше показатели стоимости задачи не учитывают активное повторное использование кэша. Долго работающий агент перечитывает один и тот же контекст на каждом шаге. Ниже приведён расчёт для кэшированного контекста объёмом 200 тыс. токенов без учёта выходных токенов:
| Модель | Тариф на кэшированные данные (на 1 млн) | За шаг | За 100 шагов |
|---|---|---|---|
| GPT-6 Astra | $1.00 | $0.20 | $20.00 |
| Claude Fable 5.1 | $0.25 | $0.05 | $5.00 |
| GPT-6.1 Sol | $0.10 | $0.02 | $2.00 |
| Gemini 4 Argon (вводная цена) | $0.10 | $0.02 | $2.00 |
Иллюстративный расчёт по заявленным тарифам на кэширование. Контекст Astra объёмом 200 тыс. токенов остаётся ниже порога в 272 тыс. для длинных запросов.
В циклах с активным использованием кэша Fable 5.1 считывает контекст по тарифу, составляющему четверть тарифа Astra. Прежде чем делать выводы по заголовочным показателям стоимости задачи, измерьте обе модели на собственных трассировках.
Какая модель для какой задачи
Выбирайте модель по рабочей нагрузке, а не по месту в рейтинге. GPT-6.1 Sol — вариант по умолчанию для большинства команд. Остальные 3 оправдывают свою цену в более узких задачах.
| Задача | Выбор | Почему | Альтернатива |
|---|---|---|---|
| Высокопроизводительные программистские агенты, боты CI, проверка PR | GPT-6.1 Sol | Сравнивается с Astra в DeepSWE v1.1 по цене $2 / $10 и $0.10 за кэшированные данные | Gemini 4 Argon после публичного запуска |
| Самая сложная открытая разработка | GPT-6 Astra | Лидирует в FrontierSWE v2 с результатом 65,5% | Claude Fable 5.1 |
| Работа с компьютером и браузерные агенты | GPT-6 Astra | Лидирует в OSWorld-2.0 с результатом 72,6% | GPT-6.1 Sol, отстающая менее чем на 2,1 пункта |
| Длительные сеансы программирования внутри инструментария | Claude Fable 5.1 | Лучший результат среди программистских агентов Artificial Analysis (70) в Claude Code; $0.25 за чтение кэша | GPT-6 Astra (67) |
| Сложные научные задачи и исследования | GPT-6 Astra | Лидирует в Terminal-Bench Science с результатом 68,1% | GPT-6.1 Sol по $5.47 за задачу |
| Автоматизация юридических, финансовых и бизнес-задач | Gemini 4 Argon | Лидирует в Vals Index (68,9%), AutomationBench (51,3%) и Harvey Legal (19,6%) | GPT-6.1 Sol; Claude Fable 5.1 |
| Очень длинные отдельные ответы: масштабный рефакторинг, полные отчёты | Gemini 4 Argon | Единственная модель с 1 млн выходных токенов за ответ | Любая из 3 остальных, с разделением на несколько ходов |
| Поиск и исправление уязвимостей | Gemini 4 Argon или GPT-6 Astra | Ничья с результатом 68% в CWE-bench v1 | Claude Fable 5.1 (58%) |
| Минимальный бюджет при качестве передового уровня | GPT-6.1 Sol | Самая низкая публичная цена; Argon соответствует ей только внутри Fairwind | Gemini 4 Argon |
Доступ определяет выбор в 2 из этих строк. Сегодня Argon доступна только специалистам по киберзащите в рамках Fairwind. Полный набор возможностей Astra для наступательной кибербезопасности доступен в рамках программы Daybreak от OpenAI; публичная версия отказывается выполнять продвинутые задачи по наступательной кибербезопасности. Anthropic предоставляет доступ к своей версии без ограничений, Claude Mythos 5.1, через программы для доверенных пользователей.
Что проверить перед переходом
Большинство приведённых здесь чисел предоставлены поставщиками, и в деталях их данные расходятся. OpenAI сообщает для Astra результат 57,9% в Terminal-Bench 4.0. В сравнительной таблице Google указано 58,2%.
- Меры безопасности влияют на результаты Fable 5.1: Anthropic проводила свои бенчмарки с включёнными производственными мерами безопасности. Помеченные задачи по кибербезопасности и биологии передаются другим моделям Claude, что, вероятно, снизило результаты в OSWorld и AutomationBench.
- Цена Argon временная: $2 / $10 — вводная цена. Позже она изменится на $4 / $20, при этом дата изменения не объявлена.
- Контекстное окно Argon не раскрыто: Google опубликовала ограничение на выходные данные в 1 млн токенов, но не указала лимит входных данных.
- Стоимость задачи — это моментальный снимок: значения $9.18 и $4.72 получены в ходе раннего сентябрьского запуска Astra компанией Artificial Analysis. Настройки усилий сильно влияют на них.
- У Anthropic есть более дешёвый вариант: В нашем материале об Argon приводятся сообщения о том, что Claude Opus 5.5 превосходит Fable 5.1 в ключевых агентных бенчмарках при более низкой цене API. Она также лидирует в Terminal-Bench 4.0 с результатом 66,4%.
Основные выводы
- GPT-6.1 Sol сравнивается с Astra в DeepSWE v1.1 при цене в пять раз ниже.
- GPT-6 Astra лидирует в FrontierSWE v2 (65,5%) и OSWorld-2.0 (72,6%).
- Gemini 4 Argon лидирует в DeepSWE, Vals Index и AutomationBench, но только внутри Fairwind.
- Стоимость Fable 5.1 составляет $9.18 за задачу против $4.72 у Astra при одинаковых заявленных ценах.
- Для агентов с активным использованием кэша чтение кэша Fable 5.1 за $0.25 в 4 раза дешевле, чем у Astra за $1.00.
Часто задаваемые вопросы
- Какая модель самая дешёвая? GPT-6.1 Sol: $2 за входные, $10 за выходные и $0.10 за кэшированные данные на 1 млн токенов. Argon соответствует этой цене только в рамках вводного тарифа и внутри Fairwind.
- Какая модель лучше всего подходит для программирования? Sol — для больших объёмов. Astra — для самых сложных задач. Fable 5.1 возглавляет индекс программистских агентов Artificial Analysis в Claude Code.
- Можно ли использовать Gemini 4 Argon уже сегодня? Только через программу Fairwind от Google для специалистов по киберзащите.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.