Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← К новостям

GPT-6 Astra против GPT-6.1 Sol против Gemini 4 Argon против Claude Fable 5.1: Какая передовая модель подходит для какой задачи

Anthropic, OpenAI и Google DeepMind выпустили 4 модели передового класса за 30 дней. Claude Fable 5.1 появилась 1 сентября. GPT-6 Astra последовала 3 сентября. GPT-6.1 Sol и Gemini 4 Argon вышли в последние дни сентября.

Мы освещали каждый запуск отдельно. В этой статье мы сопоставляем их. Результаты бенчмарков совпадают сильнее, чем можно было предположить по материалам о запусках. А вот цены, правила доступа и стоимость задачи — нет.

Расстановку сил определяет одно изменение. 28 сентября OpenAI отменила выпуск GPT-6.1 Astra после того, как модель не прошла внутренние тесты на соответствие области применения и авторизацию. GPT-6 Astra пока остаётся топовой моделью OpenAI.

Характеристики, цены и доступ

Astra и Fable 5.1 имеют одинаковую заявленную цену: $10 за входные и $50 за выходные токены. Для Sol и Argon эти цены в пять раз ниже. Цена Argon является вводной и позже удвоится.

ХарактеристикаGPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
РазработчикOpenAIOpenAIGoogle DeepMindAnthropic
Выпуск3 сентября 2026 г.29 сентября 2026 г.Анонсирована 30 сентября 2026 г.1 сентября 2026 г.
ДоступOpenAI API, ChatGPT, CodexOpenAI API, ChatGPT Work, CodexТолько программа FairwindClaude API, Bedrock, Google Cloud, Microsoft Foundry
Входные / выходные (на 1 млн)$10 / $50$2 / $10$2 / $10 в качестве вводной цены, затем $4 / $20$10 / $50
Кэшированные входные (на 1 млн)$1.00$0.10$0.10 в качестве вводной цены$0.25
Цены для длинных запросовСвыше 272 тыс.: $20 / $75Свыше 272 тыс.: 2-кратная цена входных, 1,5-кратная — выходныхНе раскрытыФиксированные до 1 млн
Контекстное окно1,05 млн1,05 млнНе раскрыто1 млн
Максимальный объём выходных данных за ответ128 тыс.128 тыс.1 млн128 тыс.
Управление рассуждениями5 уровней усилий — от низкого до максимального5 уровней усилий — от низкого до максимальногоНе раскрытоУровни усилий, включая низкий, средний и высокий
Открытые весаНетНетНетНет

Источники: материал о GPT-6.1 Sol от OpenAI, материал о Gemini 4 Argon, цены GPT-6 Astra для длинного контекста, характеристики Claude Fable 5.1. Стандартные цены первого поставщика для короткого контекста.

Строка с кэшированными входными данными важнее всего для агентов. Агенты повторно отправляют системные подсказки, схемы инструментов и историю на каждом шаге. Чтение кэша Astra за $1.00 в 4 раза дороже, чем у Fable 5.1, и в 10 раз дороже, чем у Sol.

Лимит Argon в 1 млн выходных токенов — единственное существенное исключение. Остальные 3 модели останавливаются на 128 тыс. токенов за ответ.

Бенчмарки: в чём лидирует каждая модель

Ни одна модель не выигрывает по всем направлениям. Argon лидирует в задачах, связанных с интеллектуальной работой, и в долгосрочном программировании. Astra лидирует в передовой разработке ПО и работе с компьютером. Opus 5.5, не вошедшая в это сравнение, лидирует в Terminal-Bench 4.0.

БенчмаркЧто проверяетGemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1Долгосрочная разработка ПО77,9%74,1%67,4%
Vals IndexФинансовые, программистские, юридические и налоговые задачи68,9%63,1%65,8%
FrontierSWE v2Передовая разработка ПО55,0%65,5%56,3%
Terminal-Bench 4.0Агентная работа в терминале57,4%58,2%57,9%
CWE-bench v1Устранение уязвимостей68% (ничья)68% (ничья)58%
OSWorld-2.0Работа с компьютером69,2%72,6%В таблице Google не указана

Источник: опубликованное сравнение Google DeepMind, приведённое в нашем материале о Gemini 4 Argon. Данные предоставлены поставщиком.

GPT-6.1 Sol отсутствует в таблице Google. Собственные показатели OpenAI ставят её близко к Astra:

  • DeepSWE v1.1: Sol показывает результат на уровне Astra примерно за пятую часть стоимости.
  • Офлайн-набор OSWorld 2.0: Sol отстаёт от Astra менее чем на 2,1 пункта при стоимости задачи примерно в семь раз ниже.
  • AutomationBench 1.0.6: Sol набирает на 2,2 пункта больше, чем Claude Opus 5.5, при среднем уровне усилий.
  • Terminal-Bench Science 0.1: Astra по-прежнему лидирует с результатом 68,1%. OpenAI рекомендует Astra для самых сложных исследований.

Независимые данные указывают на иную картину в отношении общего интеллекта. В Artificial Analysis Astra набирает 61 балл в индексе интеллекта. Fable 5.1 получает на 5 пунктов больше. В индексе агентов-программистов Fable 5.1 в Claude Code набирает 70 против 67 у Astra. Artificial Analysis также сообщает, что Argon сравнялась с Astra в индексе интеллекта.

В ARC-AGI-2 Astra набирает 95%, а Fable 5.1 — 90%.

Стоимость задачи: одинаковая заявленная цена, разные счета

Artificial Analysis оценивает стоимость одной задачи для Claude Fable 5.1 в $9.18 против $4.72 для GPT-6 Astra. Это примерно в 1,9 раза больше при одинаковых заявленных ценах.

Разница обусловлена объёмом токенов, а не тарифами. Стоимость задачи рассчитывается как цена, умноженная на количество использованных токенов. При одинаковых тарифах разница означает, что в этом запуске Fable 5.1 потратила больше токенов на задачу. Anthropic также отмечает, что её новый токенизатор генерирует примерно на 30% больше токенов для того же текста.

Две более дешёвые модели меняют картину ещё сильнее:

  • Gemini 4 Argon: Artificial Analysis сообщает, что Argon сравнивается с Astra по индексу интеллекта при стоимости задачи, составляющей 60% от стоимости Astra, с использованием вводных цен.
  • GPT-6.1 Sol: В Terminal-Bench Science OpenAI указывает стоимость задачи $5.47 для Sol против $23.80 для Astra.

Кэширование может изменить расстановку сил для агентов. Приведённые выше показатели стоимости задачи не учитывают активное повторное использование кэша. Долго работающий агент перечитывает один и тот же контекст на каждом шаге. Ниже приведён расчёт для кэшированного контекста объёмом 200 тыс. токенов без учёта выходных токенов:

МодельТариф на кэшированные данные (на 1 млн)За шагЗа 100 шагов
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (вводная цена)$0.10$0.02$2.00

Иллюстративный расчёт по заявленным тарифам на кэширование. Контекст Astra объёмом 200 тыс. токенов остаётся ниже порога в 272 тыс. для длинных запросов.

В циклах с активным использованием кэша Fable 5.1 считывает контекст по тарифу, составляющему четверть тарифа Astra. Прежде чем делать выводы по заголовочным показателям стоимости задачи, измерьте обе модели на собственных трассировках.

Какая модель для какой задачи

Выбирайте модель по рабочей нагрузке, а не по месту в рейтинге. GPT-6.1 Sol — вариант по умолчанию для большинства команд. Остальные 3 оправдывают свою цену в более узких задачах.

ЗадачаВыборПочемуАльтернатива
Высокопроизводительные программистские агенты, боты CI, проверка PRGPT-6.1 SolСравнивается с Astra в DeepSWE v1.1 по цене $2 / $10 и $0.10 за кэшированные данныеGemini 4 Argon после публичного запуска
Самая сложная открытая разработкаGPT-6 AstraЛидирует в FrontierSWE v2 с результатом 65,5%Claude Fable 5.1
Работа с компьютером и браузерные агентыGPT-6 AstraЛидирует в OSWorld-2.0 с результатом 72,6%GPT-6.1 Sol, отстающая менее чем на 2,1 пункта
Длительные сеансы программирования внутри инструментарияClaude Fable 5.1Лучший результат среди программистских агентов Artificial Analysis (70) в Claude Code; $0.25 за чтение кэшаGPT-6 Astra (67)
Сложные научные задачи и исследованияGPT-6 AstraЛидирует в Terminal-Bench Science с результатом 68,1%GPT-6.1 Sol по $5.47 за задачу
Автоматизация юридических, финансовых и бизнес-задачGemini 4 ArgonЛидирует в Vals Index (68,9%), AutomationBench (51,3%) и Harvey Legal (19,6%)GPT-6.1 Sol; Claude Fable 5.1
Очень длинные отдельные ответы: масштабный рефакторинг, полные отчётыGemini 4 ArgonЕдинственная модель с 1 млн выходных токенов за ответЛюбая из 3 остальных, с разделением на несколько ходов
Поиск и исправление уязвимостейGemini 4 Argon или GPT-6 AstraНичья с результатом 68% в CWE-bench v1Claude Fable 5.1 (58%)
Минимальный бюджет при качестве передового уровняGPT-6.1 SolСамая низкая публичная цена; Argon соответствует ей только внутри FairwindGemini 4 Argon

Доступ определяет выбор в 2 из этих строк. Сегодня Argon доступна только специалистам по киберзащите в рамках Fairwind. Полный набор возможностей Astra для наступательной кибербезопасности доступен в рамках программы Daybreak от OpenAI; публичная версия отказывается выполнять продвинутые задачи по наступательной кибербезопасности. Anthropic предоставляет доступ к своей версии без ограничений, Claude Mythos 5.1, через программы для доверенных пользователей.

Что проверить перед переходом

Большинство приведённых здесь чисел предоставлены поставщиками, и в деталях их данные расходятся. OpenAI сообщает для Astra результат 57,9% в Terminal-Bench 4.0. В сравнительной таблице Google указано 58,2%.

  • Меры безопасности влияют на результаты Fable 5.1: Anthropic проводила свои бенчмарки с включёнными производственными мерами безопасности. Помеченные задачи по кибербезопасности и биологии передаются другим моделям Claude, что, вероятно, снизило результаты в OSWorld и AutomationBench.
  • Цена Argon временная: $2 / $10 — вводная цена. Позже она изменится на $4 / $20, при этом дата изменения не объявлена.
  • Контекстное окно Argon не раскрыто: Google опубликовала ограничение на выходные данные в 1 млн токенов, но не указала лимит входных данных.
  • Стоимость задачи — это моментальный снимок: значения $9.18 и $4.72 получены в ходе раннего сентябрьского запуска Astra компанией Artificial Analysis. Настройки усилий сильно влияют на них.
  • У Anthropic есть более дешёвый вариант: В нашем материале об Argon приводятся сообщения о том, что Claude Opus 5.5 превосходит Fable 5.1 в ключевых агентных бенчмарках при более низкой цене API. Она также лидирует в Terminal-Bench 4.0 с результатом 66,4%.

Основные выводы

  • GPT-6.1 Sol сравнивается с Astra в DeepSWE v1.1 при цене в пять раз ниже.
  • GPT-6 Astra лидирует в FrontierSWE v2 (65,5%) и OSWorld-2.0 (72,6%).
  • Gemini 4 Argon лидирует в DeepSWE, Vals Index и AutomationBench, но только внутри Fairwind.
  • Стоимость Fable 5.1 составляет $9.18 за задачу против $4.72 у Astra при одинаковых заявленных ценах.
  • Для агентов с активным использованием кэша чтение кэша Fable 5.1 за $0.25 в 4 раза дешевле, чем у Astra за $1.00.

Часто задаваемые вопросы

  • Какая модель самая дешёвая? GPT-6.1 Sol: $2 за входные, $10 за выходные и $0.10 за кэшированные данные на 1 млн токенов. Argon соответствует этой цене только в рамках вводного тарифа и внутри Fairwind.
  • Какая модель лучше всего подходит для программирования? Sol — для больших объёмов. Astra — для самых сложных задач. Fable 5.1 возглавляет индекс программистских агентов Artificial Analysis в Claude Code.
  • Можно ли использовать Gemini 4 Argon уже сегодня? Только через программу Fairwind от Google для специалистов по киберзащите.

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием MarkTechPost

Читать оригинал на MarkTechPost ↗

Текст и изображения принадлежат MarkTechPost и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости