Sakhanda Wire
NVDA $233.95 +1.34% MSFT $517.53 +0.92% GOOGL $343.50 +1.56% META $728.08 +0.30% AMZN $251.52 +1.33%
← Към новините

GPT-6 Astra срещу GPT-6.1 Sol срещу Gemini 4 Argon срещу Claude Fable 5.1: Кой граничен модел е подходящ за коя задача

Anthropic, OpenAI и Google DeepMind пуснаха 4 модела от най-висок клас в рамките на 30 дни. Claude Fable 5.1 пристигна на 1 септември. GPT-6 Astra го последва на 3 септември. GPT-6.1 Sol и Gemini 4 Argon се появиха в последните дни на септември.

Разгледахме всяко стартиране поотделно. Този материал ги поставя едно до друго. Резултатите от бенчмарковете се припокриват повече, отколкото предполагат публикациите при пускането им. Цените, правилата за достъп и разходите за задача обаче се различават.

Една промяна определя рамката на тази селекция. OpenAI отмени GPT-6.1 Astra на 28 септември, след като моделът не премина вътрешните тестове за обхват и оторизация. Засега GPT-6 Astra остава водещият модел на OpenAI.

Спецификации, цени и достъп

Astra и Fable 5.1 споделят една и съща каталожна цена от $10 за вход и $50 за изход. Sol и Argon се предлагат на една пета от тази цена. Цената на Argon е въвеждаща и по-късно ще се удвои.

ХарактеристикаGPT-6 AstraGPT-6.1 SolGemini 4 ArgonClaude Fable 5.1
РазработчикOpenAIOpenAIGoogle DeepMindAnthropic
Пуснат3 септември 2026 г.29 септември 2026 г.Обявен на 30 септември 2026 г.1 септември 2026 г.
ДостъпOpenAI API, ChatGPT, CodexOpenAI API, ChatGPT Work, CodexСамо програмата FairwindClaude API, Bedrock, Google Cloud, Microsoft Foundry
Вход / изход (на 1 млн.)$10 / $50$2 / $10$2 / $10 въвеждаща цена, след това $4 / $20$10 / $50
Кеширан вход (на 1 млн.)$1.00$0.10$0.10 въвеждаща цена$0.25
Ценообразуване при дълги заявкиНад 272K: $20 / $75Над 272K: 2x вход, 1.5x изходНе е обявеноЕднаква цена до 1M
Контекстен прозорец1.05M1.05MНе е обявено1M
Максимален изход на отговор128K128K1M128K
Контрол на разсъжденията5 нива на усилие, от ниско до максимално5 нива на усилие, от ниско до максималноНе е обявеноНива на усилие, включително ниско, средно и високо
Отворени теглаНеНеНеНе

Източници: материалът на OpenAI за GPT-6.1 Sol, материалът за Gemini 4 Argon, ценообразуването на GPT-6 Astra при дълъг контекст, спецификациите на Claude Fable 5.1. Стандартни каталожни цени от първата страна, ниво за кратък контекст.

Редът за кеширания вход е най-важен за агентите. Агентите изпращат повторно системните подсказки, схемите на инструментите и историята при всяка стъпка. Четенето от кеша при Astra на цена $1.00 е 4 пъти по-скъпо от това при Fable 5.1 и 10 пъти по-скъпо от това при Sol.

Лимитът от 1M за изход при Argon е единственото съществено отклонение. Останалите 3 модела спират при 128K токена на отговор.

Бенчмаркове: къде води всеки модел

Нито един модел не печели във всички категории. Argon води при работата със знания и програмирането с дълъг хоризонт. Astra води при софтуерното инженерство на най-високо ниво и използването на компютър. Opus 5.5, който не е включен в тази селекция, води в Terminal-Bench 4.0.

БенчмаркКакво тестваGemini 4 ArgonGPT-6 AstraClaude Fable 5.1
DeepSWE v1.1Софтуерно инженерство с дълъг хоризонт77.9%74.1%67.4%
Vals IndexФинанси, програмиране, правна и данъчна работа68.9%63.1%65.8%
FrontierSWE v2Софтуерно инженерство на най-високо ниво55.0%65.5%56.3%
Terminal-Bench 4.0Агентна работа в терминал57.4%58.2%57.9%
CWE-bench v1Отстраняване на уязвимости68% (равенство)68% (равенство)58%
OSWorld-2.0Използване на компютър69.2%72.6%Не е включен в таблицата на Google

Източник: публикуваното сравнение на Google DeepMind, както е посочено в нашия материал за Gemini 4 Argon. Данни, предоставени от доставчиците.

GPT-6.1 Sol не е включен в таблицата на Google. Собствените данни на OpenAI го поставят близо до Astra:

  • DeepSWE v1.1: Sol постига резултат, равен на този на Astra, при приблизително една пета от разходите.
  • Офлайн наборът OSWorld 2.0: Sol е в рамките на 2.1 пункта от Astra при около една седма от разходите за задача.
  • AutomationBench 1.0.6: Sol постига резултат с 2.2 пункта над този на Claude Opus 5.5 при средно усилие.
  • Terminal-Bench Science 0.1: Astra все още води с 68.1%. OpenAI препоръчва Astra за най-трудните изследователски задачи.

Независими сигнали сочат в друга посока по отношение на суровата интелигентност. В Artificial Analysis Intelligence Index Astra получава 61 точки. Fable 5.1 получава с 5 точки повече. В своя индекс за кодиращи агенти Artificial Analysis дава на Fable 5.1 в Claude Code 70 точки срещу 67 за Astra. Artificial Analysis също съобщава, че Argon се изравнява с Astra в Intelligence Index.

В ARC-AGI-2 Astra получава 95%, а Fable 5.1 — 90%.

Разходи за задача: една и съща каталожна цена, различна сметка

Artificial Analysis оценява Claude Fable 5.1 на $9.18 за задача срещу $4.72 за GPT-6 Astra. Това е около 1.9 пъти повече при еднакви каталожни цени.

Разликата идва от обема токени, а не от ставките. Разходът за задача се изчислява чрез умножаване на цената по изразходваните токени. При еднакви ставки разликата предполага, че Fable 5.1 е изразходвал повече токени за задача в този тест. Anthropic също отбелязва, че по-новият му токенизатор генерира приблизително 30% повече токени за същия текст.

Двата по-евтини модела променят картината още повече:

  • Gemini 4 Argon: Artificial Analysis съобщава, че Argon се изравнява с Astra в Intelligence Index при 60% от разходите на Astra за задача, като се използват въвеждащите цени.
  • GPT-6.1 Sol: В Terminal-Bench Science OpenAI отчита $5.47 за задача при Sol срещу $23.80 за Astra.

Кеширането може да обърне класирането при агентите. Посочените по-горе разходи за задача не отчитат интензивно повторно използване на кеша. Един дългосрочно работещ агент прочита отново същия контекст при всяка стъпка. Ето изчислението за кеширан контекст от 200K токена, преди да се добавят изходните токени:

МоделКеширана ставка (на 1 млн.)На стъпкаНа 100 стъпки
GPT-6 Astra$1.00$0.20$20.00
Claude Fable 5.1$0.25$0.05$5.00
GPT-6.1 Sol$0.10$0.02$2.00
Gemini 4 Argon (въвеждаща цена)$0.10$0.02$2.00

Илюстративни изчисления на база каталожните ставки за кеша. Контекстът от 200K при Astra остава под прага от 272K за дълги заявки.

При цикли с интензивно кеширане Fable 5.1 чете контекста на една четвърт от ставката на Astra. Измерете и двата модела върху собствените си записи, преди да избирате въз основа на заглавните стойности за разхода на задача.

Кой модел за коя задача

Избирайте според работното натоварване, а не според позицията в класацията. GPT-6.1 Sol е стандартният избор за повечето екипи. Останалите 3 модела оправдават цената си при по-тесни приложения.

ЗадачаИзборЗащоАлтернатива
Кодиращи агенти с голям обем, CI ботове, преглед на заявки за промениGPT-6.1 SolИзравнява се с Astra в DeepSWE v1.1 при $2 / $10 и $0.10 за кеширани токениGemini 4 Argon, когато стане публично достъпен
Най-трудното отворено софтуерно инженерствоGPT-6 AstraВоди във FrontierSWE v2 с 65.5%Claude Fable 5.1
Използване на компютър и браузърни агентиGPT-6 AstraВоди в OSWorld-2.0 със 72.6%GPT-6.1 Sol, в рамките на 2.1 пункта
Дълги сесии за програмиране в рамките на хъpнесClaude Fable 5.1Най-висок резултат в индекса на Artificial Analysis за кодиращи агенти (70) в Claude Code; $0.25 за четене от кешаGPT-6 Astra (67)
Сложна наука и изследванияGPT-6 AstraВоди в Terminal-Bench Science с 68.1%GPT-6.1 Sol при $5.47 за задача
Правна, финансова и бизнес автоматизацияGemini 4 ArgonВоди във Vals Index (68.9%), AutomationBench (51.3%) и Harvey Legal (19.6%)GPT-6.1 Sol; Claude Fable 5.1
Много дълги единични изходи: големи рефакторирания, пълни докладиGemini 4 ArgonЕдинственият модел с 1M изходни токена на отговорВсеки от останалите 3, разделен на няколко хода
Откриване и отстраняване на уязвимостиGemini 4 Argon или GPT-6 AstraРавенство с 68% в CWE-bench v1Claude Fable 5.1 (58%)
Най-ограничен бюджет при качество от най-висок класGPT-6.1 SolНай-ниската публична цена; Argon се изравнява с нея само в рамките на FairwindGemini 4 Argon

Достъпът определя 2 от тези редове. Днес Argon е достъпен само за защитници в областта на киберсигурността чрез Fairwind. Пълните офанзивни възможности на Astra за киберсигурност са достъпни чрез програмата Daybreak на OpenAI; публичната версия отказва сложни офанзивни киберзадачи. Anthropic предоставя своя неограничен близнак Claude Mythos 5.1 само чрез програми за доверен достъп.

Какво да проверите, преди да смените модела

Повечето числа тук са предоставени от доставчиците, а доставчиците се разминават в детайлите. OpenAI отчита 57.9% за Astra в Terminal-Bench 4.0. Сравнителната таблица на Google посочва 58.2%.

  • Предпазните мерки влияят на резултатите на Fable 5.1: Anthropic е провел бенчмарковете си с активирани производствени предпазни мерки. Маркираните кибернетични и биологични задачи се пренасочват към други модели Claude, което вероятно е понижило резултатите в OSWorld и AutomationBench.
  • Ценообразуването на Argon е временно: $2 / $10 е въвеждаща цена. По-късно тя ще стане $4 / $20, без да е обявена крайна дата.
  • Контекстният прозорец на Argon не е обявен: Google публикува лимита от 1M изходни токена, но не и ограничението за вход.
  • Разходите за задача са моментна снимка: Стойностите от $9.18 и $4.72 идват от ранния септемврийски тест на Astra от Artificial Analysis. Настройките за усилие ги променят значително.
  • Anthropic има по-евтина опция: В нашия материал за Argon се цитират съобщения, че Claude Opus 5.5 превъзхожда Fable 5.1 при ключови бенчмаркове за агенти на по-ниска API цена. Той също води в Terminal-Bench 4.0 с 66.4%.

Основни изводи

  • GPT-6.1 Sol се изравнява с Astra в DeepSWE v1.1 при една пета от цената.
  • GPT-6 Astra води във FrontierSWE v2 (65.5%) и OSWorld-2.0 (72.6%).
  • Gemini 4 Argon води в DeepSWE, Vals Index и AutomationBench, но само в рамките на Fairwind.
  • Fable 5.1 струва $9.18 за задача срещу $4.72 за Astra при еднакви каталожни цени.
  • За агенти с интензивно кеширане четенето от кеша при Fable 5.1 на цена $0.25 е 4 пъти по-евтино от $1.00 при Astra.

Често задавани въпроси

  • Кой е най-евтин? GPT-6.1 Sol — $2 за вход, $10 за изход и $0.10 за кеширани токени на 1 млн. Argon се изравнява с него само при въвеждащата цена и в рамките на Fairwind.
  • Кой е най-добър за програмиране? Sol при големи обеми. Astra за най-трудните задачи. Fable 5.1 оглавява индекса на Artificial Analysis за кодиращи агенти в Claude Code.
  • Мога ли да използвам Gemini 4 Argon днес? Само чрез програмата Fairwind на Google за защитници в областта на киберсигурността.

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини