Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Google Gemini 4 Argon съкращава изоставането спрямо OpenAI и Anthropic, но не излиза като категоричен лидер

Google Gemini 4 Argon скъсява дистанцията с OpenAI и Anthropic, но не заема категорично лидерство
Матиас Бастиан
1 октомври 2026 г.
Google

Основни моменти

  • Google представи Gemini 4 Argon — най-новия си водещ модел, който скъсява дистанцията с водещите модели на OpenAI и Anthropic и ги изпреварва в някои ключови тестове.
  • Нова функция: Argon поддържа до един милион изходни токена, което му позволява да обработва сложни задачи за разсъждение в един проход, без да изтича времето за изпълнение.
  • Google пуска Argon поетапно, като началната промоционална цена е 2 долара за един милион входни токена и 10 долара за един милион изходни токена, а стандартните цени по-късно ще се повишат съответно до 4 и 20 долара. Кешираните входни токени са с 95 процента отстъпка.

Google представи Gemini 4 Argon, своя нов водещ модел, който скъсява дистанцията с конкурентите от OpenAI и Anthropic и ги изпреварва в някои ключови тестове. Макар да не заема категорично лидерство, той е сравнително евтин за водещ модел — поне на промоционалната цена.

Argon е първият водещ модел на Google от повече от седем месеца насам, след Gemini 3.1 Pro. Той връща технологичния гигант сред трите водещи лаборатории за изкуствен интелект, макар че Anthropic вероятно все още държи лидерството. След труден и проточил се период на разработка, при който вече обявеният водещ модел Gemini 3.5 беше изцяло пропуснат, Google отново се включва в надпреварата.

Повечето потребители ще трябва да изчакат

Първоначално Argon ще бъде предоставен на група „доверени защитници на киберпространството“ като част от програмата Fairwind. Те и вътрешните екипи на Google ще получат модела без защитни механизми срещу киберзаплахи. Google обосновава поетапното пускане с „поетапен подход“, който според компанията е необходим при възможности на изкуствения интелект от това ниво. Компанията участва и в доброволната програма на правителството на САЩ, която дава на държавните агенции достъп до нови модели преди публичното им пускане.

Обратната връзка от ранните тестери ще бъде използвана за подобряване на механизмите за безопасност на модела. Едва след това Google планира да предостави Argon на разработчици, компании и потребители, като започне от плащащите API клиенти и абонатите на Google AI Ultra. Компанията не е посочила дата, а само заявява „възможно най-скоро“.

Цената вече е определена, поне като начална тарифа: 2 долара за един милион входни токена и 10 долара за един милион изходни токена. Кешираните входни токени струват с 95 процента по-малко, което се равнява на около 10 цента за един милион. Gemini 3.8 Flash имаше 90-процентна отстъпка за кеширане. Това поставя Google значително под останалите водещи модели по номинална цена на токените, макар и не по потребление на токени (вижте по-долу).

Цена за един милион токена Gemini 4 Argon (промоционална) Gemini 4 Argon (стандартна) GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Входни токени 2 $ 4 $ 10 $ 10 $ $4
Изходни токени $10 $20 $50 $50 $20
Операции за четене от кеша $0.10* $0.20* $1 $0.25 $0.20
Операции за запис в кеша Н/П Н/П $12.50 $12.50 (5 мин.) / $20 (1 ч.) $5 (5 мин.) / $8 (1 ч.)

*Google не посочва тази стойност изрично, но заявява, че кешът е с 95 процента по-евтин от стандартната цена на входните токени.

Google също така увеличи лимита за изхода от 64 000 на един милион токена, определяйки това като първа по рода си стъпка в индустрията. Идеята е, че ако моделът може да генерира стотици хиляди токени в рамките на една траектория, той може да обмисля по-задълбочено трудните задачи и да ги решава в един проход. За тази цел Google добавя новата функция „Long Decode Continuation“ към Gemini API. Тя поставя на пауза дългите отговори и ги възобновява чрез последващи заявки, така че разсъжденията да не прекъсват поради изтичане на времето.

Контекстният прозорец за входа остава един милион токена. Argon приема текст, изображения, видео и аудио като вход, но генерира само текст.

Независими тестове показват, че Argon се изравнява с GPT-6 Astra, но изразходва повече токени

Artificial Analysis предоставя ранна независима оценка. При най-високото налично ниво на разсъждение — „High“ — Gemini 4 Argon получава 53 точки в Artificial Analysis Intelligence Index. Това го изравнява с GPT-6 Astra (макс.) на OpenAI и Claude Fable 5.1, а резултатът му е с една точка над този на GPT-6.1 Sol (макс.).

Моделите на Anthropic все още са начело. Claude Opus 5.5 получава 58 точки, а Claude Sonnet 5.5 — 56. В сравнение с последния водещ модел на Google, Gemini 3.1 Pro Preview, Argon отбелязва ръст от 23 точки. „High“ обикновено е най-високото ниво на разсъждение при моделите Gemini, макар че понякога се поддържа и специален режим „Deep Think“.

При настоящата промоционална цена една задача от Intelligence Index струва 1,99 долара. Това е 60 процента от цената на GPT-6 Astra (3,26 долара), но е 2,7 пъти по-скъпо от GPT-6.1 Sol. След края на отстъпката цената ще се повиши до 3,98 долара — около 20 процента над тази на GPT-6 Astra. Ценовото предимство идва от по-ниските тарифи за токени, а не от ефективността. Argon използва средно 62 000 изходни токена за задача, докато GPT-6 Astra се нуждае само от 27 000.

Резултатите на Artificial Analysis показват, че Argon при „High“ се доближава до най-високото ниво. | Изображение: Artificial Analysis

Argon отбелязва значителен напредък и при агентните задачи, които според Artificial Analysis са били слабо място на моделите Gemini. В AutomationBench-AA, варианта на Artificial Analysis, той заема първо място със 77,5 процента — с шест точки пред Claude Sonnet 5.5 (макс.). В Terminal Bench 4 достига 57 процента, което е ръст от 53 точки спрямо Gemini 3.1 Pro Preview. Това все още го оставя зад Claude Sonnet 5.5 (64 процента), Claude Opus 5.5 (60 процента) и GPT-6 Astra (59 процента).

Artificial Analysis подчертава и ниския процент на халюцинации при Argon. В AA-Omniscience — тест, който оценява фактическите знания и честното признаване на пропуски в знанията — процентът на халюцинации при Argon е 15 процента. GPT-6 Astra (макс.) достига 51 процента, а GPT-6.1 Sol (макс.) — 54 процента. Argon е много по-склонен да признае, че не знае отговора, вместо да даде грешен отговор. Точността му обаче достига само 50 процента — с пет точки под Gemini 3.1 Pro Preview и с 13 точки под GPT-6 Astra (макс., 63 процента). В общата оценка на теста Argon получава 42 точки, приблизително наравно с GPT-6 Astra (43) и GPT-6.1 Sol (42).

Собствените резултати на Google от тестовете представят по-оптимистична картина. Argon води в повечето от тези тестове, понякога с голяма преднина.

Вътрешни резултати на Google от тестовете на Gemini 4 Argon. | Изображение: Google

Argon води и в Vals Index. С резултат от 68,9 процента той заема първо място според Vals AI, превръщайки се в първия модел Gemini, оглавил индекса. Argon попада в челната петица в 20 от 22 тествани показателя, като е особено силен във финансите, правото, програмирането и сигурността. В този тест обаче моделът от среден клас Sonnet 5.5 също изпреварва водещия модел на Anthropic Opus 5.5, така че резултатите трябва да се приемат с известна доза скептицизъм.

Както винаги, моделите с изкуствен интелект трябва да се докажат в реална употреба, а представянето зависи не само от самия модел, но и от софтуера, изграден около него. Именно това е слабото място на Google в момента: в сравнение с Claude Cowork и ChatGPT Work приложението Gemini все още изостава.

Argon оглавява класациите за човешки предпочитания при текстови задачи

В Arena.ai, където хората оценяват резултатите на моделите в директни сравнения, Argon се представя добре. В Text Arena Gemini 4 Argon (High) заема първо място с 1525 точки — с 20 точки пред Claude Opus 4.6 (High), който е втори. Това го превръща в сериозен претендент за задачи по писане, особено след дълъг период без конкурентни модели за писане и при положение че Opus 5.5 все още не се изравнява с Opus 4.6 в класациите за човешки предпочитания. Предишният модел на Google, Gemini 3.8 Flash (High), беше на единадесето място.

Според Arena Argon води при програмирането, сложните заявки, следването на инструкции, по-дългите заявки и творческото писане. Той също така се класира на първо място във всички оценявани професионални области, както и при заявки на английски, китайски и руски език и при заявки на езици, различни от английския като цяло.

Резултатите при уеб разработката са по-скромни. В Code Arena: WebDev Argon получава 1679 точки и заема осмо място. Това е подобрение от 96 точки спрямо Gemini 3.8 Flash (High) и скок от 29-о място, но не е достатъчно за челните позиции.

По отношение на съотношението цена–резултат Arena поставя Argon пред всички конкуренти. При комбинирана цена от 8 долара за един милион токена Argon измества границата на Парето в Text Arena и в момента е най-рентабилният модел в класацията.

Новини за изкуствения интелект без сензации — подбрани от хора

Абонирайте се за THE DECODER, за да четете без реклами, да получавате седмичен бюлетин за изкуствения интелект, нашия ексклузивен водещ доклад „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.

Източник: Artificial Analysis | Google Deepmind | Vals AI / Индекс | Arena / Оценка

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от The Decoder на

Прочетете оригинала в The Decoder ↗

Текстът и изображенията са собственост на The Decoder и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини