Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Google Gemini 4 Argon скорочує відставання від OpenAI та Anthropic, але не виходить у явні лідери

Google Gemini 4 Argon скорочує відставання від OpenAI та Anthropic, але не виходить у явні лідери
Matthias Bastian
1 жовтня 2026 року
Google

Ключові моменти

  • Google представила Gemini 4 Argon — свою нову флагманську модель, яка скорочує відставання від передових моделей OpenAI та Anthropic і випереджає деякі з них у ключових бенчмарках.
  • Нова функція: Argon підтримує до одного мільйона вихідних токенів, даючи змогу опрацьовувати складні міркування за один прохід без перевищення часу очікування.
  • Google поетапно запускає Argon, починаючи зі вступної ціни $2 за мільйон вхідних токенів і $10 за мільйон вихідних, а згодом звичайна ціна зросте до $4 і $20 відповідно. Кешовані вхідні дані дешевші на 95 відсотків.

Google представила Gemini 4 Argon — свою нову передову модель, яка скорочує відставання від конкурентів з OpenAI та Anthropic і випереджає деякі з них у ключових бенчмарках. Хоча вона, можливо, і не очолює рейтинг однозначно, для передової моделі вона відносно дешева — принаймні за вступною ціною.

Argon — перша передова модель Google за понад сім місяців, після Gemini 3.1 Pro. Вона повертає рекламного гіганта до трійки провідних лабораторій штучного інтелекту, хоча Anthropic, імовірно, досі утримує лідерство. Після складного й затяжного періоду розробки, під час якого вже анонсовану передову модель Gemini 3.5 повністю пропустили, Google знову повернулася до перегонів.

Більшості користувачів доведеться зачекати

Спочатку Argon буде доступна групі «перевірених захисників кіберпростору» в межах програми Fairwind. Вони та внутрішні команди Google отримають модель без кіберзахисних обмежень. Google пояснює поступовий запуск «поетапним підходом», якого потребують можливості ШІ такого рівня. Компанія також бере участь у добровільній програмі уряду США, яка надає державним установам доступ до нових моделей до їхнього публічного релізу.

Відгуки перших тестувальників будуть використані для вдосконалення механізмів безпеки моделі. Лише після цього Google планує відкрити доступ до Argon для розробників, компаній і споживачів, починаючи з платних клієнтів API та підписників Google AI Ultra. Компанія не назвала дату, зазначивши лише: «якнайшвидше».

Ціни вже встановлено, принаймні як вступний тариф: $2 за мільйон вхідних токенів і $10 за мільйон вихідних. Кешовані вхідні токени коштують на 95 відсотків дешевше — приблизно 10 центів за мільйон. Для Gemini 3.8 Flash знижка на кеш становила 90 відсотків. Це ставить Google значно нижче за інші передові моделі за номінальною ціною токенів, хоча не за їхнім споживанням (див. нижче).

Ціна за мільйон токенів Gemini 4 Argon (промоційна) Gemini 4 Argon (звичайна) GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Вхідні токени 2 $ 4 $ 10 $ 10 $ $4
Вихідні токени $10 $20 $50 $50 $20
Операції читання кешу $0.10* $0.20* $1 $0.25 $0.20
Операції запису в кеш Н/З Н/З $12.50 $12.50 (5 хв.) / $20 (1 год.) $5 (5 хв.) / $8 (1 год.)

*Google не вказує цю цифру безпосередньо, але зазначає, що кеш на 95 відсотків дешевший за звичайну ціну вхідних токенів.

Google також збільшила ліміт вихідних даних із 64 000 до одного мільйона токенів, назвавши це першою такою можливістю в індустрії. Ідея полягає в тому, що якщо модель може генерувати сотні тисяч токенів в одному ланцюжку, вона здатна ретельніше обмірковувати складні проблеми й розв’язувати їх за один прохід. Для цього Google додає до Gemini API нову функцію «Long Decode Continuation». Вона призупиняє довгі відповіді та продовжує їх через наступні запити, щоб міркування не переривалися через перевищення часу очікування.

Розмір вікна контексту залишається на рівні одного мільйона токенів. Argon приймає на вході текст, зображення, відео й аудіо, але генерує лише текст.

Незалежні тести показують, що Argon зрівнялася з GPT-6 Astra, але витрачає більше токенів

Artificial Analysis надає першу незалежну оцінку. На найвищому доступному рівні міркувань «High» Gemini 4 Argon набирає 53 бали в індексі інтелекту Artificial Analysis. Це стільки ж, скільки GPT-6 Astra (max) від OpenAI та Claude Fable 5.1, і на один бал більше, ніж у GPT-6.1 Sol (max).

Моделі Anthropic усе ще лідирують. Claude Opus 5.5 має 58 балів, а Claude Sonnet 5.5 — 56. Порівняно з останньою передовою моделлю Google, Gemini 3.1 Pro Preview, Argon додала 23 бали. «High» зазвичай є найвищим рівнем міркувань для моделей Gemini, хоча іноді також підтримується спеціальний режим «Deep Think».

За поточною промоційною ціною одне завдання Intelligence Index коштує $1.99. Це 60 відсотків вартості GPT-6 Astra ($3.26), але у 2,7 раза дорожче за GPT-6.1 Sol. Після завершення знижки ціна зросте до $3.98 — приблизно на 20 відсотків вище, ніж у GPT-6 Astra. Перевага в ціні пояснюється нижчими тарифами на токени, а не ефективністю. Argon використовує в середньому 62 000 вихідних токенів на завдання, тоді як GPT-6 Astra потребує лише 27 000.

Результати Artificial Analysis показують, що Argon на рівні «High» наздоганяє лідерів. | Зображення: Artificial Analysis

Argon також суттєво покращила результати в агентських завданнях, які, за даними Artificial Analysis, були слабким місцем моделей Gemini. В AutomationBench-AA, варіанті Artificial Analysis, вона посідає перше місце з результатом 77,5 відсотка — на шість пунктів випереджаючи Claude Sonnet 5.5 (max). У Terminal Bench 4 вона набирає 57 відсотків — на 53 пункти більше, ніж Gemini 3.1 Pro Preview. Проте це все ще залишає її позаду Claude Sonnet 5.5 (64 відсотки), Claude Opus 5.5 (60 відсотків) і GPT-6 Astra (59 відсотків).

Artificial Analysis також відзначає низький рівень галюцинацій Argon. У AA-Omniscience — бенчмарку, який перевіряє фактичні знання та чесне поводження з прогалинами в знаннях, — рівень галюцинацій Argon становить 15 відсотків. У GPT-6 Astra (max) цей показник дорівнює 51 відсотку, а в GPT-6.1 Sol (max) — 54 відсоткам. Argon значно частіше визнає, що не знає відповіді, замість того щоб неправильно вгадувати. Однак її точність сягає лише 50 відсотків — на п’ять пунктів нижче, ніж у Gemini 3.1 Pro Preview, і на 13 пунктів нижче, ніж у GPT-6 Astra (max, 63 відсотки). За загальним результатом бенчмарку Argon набирає 42 бали, приблизно стільки ж, як GPT-6 Astra (43) і GPT-6.1 Sol (42).

Власні результати тестування Google виглядають оптимістичніше. Argon лідирує в більшості цих бенчмарків, іноді з великим відривом.

Результати внутрішніх бенчмарків Google для Gemini 4 Argon. | Зображення: Google

Argon також очолює Vals Index. За результатом 68,9 відсотка вона посідає перше місце за версією Vals AI, ставши першою моделлю Gemini, яка очолила цей індекс. Argon входить до п’ятірки найкращих у 20 із 22 протестованих бенчмарків, особливо добре показуючи себе у фінансах, праві, програмуванні та безпеці. Однак у цьому тесті модель середнього рівня Sonnet 5.5 також випереджає топову модель Anthropic Opus 5.5, тож до цих результатів варто ставитися з обережністю.

Як завжди, моделі ШІ мають довести свою спроможність у реальному використанні, а продуктивність залежить не лише від самої моделі, а й від програмного забезпечення, яке працює поверх неї. Наразі це слабке місце Google: порівняно з Claude Cowork і ChatGPT Work застосунок Gemini усе ще відстає.

Argon очолює рейтинги людських уподобань у текстах

На Arena.ai, де люди оцінюють результати моделей у прямих порівняннях, Argon демонструє хороші результати. У Text Arena Gemini 4 Argon (High) посідає перше місце з 1 525 балами — на 20 балів випереджаючи Claude Opus 4.6 (High), яка опинилася другою. Це робить модель сильним претендентом для завдань із написання текстів, особливо після тривалого періоду відсутності конкурентних моделей для письма та з огляду на те, що Opus 5.5 досі не зрівнялася з Opus 4.6 у рейтингах людських уподобань. Попередня модель Google, Gemini 3.8 Flash (High), посідала одинадцяте місце.

За даними Arena, Argon лідирує у програмуванні, складних запитах, дотриманні інструкцій, довших запитах і креативному письмі. Вона також посідає перше місце в усіх оцінених професійних сферах, а також у запитах англійською, китайською, російською та запитах неанглійськими мовами загалом.

Результати веброзробки скромніші. У Code Arena: WebDev Argon набирає 1 679 балів і посідає восьме місце. Це на 96 балів більше, ніж у Gemini 3.8 Flash (High), і стрибок із 29-го місця, але до найвищих позицій модель не дісталася.

За співвідношенням ціни та продуктивності Arena ставить Argon попереду всіх конкурентів. За змішаного тарифу $8 за мільйон токенів Argon зміщує фронт Парето в Text Arena і наразі є найефективнішою за вартістю моделлю в рейтингу.

Новини ШІ без хайпу — відібрані людьми

Підпишіться на THE DECODER, щоб читати матеріали без реклами, отримувати щотижневий інформаційний бюлетень про ШІ, наш ексклюзивний передовий звіт «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.

Джерело: Artificial Analysis | Google Deepmind | Vals AI / Index | Arena / Оцінювання

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням The Decoder

Читати оригінал на The Decoder ↗

Текст і зображення належать The Decoder і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини