Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← К новостям

Google Gemini 4 Argon сокращает отставание от OpenAI и Anthropic, но не выходит в явные лидеры

Google Gemini 4 Argon сокращает отставание от OpenAI и Anthropic, но не выходит в явные лидеры
Маттиас Бастиан
1 окт. 2026
Google

Ключевые моменты

  • Google представила Gemini 4 Argon — свою последнюю флагманскую модель, которая сокращает отставание от передовых моделей OpenAI и Anthropic и превосходит некоторые из них по ключевым бенчмаркам.
  • Новая функция: Argon поддерживает до миллиона выходных токенов, позволяя модели за один проход работать над сложными задачами рассуждения без прерывания по тайм-ауту.
  • Google поэтапно запускает Argon, начиная с промоциональной цены в 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов; позднее стандартная цена вырастет до 4 и 20 долларов соответственно. Кэшированные входные данные дешевле на 95 процентов.

Google представила Gemini 4 Argon — свою новую передовую модель, которая сокращает отставание от конкурентов из OpenAI и Anthropic и превосходит некоторых из них по ключевым бенчмаркам. Хотя она, возможно, и не станет безусловным лидером, для передовой модели она относительно дешева — по крайней мере по промоциональной цене.

Argon — первая передовая модель Google более чем за семь месяцев после Gemini 3.1 Pro. Она возвращает технологического гиганта в тройку ведущих лабораторий искусственного интеллекта, хотя Anthropic, вероятно, по-прежнему удерживает лидерство. После сложного и затянувшегося периода разработки, в ходе которого уже анонсированную передовую модель Gemini 3.5 полностью пропустили, Google снова включилась в гонку.

Большинству пользователей придется подождать

Изначально Argon будет доступна группе «проверенных специалистов по киберзащите» в рамках программы Fairwind. Они и внутренние команды Google получат модель без киберзащитных ограничений. Google объясняет постепенный запуск «поэтапным подходом», которого требуют возможности ИИ такого уровня. Компания также участвует в добровольной программе правительства США, предоставляющей ведомствам доступ к новым моделям до их публичного релиза.

Отзывы первых тестировщиков будут использованы для улучшения механизмов безопасности модели. Только после этого Google планирует открыть Argon для разработчиков, компаний и потребителей, начав с платных клиентов API и подписчиков Google AI Ultra. Компания не назвала дату, ограничившись формулировкой «как можно скорее».

Цены уже установлены — по крайней мере промоциональные: 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов. Кэшированные входные токены стоят на 95 процентов дешевле — около 10 центов за миллион. Для Gemini 3.8 Flash действовала скидка 90 процентов на кэш. Это ставит Google значительно ниже других передовых моделей по базовой цене токенов, но не по их расходу (см. ниже).

Цена за миллион токенов Gemini 4 Argon (промоциональная) Gemini 4 Argon (стандартная) GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
Входные токены 2 $ 4 $ 10 $ 10 $ $4
Выходные токены $10 $20 $50 $50 $20
Операции чтения кэша $0.10* $0.20* $1 $0.25 $0.20
Операции записи в кэш Н/Д Н/Д $12.50 $12.50 (5 мин.) / $20 (1 ч.) $5 (5 мин.) / $8 (1 ч.)

*Google не указывает эту цифру напрямую, но сообщает, что кэш на 95 процентов дешевле обычной цены входных токенов.

Google также увеличила лимит вывода с 64 000 до миллиона токенов, назвав это первым подобным решением в отрасли. Идея заключается в том, что если модель может генерировать сотни тысяч токенов в рамках одной траектории, она способна более тщательно обдумывать сложные задачи и решать их за один проход. Для этого Google добавляет в Gemini API новую функцию «Long Decode Continuation». Она приостанавливает длинные ответы и возобновляет их через последующие запросы, чтобы рассуждение не прерывалось по тайм-ауту.

Окно входного контекста остается на уровне миллиона токенов. Argon принимает на вход текст, изображения, видео и аудио, но выдает только текст.

Независимые тесты показывают, что Argon сравнялась с GPT-6 Astra, но расходует больше токенов

Artificial Analysis представила предварительную независимую оценку. На самом высоком доступном уровне рассуждения «High» Gemini 4 Argon набирает 53 балла в индексе интеллекта Artificial Analysis. Это столько же, сколько у OpenAI GPT-6 Astra (max) и Claude Fable 5.1, и на один балл больше, чем у GPT-6.1 Sol (max).

Модели Anthropic по-прежнему лидируют. Claude Opus 5.5 набирает 58 баллов, а Claude Sonnet 5.5 — 56. По сравнению с последней передовой моделью Google, Gemini 3.1 Pro Preview, Argon прибавила 23 балла. «High» обычно является высшим уровнем рассуждения для моделей Gemini, хотя иногда поддерживается и специальный режим «Deep Think».

При текущей промоциональной цене одно задание Intelligence Index стоит 1,99 доллара. Это 60 процентов стоимости GPT-6 Astra (3,26 доллара), но в 2,7 раза дороже GPT-6.1 Sol. После окончания скидки стоимость вырастет до 3,98 доллара — примерно на 20 процентов выше, чем у GPT-6 Astra. Преимущество в цене обеспечивается более низкими тарифами на токены, а не эффективностью. Argon в среднем использует 62 000 выходных токенов на задание, тогда как GPT-6 Astra требуется всего 27 000.

Результаты Artificial Analysis показывают, что Argon на уровне «High» догоняет лидеров. | Изображение: Artificial Analysis

Argon также значительно улучшила результаты в агентных задачах, которые, согласно Artificial Analysis, были слабым местом моделей Gemini. В AutomationBench-AA, версии Artificial Analysis, она занимает первое место с результатом 77,5 процента — на шесть пунктов опережая Claude Sonnet 5.5 (max). В Terminal Bench 4 она набирает 57 процентов — на 53 пункта больше, чем Gemini 3.1 Pro Preview. Однако она по-прежнему уступает Claude Sonnet 5.5 (64 процента), Claude Opus 5.5 (60 процентов) и GPT-6 Astra (59 процентов).

Artificial Analysis также отмечает низкий уровень галлюцинаций у Argon. В AA-Omniscience — бенчмарке, проверяющем фактические знания и честное признание пробелов в знаниях, — уровень галлюцинаций Argon составляет 15 процентов. У GPT-6 Astra (max) он равен 51 проценту, а у GPT-6.1 Sol (max) — 54 процентам. Argon гораздо чаще признает, что не знает ответа, чем дает неверный ответ. Однако ее точность составляет лишь 50 процентов — на пять пунктов ниже, чем у Gemini 3.1 Pro Preview, и на 13 пунктов ниже, чем у GPT-6 Astra (max, 63 процента). В общем зачете бенчмарка Argon набирает 42 балла, примерно столько же, сколько GPT-6 Astra (43) и GPT-6.1 Sol (42).

Собственные результаты Google выглядят более оптимистично. Argon лидирует в большинстве этих бенчмарков, иногда с большим отрывом.

Результаты внутренних бенчмарков Google для Gemini 4 Argon. | Изображение: Google

Argon также лидирует в Vals Index. С результатом 68,9 процента она занимает первое место, согласно Vals AI, став первой моделью Gemini, возглавившей этот индекс. Argon входит в пятерку лучших в 20 из 22 протестированных бенчмарков, особенно хорошо показывая себя в финансах, праве, программировании и безопасности. Однако в этом тесте модель среднего уровня Sonnet 5.5 также опережает топовую модель Anthropic Opus 5.5, поэтому к результатам стоит относиться с осторожностью.

Как всегда, моделям ИИ предстоит доказать свою состоятельность в реальном использовании, а производительность зависит не только от самой модели, но и от программного обеспечения, построенного вокруг нее. Сейчас это слабое место Google: по сравнению с Claude Cowork и ChatGPT Work приложение Gemini по-прежнему отстает.

Argon возглавила рейтинги человеческих предпочтений в работе с текстом

На Arena.ai, где люди оценивают ответы моделей в очных сравнениях, Argon показывает хорошие результаты. В Text Arena Gemini 4 Argon (High) занимает первое место с 1525 баллами, опережая занявшую второе место Claude Opus 4.6 (High) на 20 баллов. Это делает ее сильным претендентом для задач письма, особенно после длительного отсутствия конкурентоспособных моделей для работы с текстом и на фоне того, что Opus 5.5 по-прежнему не сравнялась с Opus 4.6 в рейтингах человеческих предпочтений. Предыдущая модель Google, Gemini 3.8 Flash (High), занимала одиннадцатое место.

Согласно Arena, Argon лидирует в программировании, сложных запросах, следовании инструкциям, длинных запросах и творческом письме. Она также занимает первое место во всех оцениваемых профессиональных областях, а также в запросах на английском, китайском и русском языках и в неанглоязычных запросах в целом.

Результаты веб-разработки скромнее. В Code Arena: WebDev Argon набирает 1679 баллов и занимает восьмое место. Это на 96 баллов больше, чем у Gemini 3.8 Flash (High), и подъем с 29-го места, но до лидирующих позиций модель не добралась.

По соотношению цены и производительности Arena ставит Argon впереди всех. При смешанном тарифе 8 долларов за миллион токенов Argon сдвигает границу Парето в Text Arena и в настоящее время является самой экономичной моделью в рейтинге.

Новости ИИ без шумихи — отобраны людьми

Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ и эксклюзивный отчет о передовых моделях «AI Radar» шесть раз в год, полный доступ к архиву и разделу комментариев.

Источник: Artificial Analysis | Google Deepmind | Vals AI / Индекс | Arena / Оценка

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием The Decoder

Читать оригинал на The Decoder ↗

Текст и изображения принадлежат The Decoder и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости