Google DeepMind представила Gemini 4 Argon с 1 млн выходных токенов для программирования, интеллектуальной работы и киберзащиты
Google DeepMind только что анонсировала Gemini 4 Argon — свою новую передовую модель и первую модель поколения Gemini 4. Она предназначена для долгосрочной разработки программного обеспечения, корпоративной интеллектуальной работы в сфере права и финансов, а также защиты от киберугроз. Главное техническое изменение — длина вывода. Argon может генерировать до 1 млн токенов в одном ответе по сравнению с 64 тыс. у предыдущих моделей Gemini.
Что анонсировала Google
Google DeepMind описала Argon как модель, созданную для сложных рабочих процессов в программировании, корпоративной интеллектуальной работе и защите от киберугроз.
Google применяет поэтапный подход. Компания участвует в добровольном процессе правительства США по предоставлению доступа к моделям до их выпуска. Она будет собирать отзывы первых тестировщиков и совершенствовать защитные механизмы перед более широким выпуском.
Цены уже опубликованы. Argon запускается по вводной цене $2 за 1 млн входных токенов и $10 за 1 млн выходных токенов. На кэшированные входные токены предоставляется скидка 95%, что составляет $0,10 за 1 млн. После окончания вводного периода цена вырастет до $4 за входные и $20 за выходные токены. Логан Килпатрик подтвердил вводную цену $2 за входные и $10 за выходные токены.
Почему ограничение в 1 млн выходных токенов имеет значение
Современные передовые API ограничивают один ответ значительно сильнее. Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra позволяют генерировать по 128 тыс. выходных токенов.
Команда Google утверждает, что Argon может глубоко рассуждать и генерировать сотни тысяч токенов за один рабочий процесс. Для разработчиков это означает возможность выполнять масштабный рефакторинг или создавать длинные отчёты без разделения работы на несколько запросов. Однако стоимость ощутима. Полный вывод объёмом 1 млн токенов стоит $10 по вводной цене и $20 после её окончания.
Google не раскрыла размер контекстного окна Argon.
Тесты: где Argon лидирует, а где уступает
Google сравнила Argon с GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1. Argon безоговорочно лидирует в 12 из 18 тестов и делит первое место ещё в одном.
Где модель лидирует:
- DeepSWE v1.1 (долгосрочная разработка программного обеспечения): 77,9% — новый рекорд. Opus 5.5 набрала 74,2%, а GPT-6 Astra — 74,1%.
- Vals Index (экономическое влияние в финансах, программировании, праве и налоговой сфере): 68,9%, первое место.
- AutomationBench (Zapier, сквозное выполнение бизнес-задач): 51,3%, первое место. Opus 5.5 набрала 42,5%.
- Harvey Legal Agent Benchmark: 19,6% против 5,4% у GPT-6 Astra.
- LVBench (понимание длинных видео): 91,7% — новый рекорд.
Где модель уступает:
- FrontierSWE v2: 55,0% против 65,5% у GPT-6 Astra.
- Terminal-Bench 4.0: 57,4% против 66,4% у Claude Opus 5.5.
- OSWorld-2.0 (работа с компьютером): 69,2% против 72,6% у GPT-6 Astra.
Artificial Analysis сообщила, что Argon сравнялась с GPT-6 Astra в её Intelligence Index, обеспечивая 60% стоимости одной задачи при использовании дисконтированных цен.
Киберзащита: найти, проверить, исправить
Google обучила Argon автономно находить, проверять и устранять критические уязвимости в программном обеспечении. Проверенные специалисты по киберзащите и внутренние команды Google получают доступ к модели без киберзащитных ограничений.
В CWE-bench v1, проверяющем устранение уязвимостей, Argon делит первое место с результатом 68%. Конкурирующие модели в этом рейтинге работают внутри собственных агентских оболочек.
Wiz уже использует Argon в рамках инициативы Scan for Good. Модель обнаружила критическую уязвимость в медицинском программном обеспечении, используемом больницами по всему миру. Google заявляет, что предыдущие передовые модели её не обнаружили.
Перед широким выпуском Google усиливает защиту в 4 областях:
- Защита от злоупотреблений в сфере киберугроз и CBRN-рисков, включая мониторинг активации, в соответствии с её Frontier Safety Framework.
- Устойчивость к косвенным инъекциям подсказок, где Argon лидирует в тесте IPI от Gray Swan.
- Мониторинг рассогласования в цепочке рассуждений и действиях с возможностью остановить выполнение.
- Изолированные герметичные песочницы для обучения и тестирования в условиях высокого риска.
Argon внутри Google
Тысячи сотрудников Google уже используют Argon. Google поделилась 4 результатами внутреннего применения:
- Агенты применили оптимизацию памяти в центрах обработки данных, освободив более 300 ТиБ; ожидается, что этот показатель составит от 500 ТиБ до 1 ПиБ.
- Агенты заменили 32 тыс. строк SIMD-кода в Rust-порте libgav1. Декодер работает в 2,7 раза быстрее при идентичном результате.
- Агенты переносят кодовые базы на C/C++ в Rust, включая до 800 тыс. строк и более в ядре Fuchsia Zircon.
- Argon превзошла опубликованный базовый результат квантового алгоритма на 40% за считанные минуты.
Сравнение: Gemini 4 Argon и ближайшие конкуренты
| Характеристика | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Разработчик | Google DeepMind | Anthropic | Anthropic | OpenAI |
| Доступность | Только программа Fairwind | Claude API и облачные сервисы | Claude API и облачные сервисы | OpenAI API |
| Максимальный вывод на ответ | 1 млн токенов | 128 тыс. | 128 тыс. | 128 тыс. |
| Контекстное окно | Не раскрыто | 1 млн | 1 млн | 1,05 млн |
| Цена входных / выходных токенов (за 1 млн) | $2 / $10 в начале, затем $4 / $20 | $4 / $20 | $10 / $50 | $10 / $50 |
| Кэшированные входные токены (за 1 млн) | $0,10 (в начале) | $0,20 | $0,25 | $1,00 |
| Открытые веса | Нет | Нет | Нет | Нет |
| DeepSWE v1.1 | 77,9% | 74,2% | 67,4% | 74,1% |
| Vals Index | 68,9% | 67,0% | 65,8% | 63,1% |
| FrontierSWE v2 | 55,0% | 62,3% | 56,3% | 65,5% |
| Terminal-Bench 4.0 | 57,4% | 66,4% | 57,9% | 58,2% |
| CWE-bench v1 | 68% (ничья) | 67% | 58% | 68% (ничья) |
Источники: Google, цены Anthropic Opus, документация Anthropic Fable 5.1, документация OpenAI GPT-6 Astra, OpenRouter. Результаты тестов взяты из опубликованного Google сравнения. Цены GPT-6 Astra относятся к уровню с коротким контекстом.
Основные выводы
- Gemini 4 Argon увеличивает лимит вывода с 64 тыс. до 1 млн токенов.
- Она лидирует в DeepSWE v1.1 (77,9%) и Vals Index (68,9%).
- Она уступает в FrontierSWE v2, Terminal-Bench 4.0 и OSWorld-2.0.
- Вводная цена $2 / $10 вдвое ниже, чем у Claude Opus 5.5.
- Доступ ограничен специалистами по киберзащите в рамках Fairwind; дата публичного выпуска пока не объявлена.
Ознакомьтесь с техническими подробностями. Вся заслуга принадлежит исследователю этого проекта. Также не стесняйтесь подписаться на нас в Twitter и не забудьте присоединиться к нашему сабреддиту 150k+ ML и подписаться на нашу рассылку. Стоп! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы Hugging Face, выпуска продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.