Gemini 4 Argon: наша следующая эра передового искусственного интеллекта
30 сент. 2026 г.
|Gemini 4 Argon демонстрирует передовые результаты в сложных рабочих процессах, связанных с реальной разработкой программного обеспечения, корпоративной интеллектуальной работой — например, в юридической и финансовой сферах — и защитой от киберугроз.
Сегодня мы представляем нашу новую передовую модель Gemini 4 Argon, которая становится доступна группе проверенных специалистов по кибербезопасности в рамках нашей программы Fairwind. Созданная для поддержания глубокого рассуждения в сложных и длительных рабочих процессах, Argon фундаментально меняет то, как мы работаем и создаём продукты в Google. Она демонстрирует передовые результаты в сложных рабочих процессах, связанных с реальной разработкой программного обеспечения, корпоративной интеллектуальной работой — например, в юридической и финансовой сферах — и защитой от киберугроз.
Безопасный выпуск передовых возможностей такого уровня требует поэтапного подхода. Мы активно участвуем в добровольном процессе правительства США по предоставлению доступа к моделям до их выпуска, постепенно расширяя доступ. Мы продолжим собирать отзывы первых тестировщиков и совершенствовать меры безопасности, прежде чем как можно скорее сделать Argon доступной разработчикам, компаниям и частным пользователям.
На первом этапе Argon будет запущена по цене 1 2 доллара за миллион входных токенов и 10 долларов за миллион выходных токенов, при этом стоимость кэшированных входных токенов будет на 95% ниже цены входных токенов.
Меняем то, как мы работаем и создаём продукты в Google
Gemini 4 Argon уже используется в наших внутренних рабочих процессах: тысячи сотрудников Google отмечают сильные стороны модели в специализированных задачах программирования, проведении более глубоких исследований и написании качественных текстов. Она помогает командам работать быстрее, расширять границы инженерной продуктивности и ускорять прорывы:
- Оптимизация квантовых алгоритмов: Argon помогает нашим исследователям в области квантовых вычислений оптимизировать пространственно-временные ресурсы (кубиты × вентили) подпрограмм, создающих узкие места в важных приложениях. В одном из примеров модель за считанные минуты превзошла опубликованный базовый показатель на 40%.
- Эффективность использования памяти: Команда агентов Argon проанализировала телеметрию профилирования всего парка систем, автономно выявила и внедрила оптимизации памяти в центрах обработки данных Google. После полного внедрения это освободило более 300 ТиБ памяти, а общий объём экономии, по оценкам, составит от 500 ТиБ до 1 ПиБ.
- Масштабная миграция и оптимизация кодовых баз: Агенты Argon работают над переносом кодовых баз C/C++ на Rust по всему Google — от десятков тысяч строк в ключевых библиотеках, таких как re2 и libgav1, до более чем 800 тысяч строк в ядре Zircon ОС Fuchsia. Учитывая критическую важность многих из этих систем, такие масштабные переписывания проходят тщательный автоматизированный и ручной аудит, эмуляционное тестирование и проверку перед внедрением в рабочую среду.
Для libgav1 — программного обеспечения Google с открытым исходным кодом для декодирования видео — агенты Argon взяли существующий порт на Rust и заменили 32 тысячи строк SIMD-кода, проведя множество циклов экспериментов с профилированием, изучая вывод компилятора и создавая безопасный код на Rust, чтобы компилятор мог автоматически векторизовать его. В результате получен безопасный с точки зрения памяти видеодекодер, работающий в 2,7 раза быстрее порта на Rust и выдающий идентичное видео, что приближает его к оптимизированной реализации на C++.
Более эффективное решение самых сложных задач
Чтобы Gemini 4 Argon могла работать с более длительными и сложными сценариями использования, мы значительно расширяем лимит выходных токенов модели — до ведущего в отрасли показателя в 1 млн токенов против прежних 64 тысяч. Когда у модели есть пространство для глубокого размышления и генерации сотен тысяч токенов в рамках одной траектории, это выводит глубину рассуждений на новый уровень и позволяет решать сложные задачи за один подход.
Поддержка процессов программирования и корпоративной работы в разных сферах
Возможности Gemini 4 Argon в программировании, рассуждении и мультимодальности, а также её способность выполнять длительные многоэтапные задачи позволяют модели эффективно работать в самых разных корпоративных процессах.
Инженеры Google используют Argon в повседневной работе — от обычной отладки до масштабной миграции кодовых баз и разработки алгоритмов. Модель устанавливает новый рекорд на тесте DeepSWE v1.1 (77,9%), который оценивает эффективность моделей в реальных длительных задачах разработки программного обеспечения.
Помимо программирования, Argon занимает первое место в индексе Vals, измеряющем экономический эффект в финансовой, программной, юридической и налоговой работе, причём каждый сектор взвешен в соответствии с его вкладом в ВВП США. Мы видим столь же высокие результаты в других специализированных оценках, таких как Vals Finance Agent v2 (многоэтапное финансовое исследование) и Harvey’s Legal Agent Benchmark (юридическое исследование и подготовка документов). В AutomationBench — тесте Zapier, измеряющем выполнение задач от начала до конца в ключевых бизнес-функциях, — Argon занимает первое место с результатом 51,3%.
Argon также обладает уникально сильными возможностями, когда интеллектуальная работа требует визуального понимания. Модель умеет выполнять профессиональный анализ графиков, находить детали в длинных видео и предпринимать действия на основе серии документов. Например, в LVBench, оценивающем понимание длинных видео, Argon устанавливает лучший на сегодняшний день результат — 91,7%.
Лидерство в защитной кибербезопасности
Чтобы лучше подготовить специалистов по кибербезопасности к новой эре кибератак, мы обучили Gemini 4 Argon эффективно защищать системы от киберугроз. Argon может автономно находить, проверять и устранять критические уязвимости программного обеспечения. Для проверенных специалистов по кибербезопасности и наших внутренних команд в Google мы выпустим Argon без киберзащитных ограничений, чтобы они могли использовать весь спектр её передовых возможностей защиты от киберугроз.
Wiz уже использует Argon для защиты от киберугроз в рамках инициативы Scan for Good — программы, призванной бесплатно защищать критически важную общественную инфраструктуру путём поиска и устранения уязвимостей высокого риска. В ходе ранней демонстрации эффективности модель обнаружила критическую уязвимость, раскрывавшую конфиденциальную личную информацию в медицинском программном обеспечении, используемом больницами по всему миру, выявив серьёзный риск, который не заметили предыдущие передовые модели.
В тесте CWE-bench v1, оценивающем способность модели устранять уязвимости системы безопасности, Argon делит первое место с максимальным результатом 68%, продолжая передовые достижения 3.8 Flash Cyber в тесте CWE-bench v0.
Gemini 4 Argon демонстрирует впечатляющий прогресс в обнаружении уязвимостей по сравнению с 3.8 Flash Cyber. Например:
- Во внутреннем комплексном тесте Google на обнаружение уязвимостей Argon выявила широкий спектр уязвимостей в сложных кодовых базах, охватывающих 20 языков программирования.
- Во внутреннем тесте Wiz на проверку методом «чёрного ящика», оценивающем способность модели анализировать работающие веб-системы без исходного кода, Argon превосходит 3.8 Flash Cyber в обнаружении поверхности атаки, выявлении уязвимостей и создании доказательств концепции для их проверки.
Усиление передовых мер безопасности до широкого запуска
До широкого запуска Gemini 4 Argon мы продолжаем усиливать критически важные меры безопасности передовых моделей в четырёх основных направлениях:
Защита от злоупотреблений: Чтобы не допустить использования Argon злоумышленниками для кибератак или химических, биологических, радиологических и ядерных (ХБРЯ) атак, модель разработана так, чтобы отказывать в выполнении вредоносных запросов, сохраняя при этом возможность легитимных научных исследований двойного назначения в соответствии с нашей системой безопасности передовых моделей. В рамках этого запуска мы усиливаем надёжность защитных механизмов, в том числе совершенствуем методы мониторинга внутренних активаций модели для выявления злоупотреблений. Эти меры безопасности прошли проверку на устойчивость силами внутренних и внешних команд красных хакеров с использованием сочетания ручных и автоматизированных методов атак.
Защита от атак с внедрением промптов: Argon также является нашей самой устойчивой моделью против косвенного внедрения промптов — атак, при которых вредоносные инструкции или контекст используются для перехвата управления поведением модели. Это сложные атаки, требующие постоянной бдительности и многоуровневой защиты. Благодаря автоматизированному тестированию командами красных хакеров и состязательному обучению Gemini 4 Argon занимает лидирующие позиции по устойчивости к внедрению промптов в тесте Gray Swan’s Indirect Prompt Injection (IPI).
Мониторинг несогласованности: Чтобы не допустить выхода Argon за установленные рамки при попытке выполнить задачу способом, выходящим за пределы намерений пользователя, мы внедряем меры по предотвращению несогласованности, которые отслеживают цепочку рассуждений и действия Argon и при необходимости останавливают выполнение.
Мы использовали аналогичную систему для мониторинга процессов обучения и отправки предупреждений специальной команде реагирования на инциденты, принимая тщательные меры предосторожности, чтобы не передавать результаты обратно в обучение и тем самым не рисковать сформировать у Argon способность уклоняться от мониторинга. Мы настоятельно рекомендуем остальным представителям отрасли сохранять прозрачность рассуждений в этот переломный момент роста возможностей, одновременно управляя рисками несогласованности, чтобы мысли модели оставались полезными для выявления и диагностики несогласованности.
Укрепление систем: По мере того как передовые модели становятся всё более способными, их безопасное тестирование требует защищённых сред, способных соответствовать самим системам. В соответствии с нашей дорожной картой контроля агентов мы укрепляем изолированные среды, изолируя и герметизируя их до начала обучения или оценки высокого риска. Мы намерены делиться этими передовыми методами защиты агентов с нашими партнёрами, чтобы повысить безопасность всей экосистемы.
Скоро запуск
Мы создали Gemini 4 Argon с передовыми возможностями в программировании, интеллектуальной работе, защите от киберугроз и творческом письме, чтобы она стала партнёром для разработчиков, специалистов и компаний при решении самых сложных задач. Мы благодарны первой группе специалистов по кибербезопасности и проверенных тестировщиков, чьи оценки в реальных условиях и отзывы помогут нам усилить наши системы до выпуска для разработчиков, компаний и частных пользователей — начиная с клиентов платного API и подписчиков Google AI Ultra.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.