Google DeepMind выпускает Gemini 3.8 Flash и Gemini 3.8 Flash Cyber: одна базовая модель, два режима доступа
Google только что анонсировала Gemini 3.8 Flash и Gemini 3.8 Flash Cyber — спустя три недели после выхода Gemini 3.7 Flash, что стало третьим релизом Flash за шесть недель. Обе версии работают на базе одного и того же фундаментального интеллекта, усовершенствованного с помощью длительных агентных циклов, в которых базовые модели рекурсивно оцениваются. Их различает не архитектура, а уровень мер безопасности и то, кому разрешён доступ.
Можно ли её развернуть? Gemini 3.8 Flash уже доступна всем через Gemini API, Google AI Studio, Antigravity, Android Studio и Gemini Enterprise, поэтому вы можете направить на неё производственный трафик уже сейчас. Веса закрыты, так что вариантов для самостоятельного или локального развертывания нет. Gemini 3.8 Flash Cyber вообще нельзя развернуть в открытом доступе: доступ предоставляется индивидуально через новую программу Fairwind.
Что на самом деле изменилось в 3.8 Flash
Исследовательская команда объясняет, что 3.8 Flash создана на основе 3.7 Flash. Спецификации не изменились: контекстное окно на 1 048 576 токенов, максимальный объём вывода — 65 536 токенов, входные данные в виде текста, изображений, аудио и видео, а также текстовый вывод. Уровни рассуждения по-прежнему обозначаются как LOW, MEDIUM и HIGH, причём по умолчанию используется MEDIUM. Важная деталь, которая может повлиять на миграцию: MINIMAL не поддерживается в 3.8 Flash, и его установка приводит к ошибке валидации API.
Главное изменение — в поведении модели. Google прямо описывает улучшение: 3.8 Flash работает усерднее. При выполнении сложных задач она делает дополнительные шаги рассуждения и итеративно вызывает инструменты, а на более высоких уровнях усилий может расходовать больше токенов. Собственное руководство для разработчиков Google откровенно признаёт, что это повышает точность ценой большего потребления токенов, и рекомендует использовать 3.7 Flash, если вычислительная эффективность является главным ограничением. Это необычно прямое признание того, что новая модель подходит не для каждой рабочей нагрузки.
Где проявляются улучшения
На DeepSWE v1.1 — бенчмарке долгосрочной разработки программного обеспечения — Google сообщает, что 3.8 Flash превосходит большинство более крупных передовых моделей при значительно меньшей стоимости. Она набирает 54,9% на HLE-Verified, а также превосходит 3.7 Flash и другие передовые модели на тестах Vals Finance Agent V2 и Harvey’s Legal Agent Benchmark. Следует отметить, что результаты в финансовой и юридической сферах представлены как относительные превосходства, без указания абсолютных баллов в анонсе.
Flash Cyber и причины ограничения доступа
На CyberGym — стандартном бенчмарке обнаружения уязвимостей — Google сообщает о результатах уровня передовых моделей, превосходящих показатели 3.5 Flash Cyber и значительно более крупных передовых моделей, хотя абсолютная цифра не опубликована. Поскольку CyberGym в основном использует C и C++, Google также провела внутреннее тестирование на 20 языках программирования и сообщает об успешном обнаружении уязвимостей более чем в 70% случаев.
Что касается исправления уязвимостей, CWE-Bench, проводимый Collinear, показывает для Flash Cyber результат 47,2% pass@1 против 47,8% у ведущей передовой модели. Заявление заключается в почти равных результатах при существенно меньшей стоимости, и Google позиционирует модель как находящуюся на границе Парето, а не как лидера рейтинга.
По данным Chrome Security, модель создаёт в 2,6 раза больше корректных исправлений, чем лучшие значительно более крупные коммерческие модели. Wiz измерила на 7,5–9,7 процентного пункта более высокую полноту на своём внутреннем бенчмарке тестирования на проникновение при стоимости в 2,3–5,2 раза ниже. Команда Google по исследованию уязвимостей в облачных системах обнаружила критическую фундаментальную уязвимость менее чем за два часа — обычно такая работа занимает месяцы.
Google прямо заявляет, что уделила приоритетное внимание исправлению уязвимостей, а не наступательным возможностям вроде эксплуатации. Flash Cyber поставляется с более разрешительным набором мер кибербезопасности, и именно поэтому доступ к ней ограничен доверенными защитниками: государственными органами, операторами критической инфраструктуры и сопровождающими программное обеспечение разработчиками, которые подают заявки через Fairwind.
Интерактивное объяснение
Основные выводы
- Две версии работают на одном общем ядре и различаются мерами безопасности, а не размером модели.
- Цена 3.8 Flash остаётся такой же, как у 3.7 Flash: $0.75/$3.75 за 1 млн токенов до 31 декабря 2026 года.
- Модель обменивает токены на точность: больше шагов рассуждения, больше вызовов инструментов и более высокие расходы на каждую задачу.
- Flash Cyber показывает результат 47,2% pass@1 на CWE-Bench против 47,8% у передовой модели при значительно меньшей стоимости.
- Доступ к Cyber предоставляется проверенным защитникам, а не продаётся по опубликованному прайс-листу.
Ознакомьтесь с техническими подробностями здесь. Также подписывайтесь на нас в Твиттере и не забудьте присоединиться к нашему сабреддиту о машинном обучении с более чем 150 тысячами участников и подписаться на нашу рассылку. Подождите! Вы есть в Telegram? теперь вы также можете присоединиться к нам в Telegram.
Хотите сотрудничать с нами для продвижения своего репозитория GitHub, страницы на Hugging Face, релиза продукта, вебинара и т. д.? Свяжитесь с нами
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.