Google DeepMind випускає Gemini 3.8 Flash і Gemini 3.8 Flash Cyber: одна базова модель, два режими доступу
Google щойно анонсувала Gemini 3.8 Flash і Gemini 3.8 Flash Cyber — через три тижні після Gemini 3.7 Flash, що стало третім випуском Flash за шість тижнів. Обидва варіанти працюють на базі одного фундаментального інтелекту, удосконаленого завдяки тривалим агентним циклам, які рекурсивно оцінюють базові моделі. Їх відрізняє не архітектура, а межі безпеки та те, кому дозволено їх перетинати.
Чи готова модель до розгортання? Gemini 3.8 Flash вже сьогодні загальнодоступна через Gemini API, Google AI Studio, Antigravity, Android Studio та Gemini Enterprise, тож ви можете спрямувати на неї робочий трафік уже зараз. Ваги моделі закриті, тому варіантів для самостійного розміщення чи локального розгортання немає. Gemini 3.8 Flash Cyber взагалі не доступна для відкритого розгортання: доступ надається в кожному випадку окремо через нову програму Fairwind.
Що насправді змінилося в 3.8 Flash
Дослідницька команда пояснює, що 3.8 Flash базується на 3.7 Flash. Характеристики не змінилися: контекстне вікно на 1 048 576 токенів, максимальний вихід на 65 536 токенів, введення тексту, зображень, аудіо та відео, а також текстовий вихід. Рівні міркування залишаються LOW, MEDIUM і HIGH, причому MEDIUM використовується за замовчуванням. Важлива деталь для тих, хто переходить на нову версію: MINIMAL не підтримується в 3.8 Flash, а його встановлення повертає помилку перевірки API.
Ключовою є зміна поведінки. Google прямо описує перевагу: 3.8 Flash працює старанніше. У складних завданнях вона виконує додаткові кроки міркування та ітеративно викликає інструменти, а на вищих рівнях зусиль може витрачати більше токенів. Власний посібник для розробників Google відверто визнає, що це забезпечує кращу точність ціною більшого споживання токенів, і рекомендує залишатися на 3.7 Flash, якщо обмежувальним фактором є обчислювальна ефективність. Це незвично пряме визнання того, що новіша модель не є оптимальним вибором за замовчуванням для кожного робочого навантаження.
Де проявляються переваги
На DeepSWE v1.1 — бенчмарку довготривалої інженерії програмного забезпечення — Google повідомляє, що 3.8 Flash перевершує більшість великих передових моделей за частку їхньої вартості. Вона показує результат 54,9% на HLE-Verified, а також випереджає 3.7 Flash та інші передові моделі на Vals Finance Agent V2 і Harvey’s Legal Agent Benchmark. Зверніть увагу, що результати у фінансовій та юридичній сферах наведено як відносні перемоги, без абсолютних балів в анонсі.
Flash Cyber і чому доступ до неї обмежений
На CyberGym — стандартному бенчмарку пошуку вразливостей — Google повідомляє про результати на рівні передових моделей, що перевершують як 3.5 Flash Cyber, так і значно більші передові моделі, хоча абсолютний показник не опубліковано. Оскільки CyberGym переважно працює з C і C++, Google також провела внутрішнє тестування на 20 мовах програмування та повідомляє про рівень успішного виявлення понад 70%.
Щодо виправлення вразливостей, CWE-Bench, який підтримує Collinear, показує для Flash Cyber результат 47,2% pass@1 проти 47,8% у провідної передової моделі. Йдеться про майже паритетний результат за істотно нижчої вартості, і Google позиціонує модель як таку, що перебуває на фронтирі Парето, а не очолює таблицю лідерів.
Chrome Security повідомляє про у 2,6 раза більшу кількість правильних виправлень, ніж у найкращих значно більших комерційних моделей. Wiz зафіксувала на 7,5–9,7 відсоткового пункта вищу повноту на власному бенчмарку тестування на проникнення за вартості, нижчої у 2,3–5,2 раза. Команда Google Cloud Vulnerability Research виявила критичну фундаментальну вразливість менш ніж за дві години — роботу, яка зазвичай займає місяці.
Google прямо зазначає, що надала пріоритет виправленню вразливостей, а не наступальним можливостям, таким як експлуатація. Flash Cyber постачається з більш дозволеним набором кібернетичних обмежень, саме тому її доступ обмежено довіреними захисниками: державними органами, операторами критичної інфраструктури та розробниками програмного забезпечення, які подають заявки через Fairwind.
Інтерактивне пояснення
Ключові висновки
- Два варіанти працюють на одному спільному ядрі, а відрізняються обмеженнями безпеки, а не розміром моделі.
- 3.8 Flash зберігає ціни 3.7 Flash — $0,75/$3,75 за 1 млн токенів — до 31 грудня 2026 року.
- Модель обмінює токени на точність: більше кроків міркування, більше викликів інструментів, вищі витрати на завдання.
- Flash Cyber досягає 47,2% pass@1 на CWE-Bench проти 47,8% у передової моделі, але за значно нижчої вартості.
- Доступ до Cyber обмежений перевіреними захисниками, а не продається за фіксованим прайс-листом.
Ознайомтеся з технічними деталями тут. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого сабреддіту про машинне навчання з понад 150 тисячами учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Потрібно налагодити партнерство з нами для просування вашого репозиторію GitHub, сторінки Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.