Google DeepMind пуска Gemini 3.8 Flash и Gemini 3.8 Flash Cyber: един основен модел, два режима на достъп
Google току-що обяви Gemini 3.8 Flash и Gemini 3.8 Flash Cyber, три седмици след Gemini 3.7 Flash и отбелязвайки третото издание на Flash за шест седмици. Двата варианта работят на базата на една и съща фундаментална интелигентност, усъвършенствана чрез продължителни агентни цикли, които рекурсивно оценяват базовите модели. Това, което ги разделя, не е архитектурата, а обхватът на безопасността и това кой има право да премине през него.
Може ли да се внедри? Gemini 3.8 Flash е общодостъпен от днес чрез Gemini API, Google AI Studio, Antigravity, Android Studio и Gemini Enterprise, така че можете да насочите продукционния трафик към него още сега. Теглата са затворени, така че няма възможност за самостоятелно хостване или локално внедряване. Gemini 3.8 Flash Cyber изобщо не може да бъде внедрен свободно: достъпът се предоставя за всеки отделен случай чрез новата програма Fairwind.
Какво всъщност се промени в 3.8 Flash
Изследователският екип обяснява, че 3.8 Flash е базиран на 3.7 Flash. Спецификациите са непроменени: контекстен прозорец от 1 048 576 токена, максимален изход от 65 536 токена, вход за текст, изображения, аудио и видео и текстов изход. Нивата на мислене остават LOW, MEDIUM и HIGH, като MEDIUM е стойността по подразбиране. Един важен детайл за всеки, който мигрира: MINIMAL не се поддържа от 3.8 Flash и задаването му връща грешка при валидиране на API.
Промяната в поведението е същината. Google описва подобрението директно: 3.8 Flash работи по-усърдно. При сложни задачи той изпълнява допълнителни стъпки за разсъждение и извиква инструментите итеративно, като при по-високи нива на усилие може да изразходва повече токени. Собственият наръчник за разработчици на Google откровено признава, че това осигурява по-добра точност за сметка на по-висока консумация на токени, и препоръчва да останете на 3.7 Flash, когато изчислителната ефективност е решаващото ограничение. Това е необичайно директно признание, че по-новият модел не е правилният избор по подразбиране за всяко работно натоварване.
Къде се проявяват подобренията
При DeepSWE v1.1, бенчмарк за софтуерно инженерство с дълъг хоризонт, Google съобщава, че 3.8 Flash превъзхожда повечето по-големи авангардни модели на малка част от разходите. Той постига 54,9% в HLE-Verified, както и подобрения спрямо 3.7 Flash и други авангардни модели в Vals Finance Agent V2 и Harvey’s Legal Agent Benchmark. Имайте предвид, че резултатите във финансовата и правната сфера са представени като относителни победи, без абсолютни оценки в съобщението.
Flash Cyber и защо достъпът до него е ограничен
При CyberGym, стандартния бенчмарк за откриване на уязвимости, Google съобщава за производителност на ниво авангардни модели, надминаваща както 3.5 Flash Cyber, така и значително по-големи авангардни модели, макар че не е публикувана абсолютна стойност. Тъй като CyberGym е предимно на C и C++, Google е провел и вътрешен бенчмарк на 20 програмни езика и съобщава за успеваемост при откриването над 70%.
При създаването на пачове CWE-Bench, поддържан от Collinear, поставя Flash Cyber на 47,2% pass@1 спрямо 47,8% за водещ авангарден модел. Твърдението е за почти равни резултати при значително по-ниска цена, като Google представя модела като част от границата на Парето, а не като лидер в класацията.
Chrome Security отчита 2,6 пъти повече коректни пачове в сравнение с най-добрите, много по-големи комерсиални модели. Wiz измерва с 7,5 до 9,7 процентни пункта по-висока пълнота на откриването при вътрешния си бенчмарк за тестове за проникване, при 2,3 до 5,2 пъти по-ниска цена. Екипът на Google за изследване на уязвимости в облака е открил критична фундаментална уязвимост за по-малко от два часа — работа, която обикновено отнема месеци.
Google изрично посочва, че е дал приоритет на отстраняването на уязвимости пред офанзивни възможности като експлоатирането им. Flash Cyber се предлага с по-либерален набор от киберзащитни ограничения, което е именно причината да бъде ограничен до доверени защитници: държавни органи, оператори на критична инфраструктура и поддържащи софтуер, които кандидатстват чрез Fairwind.
Интерактивно обяснение
Основни изводи
- Двата варианта се предлагат на базата на едно общо ядро и се различават по защитните ограничения, а не по размера на модела.
- 3.8 Flash запазва цените на 3.7 Flash — $0.75/$3.75 за 1 млн. токена — до 31 декември 2026 г.
- Моделът разменя токени за точност: повече стъпки за разсъждение, повече извиквания на инструменти и по-високи разходи за задача.
- Flash Cyber постига 47,2% pass@1 в CWE-Bench спрямо 47,8% за авангарден модел, при значително по-ниска цена.
- Достъпът до Cyber е ограничен до проверени защитници и не се продава на база публичен ценоразпис.
Вижте техническите подробности тук. Също така можете да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньорство с нас за популяризиране на вашето GitHub хранилище, страница в Hugging Face, издание на продукт, уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.