Gemini 4 Argon: следващата ни ера на авангардния интелект
30 септември 2026 г.
|Gemini 4 Argon осигурява водещи резултати при сложни работни процеси в реалното софтуерно инженерство, корпоративната работа със знания като правото и финансите и защитата от киберзаплахи.
Днес обявяваме нашия нов водещ модел Gemini 4 Argon, който предоставяме на група проверени защитници на киберпространството чрез нашата програма Fairwind. Създаден да поддържа задълбочено разсъждение при сложни, продължителни работни процеси, Argon променя фундаментално начина, по който работим и създаваме в Google. Той осигурява водещи резултати при сложни работни процеси в реалното софтуерно инженерство, корпоративната работа със знания като правото и финансите и защитата от киберзаплахи.
Безопасното предоставяне на водещи възможности на това ниво изисква поетапен подход. Активно участваме в доброволния процес на правителството на САЩ за достъп до модели преди публичното им пускане, докато постепенно разширяваме достъпа. Ще продължим да събираме обратна връзка от първите тестери, докато усъвършенстваме защитните механизми, преди да предоставим Argon на разработчици, предприятия и потребители възможно най-скоро.
Argon ще бъде пуснат на въвеждаща цена 1 от 2 долара за милион входни токени и 10 долара за милион изходни токени, като кешираните входни токени ще се таксуват с 95% отстъпка от цената на входните токени.
Промяна на начина, по който работим и създаваме в Google
Gemini 4 Argon вече задвижва вътрешните ни работни процеси, като хиляди служители на Google подчертават силните страни на модела при специализирани задачи за програмиране, провеждане на по-задълбочени проучвания и писане на качествено съдържание. Той помага на екипите да създават по-бързо, да разширяват границите на инженерната продуктивност и да ускоряват пробивите:
- Алгоритмична оптимизация за квантови изчисления: Argon помага на нашите изследователи в областта на квантовите изчисления да оптимизират ресурсите пространство-време (кубити × гейтове) на подпрограми, които са тясно място за важни приложения. В един пример той надмина публикувания базов резултат с 40% само за няколко минути.
- Ефективност на паметта: Екип от агенти на Argon анализира телеметрията от профилирането в целия парк, за да идентифицира и приложи автономно оптимизации на паметта в центровете за данни на Google, освобождавайки над 300 TiB памет след внедряването им, с прогнозирани общи спестявания от 500 TiB до 1 PiB.
- Мащабни миграции и оптимизации на кодови бази: Агенти на Argon работят по мигрирането на кодови бази на C/C++ към Rust в целия Google — от десетки хиляди редове в основни библиотеки като re2 и libgav1 до над 800 хил. реда за ядрото Zircon на операционната система Fuchsia. Предвид критичното значение на много от тези системи, подобни мащабни пренаписвания преминават през строг автоматизиран и ръчен одит, емулационни тестове и преглед, преди да бъдат внедрени в продукционна среда.
За libgav1, софтуера с отворен код на Google за декодиране на видео, агентите на Argon взеха съществуващ порт на Rust и замениха 32 хил. реда SIMD код, като проведоха множество кръгове от експерименти, насочени от профилирането, анализираха изхода на компилатора и създадоха безопасен Rust код, така че компилаторът автоматично да го векторизира. Крайният резултат е безопасен за паметта видеодекодер, който работи 2,7 пъти по-бързо от порта на Rust, с идентичен видеоизход, доближавайки се до оптимизирания C++.
По-усилена работа по най-сложните ви проблеми
За да поддържаме възможностите на Gemini 4 Argon при по-дълги и сложни случаи на употреба, значително разширяваме лимита за изходни токени на модела до водещите за индустрията 1 милион токена спрямо предишните 64 хил. токена. Когато моделът разполага с достатъчно пространство за задълбочено мислене и генерира стотици хиляди токени в рамките на една траектория, това добавя ново ниво на дълбочина на разсъждението за решаване на трудни проблеми наведнъж.
Осигуряване на работни процеси за програмиране и предприятия в различни области
Възможностите на Gemini 4 Argon за програмиране, разсъждение и мултимодалност, както и способността му да изпълнява продължителни многоетапни задачи, му позволяват да се отличава в широк спектър от корпоративни работни процеси.
Инженерите на Google използват Argon за ежедневните си задачи — от обичайно отстраняване на грешки до мащабни миграции на кодови бази и проектиране на алгоритми. Той поставя нов най-добър резултат в DeepSWE v1.1 (77,9%), който измерва представянето на моделите при реални, продължителни задачи по софтуерно инженерство.
Отвъд програмирането Argon е водещият модел в индекса Vals, който измерва икономическото въздействие в областите на финансите, програмирането, правото и данъчното облагане, като всеки сектор е претеглен според приноса си към БВП на САЩ. Виждаме подобни водещи резултати и в други оценки по отрасли, като Vals Finance Agent v2 (многоетапно финансово проучване) и Harvey’s Legal Agent Benchmark (правни проучвания и изготвяне на документи). В AutomationBench, бенчмарка на Zapier за измерване на изпълнението от край до край в основни бизнес функции, Argon се класира на първо място с резултат 51,3%.
Argon е уникално силен и когато работата със знания изисква визуално разбиране. Той може да извършва професионален анализ на графики, да идентифицира подробности от дълги видеоклипове и да предприема действия въз основа на поредица от документи. Например в LVBench, който измерва разбирането на дълги видеоклипове, Argon е водещ в индустрията с резултат 91,7%.
Лидер в защитната киберсигурност
За да осигурим по-добра подготовка на защитниците на киберпространството за новата ера на кибератаките, обучихме Gemini 4 Argon да бъде високоефективен в защитата от киберзаплахи. Argon може автономно да открива, валидира и коригира критични уязвимости в софтуера. За проверените защитници и собствените ни вътрешни екипи в Google ще предоставим Argon без киберзащитни ограничения, за да могат да използват пълните му водещи за индустрията възможности за защита от киберзаплахи.
Wiz вече използва Argon за защита от киберзаплахи чрез инициативата си Scan for Good — програма, посветена на безплатната защита на критична обществена инфраструктура чрез откриване и отстраняване на високорискови уязвимости. В ранна демонстрация на въздействието му моделът откри критична уязвимост, разкриваща чувствителна лична информация в здравен софтуер, използван от болници по целия свят, като идентифицира сериозен риск, който предишните водещи модели не бяха забелязали.
В CWE-bench v1, който оценява способността на модела да отстранява уязвимости в сигурността, Argon дели първото място с най-висок резултат от 68%, надграждайки водещото представяне на 3.8 Flash Cyber в CWE-bench v0.
Gemini 4 Argon демонстрира впечатляващ напредък в откриването на уязвимости спрямо 3.8 Flash Cyber. Например:
- Във вътрешния цялостен бенчмарк за уязвимости на Google Argon откри широк спектър от уязвимости в сложни кодови бази, обхващащи 20 програмни езика.
- Във вътрешния бенчмарк на Wiz за тестване на проникване тип „черна кутия“, който проверява способността на даден модел да анализира активни уеб системи без изходния код, Argon превъзхожда 3.8 Flash Cyber при откриването на повърхността за атака, идентифицирането на уязвимости и създаването на доказателства тип „доказателство за концепция“ за валидирането им.
Укрепване на водещите защитни механизми преди широката наличност
Преди да предоставим широко Gemini 4 Argon, продължаваме да укрепваме критичните водещи защитни механизми в четири основни области:
Защита срещу злоупотреба: За да предотвратим използването на Argon от злонамерени лица за кибератаки или химически, биологични, радиологични и ядрени (CBRN) атаки, моделът е създаден да отказва вредни заявки, като същевременно запазва възможността за легитимни научни изследвания с двойна употреба, в съответствие с нашата Рамка за водеща безопасност. За това стартиране укрепваме надеждността на защитните си механизми, включително чрез подобряване на техниките за наблюдение на вътрешните активации на модела с цел откриване на злоупотреба. Тези защитни механизми бяха подложени на изпитания за надеждност от вътрешни и външни червени екипи, използващи комбинация от ръчни и автоматизирани методи за атака.
Защита срещу атаки чрез инжектиране на подкани: Argon е и най-устойчивият ни досега модел срещу косвено инжектиране на подкани, при което злонамерени инструкции или контекст се използват за отвличане на поведението на модела. Това са сложни атаки, които изискват постоянна бдителност и множество защитни слоеве. Чрез автоматизирано тестване от червени екипи и състезателно обучение Gemini 4 Argon е водещ по устойчивост срещу инжектиране на подкани в бенчмарка Indirect Prompt Injection (IPI) на Gray Swan.
Наблюдение за несъответствие: За да предотвратим излизането на Argon извън зададените граници при опити да изпълни задача по начин, надхвърлящ намеренията на потребителя, внедряваме мерки за ограничаване на несъответствията, които наблюдават веригата от мисли и действията на Argon и спират изпълнението, когато е необходимо.
Използвахме подобна система за наблюдение на тренировъчните ни процеси и изпращане на сигнали до специализиран екип за реакция при инциденти, като взехме внимателни предпазни мерки, за да не подаваме резултатите обратно в обучението и да не рискуваме да оформим разсъжденията на Argon така, че да заобикалят наблюдението ни. Настойчиво насърчаваме останалата част от индустрията да запази прозрачността на разсъжденията в тези решаващи моменти на нарастващи възможности, докато се справяме с рисковете за съответствието, така че мислите на моделите да останат полезни за идентифициране и диагностициране на несъответствия.
Укрепване на системите: С нарастването на възможностите на водещите модели безопасното им тестване изисква сигурни среди, които могат да бъдат в крак със самите системи. В съответствие с нашата пътна карта за контрол на агентите укрепваме изолираните си среди, като ги изолираме и запечатваме преди началото на високорискови обучения или оценки. Поели сме ангажимент да споделяме тези най-добри практики за сигурност на агентите с партньорите си, за да подобрим сигурността в цялата екосистема.
Скоро ще бъде предоставен
Създадохме Gemini 4 Argon с водещи възможности в програмирането, работата със знания, защитата от киберзаплахи и творческото писане, за да бъде партньор на разработчици, професионалисти и предприятия, докато се справят с най-трудните проблеми. Благодарни сме на първоначалната група защитници на киберпространството и проверени тестери, чиито оценки в реални условия и обратна връзка ще ни помогнат да укрепим системите си, преди да го предоставим на разработчици, предприятия и потребители, започвайки с платените клиенти на API и абонатите на Google AI Ultra.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.