Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Gemini 4 Argon: наша наступна ера передового штучного інтелекту

Gemini 4 Argon: наша наступна ера передового інтелекту

30 вересня 2026 року

|

Gemini 4 Argon забезпечує передові результати у складних робочих процесах, пов’язаних із реальними завданнями розробки програмного забезпечення, корпоративною інтелектуальною роботою — зокрема у сфері права та фінансів — і захистом кібербезпеки.



Стилізована рекламна графіка ключового зображення блогу із сучасним редакційним оформленням і текстом "Gemini 4 Argon"
Прослухати статтю
[[duration]] хвилин
У цій статті

Сьогодні ми оголошуємо про нашу нову передову модель Gemini 4 Argon, яка стає доступною для групи перевірених фахівців із кіберзахисту в межах нашої програми Fairwind. Створена для підтримання глибокого міркування у складних довготривалих робочих процесах, Argon докорінно змінює спосіб нашої роботи та розробки в Google. Вона забезпечує передові результати у складних робочих процесах, пов’язаних із реальними завданнями розробки програмного забезпечення, корпоративною інтелектуальною роботою — зокрема у сфері права та фінансів — і захистом кібербезпеки.

Безпечний випуск передових можливостей такого рівня потребує поетапного підходу. Ми активно беремо участь у добровільному процесі уряду США щодо доступу до моделей до їхнього випуску, поступово розширюючи доступ. Ми й надалі збиратимемо відгуки перших тестувальників, удосконалюючи запобіжні заходи, перш ніж якнайшвидше зробити Argon доступною для розробників, підприємств і споживачів.

Argon буде запущено за вступною ціною1 у розмірі 2 доларів США за мільйон вхідних токенів і 10 доларів США за мільйон вихідних токенів, а вартість кешованих вхідних токенів буде на 95% нижчою за ціну вхідних токенів.

Зміна способу нашої роботи та розробки в Google

Gemini 4 Argon уже забезпечує роботу наших внутрішніх процесів: тисячі співробітників Google відзначають сильні сторони моделі у спеціалізованих завданнях із програмування, проведенні глибших досліджень і написанні якісних текстів. Вона допомагає командам працювати швидше, розширювати межі продуктивності розробки та прискорювати прориви:

  • Оптимізація квантових алгоритмів: Argon допомагає нашим дослідникам у галузі квантових обчислень оптимізувати просторово-часові ресурси (кубіти × вентилі) підпрограм, які є вузьким місцем для важливих застосувань. В одному з прикладів за лічені хвилини модель перевершила опублікований базовий показник на 40%.
  • Ефективність використання пам’яті: Команда агентів Argon проаналізувала телеметрію профілювання всього парку систем, автономно виявила та застосувала оптимізації пам’яті в центрах обробки даних Google, що після розгортання вивільнило понад 300 ТіБ пам’яті; загальна оцінка заощаджень становить від 500 ТіБ до 1 ПіБ.
  • Масштабна міграція й оптимізація кодових баз: Агенти Argon працюють над перенесенням кодових баз C/C++ на Rust у всьому Google — від десятків тисяч рядків у ключових бібліотеках, таких як re2 і libgav1, до понад 800 тисяч рядків у ядрі операційної системи Fuchsia OS Zircon. З огляду на критичну важливість багатьох із цих систем такі масштабні переписування проходять ретельний автоматизований і ручний аудит, емуляційне тестування та перевірку, перш ніж їх буде розгорнуто у виробничому середовищі.

    Для libgav1 — програмного забезпечення Google з відкритим кодом для декодування відео — агенти Argon взяли наявний порт на Rust і замінили 32 тисячі рядків SIMD-коду, провівши багато раундів експериментів із профілюванням, вивчивши вихідні дані компілятора та створивши безпечний Rust, щоб компілятор міг автоматично векторизувати його. У результаті було створено декодер відео з безпечною роботою з пам’яттю, який працює у 2,7 раза швидше за порт на Rust, забезпечуючи ідентичний відеовихід і наближаючись до оптимізованої версії на C++.

Більше зусиль для розв’язання ваших найскладніших проблем

Щоб підтримати можливості Gemini 4 Argon у довших і складніших сценаріях використання, ми суттєво розширюємо ліміт вихідних токенів моделі — до провідного в індустрії показника в 1 мільйон токенів проти попередніх 64 тисяч. Коли модель має достатньо простору для глибокого обдумування та генерування сотень тисяч токенів у межах однієї траєкторії, це забезпечує новий рівень глибини міркування для розв’язання складних проблем за один підхід.

діаграма порівняльного тестування можливостей Gemini 4 Argon

Забезпечення програмування та корпоративних робочих процесів у різних сферах

Можливості Gemini 4 Argon у програмуванні, міркуванні та мультимодальності, а також здатність підтримувати тривалі багатокрокові завдання дають змогу моделі ефективно працювати в широкому спектрі корпоративних процесів.

Інженери Google використовують Argon для щоденних завдань — від звичайного налагодження до масштабної міграції кодових баз і розробки алгоритмів. Модель встановлює новий найкращий результат на DeepSWE v1.1 (77,9%), який вимірює ефективність моделі у реальних довготривалих завданнях із розробки програмного забезпечення.

Окрім програмування, Argon є провідною моделлю в індексі Vals, який вимірює економічний вплив у фінансах, програмуванні, юридичній і податковій роботі, зважуючи кожен сектор відповідно до його внеску у ВВП США. Ми спостерігаємо аналогічно провідні результати в інших спеціалізованих оцінюваннях, як-от Vals Finance Agent v2 (багатокрокове фінансове дослідження) та Harvey’s Legal Agent Benchmark (юридичні дослідження й підготовка документів). У AutomationBench — тесті Zapier, що вимірює наскрізне виконання завдань у ключових бізнес-функціях, — Argon посідає перше місце з результатом 51,3%.

Argon також вирізняється унікальною ефективністю, коли інтелектуальна робота потребує візуального розуміння. Модель здатна виконувати професійний аналіз діаграм, виявляти деталі у тривалих відео та діяти на основі серії документів. Наприклад, у LVBench, який вимірює розуміння тривалих відео, Argon демонструє найкращий результат у галузі — 91,7%.

діаграма оцінювання DeepSwe
діаграма індексу Vals
діаграма фінансового порівняльного тестування Val's
діаграма порівняльного тестування Harvey
діаграма тестування автоматизації

Лідерство у сфері захисної кібербезпеки

Щоб краще озброїти фахівців із кіберзахисту в нову еру кібератак, ми навчили Gemini 4 Argon бути високоефективною у сфері захисту кібербезпеки. Argon може автономно знаходити, перевіряти та виправляти критичні вразливості програмного забезпечення. Для перевірених фахівців із кіберзахисту та наших внутрішніх команд у Google ми випускатимемо Argon без кіберзапобіжників, щоб вони могли використовувати всі передові можливості моделі у сфері захисту кібербезпеки.

Wiz уже використовує Argon для захисту кібербезпеки в межах своєї ініціативи Scan for Good — програми, присвяченої безкоштовному захисту критичної державної інфраструктури шляхом виявлення та усунення високоризикових вразливостей. Під час ранньої демонстрації впливу моделі було виявлено критичну вразливість, яка розкривала конфіденційну особисту інформацію в медичному програмному забезпеченні, що використовується лікарнями по всьому світу; модель виявила серйозний ризик, який не помітили попередні передові моделі.

У CWE-bench v1, який оцінює здатність моделі усувати вразливості безпеки, Argon ділить перше місце з найвищим результатом 68%, розвиваючи передові результати 3.8 Flash Cyber у CWE-bench v0.

діаграма порівняльного тестування CWE

Gemini 4 Argon демонструє значний прогрес у виявленні вразливостей порівняно з 3.8 Flash Cyber. Наприклад:

  • У внутрішньому комплексному порівняльному тестуванні вразливостей Google Argon виявила широкий спектр вразливостей у складних кодових базах, що охоплюють 20 мов програмування.
  • У внутрішньому порівняльному тестуванні Wiz із методом «чорної скриньки» для перевірки на проникнення, яке оцінює здатність моделі аналізувати активні вебсистеми без вихідного коду, Argon перевершує 3.8 Flash Cyber у виявленні поверхні атаки, ідентифікації вразливостей і створенні доказів концепції для їх перевірки.
діаграма вразливостей безпеки

Посилення передових запобіжних заходів перед широкою доступністю

Перш ніж широко запустити Gemini 4 Argon, ми продовжуємо посилювати критично важливі передові запобіжні заходи у чотирьох основних сферах:

Захист від зловживань: Щоб запобігти використанню Argon зловмисниками для кібератак або хімічних, біологічних, радіологічних і ядерних (CBRN) атак, модель розроблено так, щоб відмовлятися від шкідливих запитів, водночас зберігаючи можливість легітимних наукових досліджень подвійного призначення відповідно до нашої системи передової безпеки. Ми посилюємо надійність наших запобіжних заходів для цього запуску, зокрема вдосконалюємо методи моніторингу внутрішніх активацій моделі для виявлення зловживань. Надійність цих запобіжних заходів перевіряли внутрішні та зовнішні команди червоного тестування, використовуючи поєднання ручних і автоматизованих методів атак.

Захист від атак із впровадженням підказок: Argon також є нашою найбільш стійкою моделлю проти непрямих впроваджень підказок, коли шкідливі інструкції або контекст використовуються для перехоплення поведінки моделі. Це складні атаки, що потребують постійної пильності та багаторівневого захисту. Завдяки автоматизованому червоному тестуванню та змагальному навчанню Gemini 4 Argon демонструє провідну стійкість до впровадження підказок у тесті Gray Swan Indirect Prompt Injection (IPI).

оцінювання Gray Swan

Моніторинг неузгодженості: Щоб не допустити виходу Argon за межі дозволеного під час виконання завдання у спосіб, що виходить за наміри користувача, ми впроваджуємо засоби пом’якшення неузгодженості, які відстежують ланцюжок міркувань і дії Argon та за потреби зупиняють виконання.

Ми використовували подібну систему для моніторингу навчальних запусків і надсилання сповіщень спеціалізованій команді реагування на інциденти, вживаючи ретельних заходів, щоб не передавати результати назад у навчання й не ризикувати формуванням у Argon міркувань, спрямованих на ухилення від нашого моніторингу. Ми настійно закликаємо решту індустрії зберігати прозорість міркувань у ці переломні моменти зростання можливостей, одночасно долаючи ризики неузгодженості, щоб думки моделі залишалися корисними для виявлення та діагностування неузгодженості.

Посилення систем: У міру того як передові моделі стають дедалі потужнішими, їхнє безпечне тестування потребує захищених середовищ, здатних відповідати самим системам. Відповідно до нашої дорожньої карти контролю агентів ми посилюємо захищені середовища, ізолюючи їх і герметизуючи до початку високоризикового навчання або оцінювання. Ми прагнемо ділитися цими найкращими практиками безпеки агентів із нашими партнерами, щоб підвищувати безпеку всієї екосистеми.

Незабаром запуск

Ми створили Gemini 4 Argon із передовими можливостями у програмуванні, інтелектуальній роботі, захисті кібербезпеки та креативному письмі, щоб вона була партнером для розробників, професіоналів і підприємств у розв’язанні найскладніших проблем. Ми вдячні першій групі фахівців із кіберзахисту та перевірених тестувальників, чиї оцінювання в реальних умовах і відгуки допоможуть нам посилити системи до їхнього випуску для розробників, підприємств і споживачів — починаючи з платних клієнтів API та передплатників Google AI Ultra.

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням DeepMind

Читати оригінал на DeepMind ↗

Текст і зображення належать DeepMind і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини