Google DeepMind представила Gemini 4 Argon із 1 млн вихідних токенів для програмування, інтелектуальної роботи та кіберзахисту
Google DeepMind щойно анонсувала Gemini 4 Argon — свою нову передову модель і першу модель покоління Gemini 4. Вона орієнтована на довготривалу розробку програмного забезпечення, корпоративну роботу зі знаннями у сфері права та фінансів і захист від кіберзагроз. Найбільша технічна зміна — довжина відповіді. Argon може генерувати до 1 млн токенів в одній відповіді — проти 64 тис. у попередніх моделях Gemini.
Що оголосила Google
Google DeepMind описала Argon як модель, створену для складних робочих процесів у програмуванні, корпоративній роботі зі знаннями та кіберзахисті.
Google застосовує поетапний підхід. Компанія бере участь у добровільному процесі уряду США щодо доступу до моделей до їхнього офіційного випуску. Вона збиратиме відгуки від перших тестувальників і вдосконалюватиме захисні механізми перед ширшим запуском.
Ціни вже оприлюднено. Argon запускається за вступною ціною $2 за 1 млн вхідних токенів і $10 за 1 млн вихідних токенів. Кешовані вхідні токени отримують знижку 95%, що становить $0,10 за 1 млн. Після завершення вступного періоду ціна зросте до $4 за вхідні та $20 за вихідні токени. Логан Кілпатрік підтвердив вступні ціни $2 за вхідні та $10 за вихідні токени.
Чому ліміт у 1 млн вихідних токенів має значення
Сучасні передові API обмежують одну відповідь значно сильніше. Claude Opus 5.5, Claude Fable 5.1 і GPT-6 Astra дозволяють генерувати по 128 тис. вихідних токенів.
Команда Google заявляє, що Argon може глибоко міркувати та генерувати сотні тисяч токенів в одному ланцюжку. Для розробників це означає можливість виконувати масштабні рефакторинги або створювати довгі звіти без розподілу роботи між кількома ходами. Однак вартість є суттєвою. Повний обсяг у 1 млн вихідних токенів коштує $10 за вступною ціною та $20 після її завершення.
Google не розкрила розмір контекстного вікна Argon.
Бенчмарки: де Argon лідирує, а де поступається
Google порівняла Argon із GPT-6 Astra, Claude Opus 5.5 і Claude Fable 5.1. Argon беззаперечно лідирує у 12 із 18 бенчмарків і ділить перше місце ще в одному.
Де він лідирує:
- DeepSWE v1.1 (довготривала розробка програмного забезпечення): 77,9% — новий найкращий результат. Opus 5.5 набрала 74,2%, а GPT-6 Astra — 74,1%.
- Vals Index (економічний вплив у фінансах, програмуванні, праві та оподаткуванні): 68,9% — перше місце.
- AutomationBench (Zapier, наскрізне виконання бізнес-завдань): 51,3% — перше місце. Opus 5.5 набрала 42,5%.
- Harvey Legal Agent Benchmark: 19,6% проти 5,4% у GPT-6 Astra.
- LVBench (розуміння довгих відео): 91,7% — новий найкращий результат.
Де він поступається:
- FrontierSWE v2: 55,0% — позаду GPT-6 Astra з результатом 65,5%.
- Terminal-Bench 4.0: 57,4% — позаду Claude Opus 5.5 з результатом 66,4%.
- OSWorld-2.0 (використання комп’ютера): 69,2% — позаду GPT-6 Astra з результатом 72,6%.
Artificial Analysis повідомила, що Argon дорівнює GPT-6 Astra за показником Intelligence Index, але коштує 60% від ціни за завдання за умови використання знижки.
Кіберзахист: знайти, перевірити, виправити
Google навчила Argon автономно знаходити, перевіряти та виправляти критичні вразливості програмного забезпечення. Надійні захисники та внутрішні команди Google отримують доступ до моделі без кіберзахисних обмежень.
У CWE-bench v1, який перевіряє усунення вразливостей, Argon ділить перше місце з результатом 68%. Конкуруючі моделі в цьому рейтингу працюють у власних агентських середовищах.
Wiz уже використовує Argon у межах своєї ініціативи Scan for Good. Модель виявила критичну вразливість у медичному програмному забезпеченні, яке використовують лікарні по всьому світу. Google заявляє, що попередні передові моделі її не виявили.
До широкого випуску Google посилює захисні механізми у 4 сферах:
- Захист від зловживань у кіберсфері та ризиків, пов’язаних із CBRN, зокрема моніторинг активації, у межах її Frontier Safety Framework.
- Стійкість до непрямих ін’єкцій промптів, де Argon лідирує в бенчмарку IPI від Gray Swan.
- Моніторинг розузгодженості ланцюжка міркувань і дій із можливістю зупинити виконання.
- Герметичні ізольовані пісочниці для високоризикового навчання та оцінювання.
Argon усередині Google
Тисячі співробітників Google уже використовують Argon. Google поділилася 4 внутрішніми результатами:
- Агенти Argon застосували оптимізацію пам’яті в центрах обробки даних, звільнивши понад 300 ТіБ; за прогнозами, цей показник зросте до 500 ТіБ–1 ПіБ.
- Агенти замінили 32 тис. рядків SIMD-коду в Rust-порті libgav1. Декодер працює у 2,7 раза швидше, забезпечуючи ідентичний результат.
- Агенти переносять кодові бази C/C++ на Rust — до понад 800 тис. рядків у ядрі Fuchsia Zircon.
- Argon за лічені хвилини перевершила опублікований базовий показник квантового алгоритму на 40%.
Порівняння: Gemini 4 Argon і найближчі конкуренти
| Функція | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Розробник | Google DeepMind | Anthropic | Anthropic | OpenAI |
| Доступність | Лише програма Fairwind | Claude API і хмарні сервіси | Claude API і хмарні сервіси | OpenAI API |
| Максимальна кількість вихідних токенів за відповідь | 1 млн токенів | 128 тис. | 128 тис. | 128 тис. |
| Контекстне вікно | Не розкрито | 1 млн | 1 млн | 1,05 млн |
| Ціна вхідних / вихідних токенів (за 1 млн) | $2 / $10 на старті, потім $4 / $20 | $4 / $20 | $10 / $50 | $10 / $50 |
| Кешовані вхідні токени (за 1 млн) | $0,10 (на старті) | $0,20 | $0,25 | $1,00 |
| Відкриті ваги | Ні | Ні | Ні | Ні |
| DeepSWE v1.1 | 77,9% | 74,2% | 67,4% | 74,1% |
| Vals Index | 68,9% | 67,0% | 65,8% | 63,1% |
| FrontierSWE v2 | 55,0% | 62,3% | 56,3% | 65,5% |
| Terminal-Bench 4.0 | 57,4% | 66,4% | 57,9% | 58,2% |
| CWE-bench v1 | 68% (нічия) | 67% | 58% | 68% (нічия) |
Джерела: Google, ціни Anthropic Opus, документація Anthropic Fable 5.1, документація OpenAI GPT-6 Astra, OpenRouter. Результати бенчмарків взято з опублікованого Google порівняння. Ціни GPT-6 Astra наведено для рівня короткого контексту.
Основні висновки
- Gemini 4 Argon збільшує ліміт вихідних токенів із 64 тис. до 1 млн.
- Вона лідирує в DeepSWE v1.1 (77,9%) і Vals Index (68,9%).
- Вона поступається у FrontierSWE v2, Terminal-Bench 4.0 та OSWorld-2.0.
- Вступна ціна $2 / $10 удвічі нижча, ніж у Claude Opus 5.5.
- Доступ обмежено кіберзахисниками Fairwind; дати публічного випуску поки немає.
Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.
Хочете співпрацювати з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.