Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← До новин

Google DeepMind представила Gemini 4 Argon із 1 млн вихідних токенів для програмування, інтелектуальної роботи та кіберзахисту

Google DeepMind щойно анонсувала Gemini 4 Argon — свою нову передову модель і першу модель покоління Gemini 4. Вона орієнтована на довготривалу розробку програмного забезпечення, корпоративну роботу зі знаннями у сфері права та фінансів і захист від кіберзагроз. Найбільша технічна зміна — довжина відповіді. Argon може генерувати до 1 млн токенів в одній відповіді — проти 64 тис. у попередніх моделях Gemini.

Що оголосила Google

Google DeepMind описала Argon як модель, створену для складних робочих процесів у програмуванні, корпоративній роботі зі знаннями та кіберзахисті.

Google застосовує поетапний підхід. Компанія бере участь у добровільному процесі уряду США щодо доступу до моделей до їхнього офіційного випуску. Вона збиратиме відгуки від перших тестувальників і вдосконалюватиме захисні механізми перед ширшим запуском.

Ціни вже оприлюднено. Argon запускається за вступною ціною $2 за 1 млн вхідних токенів і $10 за 1 млн вихідних токенів. Кешовані вхідні токени отримують знижку 95%, що становить $0,10 за 1 млн. Після завершення вступного періоду ціна зросте до $4 за вхідні та $20 за вихідні токени. Логан Кілпатрік підтвердив вступні ціни $2 за вхідні та $10 за вихідні токени.

Чому ліміт у 1 млн вихідних токенів має значення

Сучасні передові API обмежують одну відповідь значно сильніше. Claude Opus 5.5, Claude Fable 5.1 і GPT-6 Astra дозволяють генерувати по 128 тис. вихідних токенів.

Команда Google заявляє, що Argon може глибоко міркувати та генерувати сотні тисяч токенів в одному ланцюжку. Для розробників це означає можливість виконувати масштабні рефакторинги або створювати довгі звіти без розподілу роботи між кількома ходами. Однак вартість є суттєвою. Повний обсяг у 1 млн вихідних токенів коштує $10 за вступною ціною та $20 після її завершення.

Google не розкрила розмір контекстного вікна Argon.

Бенчмарки: де Argon лідирує, а де поступається

Google порівняла Argon із GPT-6 Astra, Claude Opus 5.5 і Claude Fable 5.1. Argon беззаперечно лідирує у 12 із 18 бенчмарків і ділить перше місце ще в одному.

Де він лідирує:

  • DeepSWE v1.1 (довготривала розробка програмного забезпечення): 77,9% — новий найкращий результат. Opus 5.5 набрала 74,2%, а GPT-6 Astra — 74,1%.
  • Vals Index (економічний вплив у фінансах, програмуванні, праві та оподаткуванні): 68,9% — перше місце.
  • AutomationBench (Zapier, наскрізне виконання бізнес-завдань): 51,3% — перше місце. Opus 5.5 набрала 42,5%.
  • Harvey Legal Agent Benchmark: 19,6% проти 5,4% у GPT-6 Astra.
  • LVBench (розуміння довгих відео): 91,7% — новий найкращий результат.

Де він поступається:

  • FrontierSWE v2: 55,0% — позаду GPT-6 Astra з результатом 65,5%.
  • Terminal-Bench 4.0: 57,4% — позаду Claude Opus 5.5 з результатом 66,4%.
  • OSWorld-2.0 (використання комп’ютера): 69,2% — позаду GPT-6 Astra з результатом 72,6%.

Artificial Analysis повідомила, що Argon дорівнює GPT-6 Astra за показником Intelligence Index, але коштує 60% від ціни за завдання за умови використання знижки.

Кіберзахист: знайти, перевірити, виправити

Google навчила Argon автономно знаходити, перевіряти та виправляти критичні вразливості програмного забезпечення. Надійні захисники та внутрішні команди Google отримують доступ до моделі без кіберзахисних обмежень.

У CWE-bench v1, який перевіряє усунення вразливостей, Argon ділить перше місце з результатом 68%. Конкуруючі моделі в цьому рейтингу працюють у власних агентських середовищах.

Wiz уже використовує Argon у межах своєї ініціативи Scan for Good. Модель виявила критичну вразливість у медичному програмному забезпеченні, яке використовують лікарні по всьому світу. Google заявляє, що попередні передові моделі її не виявили.

До широкого випуску Google посилює захисні механізми у 4 сферах:

  • Захист від зловживань у кіберсфері та ризиків, пов’язаних із CBRN, зокрема моніторинг активації, у межах її Frontier Safety Framework.
  • Стійкість до непрямих ін’єкцій промптів, де Argon лідирує в бенчмарку IPI від Gray Swan.
  • Моніторинг розузгодженості ланцюжка міркувань і дій із можливістю зупинити виконання.
  • Герметичні ізольовані пісочниці для високоризикового навчання та оцінювання.

Argon усередині Google

Тисячі співробітників Google уже використовують Argon. Google поділилася 4 внутрішніми результатами:

  • Агенти Argon застосували оптимізацію пам’яті в центрах обробки даних, звільнивши понад 300 ТіБ; за прогнозами, цей показник зросте до 500 ТіБ–1 ПіБ.
  • Агенти замінили 32 тис. рядків SIMD-коду в Rust-порті libgav1. Декодер працює у 2,7 раза швидше, забезпечуючи ідентичний результат.
  • Агенти переносять кодові бази C/C++ на Rust — до понад 800 тис. рядків у ядрі Fuchsia Zircon.
  • Argon за лічені хвилини перевершила опублікований базовий показник квантового алгоритму на 40%.

Порівняння: Gemini 4 Argon і найближчі конкуренти

ФункціяGemini 4 ArgonClaude Opus 5.5Claude Fable 5.1GPT-6 Astra
РозробникGoogle DeepMindAnthropicAnthropicOpenAI
ДоступністьЛише програма FairwindClaude API і хмарні сервісиClaude API і хмарні сервісиOpenAI API
Максимальна кількість вихідних токенів за відповідь1 млн токенів128 тис.128 тис.128 тис.
Контекстне вікноНе розкрито1 млн1 млн1,05 млн
Ціна вхідних / вихідних токенів (за 1 млн)$2 / $10 на старті, потім $4 / $20$4 / $20$10 / $50$10 / $50
Кешовані вхідні токени (за 1 млн)$0,10 (на старті)$0,20$0,25$1,00
Відкриті вагиНіНіНіНі
DeepSWE v1.177,9%74,2%67,4%74,1%
Vals Index68,9%67,0%65,8%63,1%
FrontierSWE v255,0%62,3%56,3%65,5%
Terminal-Bench 4.057,4%66,4%57,9%58,2%
CWE-bench v168% (нічия)67%58%68% (нічия)

Джерела: Google, ціни Anthropic Opus, документація Anthropic Fable 5.1, документація OpenAI GPT-6 Astra, OpenRouter. Результати бенчмарків взято з опублікованого Google порівняння. Ціни GPT-6 Astra наведено для рівня короткого контексту.

Основні висновки

  • Gemini 4 Argon збільшує ліміт вихідних токенів із 64 тис. до 1 млн.
  • Вона лідирує в DeepSWE v1.1 (77,9%) і Vals Index (68,9%).
  • Вона поступається у FrontierSWE v2, Terminal-Bench 4.0 та OSWorld-2.0.
  • Вступна ціна $2 / $10 удвічі нижча, ніж у Claude Opus 5.5.
  • Доступ обмежено кіберзахисниками Fairwind; дати публічного випуску поки немає.

Ознайомтеся з технічними деталями. Уся подяка належить досліднику цього проєкту. Також підписуйтеся на нас у Twitter і не забудьте приєднатися до нашого ML SubReddit із понад 150 тис. учасників та підписатися на нашу розсилку. Стривайте! Ви є в Telegram? тепер ви також можете приєднатися до нас у Telegram.

Хочете співпрацювати з нами для просування вашого GitHub-репозиторію, сторінки на Hugging Face, випуску продукту, вебінару тощо? Зв’яжіться з нами

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням MarkTechPost

Читати оригінал на MarkTechPost ↗

Текст і зображення належать MarkTechPost і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини