Google DeepMind представи Gemini 4 Argon с 1 млн. изходни токена за програмиране, интелектуален труд и киберзащита
Google DeepMind току-що обяви Gemini 4 Argon — своя нов водещ модел и първия модел от поколението Gemini 4. Той е насочен към софтуерно инженерство с дълъг хоризонт, работа със знания в предприятията в сферите на правото и финансите, както и защита от киберзаплахи. Най-голямата техническа промяна е дължината на изхода. Argon може да генерира до 1 млн. токена в един отговор спрямо 64 хил. при по-ранните модели Gemini.
Какво обяви Google
Google DeepMind описа Argon като модел, създаден за сложни работни процеси в програмирането, работата със знания в предприятията и защитата от киберзаплахи.
Google възприема поетапен подход. Компанията участва в доброволния процес на правителството на САЩ за достъп до модели преди публичното им пускане. Тя ще събира обратна връзка от ранните тестери и ще усъвършенства защитните механизми преди по-широкото разпространение.
Цените вече са публично обявени. Argon стартира с въвеждаща цена от $2 за 1 млн. входни токена и $10 за 1 млн. изходни токена. Кешираните входни токени получават 95% отстъпка, което се равнява на $0,10 за 1 млн. След въвеждащия период цените ще се повишат до $4 за входни и $20 за изходни токени. Logan Kilpatrick потвърди въвеждащите цени от $2 за вход и $10 за изход.
Защо ограничението от 1 млн. изходни токена е важно
Настоящите водещи API интерфейси ограничават единичния отговор до значително по-малък обем. Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra позволяват по 128 хил. изходни токена.
Екипът на Google заявява, че Argon може да разсъждава задълбочено и да генерира стотици хиляди токени в една траектория. За разработчиците това означава мащабни рефакторирания или дълги доклади, без работата да се разделя на множество стъпки. Цената обаче е реална. Пълните 1 млн. изходни токена струват $10 при въвеждащата цена и $20 след това.
Google не е разкрил размера на контекстния прозорец на Argon.
Бенчмаркове: къде Argon води и къде изостава
Google сравни Argon с GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1. Argon води убедително в 12 от 18 бенчмарка и дели първото място в още 1.
Къде води:
- DeepSWE v1.1 (софтуерно инженерство с дълъг хоризонт): 77,9% — нов най-добър резултат. Opus 5.5 постига 74,2%, а GPT-6 Astra — 74,1%.
- Vals Index (икономическо въздействие във финансите, програмирането, правото и данъчното облагане): 68,9% — първо място.
- AutomationBench (Zapier, изпълнение на бизнес задачи от край до край): 51,3% — първо място. Opus 5.5 постига 42,5%.
- Harvey Legal Agent Benchmark: 19,6% спрямо 5,4% за GPT-6 Astra.
- LVBench (разбиране на дълги видеоклипове): 91,7% — нов най-добър резултат.
Къде изостава:
- FrontierSWE v2: 55,0% — зад GPT-6 Astra с 65,5%.
- Terminal-Bench 4.0: 57,4% — зад Claude Opus 5.5 с 66,4%.
- OSWorld-2.0 (използване на компютър): 69,2% — зад GPT-6 Astra с 72,6%.
Artificial Analysis съобщи, че Argon се изравнява с GPT-6 Astra в неговия Intelligence Index при 60% от разходите за задача, използвайки намалените цени.
Киберзащита: откриване, валидиране, коригиране
Google е обучил Argon автономно да открива, валидира и коригира критични уязвимости в софтуера. Доверени защитници и вътрешни екипи на Google получават достъп до него без киберзащитни ограничения.
При CWE-bench v1, който тества отстраняването на уязвимости, Argon дели първото място с резултат от 68%. Конкурентните модели в тази класация работят в собствените си агентски среди.
Wiz вече използва Argon чрез инициативата си Scan for Good. Моделът е открил критична уязвимост в медицински софтуер, използван от болници по света. Google заявява, че предишните водещи модели не са успели да я открият.
Преди широкото пускане Google укрепва защитните механизми в 4 области:
- Защита срещу злоупотреби при киберрискове и CBRN рискове, включително наблюдение на активирането, съгласно неговата Рамка за безопасност на водещите модели.
- Устойчивост срещу непряка инжекция на подсказвания, където Argon води в бенчмарка IPI на Gray Swan.
- Наблюдение за несъответствие в логиката на разсъжденията и действията с възможност за спиране на изпълнението.
- Запечатани, изолирани пясъчници за високорисково обучение и оценяване.
Argon в Google
Хиляди служители на Google вече използват Argon. Google сподели 4 вътрешни резултата:
- Агентите приложиха оптимизации на паметта в центровете за данни, освобождавайки над 300 TiB, като прогнозите са за 500 TiB до 1 PiB.
- Агентите замениха 32 хил. реда SIMD код в Rust порта на libgav1. Декодерът работи 2,7 пъти по-бързо при идентичен изход.
- Агентите мигрират кодови бази на C/C++ към Rust, включително до над 800 хил. реда в ядрото Fuchsia Zircon.
- Argon надмина публикуван базов резултат за квантов алгоритъм с 40% за минути.
Сравнение: Gemini 4 Argon срещу най-близките конкуренти
| Функция | Gemini 4 Argon | Claude Opus 5.5 | Claude Fable 5.1 | GPT-6 Astra |
|---|---|---|---|---|
| Разработчик | Google DeepMind | Anthropic | Anthropic | OpenAI |
| Достъпност | Само програмата Fairwind | Claude API и облачни услуги | Claude API и облачни услуги | OpenAI API |
| Максимален изход за отговор | 1 млн. токена | 128 хил. | 128 хил. | 128 хил. |
| Контекстен прозорец | Не е разкрит | 1 млн. | 1 млн. | 1,05 млн. |
| Цена за вход / изход (за 1 млн.) | $2 / $10 въвеждаща, след това $4 / $20 | $4 / $20 | $10 / $50 | $10 / $50 |
| Кеширан вход (за 1 млн.) | $0,10 (въвеждаща) | $0,20 | $0,25 | $1,00 |
| Отворени тегла | Не | Не | Не | Не |
| DeepSWE v1.1 | 77,9% | 74,2% | 67,4% | 74,1% |
| Vals Index | 68,9% | 67,0% | 65,8% | 63,1% |
| FrontierSWE v2 | 55,0% | 62,3% | 56,3% | 65,5% |
| Terminal-Bench 4.0 | 57,4% | 66,4% | 57,9% | 58,2% |
| CWE-bench v1 | 68% (равенство) | 67% | 58% | 68% (равенство) |
Източници: Google, ценова информация за Anthropic Opus, документация на Anthropic Fable 5.1, документация на OpenAI GPT-6 Astra, OpenRouter. Резултатите от бенчмарковете са от публикуваното от Google сравнение. Цените на GPT-6 Astra са за неговото ниво с кратък контекст.
Основни изводи
- Gemini 4 Argon увеличава ограничението за изхода от 64 хил. на 1 млн. токена.
- Той води в DeepSWE v1.1 (77,9%) и Vals Index (68,9%).
- Изостава в FrontierSWE v2, Terminal-Bench 4.0 и OSWorld-2.0.
- Въвеждащата цена от $2 / $10 е наполовина на тази на Claude Opus 5.5.
- Достъпът е ограничен до киберзащитници от Fairwind; все още няма дата за публично пускане.
Разгледайте техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.
Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова премиера ИЛИ уебинар и т.н.? Свържете се с нас
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.