Sakhanda Wire
NVDA $230.86 +1.09% MSFT $512.80 -0.02% GOOGL $338.24 -1.70% META $725.93 +0.10% AMZN $248.23 -0.37%
← Към новините

Google DeepMind представи Gemini 4 Argon с 1 млн. изходни токена за програмиране, интелектуален труд и киберзащита

Google DeepMind току-що обяви Gemini 4 Argon — своя нов водещ модел и първия модел от поколението Gemini 4. Той е насочен към софтуерно инженерство с дълъг хоризонт, работа със знания в предприятията в сферите на правото и финансите, както и защита от киберзаплахи. Най-голямата техническа промяна е дължината на изхода. Argon може да генерира до 1 млн. токена в един отговор спрямо 64 хил. при по-ранните модели Gemini.

Какво обяви Google

Google DeepMind описа Argon като модел, създаден за сложни работни процеси в програмирането, работата със знания в предприятията и защитата от киберзаплахи.

Google възприема поетапен подход. Компанията участва в доброволния процес на правителството на САЩ за достъп до модели преди публичното им пускане. Тя ще събира обратна връзка от ранните тестери и ще усъвършенства защитните механизми преди по-широкото разпространение.

Цените вече са публично обявени. Argon стартира с въвеждаща цена от $2 за 1 млн. входни токена и $10 за 1 млн. изходни токена. Кешираните входни токени получават 95% отстъпка, което се равнява на $0,10 за 1 млн. След въвеждащия период цените ще се повишат до $4 за входни и $20 за изходни токени. Logan Kilpatrick потвърди въвеждащите цени от $2 за вход и $10 за изход.

Защо ограничението от 1 млн. изходни токена е важно

Настоящите водещи API интерфейси ограничават единичния отговор до значително по-малък обем. Claude Opus 5.5, Claude Fable 5.1 и GPT-6 Astra позволяват по 128 хил. изходни токена.

Екипът на Google заявява, че Argon може да разсъждава задълбочено и да генерира стотици хиляди токени в една траектория. За разработчиците това означава мащабни рефакторирания или дълги доклади, без работата да се разделя на множество стъпки. Цената обаче е реална. Пълните 1 млн. изходни токена струват $10 при въвеждащата цена и $20 след това.

Google не е разкрил размера на контекстния прозорец на Argon.

Бенчмаркове: къде Argon води и къде изостава

Google сравни Argon с GPT-6 Astra, Claude Opus 5.5 и Claude Fable 5.1. Argon води убедително в 12 от 18 бенчмарка и дели първото място в още 1.

Къде води:

  • DeepSWE v1.1 (софтуерно инженерство с дълъг хоризонт): 77,9% — нов най-добър резултат. Opus 5.5 постига 74,2%, а GPT-6 Astra — 74,1%.
  • Vals Index (икономическо въздействие във финансите, програмирането, правото и данъчното облагане): 68,9% — първо място.
  • AutomationBench (Zapier, изпълнение на бизнес задачи от край до край): 51,3% — първо място. Opus 5.5 постига 42,5%.
  • Harvey Legal Agent Benchmark: 19,6% спрямо 5,4% за GPT-6 Astra.
  • LVBench (разбиране на дълги видеоклипове): 91,7% — нов най-добър резултат.

Къде изостава:

  • FrontierSWE v2: 55,0% — зад GPT-6 Astra с 65,5%.
  • Terminal-Bench 4.0: 57,4% — зад Claude Opus 5.5 с 66,4%.
  • OSWorld-2.0 (използване на компютър): 69,2% — зад GPT-6 Astra с 72,6%.

Artificial Analysis съобщи, че Argon се изравнява с GPT-6 Astra в неговия Intelligence Index при 60% от разходите за задача, използвайки намалените цени.

Киберзащита: откриване, валидиране, коригиране

Google е обучил Argon автономно да открива, валидира и коригира критични уязвимости в софтуера. Доверени защитници и вътрешни екипи на Google получават достъп до него без киберзащитни ограничения.

При CWE-bench v1, който тества отстраняването на уязвимости, Argon дели първото място с резултат от 68%. Конкурентните модели в тази класация работят в собствените си агентски среди.

Wiz вече използва Argon чрез инициативата си Scan for Good. Моделът е открил критична уязвимост в медицински софтуер, използван от болници по света. Google заявява, че предишните водещи модели не са успели да я открият.

Преди широкото пускане Google укрепва защитните механизми в 4 области:

  • Защита срещу злоупотреби при киберрискове и CBRN рискове, включително наблюдение на активирането, съгласно неговата Рамка за безопасност на водещите модели.
  • Устойчивост срещу непряка инжекция на подсказвания, където Argon води в бенчмарка IPI на Gray Swan.
  • Наблюдение за несъответствие в логиката на разсъжденията и действията с възможност за спиране на изпълнението.
  • Запечатани, изолирани пясъчници за високорисково обучение и оценяване.

Argon в Google

Хиляди служители на Google вече използват Argon. Google сподели 4 вътрешни резултата:

  • Агентите приложиха оптимизации на паметта в центровете за данни, освобождавайки над 300 TiB, като прогнозите са за 500 TiB до 1 PiB.
  • Агентите замениха 32 хил. реда SIMD код в Rust порта на libgav1. Декодерът работи 2,7 пъти по-бързо при идентичен изход.
  • Агентите мигрират кодови бази на C/C++ към Rust, включително до над 800 хил. реда в ядрото Fuchsia Zircon.
  • Argon надмина публикуван базов резултат за квантов алгоритъм с 40% за минути.

Сравнение: Gemini 4 Argon срещу най-близките конкуренти

ФункцияGemini 4 ArgonClaude Opus 5.5Claude Fable 5.1GPT-6 Astra
РазработчикGoogle DeepMindAnthropicAnthropicOpenAI
ДостъпностСамо програмата FairwindClaude API и облачни услугиClaude API и облачни услугиOpenAI API
Максимален изход за отговор1 млн. токена128 хил.128 хил.128 хил.
Контекстен прозорецНе е разкрит1 млн.1 млн.1,05 млн.
Цена за вход / изход (за 1 млн.)$2 / $10 въвеждаща, след това $4 / $20$4 / $20$10 / $50$10 / $50
Кеширан вход (за 1 млн.)$0,10 (въвеждаща)$0,20$0,25$1,00
Отворени теглаНеНеНеНе
DeepSWE v1.177,9%74,2%67,4%74,1%
Vals Index68,9%67,0%65,8%63,1%
FrontierSWE v255,0%62,3%56,3%65,5%
Terminal-Bench 4.057,4%66,4%57,9%58,2%
CWE-bench v168% (равенство)67%58%68% (равенство)

Източници: Google, ценова информация за Anthropic Opus, документация на Anthropic Fable 5.1, документация на OpenAI GPT-6 Astra, OpenRouter. Резултатите от бенчмарковете са от публикуваното от Google сравнение. Цените на GPT-6 Astra са за неговото ниво с кратък контекст.

Основни изводи

  • Gemini 4 Argon увеличава ограничението за изхода от 64 хил. на 1 млн. токена.
  • Той води в DeepSWE v1.1 (77,9%) и Vals Index (68,9%).
  • Изостава в FrontierSWE v2, Terminal-Bench 4.0 и OSWorld-2.0.
  • Въвеждащата цена от $2 / $10 е наполовина на тази на Claude Opus 5.5.
  • Достъпът е ограничен до киберзащитници от Fairwind; все още няма дата за публично пускане.

Разгледайте техническите подробности. Всички заслуги са за изследователя на този проект. Също така, не се колебайте да ни последвате в Twitter и не забравяйте да се присъедините към нашия ML SubReddit с над 150 хил. членове и да се абонирате за нашия бюлетин. Чакайте! В Telegram ли сте? Вече можете да се присъедините към нас и в Telegram.

Имате нужда от партньор за популяризирането на вашето GitHub хранилище ИЛИ страница в Hugging Face ИЛИ продуктова премиера ИЛИ уебинар и т.н.? Свържете се с нас

Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.

Първоначално публикувано от MarkTechPost на

Прочетете оригинала в MarkTechPost ↗

Текстът и изображенията са собственост на MarkTechPost и са възпроизведени тук с посочване на авторството и връзка към оригиналната публикация.

← Към новините

Още новини

Всички последни новини