Nvidia твърди, че Groq 3 LPX е четири пъти по-бърз от Cerebras, но сметката е по-сложна
Основни акценти
- Nvidia започва серийното производство на новия си ускорител за инференция Groq 3 LPX, оптимизиран за бързо генериране на токени от AI агенти.
- При един от бенчмарковете системата достигна 3400 токена в секунда, което според Nvidia е четири пъти повече от резултата на конкурента Cerebras.
- Експерти обаче определят сравнението като изгодно за Nvidia, тъй като архитектурата ѝ изисква поне 64 чипа, за да постигне този резултат, докато Cerebras се справя с един или два ускорителя.
Nvidia премести специализирания си ускорител за инференция Groq 3 LPX в серийно производство. Независим бенчмарк показва високи резултати при генерирането на токени, но експерти предупреждават, че сравнението е изгодно за Nvidia.
На конференцията Hot Chips 2026 Nvidia обяви, че нейният Groq 3 LPX е влязъл в серийно производство. Чипът, който Nvidia нарича „ускорител за интерактивен AI инференция“, разширява платформата Vera Rubin и е създаден за ултрабързо генериране на токени за агентни AI системи. Nvidia твърди, че той ще бъде пуснат в експлоатация по-късно тази година.
В края на декември компанията плати около 20 млрд. долара за лиценза на Groq и привлече основателя Джонатан Рос и президента Съни Мадра. Groq създава процесори, оптимизирани за инференция, а не за обучение на AI.
Скоростта е важна за агентните приложения, тъй като агентите обработват огромни количества токени в рамките на стотици до хиляди стъпки на инференция. Колкото по-бързо една система генерира токени, толкова повече стъпки на разсъждение и извиквания на инструменти могат да се вместят в същия период от време. Така, в рамките на време за изчакване, което потребителите намират за приемливо, един агент може да повтаря действията си по-често, да проверява файлове, да пише и тества код и да проверява резултатите. Nvidia твърди, че това съкращава задачите по програмиране до „минути вместо часове“.
Бенчмарк от Artificial Analysis има за цел да покаже колко бързо работи Groq 3 LPX: при отворения модел Gemma 4 31B с контекстен прозорец от 100 000 токена, системата LPX достигна 3400 токена в секунда, измерени в рамките на 50 последователни заявки. Производителността остана стабилна при дължина на входа между 10 000 и 100 000 токена. Това е най-високият резултат, регистриран някога за този модел. Nvidia твърди, че това прави ускорителя четири пъти по-бърз от следващата най-добра опция — чипа на Cerebras, който достига 882 токена в секунда.
Защо рекордът изглежда различно на практика
Groq разчита на архитектура за обработка на данни с голям дял SRAM. Според The Register проблемът е, че всеки LPU разполага само с 500 MB памет — 576 пъти по-малко от графичен процесор Rubin с 288 GB. Затова моделите се разделят между няколко ускорителя чрез Ethernet, като един шкаф побира до 256 LPU. В тази смесена конфигурация графичните процесори обработват фазата на предварително попълване, натоварена с изчисления, а LPU поемат фазата на декодиране, натоварена с трансфер на данни.
В тази конфигурация, отбелязва The Register, Gemma 4 31B е сценарий в най-благоприятния случай: плътен модел, който се побира изцяло в един шкаф. Как архитектурата се мащабира при по-големи модели от типа „смес от експерти“ остава открит въпрос. DeepSeek V3 например би изисквал 1342 ускорителя, или малко повече от пет шкафа. Сравнението с Cerebras също не отчита броя на чиповете. Cerebras се нуждае от един или два ускорителя за модела, докато Nvidia изисква поне 64. Освен това сравнението изобщо не включва най-новото поколение CS-4 на Cerebras.
Nebius планира да бъде първият облачен доставчик, който ще предлага чипа чрез своята Token Factory, а самата Groq е сред първите му потребители.
AI новини без сензация – подбрани от хора
Абонирайте се за THE DECODER и получете четене без реклами, седмичен AI бюлетин, нашия ексклузивен доклад за авангардни технологии „AI Radar“ шест пъти годишно, пълен достъп до архива и достъп до секцията за коментари.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.