Nvidia заявляє, що Groq 3 LPX у чотири рази швидший за Cerebras, але все складніше
Ключові моменти
- Nvidia розпочинає повномасштабне виробництво свого нового прискорювача логічного виведення Groq 3 LPX, оптимізованого для швидкої генерації токенів в AI-агентах.
- В одному з тестів система досягла швидкості 3400 токенів за секунду, що, за словами Nvidia, у чотири рази перевищує показник конкурента Cerebras.
- Але експерти називають порівняння вигідним для Nvidia, оскільки її архітектурі потрібно щонайменше 64 чипи для досягнення такого результату, тоді як Cerebras обходиться одним або двома прискорювачами.
Nvidia перевела свій спеціалізований прискорювач логічного виведення Groq 3 LPX у повномасштабне виробництво. Незалежний тест показує чудові результати генерації токенів, але експерти попереджають, що порівняння вигідне для Nvidia.
На конференції Hot Chips 2026 Nvidia оголосила, що її Groq 3 LPX перейшов у повномасштабне виробництво. Чип, який Nvidia називає «прискорювачем інтерактивного AI-логічного виведення», розширює платформу Vera Rubin і створений для надшвидкої генерації токенів в агентних AI-системах. Nvidia заявляє, що він буде запущений пізніше цього року.
Наприкінці грудня компанія заплатила близько 20 мільярдів доларів за ліцензію Groq і залучила засновника Джонатана Росса та президента Санні Мадру. Groq створює процесори, оптимізовані для логічного виведення, а не для навчання AI.
Швидкість важлива для агентних застосунків, оскільки агенти обробляють величезні обсяги токенів протягом сотень і тисяч кроків логічного виведення. Що швидше система генерує токени, то більше кроків міркування та викликів інструментів поміщається в той самий проміжок часу. Тож за прийнятного для користувачів часу очікування агент може частіше повторювати ітерації, перевіряти файли, писати й тестувати код та перевіряти результати. Nvidia заявляє, що це скорочує виконання завдань із програмування до «хвилин замість годин».
Тест від Artificial Analysis має продемонструвати, наскільки швидко працює Groq 3 LPX: на відкритій моделі Gemma 4 31B із контекстним вікном у 100 000 токенів стійка LPX досягла швидкості 3400 токенів за секунду, виміряної на 50 послідовних запитах. Продуктивність залишалася стабільною за довжини вхідних даних від 10 000 до 100 000 токенів. Це найвищий показник, коли-небудь зафіксований для цієї моделі. Nvidia заявляє, що це робить прискорювач у чотири рази швидшим за наступний найкращий варіант — чип Cerebras, який досягає 882 токенів за секунду.
Чому рекорд на практиці виглядає інакше
Groq покладається на архітектуру потоків даних із великим обсягом SRAM. За даними The Register, проблема полягає в тому, що кожен LPU має лише 500 МБ пам’яті — у 576 разів менше, ніж GPU Rubin із 288 ГБ. Тому моделі розподіляються між кількома прискорювачами через Ethernet, а одна стійка вміщує до 256 LPU. У цій змішаній конфігурації GPU виконують ресурсоємну фазу попереднього заповнення, а LPU — фазу декодування, що потребує високої пропускної здатності.
У цій конфігурації, зазначає The Register, Gemma 4 31B є найсприятливішим сценарієм: це щільна модель, яка повністю вміщується в одній стійці. Як архітектура масштабується для більших моделей із сумішшю експертів, залишається відкритим питанням. Наприклад, для DeepSeek V3 знадобиться 1342 прискорювачі, або трохи більше ніж п’ять стійок. У порівнянні з Cerebras також не враховано кількість чипів. Cerebras потребує для моделі одного або двох прискорювачів, тоді як Nvidia — щонайменше 64. Крім того, порівняння взагалі не враховує новітнє покоління CS-4 від Cerebras.
Nebius планує стати першим хмарним провайдером, який пропонуватиме цей чип через свій Token Factory, а сама Groq є одним із перших користувачів.
Новини AI без хайпу — відібрані людьми
Підпишіться на THE DECODER, щоб читати без реклами, отримувати щотижневу розсилку про AI, ексклюзивний звіт про передові розробки «AI Radar» шість разів на рік, повний доступ до архіву та доступ до розділу коментарів.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.