Nvidia заявляет, что Groq 3 LPX в четыре раза быстрее Cerebras, но всё не так просто
Ключевые моменты
- Nvidia начинает серийное производство нового ускорителя инференса Groq 3 LPX, оптимизированного для быстрой генерации токенов ИИ-агентами.
- В одном из тестов система достигла 3 400 токенов в секунду — Nvidia заявляет, что это в четыре раза больше, чем у конкурирующей Cerebras.
- Однако эксперты считают сравнение выгодным для Nvidia, поскольку для достижения такого результата ее архитектуре требуется как минимум 64 чипа, тогда как Cerebras обходится одним или двумя ускорителями.
Nvidia перевела специализированный ускоритель инференса Groq 3 LPX в серийное производство. Независимый тест показал высокие результаты по скорости генерации токенов, однако эксперты предупреждают, что сравнение складывается в пользу Nvidia.
На конференции Hot Chips 2026 Nvidia объявила, что ее Groq 3 LPX запущен в серийное производство. Этот чип, который Nvidia называет «ускорителем интерактивного ИИ-инференса», расширяет платформу Vera Rubin и предназначен для сверхбыстрой генерации токенов в системах агентного ИИ. Nvidia заявляет, что он начнет работать позднее в этом году.
В конце декабря компания заплатила около 20 миллиардов долларов за лицензию Groq и привлекла основателя Джонатана Росса и президента Санни Мадру. Groq создает процессоры, оптимизированные для инференса, а не для обучения ИИ.
Скорость важна для агентных приложений, поскольку агенты расходуют огромное количество токенов за сотни и тысячи шагов инференса. Чем быстрее система генерирует токены, тем больше шагов рассуждения и вызовов инструментов укладывается в один и тот же промежуток времени. Поэтому за приемлемое для пользователей время ожидания агент может чаще выполнять итерации, проверять файлы, писать и тестировать код, а также проверять результаты. Nvidia утверждает, что это сокращает время выполнения задач по программированию «с часов до минут».
Тест Artificial Analysis призван показать, насколько быстро работает Groq 3 LPX: на открытой модели Gemma 4 31B с контекстным окном в 100 000 токенов стойка LPX достигла скорости 3 400 токенов в секунду при измерении на 50 последовательных запросах. Производительность оставалась стабильной при длине входных данных от 10 000 до 100 000 токенов. Это самый высокий показатель, когда-либо зафиксированный для этой модели. Nvidia заявляет, что благодаря этому ускоритель в четыре раза быстрее следующего по результативности варианта — чипа Cerebras, показавшего 882 токена в секунду.
Почему рекорд на практике выглядит иначе
Groq использует архитектуру потоковой обработки данных с большим объемом SRAM. Как отмечает The Register, проблема заключается в том, что каждый LPU располагает лишь 500 МБ памяти — в 576 раз меньше, чем графический процессор Rubin с 288 ГБ. Поэтому модели распределяются между несколькими ускорителями по Ethernet, причем одна стойка вмещает до 256 LPU. В такой смешанной конфигурации графические процессоры выполняют ресурсоемкую фазу предварительного заполнения, а LPU — требующую высокой пропускной способности фазу декодирования.
В этой конфигурации, отмечает The Register, Gemma 4 31B представляет собой оптимальный сценарий: это плотная модель, которая полностью помещается в одну стойку. Как архитектура будет масштабироваться для более крупных моделей со смесью экспертов, остается открытым вопросом. Например, для DeepSeek V3 потребуется 1 342 ускорителя, то есть чуть больше пяти стоек. В сравнении с Cerebras также не учитывается количество чипов. Cerebras требуется один или два ускорителя для модели, тогда как Nvidia — как минимум 64. Кроме того, сравнение вовсе не учитывает новое поколение CS-4 от Cerebras.
Nebius планирует стать первым облачным провайдером, который предложит этот чип через свой Token Factory, а сама Groq входит в число первых пользователей.
Новости ИИ без шумихи — отобраны людьми
Подпишитесь на THE DECODER, чтобы читать материалы без рекламы, получать еженедельную рассылку об ИИ, эксклюзивный отчет о передовых разработках «AI Radar» шесть раз в год, полный доступ к архиву и доступ к разделу комментариев.
Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.