Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← К новостям

Чип Jalapeño от OpenAI создан для быстрого инференса в больших масштабах, показывают результаты бенчмарков

Во вторник на конференции Hot Chips компания OpenAI представила более подробный обзор Jalapeño, включая первую серию результатов тестирования новой системы. В ходе тестирования по бенчмарку InferenceX от SemiAnalysis Jalapeño показала как большее количество токенов на пользователя, так и более высокую производительность на киловатт по сравнению с доступными в настоящее время передовыми процессорами для инференса.

«Суть в том, что результаты демонстрируют очень, очень значительный прирост производительности по сравнению с современными решениями», — заявил в ходе пресс-конференции руководитель аппаратного направления OpenAI Ричард Хо. «Jalapeño может выполнять больше задач ИИ на единицу потребляемой мощности и одновременно быстрее возвращать ответы. Система очень эффективна при обслуживании большого числа клиентов, но также способна обеспечивать очень низкую задержку».

Примечательно, что сравнение проводилось с системой Nvidia Blackwell, однако к моменту полномасштабного внедрения Jalapeño конкуренты могут значительно продвинуться. Хо оценил, что Jalapeño будет развернута в конце 2026 года «в очень небольших объемах», а более масштабное внедрение начнется в 2027 году.

Впервые представленная в октябре прошлого года, Jalapeño была разработана OpenAI в тесном сотрудничестве с Broadcom, причем собственные модели OpenAI помогали в процессе разработки. Компания планирует превратить Jalapeño в платформу для нескольких поколений, чтобы продукты ИИ, модели, чипы и память разрабатывались согласованно.

Благодаря такому комплексному подходу OpenAI смогла устранить проблемы на отдельных этапах процесса инференса, которые часто создают препятствия при обработке запросов. В частности, Jalapeño разработана для минимизации задержек на этапах предварительного заполнения и коммуникации, которые, по словам OpenAI, часто становятся узкими местами.

«Мы разработали Jalapeño так, чтобы минимизировать перемещение данных и задержки при обмене информацией», — заявила компания в записи блога, посвященной результатам. «Это означает, что состояние модели, включая KV-кэш, используемый при генерации ответа, можно явно размещать и сохранять локально, пока система активирует необходимое сочетание вычислительных ресурсов, памяти и сетевого оборудования для каждого этапа инференса».

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости