Чипът Jalapeño на OpenAI е създаден за бърз инференс в голям мащаб, показват бенчмаркове
На конференцията Hot Chips във вторник OpenAI представи по-подробен поглед към Jalapeño, включително първата серия резултати от тестове за новата система. Тестван в бенчмарка InferenceX на SemiAnalysis, Jalapeño показа както повече токени на потребител, така и по-голяма пропускателна способност на киловат от наличните в момента най-съвременни процесори за инференция.
„Изводът е, че резултатите показват много, много значителен напредък в производителността спрямо най-съвременните решения“, заяви Ричард Хо, ръководител на хардуерното направление в OpenAI, по време на разговор с журналисти. „Jalapeño може да обработва повече работа с изкуствен интелект за единица мощност, като същевременно връща отговорите по-бързо. Той е много ефективен при обслужването на много клиенти, но може да осигури и много ниска латентност.“
Забележително е, че сравнението е с система Nvidia Blackwell — но докато Jalapeño достигне пълномащабно внедряване, конкуренцията може да е напреднала значително. Хо изчисли, че Jalapeño ще бъде внедрен в края на 2026 г. „в много малки количества“, като по-същественото внедряване ще започне през 2027 г.
Jalapeño беше обявен за първи път миналия октомври и е разработен от OpenAI в тясно сътрудничество с Broadcom, като собствените модели на OpenAI са подпомагали процеса на разработка. Компанията планира да превърне Jalapeño в многопоколенческа платформа, която да позволява продуктите с изкуствен интелект, моделите, чиповете и паметта да бъдат разработвани съвместно.
Благодарение на този цялостен подход OpenAI е успяла да се справи с конкретни фази от процеса на инференция, които често създават затруднения по време на обработката. По-специално, Jalapeño е проектиран да минимизира забавянията по време на фазите на предварително запълване и комуникация, които според OpenAI често се превръщат в тесни места.
„Проектирахме Jalapeño така, че да минимизираме преместването на данни и комуникационните забавяния“, заяви компанията в публикация в блога, представяща резултатите. „Това означава, че състоянието на модела, включително кешът KV, използван при генерирането на отговор, може да бъде изрично разположен и съхраняван локално, докато системата активира правилната комбинация от изчислителни ресурси, памет и мрежови възможности за всяка фаза на инференцията.“
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.