Sakhanda Wire
NVDA MSFT GOOGL META AMZN
← До новин

Чип Jalapeño від OpenAI створений для швидкого інференсу у великих масштабах, свідчать результати бенчмарків

На конференції Hot Chips у вівторок OpenAI поділилася детальнішим оглядом Jalapeño, зокрема першою серією результатів тестування нової системи. Під час тестування за допомогою бенчмарку InferenceX від SemiAnalysis Jalapeño продемонструвала як більшу кількість токенів на користувача, так і вищу пропускну здатність на кіловат, ніж доступні нині найсучасніші процесори для інференсу.

«Суть у тому, що результати демонструють дуже, дуже значне підвищення продуктивності порівняно з найсучаснішими рішеннями», — сказав Річард Хо, керівник апаратного напряму OpenAI, під час телефонної пресконференції. «Jalapeño може обробляти більше завдань ШІ на одиницю потужності, водночас швидше повертаючи відповіді. Система дуже ефективна для обслуговування великої кількості клієнтів, але також може забезпечувати дуже низьку затримку».

Примітно, що порівняння проводилося із системою Nvidia Blackwell, однак до моменту повномасштабного розгортання Jalapeño конкуренти можуть суттєво просунутися вперед. Хо оцінив, що Jalapeño почнуть розгортати наприкінці 2026 року «в дуже малих обсягах», а значно масштабніше розгортання відбудеться у 2027 році.

Jalapeño, уперше представлена минулого жовтня, була розроблена OpenAI у тісній співпраці з Broadcom, причому власні моделі OpenAI допомагали в процесі розробки. Компанія планує перетворити Jalapeño на багатопоколінну платформу, у межах якої продукти ШІ, моделі, чипи та пам’ять розроблятимуться узгоджено.

Завдяки такому комплексному підходу OpenAI змогла розв’язати проблеми, пов’язані з окремими етапами процесу інференсу, які часто створюють труднощі під час обробки запитів. Зокрема, Jalapeño розроблено для мінімізації затримок на етапах попереднього заповнення та комунікації, які, за словами OpenAI, часто стають вузькими місцями.

«Ми розробили Jalapeño так, щоб мінімізувати переміщення даних і затримки комунікації», — заявила компанія в дописі блогу, де представила результати. «Це означає, що стан моделі, зокрема кеш KV, який використовується під час генерування відповіді, можна явно розміщувати й зберігати локально, тоді як система активує правильне поєднання обчислювальних ресурсів, пам’яті та мережевих засобів для кожного етапу інференсу».

Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.

Вперше опубліковано виданням TechCrunch

Читати оригінал на TechCrunch ↗

Текст і зображення належать TechCrunch і наводяться тут із зазначенням авторства та посиланням на оригінальну публікацію.

← До новин

Ще новини

Усі останні новини