Kog заглиблюється, щоб отримати більше інференсу від GPU
Гонка за швидшою інференцією ШІ триває, і ринки тепло зустріли Cerebras та її спеціально розроблені чипи під час дебюту компанії на біржі в травні. Але французький стартап Kog робить ставку на те, що зі звичайних GPU можна вичавити набагато більше потужності.
Стартап потрапив на головну сторінку Hacker News у травні завдяки технічному прев’ю, покликаному довести, що «надзвичайно швидке декодування в межах одного запиту можливе на стандартних серверних GPU, які підприємства вже мають», — зокрема на GPU AMD MI300X і NVIDIA H200, використаних у демонстрації.
Дехто був розчарований, почувши, що це не поширюється на GPU у наших ноутбуках, але інші побачили потенціал. Оскільки швидкість і вартість інференції тепер стали критичним вузьким місцем, обіцянка Kog розблокувати нові можливості на наявному обладнанні за допомогою програмної оптимізації привернула не лише спостерігачів. «Ми отримали 200 конкретних бізнес-лідів», — розповів TechCrunch генеральний директор Гаель Делалло.
Ґрунтуючись на перших відгуках, засновник-одинак очікує, що першим варіантом використання стане програмна інженерія. Досвідчені користувачі Claude Code добре знають, що іноді їм доводиться годинами чекати на результати. Сама Anthropic розуміє, що швидкість варта грошей, і стягує кратну ціну за швидкий режим Claude.
Kog сподівається залучити клієнтів, яких відлякують такі затримки, зазвичай через те, що вони покладаються на робочі процеси зі ШІ для професійних завдань. Але стартап також має партнерів із розробки, які дають користувачам змогу генерувати ігри та застосунки за допомогою одного запиту, і для яких швидший результат завдяки Kog Inference Engine (KIE) означатиме більший дохід, сказав Делалло.
Компанія усвідомлює, що цей ринок ще не цілком сформований. Спостерігаючи за попитом, Kog з’ясувала, що її потенційні клієнти не готові до тонкого налаштування малих моделей. «І саме тому від моменту запуску ми повністю зосереджені на прискоренні розробки більших моделей, щоб задовольнити попит, який ми побачили».
Тож Kog доведеться зробити величезний стрибок, щоб виконати обіцянку «у 30 разів швидшої інференції LLM». Її демонстрація показала вражаючі 3 000 токенів за секунду на запит (TPS), але з використанням спеціально розробленої малої моделі лише приблизно з 2 мільярдами параметрів — нині відкритої Laneformer 2B.
Всупереч скептикам, Делалло впевнений, що такий самий підхід може добре працювати і з LLM, розмір яких може бути викликом для інференс-чипів. «На GPU чекає світле майбутнє», — сказав він. На думку генерального директора Kog, уявлення про те, що вони погано підходять для декодування, стало хибною думкою; новіші GPU мають дедалі більшу пропускну здатність пам’яті, яку потрібно лише розблокувати.
Kog не єдина вважає, що програмна оптимізація може допомогти GPU робити більше, ніж заявлено на коробці. ZML, також із Франції, випустила апаратно-агностичне програмне забезпечення, яке обходить CUDA від Nvidia для підтримки швидкої інференції на конкуруючих чипах. Але Делалло сказав, що Kog більше схожа на лабораторію Стенфордського університету Hazy Research, з іще глибшим зосередженням на прискоренні GPU.
Сам Делалло не є дослідником, а його перший стартап, випускник TechCrunch50 2009 року Stribe, не має нічого спільного з новою компанією — за винятком його колишнього співзасновника, який став венчурним інвестором, Камеля Зеруаля, чия фірма Varsity VC співочолила посівний раунд Kog. Але глибокий фокус стартапу зумовлений унікальним досвідом Делалло.
Вивчавши фізику твердого тіла у французькій Політехнічній школі, він почав працювати у сфері наступальної кібербезпеки, також відомої як етичний хакинг. За словами Делалло, це сформувало спосіб мислення, який він тепер заохочує переймати свою команду. З наукового боку «йдеться про спосіб мислення, що передбачає розуміння законів фізики та законів роботи GPU, щоб використовувати їх максимально ефективно».
Щодо хакингу, чотириразовий фіналіст турніру DEF CON CTF сказав, що це навчило його «здійснювати зворотну інженерію речей на дуже низькому рівні — аж до мови асемблера та двійкового коду — щоб зрозуміти, як вони працюють, і спробувати використати їх для досягнення мети, для якої вони не обов’язково були призначені».
Недоліком такого підходу є те, що він вимагає багато ручної роботи й часу. «Для кожного нового GPU ми присвячуватимемо кілька тижнів або навіть місяців, щоб ретельно вивчити деталі та провести дослідження з інженерії GPU на цьому обладнанні». З командою з 11 людей це обмежує кількість чипів, з якими Kog може працювати, принаймні в осяжному майбутньому.
У довгостроковій перспективі Kog сподівається закласти свою методологію в агентні конвеєри, які дадуть змогу підтримувати більше чипів і моделей. Оскільки Європа прагне розвивати власні спроможності на обох цих напрямках, це може створити додатковий імпульс для технологічного суверенітету стартапу, який уже отримує підтримку від Scaleway і фінансується французькими Bpifrance та програмою French Tech 2030.
Однак наразі Kog потрібно довести світові, що її підхід працює з LLM. Це також буде ключовим для залучення додаткового фінансування. «Щойно ми реалізуємо нашу першу велику модель із десятикратним прискоренням, що, на мою думку, станеться у вересні, ми зможемо почати демонструвати зацікавленість клієнтів, а відтак залучити фінансування раунду Series A», — сказав Делалло.
Перекладено автоматично з англійської. Оригінал статті — за посиланням нижче.