Kog навлиза по-дълбоко, за да извлече повече инференс от GPU-тата
Надпреварата за по-бърз AI инференс започна, а пазарите посрещнаха топло Cerebras и нейните специално създадени чипове при дебюта ѝ на борсата през май. Но френският стартъп Kog залага, че от стандартните GPU може да бъде извлечена още много мощ.
Стартъпът попадна на първа страница в Hacker News през май с технологична демонстрация, целяща да докаже, че „изключително бързото декодиране на единични заявки е възможно със стандартните сървърни GPU, които предприятията вече притежават“ — като AMD MI300X и NVIDIA H200, използвани в демонстрацията.
Някои бяха разочаровани да чуят, че това не се отнася за GPU в лаптопите ни, но други видяха потенциала. Тъй като скоростта и разходите за инференс вече са критично тесно място, обещанието на Kog да отключи нови възможности чрез софтуерна оптимизация върху съществуващ хардуер привлече повече от просто наблюдатели. „Имахме 200 конкретни бизнес потенциални клиенти“, каза главният изпълнителен директор Гаел Делало пред TechCrunch.
Въз основа на ранната обратна връзка единственият основател очаква софтуерното инженерство да бъде първият случай на употреба. Опитните потребители на Claude Code добре знаят, че понякога трябва да чакат с часове, за да получат резултати. Самата Anthropic разбира, че скоростта струва пари, и начислява многократно по-висока цена за Fast Mode на Claude.
Kog се надява да се насочи към клиенти, отказали се заради тези забавяния, обикновено защото разчитат на работни процеси с AI за професионални задачи. Но стартъпът има и партньори по дизайна, които позволяват на потребителите да създават игри и приложения с една подкана и за които по-бързият резултат благодарение на Kog Inference Engine (KIE) би означавал повече приходи, каза Делало.
Компанията осъзнава, че този пазар все още не е напълно зрял. Наблюдавайки търсенето, Kog научи, че потенциалните ѝ клиенти не са готови да дообучават малки модели. „И именно затова от стартирането насам сме изцяло фокусирани върху ускоряването на разработката на по-големи модели, за да отговорим на търсенето, което наблюдаваме.“
Това оставя пред Kog огромен скок, който трябва да направи, за да изпълни обещанието си за „30 пъти по-бърз LLM инференс“. Демонстрацията показа впечатляващите 3000 токена в секунда на заявка (TPS) — но със специално създаден малък модел с едва около 2 милиарда параметъра — вече публикувания като отворен код Laneformer 2B.
Опровергавайки скептиците, Делало е уверен, че същият подход може да работи също толкова добре и с LLM, чийто размер може да се окаже предизвикателство за инференс чиповете. „GPU имат светло бъдеще“, каза той. Според главния изпълнителен директор на Kog идеята, че те не са подходящи за декодиране, се е превърнала в погрешно схващане; по-новите GPU имат все по-голяма пропускателна способност на паметта, която само чака да бъде отключена.
Kog не е единственият, който смята, че софтуерната оптимизация може да помогне на GPU да правят повече, отколкото е посочено на кутията. ZML, също от Франция, пусна хардуерно независим софтуер, който заобикаля CUDA на Nvidia, за да осигури бърз инференс върху конкурентни чипове. Но Делало каза, че Kog е по-близо до лабораторията Hazy Research на Станфордския университет, с още по-задълбочен фокус върху ускоряването на GPU.
Самият Делало не е изследовател, а първият му стартъп, възпитаникът на TechCrunch50 за 2009 г. Stribe, няма нищо общо с новото му начинание — освен бившия му съосновател, превърнал се във венчър капиталист, Камел Зеруал, чиято фирма Varsity VC съвместно ръководи началния инвестиционен кръг на Kog. Но задълбоченият фокус на стартъпа произтича от уникалния му професионален опит.
След като изучава физика на твърдото тяло във френското École Polytechnique, той започва работа в областта на офанзивната киберсигурност — известна още като хакерство с „бяла шапка“. По думите на Делало това е оформило начина на мислене, който сега насърчава екипа си да възприеме. От научна гледна точка „става дума за нагласата да разбираме законите на физиката и законите на GPU, за да извлечем максимума от тях“.
Що се отнася до хакерството, четирикратният финалист в CTF турнира на DEF CON каза, че то го е научило „да извършва обратно инженерство на нещата на много ниско ниво — до асемблерен език и двоичен код — за да разбере как работят и да се опита да ги използва за постигането на цел, за която не са били непременно предназначени“.
Недостатъкът на този подход е, че той изисква много практическа работа и време. „За всеки нов GPU ще отделяме по няколко седмици или дори месеци, за да навлезем наистина в детайлите и да проведем изследвания в областта на GPU инженерството върху този хардуер.“ С екип от 11 души това ограничава броя чипове, с които Kog може да работи, поне в обозримо бъдеще.
В по-дългосрочен план Kog се надява да вложи методологията си в базирани на агенти работни процеси, които ще ѝ позволят да поддържа повече чипове и модели. Докато Европа се стреми да изгради собствен капацитет на тези два фронта, това може да осигури допълнителен попътен вятър за суверенитета на стартъпа, който вече е подкрепен от Scaleway и финансиран от френските Bpifrance и програмата French Tech 2030.
Засега обаче Kog трябва да докаже на света, че подходът ѝ работи с LLM. Това ще бъде от ключово значение и за осигуряването на допълнително финансиране. „След като внедрим първия си голям модел с 10 пъти по-висока скорост, което според мен ще стане през септември, ще можем да започнем да демонстрираме привличане на клиенти и оттам да наберем финансиране за серия A“, каза Делало.
Преведено автоматично от английски. Оригиналната статия е на връзката по-долу.