Sakhanda Wire
NVDA $225.65 +0.15% MSFT $497.15 +0.05% GOOGL $344.85 -0.44% META $593.00 -0.33% AMZN $263.88 -0.47%
← К новостям

Kog углубляется, чтобы выжать больше инференса из GPU

Гонка за более быстрым инференсом ИИ идет полным ходом, и рынки тепло приветствовали Cerebras и ее специализированные чипы во время дебюта компании на IPO в мае. Но французский стартап Kog делает ставку на то, что из обычных GPU можно выжать гораздо больше мощности.

В мае стартап вышел на главную страницу Hacker News с техническим превью, призванным доказать, что «чрезвычайно быстрое декодирование в рамках одного запроса возможно на стандартных серверных GPU, которыми предприятия уже владеют», — например, на использованных в демонстрации GPU AMD MI300X и NVIDIA H200.

Некоторые были разочарованы, узнав, что это не распространяется на GPU в наших ноутбуках, но другие увидели в этом потенциал. На фоне того, что скорость и стоимость инференса теперь стали критически важным узким местом, обещание Kog раскрыть новые возможности существующего оборудования с помощью программной оптимизации привлекло не только наблюдателей. «У нас было 200 конкретных потенциальных клиентов», — рассказал TechCrunch генеральный директор Гаэль Делалло. 

Основатель-одиночка ожидает, что первым вариантом использования станет разработка программного обеспечения. Опытные пользователи Claude Code хорошо знают, что иногда им приходится часами ждать результатов. Сама Anthropic понимает, что скорость стоит денег, и взимает повышенную плату за быстрый режим Claude.

Kog надеется привлечь клиентов, которых отпугивают такие задержки, обычно потому, что они используют рабочие процессы на базе ИИ для профессиональных задач. Но у стартапа также есть партнеры по разработке, позволяющие пользователям создавать игры и приложения с помощью одного запроса; для них более быстрый результат благодаря Kog Inference Engine (KIE) означал бы больше дохода, сказал Делалло.

Компания понимает, что этот рынок пока еще недостаточно зрелый. Наблюдая за спросом, Kog выяснила, что ее потенциальные клиенты не готовы дообучать небольшие модели. «Именно поэтому с момента запуска мы полностью сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить выявленный нами спрос».

Это означает, что Kog предстоит совершить огромный рывок, чтобы выполнить обещание «ускорить инференс больших языковых моделей в 30 раз». В демонстрации была показана впечатляющая скорость — 3 000 токенов в секунду на запрос (TPS), — но использовалась специально созданная небольшая модель всего примерно с 2 миллиардами параметров — теперь доступная в открытом исходном коде модель Laneformer 2B

Вопреки мнению скептиков, Делалло уверен, что тот же подход может столь же хорошо работать с большими языковыми моделями, размер которых может создавать сложности для инференс-чипов. «У GPU большое будущее», — сказал он. По мнению генерального директора Kog, представление о том, что GPU плохо подходят для декодирования, стало ошибочным: у новых GPU все выше пропускная способность памяти, и остается лишь раскрыть ее потенциал.

Kog не единственная компания, считающая, что программная оптимизация может позволить GPU делать больше заявленного производителем. ZML, также из Франции, выпустила не зависящее от оборудования программное обеспечение, которое обходит CUDA от Nvidia и обеспечивает быстрый инференс на конкурирующих чипах. Но Делалло сказал, что Kog скорее похожа на лабораторию Стэнфордского университета Hazy Research, уделяя еще больше внимания ускорению GPU на глубинном уровне.

Сам Делалло не является исследователем, а его первый стартап, выпускник TechCrunch50 2009 года Stribe, никак не связан с новым проектом — за исключением его бывшего сооснователя, ставшего венчурным инвестором, Камеля Зеруаля, чья фирма Varsity VC совместно возглавила посевной раунд Kog. Однако глубокий технологический фокус стартапа обусловлен уникальным опытом Делалло.

Изучив физику твердого тела в парижской Политехнической школе, он затем занялся наступательной кибербезопасностью, также известной как этичный взлом. По словам Делалло, это сформировало образ мышления, который он теперь прививает своей команде. С научной точки зрения «речь идет о понимании законов физики и законов работы GPU, чтобы использовать их максимально эффективно».

Что касается взлома, четырехкратный финалист турнира DEF CON CTF сказал, что это научило его «проводить обратную разработку на очень низком уровне — вплоть до языка ассемблера и двоичного кода, — чтобы понять, как все работает, и попытаться использовать это для достижения цели, для которой система изначально не обязательно предназначалась».

Обратная сторона такого подхода заключается в том, что он требует непосредственной работы и занимает много времени. «Для каждого нового GPU мы будем выделять несколько недель или даже месяцев, чтобы действительно разобраться в деталях и провести исследование архитектуры GPU на этом оборудовании». При команде из 11 человек это ограничивает количество чипов, с которыми Kog может работать, по крайней мере в обозримом будущем.

В долгосрочной перспективе Kog надеется внедрить свою методологию в агентные конвейеры, которые позволят ей поддерживать больше чипов и моделей. Пока Европа стремится создать собственные возможности по обоим направлениям, это может обеспечить стартапу дополнительный импульс благодаря стремлению к технологическому суверенитету. Уже сейчас его поддерживает Scaleway, а также финансируют французские Bpifrance и программа French Tech 2030.

Но пока Kog необходимо доказать всему миру, что ее подход работает с большими языковыми моделями. Это также станет ключом к привлечению дополнительного финансирования. «Как только мы реализуем нашу первую крупную модель с десятикратным ускорением, что, думаю, произойдет в сентябре, мы сможем начать демонстрировать интерес клиентов, а затем привлечь инвестиции раунда Series A», — сказал Делалло. 

Переведено автоматически с английского. Оригинал статьи — по ссылке ниже.

Впервые опубликовано изданием TechCrunch

Читать оригинал на TechCrunch ↗

Текст и изображения принадлежат TechCrunch и приводятся здесь с указанием авторства и ссылкой на оригинальную публикацию.

← К новостям

Ещё новости

Все последние новости