Французский стартап Kog стремится выжать максимум из обычных GPU для ускорения AI-инференса

/ ТехнологииНовости / Технологии

Гонка за ускорение AI-инференса набирает обороты, и рынок тепло встретил Cerebras с её специализированными чипами во время IPO в мае. Однако французский стартап Kog делает ставку на то, что из обычных GPU можно выжать гораздо больше мощности.

В мае стартап попал на главную страницу Hacker News с техническим превью, целью которого было доказать, что «чрезвычайно быстрая однозапросная декодировка возможна на стандартных датацентровых GPU, которые уже есть у предприятий», — таких как AMD MI300X и Nvidia H200, использованных в демонстрации. Некоторые были разочарованы, что это не касается GPU в ноутбуках, но другие увидели потенциал. Поскольку скорость и стоимость инференса становятся критическим узким местом, обещание Kog разблокировать новые возможности на существующем оборудовании с помощью оптимизации ПО привлекло внимание не только зевак. «У нас было 200 реальных бизнес-лидов», — рассказал TechCrunch генеральный директор Гаэль Делалло.

Основываясь на ранних отзывах, основатель-одиночка ожидает, что первым вариантом использования станет разработка программного обеспечения. Опытные пользователи Claude Code знают, что иногда им приходится часами ждать результатов. Сама Anthropic понимает, что скорость стоит денег, и взимает повышенную плату за Fast Mode в Claude.

Kog надеется привлечь клиентов, которых отпугивают такие задержки, обычно потому, что они полагаются на AI-рабочие процессы для профессиональных задач. У стартапа также есть партнёры по дизайну, которые позволяют пользователям генерировать игры и приложения по запросу, и для них более быстрый результат благодаря Kog Inference Engine (KIE) означал бы больший доход, отметил Делалло.

Компания осознаёт, что рынок ещё не совсем зрелый. Наблюдая за спросом, Kog выяснила, что потенциальные клиенты не готовы дообучать маленькие модели. «И именно поэтому с момента запуска мы полностью сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить наблюдаемый спрос».

Это оставляет Kog огромный скачок, чтобы выполнить обещание «ускорения LLM-инференса в 30 раз». Демонстрация показала впечатляющие 3000 токенов в секунду на запрос, но с использованием специально созданной небольшой модели всего с ~2 миллиардами параметров — недавно открытой Laneformer 2B.

Вопреки скептикам, Делалло уверен, что тот же подход может отлично работать с большими языковыми моделями, чей размер может быть проблемой для инференс-чипов. «У GPU светлое будущее», — сказал он. По мнению CEO Kog, представление о том, что они плохо подходят для декодирования, стало заблуждением; новые GPU имеют всё больше и больше пропускной способности памяти, которую только и нужно разблокировать.

Kog не одинока в мысли, что программная оптимизация может помочь GPU делать больше, чем заявлено. ZML, также из Франции, выпустила аппаратно-независимое ПО, обходящее CUDA от Nvidia для поддержки быстрого инференса на конкурирующих чипах. Но Делалло говорит, что Kog больше похожа на лабораторию Hazy Research из Стэнфордского университета, с ещё более глубоким фокусом на ускорение GPU.

Сам Делалло не исследователь, и его первый стартап, участник TechCrunch50 2009 года Stribe, не имеет ничего общего с новым — кроме его бывшего сооснователя, ставшего венчурным инвестором Камеля Зеруаля, чья фирма Varsity VC выступила со-лидером посевного раунда Kog. Но глубокий технический фокус стартапа проистекает из его уникального бэкграунда.

Изучив физику твёрдого тела в парижской Политехнической школе, он перешёл в наступательную кибербезопасность, также известную как белое хакерство. По словам Делалло, это сформировало мышление, которое он сейчас прививает своей команде. С научной стороны, «есть образ мышления, основанный на понимании законов физики и законов GPU, чтобы извлечь из них максимум».

Что касается хакинга, четырёхкратный финалист турнира DEFCON CTF сказал, что это научило его «реверс-инжинирингу вещей на очень низком уровне — вплоть до ассемблера и бинарного кода — чтобы понять, как это работает, и попытаться использовать это для достижения цели, для которой оно не обязательно было предназначено».

Обратная сторона такого подхода — он очень трудоёмкий и требует много времени. «Для каждого нового GPU мы будем тратить несколько недель или даже месяцев на детальное изучение и проведение GPU-инженерных исследований на этом оборудовании». С командой из 11 человек это ограничивает количество чипов, с которыми Kog может работать, по крайней мере в обозримом будущем.

В долгосрочной перспективе Kog надеется внедрить свою методологию в конвейеры на основе агентов, что позволит поддерживать больше чипов и моделей. Поскольку Европа стремится наращивать собственный потенциал на этих двух фронтах, это может добавить стартапу «суверенные» попутные ветры: его уже поддерживает Scaleway, а также французские Bpifrance и программа French Tech 2030.

Пока же Kog нужно доказать миру, что её подход работает на LLM. Это также станет ключом к привлечению дополнительного финансирования. «Как только мы внедрим нашу первую крупную модель на 10-кратной скорости, что, я думаю, произойдёт в сентябре, мы сможем начать демонстрировать привлечение клиентов и после этого привлечь раунд серии A», — сказал Делалло.

Подписаться на обновления Новости / Технологии
Зарегистрируйтесь на сайте, чтобы отключить рекламу

ℹ️ Помощь от ИИ в комментариях

Вы можете задать вопрос нашему ИИ-помощнику прямо в комментариях к этой статье. Он постарается быстро ответить или уточнить информацию.

⚠️ ИИ может ошибаться — проверяйте важную информацию.


0 комментариев

Оставить комментарий


Все комментарии - Технологии