Метка: Kog

  • Французский стартап Kog ускоряет работу ИИ

    Французский стартап Kog ускоряет работу ИИ

    Идёт гонка за более быстрый вывод данных с помощью ИИ, и рынки тепло встретили Cerebras и её специализированные чипы, когда компания провела IPO в мае. Но французский стартап Kog делает ставку на то, что из обычных графических процессоров можно выжать гораздо больше мощности.

    Стартап попал на первую страницу Hacker News в мае с техническим предварительным просмотром, направленным на доказательство того, что «на стандартных графических процессорах центров обработки данных, которые уже есть у предприятий», таких как AMD MI300X и Nvidia H200, использованные для демонстрации, «возможно чрезвычайно быстрое декодирование по одному запросу».

    Некоторые были разочарованы, услышав, что это не распространяется на графические процессоры в наших ноутбуках, но другие увидели потенциал. Поскольку скорость вывода данных и затраты сейчас являются критическим узким местом, обещание Kog разблокировать новые возможности на существующем оборудовании с помощью оптимизации программного обеспечения привлекло больше, чем просто наблюдателей. «У нас было 200 реальных бизнес-лидов», — сказал генеральный директор Гаэль Делалле в TechCrunch.

    Основываясь на первых отзывах, основатель-одиночка ожидает, что разработка программного обеспечения станет первым вариантом использования. Пользователи Claude Code хорошо знают, что иногда им приходится ждать часами, чтобы получить результаты. Сама компания Anthropic понимает, что скорость стоит денег, и взимает дополнительную плату за Fast Mode для Claude.

    Kog надеется привлечь клиентов, которых отпугивают такие задержки, обычно потому, что они используют рабочие процессы искусственного интеллекта для решения профессиональных задач. Но у стартапа также есть партнёры по дизайну, которые позволяют пользователям создавать игры и приложения с помощью подсказок, и для которых более быстрый результат благодаря Kog Inference Engine (KIE) будет означать увеличение доходов, сказал Делалле.

    Компания осознаёт, что этот рынок ещё не совсем созрел. Наблюдая за спросом, Kog выяснил, что потенциальные клиенты не готовы настраивать небольшие модели. «И именно поэтому с момента запуска мы полностью сосредоточились на ускорении разработки более крупных моделей, чтобы удовлетворить спрос, который мы наблюдаем», — говорится в сообщении.

    Это оставляет Kog с огромным скачком, чтобы выполнить своё обещание о «выводах LLM в 30 раз быстрее». Его демонстрация показала впечатляющие 3000 токенов в секунду (TPS) на запрос — но с узкоспециализированной небольшой моделью всего с 2 миллиардами параметров, теперь открытой — Laneformer 2B.

    Вопреки скептикам, Делаллё уверен, что такой же подход может так же хорошо работать с LLM, размер которых может стать проблемой для чипов вывода. «У GPU светлое будущее», — сказал он. Для генерального директора Kog идея о том, что они плохо подходят для декодирования, стала заблуждением; новые GPU имеют всё больше и больше пропускной способности памяти, которую только и остаётся, что разблокировать.

    Kog не одинока в своём мнении, что оптимизация программного обеспечения может помочь GPU делать больше, чем указано в характеристиках. ZML, также из Франции, выпустила программное обеспечение, независимое от аппаратного обеспечения, которое обходит Nvidia CUDA для поддержки быстрого вывода на конкурирующих чипах. Но Делаллё сказал, что Kog больше похожа на лабораторию Стэнфордского университета Hazy Research, с ещё более глубоким фокусом на ускорении работы с GPU.

    Сам Делаллё не является исследователем, и его первый стартап, выпускник TechCrunch50 2009 Stribe, не имеет ничего общего с его новым — кроме его бывшего соучредителя, ставшего венчурным капиталистом, Камеля Зеруаля, чья фирма Varsity VC совместно возглавила посевной раунд Kog. Но глубокий фокус стартапа проистекает из его уникального опыта.

    Изучив физику твёрдого тела в Политехнической школе Франции, он продолжил работать в сфере наступательной кибербезопасности — также известной как хакерство в белой шляпе. По словам Делаллё, это сформировало образ мышления, который он сейчас поощряет в своей команде. С научной точки зрения, «есть такое мышление — понимать законы физики и законы работы GPU, чтобы максимально их использовать».

    Что касается хакерства, четырёхкратный финалист турнира DEFCON CTF сказал, что это научило его «разбирать механизмы на очень низком уровне — вплоть до языка ассемблера и двоичного кода — чтобы понять, как они работают, и попытаться использовать их для достижения цели, для которой они изначально не были предназначены».

    Недостатком такого подхода является то, что он требует больших затрат времени и усилий. «Для каждого нового GPU мы будем уделять несколько недель или даже месяцев, чтобы действительно разобраться в деталях и провести инженерные исследования GPU на этом оборудовании». Из-за команды из 11 человек это ограничивает количество чипов, с которыми может работать Kog, по крайней мере, в обозримом будущем.

    В более долгосрочной перспективе Kog надеется внедрить свою методологию в основанные на агентах конвейеры, которые позволят ему поддерживать больше чипов и моделей. Поскольку Европа стремится создать собственные возможности в этих двух направлениях, это может усилить поддержку стартапа со стороны государства, который уже поддерживается Scaleway и программами Bpifrance и French Tech 2030.

    Пока же Kog должен доказать миру, что его подход работает с LLM. Это также будет ключом к получению дополнительного финансирования. «Как только мы внедрим нашу первую крупную модель со скоростью 10x, что, я думаю, будет в сентябре, мы сможем начать демонстрировать интерес клиентов и с этого момента привлечь наши инвестиции серии А», — сказал Деллало.

    Читайте также другие новости на нашем сайте: Главная страница

    Источник: techcrunch.com