Френският стартъп Kog прави пробив в инференцията, оптимизирайки стандартните GPU
14 август 2026 г.
Френският стартъп Kog залага на дълбока софтуерна оптимизация, за да извлече максимална скорост от масовите графични процесори за центрове за данни. Основана от бивш хакер и физик, компанията има за цел да ускори работата на големите езикови модели до 30 пъти, без да се налага покупката на нов хардуер. Това би спестило ценно време и разходи за компаниите, разработващи решения с изкуствен интелект.

Докато състезанието за по-бърза инференция (AI inference) се изостря, а пазарът посреща с ентусиазъм специализираните чипове на компании като Cerebras, френският стартъп Kog залага на друг подход. Според тях традиционните графични процесори (GPU) разполагат с огромен неизползван потенциал, който може да бъде отключен чрез софтуер.
През май компанията привлече вниманието на технологичната общност с демонстрация, че изключително бързата обработка на единични заявки е напълно възможна върху стандартния хардуер, с който корпорациите вече разполагат — като AMD MI300X и Nvidia H200. Публикацията генерира над 200 реални бизнес контакта, потвърждавайки, че ниската скорост и високите разходи за инференция са сред основните пречки пред AI индустрията днес.
Първоначално решението е насочено към професионални потребители, чиито работни процеси зависят от бързината на AI. Типичен пример са софтуерните инженери, използващи инструменти като Claude Code, при които генерирането на комплексен код понякога отнема часове. От Kog отчитат, че пазарът няма желание да фино настройва (fine-tune) малки модели, поради което разработването натехния енджин (Kog Inference Engine – KIE) вече е изцяло фокусирано върху ускоряването на големи езикови модели (LLM).
Зад нестандартния технически подход на Kog стои нейният основател Гаел Делальо. С образование по физика на твърдото тяло от френската École Polytechnique и опит в офанзивната киберсигурност („етично хакване“), той прилага умения за обратен инженеринг на най-ниско ниво — чак до асембли език и бинарен код. Делальо смята за мит твърдението, че графичните чипове не са подходящи за бърз декодинг, и посочва, че новите генерации GPU разполагат с огромна пропускателна способност на паметта, която просто трябва да бъде използвана правилно.
Основното предизвикателство пред 11-членния екип на стартъпа е, че този дълбочинен подход изисква време — оптимизацията за всеки нов модел GPU може да отнеме месеци. Въпреки това Kog, подкрепена от Scaleway, Bpifrance и Varsity VC, се подготвя за ключова демонстрация през септември, с която да докаже 10-кратно ускорение при един от водещите големи модели, преди да започне набирането на капитал от серия A.
По материал на английски език: Kog is going deeper to squeeze more inference out of GPUs