La compétition pour accélérer les inférences en IA s'intensifie. La startup française Kog a choisi de ne pas développer ses propres puces, mais de parier sur l'optimisation logicielle pour libérer davantage la capacité d'inférence des GPU existants dans les centres de données des entreprises.
Ciblant d'abord les scénarios à forte latence
Cette entreprise a attiré l'attention en mai dernier grâce à une démonstration technique. Kog a montré qu'en utilisant des GPU standards de centres de données comme l'AMD MI300X et le Nvidia H200, il était possible d'atteindre des vitesses de décodage très rapides pour des requêtes uniques. L'entreprise a ensuite déclaré que cette démonstration avait généré environ 200 pistes commerciales concrètes.
Kog se concentre actuellement sur des flux de travail professionnels nécessitant une réponse rapide, en particulier dans le domaine de l'ingénierie logicielle. Selon l'entreprise, certains utilisateurs de génération de code intensif peuvent attendre des résultats pendant des heures, et la latence d'inférence est devenue un problème majeur affectant l'expérience utilisateur et les coûts.
L'entreprise collabore également avec certains partenaires de conception pour faire avancer l'application. Ces clients permettent aux utilisateurs de générer des jeux ou des applications via des invites, et une augmentation de la vitesse d'inférence signifie généralement une efficacité de conversion et un potentiel de revenus plus élevés.
Des petits modèles atteignent 3000 TPS
Kog avait précédemment fixé l'objectif d'"accélérer les inférences des grands modèles par 30 fois", mais les démonstrations publiques reposent encore principalement sur de petits modèles. La démonstration a utilisé le Laneformer 2B, qui compte environ 2 milliards de paramètres, atteignant une vitesse d'inférence de 3000 tokens par seconde pour une requête unique. Ce modèle est désormais open source.
Cependant, la demande du marché ne se limite pas à l'ajustement des petits modèles. Kog indique que les clients potentiels ne prévoient pas de se concentrer sur les petits modèles, c'est pourquoi l'entreprise a depuis déplacé son attention vers le développement accéléré de modèles plus grands pour répondre aux besoins réels.
Validation des capacités des grands modèles autour de septembre
Kog estime que le potentiel des GPU pour le décodage d'inférence n'a pas encore été entièrement exploité. Le PDG de l'entreprise, Gaël Delalleau, a déclaré qu'avec l'augmentation continue de la bande passante mémoire des nouveaux GPU, il reste encore beaucoup d'espace pour l'optimisation au niveau logiciel.
Le coût de cette méthode est un cycle de développement plus long. Kog indique que pour chaque nouvelle adaptation de GPU, l'équipe doit souvent consacrer plusieurs semaines, voire des mois, à la recherche au niveau matériel. Avec une équipe de 11 personnes, le nombre de puces que l'entreprise peut soutenir à court terme reste limité.
Kog prévoit d'intégrer progressivement cette méthode dans le processus de développement basé sur des agents pour prendre en charge davantage de puces et de modèles. Le point clé pour l'instant est de prouver que cette approche peut fonctionner sur de grands modèles. Delalleau prévoit que l'entreprise réalisera une accélération d'environ 10 fois pour son premier modèle majeur autour de septembre, et présentera les progrès aux clients pour favoriser un futur financement de série A.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























