Token tue les applications d'IA

By: rootdata|2026/07/30 23:58:00

Auteur : Li Nan, Huang Xiaoyi, Yoky, Sun Rui, Silicon Star

Éditeur | Wang Zhaoyang

À la mi-2026, la startup OiiOii, spécialisée dans la génération de vidéos AI, avait encore neuf chiffres en RMB sur son compte, mais elle a tout de même lancé un nouveau tour de financement.

Auparavant, elle avait signé un accord-cadre annuel avec Volcano Engine, la plateforme de services cloud de ByteDance : OiiOii doit payer 50 millions de RMB à Volcano Engine d'ici la fin de 2026.

Cela a mis un peu de pression sur la trésorerie d'OiiOii. Les 50 millions de RMB seront utilisés pour acheter l'API "pure blood version" du produit AI le plus réussi de ByteDance - le modèle de génération vidéo multimodal Seedance 2.0.

La "pure blood version" fait référence à l'API Seedance fournie par Volcano Engine via des canaux officiels, avec des droits complets.

Après que Seedance 2.0 ait émerveillé l'industrie de l'IA et l'ensemble du secteur de la production cinématographique, le marché a été inondé d'APIs Seedance d'origines diverses. Certains fournisseurs de services intermédiaires, dont l'origine est douteuse, mélangent Seedance 2.0 avec sa version allégée - Seedance 2.0 mini et Seedance 2.0 fast, et les vendent à des prix relativement bas. Les utilisateurs qui souhaitent générer un film de qualité finissent par obtenir un produit de mauvaise qualité.

L'API "pure blood version" de Seedance 2.0 est la bouée de sauvetage des applications de génération vidéo AI. Tout comme les modèles de langage de pointe dépendent de la puissance de calcul de haut niveau, comme les GPU haut de gamme de NVIDIA, les tokens générés par l'API des modèles de pointe déterminent fondamentalement les capacités des applications AI - souvent appelées AI Agents.

Ainsi, les tokens des modèles de pointe sont devenus une monnaie rare et précieuse. Et Seedance 2.0 est sans aucun doute le modèle vidéo le plus puissant sur cette planète.

Selon les informations officielles, lorsque Seedance 2.0 génère une vidéo 720p sans entrée vidéo, le prix est de 46 RMB par million de tokens, le coût d'une seconde de vidéo étant d'environ 0,99 RMB. En comparaison, le coût de génération d'une vidéo 720p avec Ling 3.0 est de 0,6 RMB, et Vidu Q3-pro est d'environ 0,68 RMB, ce qui rend Seedance 2.0 beaucoup plus cher.

OiiOii, qui excelle dans la génération de séries et de courts métrages, a besoin de la puissance de Seedance 2.0, mais dépenser près de 40 % de sa trésorerie pour acheter ses tokens semble un peu fou.

Pour les startups d'applications AI d'aujourd'hui, cela est devenu monnaie courante. Comparé aux startups de modèles de langage de grande envergure (y compris OpenAI et Anthropic) qui consacrent généralement 70 % à 80 % de leurs financements à l'achat ou à la location de GPU et au paiement de la puissance de calcul cloud, cela ne semble pas si extravagant.

Ce qu'OiiOii achète, ce n'est pas une consommation de tokens basée sur des besoins commerciaux réels, mais le droit de premier accès à l'API Seedance 2.0.

Peu de gens ont remarqué qu'OiiOii a officiellement lancé son service le 2 avril 2026, le même jour où Seedance 2.0 a ouvert ses portes aux entreprises pour des tests publics. Cela ressemble à une annonce de Volcano Engine désignant OiiOii comme l'un des premiers distributeurs de Seedance 2.0, plutôt qu'OiiOii lançant son propre agent vidéo ce jour-là.

Cela n'a pas d'importance, il est plus crucial de fournir en avant-première la "pure blood version" de Seedance 2.0.

La "pure blood version" de Seedance 2.0 est vendue avec un ensemble complet de droits, tels que l'accès à la base de données de visages, le nombre maximum de connexions simultanées, etc. Cela détermine directement si le produit de la startup peut fonctionner sans problème.

Si une application de génération vidéo AI s'adresse au grand public, les utilisateurs doivent générer des vidéos en temps réel, ce qui nécessite un nombre de connexions simultanées suffisamment élevé. Lorsque le modèle vient d'être lancé, la puissance de calcul est limitée, et sans le soutien de Volcano Engine, les utilisateurs de l'Agent doivent faire la queue, subir des délais, voire ne pas pouvoir générer de vidéos.

Un professionnel des applications vidéo AI nous a révélé que 10 millions de RMB pour un cadre annuel de Seedance 2.0 correspond à environ 400 connexions simultanées, tandis qu'un cadre annuel de 5 millions de RMB correspond à environ 200 connexions simultanées. La différence de prix se traduit directement par une différence d'expérience utilisateur.

Source de l'image : Volcano Ark

Les utilisateurs peuvent accéder à davantage de ressources de visages disponibles, plutôt que de devoir utiliser les quelques visages "AI" de plus en plus inquiétants, ce qui est également lié au prix du cadre annuel de Seedance. La différence entre acheter ou ne pas acheter est celle entre la vie et la mort du produit, vous n'avez apparemment pas d'autre choix.

"Taux de perte brut"

Alors que la capacité des modèles de pointe détermine le plafond des capacités des applications AI, après avoir "bloqué" les applications AI avec des prix élevés, le fait de facturer des frais d'abonnement aux utilisateurs en utilisant le prix des tokens comme point de référence est devenu une entreprise de "deuxième propriétaire", une équation mathématique que l'on ne peut jamais résoudre, une fonction variable sur la liste de prix d'un modèle.

Cela dit, le droit de premier accès à Seedance 2.0 obtenu par OiiOii n'est pas exclusif. Plusieurs concurrents d'OiiOii, tels que LibTV et Flova, ont également obtenu le droit de "première publication" de Seedance 2.0, annonçant presque simultanément que leurs produits étaient intégrés à Seedance 2.0, à des prix également élevés.

Volcano Engine est ainsi généreux, il ne donnera aucun traitement préférentiel à une seule entreprise pour la première publication de Seedance 2.0, même pour le cadre annuel le plus élevé. De plus, le prix de base de Volcano Engine est très strict : presque pas de remises, la consommation de tokens pour des contrats de plusieurs millions est remboursée en fonction de l'utilisation, avec un plafond de 10 %, c'est-à-dire qu'ils ne donnent qu'un bon de puissance de calcul équivalent à 10 % du montant du contrat.

D'autre part, Volcano interdit strictement la revente, afin d'éviter que des tokens à bas prix ne pénètrent sur le marché gris.

Dans ce mécanisme, un fait cruel émerge : les outils vidéo AI ne peuvent presque pas gagner d'argent à partir des tokens Seedance 2.0 à pleine puissance.

En théorie, si les tokens de Seedance 2.0 sont vendus aux clients au prix d'origine, sans tenir compte des remises, la marge brute est au maximum de 10 %. Mais en réalité, aucune entreprise d'outils de génération vidéo AI ne vendra les tokens de Seedance 2.0 à un prix plus élevé - même pas au prix d'origine. Après tout, en théorie, tout le monde peut faire des affaires directement avec Volcano Engine. Pourquoi passer par un intermédiaire pour faire du profit ?

Selon des rapports de "Intelligent Emergence" : les entreprises de séries et de production cinématographique achètent également directement l'API Seedance 2.0 "full blood", y compris des entreprises de premier plan dans l'industrie, avec un montant de recharge atteignant jusqu'à 50 millions. Cela montre clairement la demande du marché pour Seedance 2.0, et signifie que les startups d'applications AI qui obtiennent les droits les plus élevés de Seedance 2.0, si elles n'offrent pas des prix compétitifs pour les tokens, ne seront pas utilisées.

"Les produits à caractère d'outil n'ont pas de fidélité." a déclaré un investisseur en capital-risque.

Ainsi, un "chemin sauvage" est apparu : les grandes entreprises d'applications AI commencent à réduire activement leurs prix pour attirer des clients, voire à revendre directement des tokens.

La société mère de LibLib, Evoken, est la plus grande entreprise d'applications AI en termes de volume d'achat de tokens en Chine. Elle a commencé dans la communauté de modèles open source, puis s'est rapidement transformée en une plateforme de création multimodale. En même temps, elle a mené plusieurs tours de financement, récemment complétant un tour de financement de 300 millions de dollars, avec une valorisation post-financement de plus de 2 milliards de dollars, formant une barrière intégrée de capital et de produits - LibLib AI est une communauté de création et une plateforme de génération d'images, Lovart et Xingliu ciblent respectivement les marchés de conception à l'étranger et en Chine, LibTV se concentre sur la production vidéo professionnelle...

Cependant, Evoken n'a développé aucun modèle par elle-même, même pas de modèle de post-formation. Cela a conduit à des débats fréquents sur la question de savoir si cette entreprise n'est qu'une station de transit pour des modèles de pointe, sans aucune barrière technique. Mais sans aucun doute : Evoken est un gros client des tokens des modèles de pointe.

Dans le domaine des outils vidéo, LibTV est un client de premier plan de Seedance 2.0, ayant signé un gros contrat annuel de 50 millions, utilisé comme munitions pour LibTV Agent. Dans le domaine des outils de conception, l'année dernière, Nano Banana a explosé, et Lovart, sous LibLib, a également signé un contrat de plusieurs millions de dollars avec Google Cloud.

Cependant, selon des estimations de plateformes tierces telles que Similarweb : en juin 2026, le site Lovart avait environ 3,1 millions de visites par mois, et le site LibTV avait environ 2,2 millions de visites par mois. Cette échelle de trafic n'est pas négligeable, mais le trafic et la création ne sont pas équivalents. Les informations publiques indiquent que LibTV a plusieurs centaines de milliers d'utilisateurs payants, bien qu'il ait dépassé la plupart de ses concurrents, il est pratiquement certain qu'il ne pourra pas consommer tous les tokens Seedance 2.0 achetés à grands frais.

Volcano Engine n'accepte pas les "retours" de tokens, ce qui a conduit à la création de revenus secondaires pour les entreprises d'applications AI.

Le fondateur et PDG d'Evoken, Chen Mian, a mentionné dans une interview avec "Latepost" qu'il avait entendu des rumeurs selon lesquelles LibTV revendait les clés API de Seedance 2.0 pour faire du profit, mais il a clairement nié cela.

Cependant, ce que nous avons appris est que LibTV ne fait pas de "profit" en revendant les clés API de Seedance 2.0, car il les vend à perte.

Des concurrents de LibTV, qui se consacrent à la génération vidéo AI, nous ont déclaré que LibLib avait tenté à plusieurs reprises de leur vendre l'API Seedance 2.0 à un prix inférieur à celui de Volcano Engine : en achetant directement à Volcano, un contrat de plus de 10 millions de RMB peut obtenir un retour de 10 % en coupons de puissance de calcul ; mais LibLib peut encore leur offrir un retour de 10 % sur cette base.

Il n'y a évidemment pas de marge, encore moins de profit, mais cela génère des revenus. Cela peut augmenter l'ARR (revenu récurrent annuel) de LibTV, fournissant un soutien numérique pour le récit de financement ultérieur.

Cette ARR est essentiellement un revenu de "marge brute négative" : en obtenant des tokens à un prix contractuel de 90 %, soit une remise de 10 %, puis en les revendant à 10 % de réduction à des concurrents ayant besoin de tokens à un prix plus bas, la structure est celle d'une vente à perte.

Ce qui en résulte n'est même pas une marge brute, mais un "taux de perte brut".

D'autre part, la stratégie de prix de LibTV et Lovart pour les utilisateurs payants rend également la marge brute d'une entreprise d'applications AI aussi insaisissable qu'un mirage.

On peut d'abord faire un calcul approximatif...

Le prix moyen mensuel d'un abonnement annuel standard LibTV est de 47,4 yuans, et le site officiel estime qu'il peut générer une vidéo Seedance 2.0 720P de 56 secondes, ce qui équivaut à un revenu d'environ 0,85 yuans par seconde pour les abonnés. Si l'on suppose que les utilisateurs utilisent l'intégralité de leur quota pour Seedance 2.0 sans entrée vidéo, et en estimant le coût d'appel du modèle à environ 0,99 yuans/seconde selon le prix de Volcano Engine, la marge brute marginale serait d'environ -17 %. Même si 10 % des coupons de puissance de calcul pouvaient être entièrement échangés, cette marge brute marginale ne serait que d'environ -5 %. De plus, cela doit couvrir les remises nocturnes, les crédits offerts lors de l'ouverture de compte et les promotions temporaires.

La situation de Lovart est similaire. Si les points sont entièrement utilisés pour générer des images de qualité moyenne 1K avec GPT Image 2, en tenant compte des avantages de l'abonnement Pro le plus populaire et du prix promotionnel de 39 dollars en cette "fête de fin de mois", ainsi que des prix standard de l'API d'OpenAI, lorsque les utilisateurs utilisent leur quota maximal, la marge brute marginale est d'environ -87 % (il y a quelques jours, le prix moyen de cet abonnement après réduction était encore de 45 dollars, correspondant à une marge brute marginale d'environ -60 %).

Cependant, tout cela fait partie d'un "test de stress". En réalité, les utilisateurs n'utilisent pas nécessairement leur quota au maximum, et peuvent également utiliser leurs points pour des modèles et des solutions de génération à coût inférieur. Les plateformes peuvent également obtenir différents niveaux de réduction en achetant des API de différents modèles, ce qui réduit les pertes réelles.

Chen Mian, PDG de Yanyu Technology, a également répondu à ce sujet lors d'une interview avec "Latepost" : si les utilisateurs utilisent tous les tokens de leur abonnement, LibTV subira certainement des pertes. Mais si un utilisateur achète un million de points et n'en utilise que 200 000, les 800 000 restants deviennent des bénéfices. Il y a aussi des utilisateurs malveillants qui font de l'ingénierie inverse sur les comptes d'abonnement annuel de LibTV pour les transformer en API, ce qui entraîne des pertes, donc une régulation est nécessaire.

L'ingénierie inverse a un exemple clair : en février 2026, l'opérateur du compte WeChat influent dans le domaine du Web 3 et de l'IA, "Web 3 Sky City", a publié un article dénonçant l'application de design visuel Lovart, affirmant avoir payé 540 dollars pour un abonnement Lovart Pro, mais que son compte a été suspendu dix jours plus tard sans remboursement. "Le Seigneur" a tenté de faire appel par e-mail et de communiquer avec les membres de l'équipe Lovart, mais n'a reçu aucune réponse.

D'après nos informations, le compte de "Le Seigneur" a été jugé par le mécanisme de contrôle interne de Lovart comme ayant effectué de l'ingénierie inverse, et l'entreprise a également renforcé ses mesures de régulation. La décision de ne pas communiquer davantage avec "Le Seigneur" et de refuser le remboursement a été prise par Chen Mian lui-même.

Cet incident a suscité une certaine controverse, entraînant des discussions sur la transparence des mécanismes de prépaiement des logiciels d'application IA, les critères de suspension de compte et la protection des droits des consommateurs. Cela montre à quel point le modèle commercial qui espère que les utilisateurs paient sans consommer de tokens est fragile ; de plus, dans un environnement où le prix des tokens est extrêmement sensible, il existe de nombreuses failles susceptibles d'être exploitées.

En réalité, ceux qui font de l'ingénierie inverse en encapsulant des tokens d'abonnement non utilisés en API sont en fait Lovart ou LibTV eux-mêmes.

Car les tokens non consommés par les utilisateurs ne se traduisent pas réellement en bénéfices, les entreprises d'application IA ont déjà payé des frais aux fournisseurs de modèles pour ces quotas.

Ils sont inclus dans le cadre annuel. La logique des fournisseurs de modèles puissants est : ce qui est utilisé peut être racheté, ce qui n'est pas utilisé ne sera absolument pas remboursé. Le fait que 1 million de points utilisés soit de 200 000, et que les 800 000 restants deviennent des bénéfices n'existe pas. En d'autres termes, le quota de tokens "non consommés" devient en réalité "l'inventaire" des entreprises d'application IA.

Puisque c'est de l'inventaire, il faut le liquider, sinon les pertes seront plus importantes. Cela explique pourquoi d'autres équipes de génération de vidéos IA reçoivent des offres de vente de tokens à prix réduit de LibTV. La lutte officielle contre l'ingénierie inverse des utilisateurs pour revendre des tokens est en réalité une compétition pour le droit de revente des tokens avec les utilisateurs.

Comparé aux pertes causées par la vente à prix réduit de l'inventaire de tokens, les pertes dues à l'utilisation maximale des droits par les utilisateurs sont plus importantes. Même si "les tokens non consommés sont des bénéfices" peut être vrai, cela verrouille le plafond du modèle de profit - lorsque tous les utilisateurs ne rechargent que sans consommer un seul token, son profit peut théoriquement être maximisé.

Si un utilisateur consomme un token de plus, cela l'éloigne davantage des pertes. Cela crée un dangereux choix inverse : plus son prix est bas, plus il attire des utilisateurs lourds qui consomment des modèles coûteux, ces utilisateurs ayant un taux d'utilisation des points plus élevé, laissant moins de revenus résiduels à la plateforme.

Ce cycle pourrait donc élargir les pertes des entreprises d'application IA, le seul avantage étant un ARR plus attrayant à court terme.

Les entreprises d'application IA en sont conscientes, mais lorsqu'elles se présentent aux VC, elles peuvent toujours cacher ces "pièges". Un investisseur en capital-risque nous a révélé : LibLib montre aux investisseurs et au marché des capitaux une marge brute qui est très probablement positive.

Cela met à l'épreuve les "techniques financières" : crédits offerts, promotions temporaires, remises nocturnes... tous ces coûts rigides qui grignotent la marge brute peuvent être comptabilisés dans le taux de vente, et un taux de vente élevé au début peut être qualifié de "dépense de croissance" ; tous les revenus - y compris les revenus des utilisateurs pour l'achat de points d'abonnement et la revente de tokens - sont comptabilisés au prix d'origine, rendant possible d'atteindre une "marge brute positive" sous différents angles.

Dans nos échanges avec de nombreux investisseurs et entrepreneurs, un consensus émerge : même en prenant en compte la plus large des définitions, la marge brute des applications IA dont le modèle commercial est centré sur la consommation et la vente de tokens se situe généralement entre 10 % et 25 %, ce qui est presque insuffisant pour couvrir tous les coûts.

La plupart des équipes de startups d'application IA en Chine se sont tournées vers les marchés étrangers dès le premier jour, mais des personnes informées ont calculé que le coût d'acquisition d'un utilisateur payant à l'étranger est d'environ 200 dollars, tandis que l'utilisateur paie en moyenne 50 dollars, la marge brute des tokens ne couvre même pas la croissance des utilisateurs, sans parler des dépenses de recherche et développement, d'exploitation et de gestion.

Au cours des dernières années, le marché des capitaux et le cercle des startups ont préféré comprendre les applications IA sous le cadre SaaS. Mais maintenant, les investisseurs ont pris conscience : "Le SaaS devient moins cher avec plus d'utilisateurs, tandis que les applications IA, plus il y a d'utilisateurs, plus vous perdez".

Cela souligne la différence fondamentale entre les applications IA et les logiciels traditionnels - le coût marginal du SaaS traditionnel se dilue avec l'échelle, tandis que le coût marginal des applications IA réapparaît avec l'utilisation. Plus les utilisateurs consomment, plus il y a de tokens ; plus il y a de tokens, plus le coût est élevé.

Au niveau fondamental, les entreprises d'application IA gèrent "une chaîne de rotation de tokens continuellement déficitaire", c'est ce qu'on appelle le "taux de perte brute".

"Contrôleur de tokens"

Les startups d'application IA ne sautent pas dans le piège des tokens en sachant qu'il s'agit d'un feu de joie, elles se trouvent également dans le flou.

Le coût apparent d'achat de tokens auprès des fournisseurs de modèles est clair, mais la tarification des produits, les subventions aux utilisateurs et le calcul des marges sont tous dictés par le système de règlement postérieur des modèles. Au début, on pensait que la marge brute pourrait être obtenue, mais après que la facture soit arrivée, on découvre qu'il s'agit d'un taux de perte brute.

Prenons encore Seedance 2.0 comme exemple : le coût réel de génération d'une vidéo prend en compte simultanément la durée de la vidéo d'entrée, la durée de la vidéo de sortie, la résolution de sortie, le taux de rafraîchissement, la version du modèle, la durée de facturation minimale et les niveaux de durée. L'API du modèle vidéo peut facturer uniformément 4 secondes pour des durées allant de 1 à 4 secondes, et les différentes longueurs ne croissent souvent pas de manière linéaire. Les entreprises d'application IA génèrent des coûts quotidiennement après avoir signé, mais il faut généralement attendre T+N jours pour voir les frais détaillés sur la facture.

Cela constitue un état typique de "bloqué dans les tokens" : l'entreprise connaît le coût apparent des tokens, mais ne sait pas comment le coût réel sera amplifié, à quel moment et dans quelle mesure.

Cependant, les équipes de startups d'application IA ne peuvent pas échapper à cette dépendance, elles s'enfoncent même davantage. Après tout, elles ne peuvent pas se passer des "avantages" apportés par les meilleurs modèles.

Si l'on devait présenter la source des coûts des applications IA sous forme d'équation, cela serait : "Coût réel de génération = Prix de génération unique × Nombre moyen d'extractions". Cela s'applique à la vidéo, à l'image ou à la conception de PPT.

Les modèles de premier plan ont un taux de réussite élevé, ce qui réduit le nombre d'extractions, ce qui peut parfois réduire le coût de calcul de base.

Comment les équipes d'application IA doivent-elles choisir entre des modèles de premier plan à coût élevé, à bon effet, avec peu d'extractions, et des modèles de second choix à faible coût d'entrée, à faible coût d'appel, avec de nombreuses extractions, augmentant le coût global et sacrifiant potentiellement la conversion et la rétention ?

Des personnes du secteur ont révélé : pour augmenter les contrats, les clients de Keling 1.0 ont pu obtenir pendant longtemps des réductions allant jusqu'à 65 %. Ce niveau de réduction est déjà déficitaire pour le coût d'inférence de Keling, et avec la mise à niveau ultérieure du modèle Keling, le coût de calcul d'inférence augmentant, ce prix devient une perte supplémentaire. Son seul objectif est de voler des clients.

Le résultat objectif est que les fournisseurs de modèles qui tentent de vendre plus de tokens aux entreprises d'application en baissant les prix seront toujours mis de côté. Un exemple qui peut le prouver est que la demande quotidienne de Seedance 2.0 sur OpenRouter reste stable à plus de 3000 fois, tandis que Keling 3.0 n'a que 300 à 400 fois.

Ainsi, pour résoudre le "taux de perte brute" naturel, les deux solutions les plus directes sont : augmenter le prix des produits ou réduire le coût des tokens. D'après la situation actuelle, la plupart des startups d'application IA choisissent la seconde option.

En apparence, tout le monde itère activement les produits, met à jour les fonctionnalités et crée des différences, mais en réalité, une grande partie de l'énergie est consacrée à la recherche de tokens bon marché. Et les tokens bon marché proviennent de diverses sources.

Tout d'abord, la vente à bas prix des entreprises d'AI Agent en amont est un canal important.

Comme mentionné précédemment, LibLib vendra des tokens à 81 % de réduction aux équipes d'application IA qui ne peuvent pas se permettre la version complète de Seedance 2.0. Certaines startups accueillent ces "offres", tandis que d'autres craignent de violer la politique de vente de Volcano Engine et n'osent pas accepter.

Ensuite, les pairs en reconversion d'activité peuvent également fournir des tokens à bas prix.

Comme mentionné précédemment, les politiques annuelles des principaux fournisseurs de modèles sont assez strictes, avec des quotas garantis, "périmés" - si non consommés dans l'année, les tokens restants sont annulés. C'est aussi pourquoi la revente de tokens est constamment interdite par les fournisseurs de modèles, que ce soit pour limiter les pertes, récupérer des coûts ou "générer" des marges, cela oblige les équipes d'application IA à le faire.

Surtout lorsque certaines entreprises brûlent de l'argent et échouent à raconter leur histoire, incapables de continuer ou au bord de la faillite, les "énormes" quotas de tokens restants peuvent être liquidés à des prix très bas.

Un détail intéressant est que certaines entreprises dépensent des millions pour acheter des tokens, mais leur objectif principal n'est pas de faire des affaires, mais de raconter une histoire : dire au marché des capitaux qu'elles sont devenues de grands clients de modèles de premier plan, montrant leur force, et levant rapidement un nouveau tour de financement. Des personnes du secteur du capital-risque nous ont dit que l'achat de tokens dans certaines startups est déjà complètement "détaché de la réalité".

De plus, rechercher des subventions gouvernementales est un canal courant et plus fiable pour obtenir des tokens à prix réduit.

Les gouvernements locaux de niveau urbain fourniront des subventions pour la puissance de calcul ou les modèles aux entreprises d'IA reconnues sur leur territoire, permettant ainsi aux entreprises d'application de réduire le coût des tokens à environ 75 à 90 % de leur prix d'origine. Cependant, ces ressources ne sont pas courantes, et pour obtenir des tokens à bas prix, chacun doit "trouver sa propre méthode".

En fin de compte, tout le monde cherche à obtenir des tokens moins chers. Cette quête de maximisation des tokens bon marché entraînera inévitablement une prolifération de "stations de transit".

En tant qu'industrie souterraine de l'IA, les "stations de transit" sont essentiellement des grossistes de tokens qui les revendent au détail. Elles peuvent être classées en trois catégories.

La première catégorie est la revente "légale", qui consiste à acheter en gros des tokens de modèles étrangers, à obtenir des réductions et à les revendre sur le marché domestique, ce qui reste une logique de distributeur "normale".

La deuxième catégorie est celle des activités totalement illégales, souvent gérées par des individus, où l'on peut trouver des offres comme "un million de tokens pour trois yuans", avec un risque constant de fuite ou de fermeture.

La troisième catégorie consiste à "pooler" des ressources. Ces stations de transit rassemblent des quotas de tokens provenant de divers canaux éparpillés et créent une couche de routage unifiée.

Les stations de transit sont l'un des principaux canaux pour obtenir des tokens à bas prix sur le marché des applications d'IA. Cependant, les prix de ces ressources varient considérablement et leur qualité n'est pas toujours stable. Dans le domaine de la génération vidéo, le phénomène de "dilution" est courant.

Une station de transit qui "fournit" des tokens à une startup d'IA nous a dit : "Par exemple, en utilisant l'API de Keling, sur 10 appels, 8 sont de Keling et 2 sont de ce modèle de l'entreprise. Si la station de transit veut gagner plus, elle ajuste ce ratio".

Les entreprises d'application d'IA en sont conscientes, mais certaines intègrent tout de même des tokens dilués dans leurs produits, ce qui réduit encore la qualité du service pour les utilisateurs finaux. Après tout, "ne pas réussir à tirer une carte" est devenu la norme, et même si les utilisateurs soupçonnent que ce qu'ils utilisent n'est pas conforme, ils peuvent toujours trouver une explication.

Malgré ces divers canaux, les entreprises d'application d'IA cherchent encore à réduire leurs coûts.

Pour réduire légalement le coût des tokens et trouver un peu de marge brute pour leurs états financiers, certaines startups ont inventé une autre voie : concevoir leurs produits comme des contrôleurs de tokens précis — en limitant la durée, en stratifiant les forfaits, en dégradant les modèles, en cachant les paramètres, etc., afin de réduire l'impact des tokens sur la marge brute.

Concrètement, certaines applications limiteront directement la durée de génération de vidéos par les utilisateurs, par exemple en générant systématiquement des vidéos de 4 secondes, évitant ainsi le gaspillage de facturer 4 secondes pour une vidéo de 3 secondes.

Le "piège des forfaits" est une méthode encore plus astucieuse. Certaines applications ne fourniront pas le meilleur modèle dans les forfaits intermédiaires et ne donneront pas accès au modèle optimal pour les scénarios à forte consommation, tout en concevant des forfaits que les utilisateurs "ne peuvent pas épuiser", espérant que les utilisateurs soient inactifs et peu utilisés, créant ainsi un espace d'arbitrage.

Ils utiliseront des formules comme "nombre d'utilisateurs au niveau de 199 yuans × quota de 2 milliards de tokens" pour négocier des prix de gros avec les fournisseurs de modèles, obtenant des prix d'achat bien inférieurs à la demande réelle de consommation. La partie non consommée sera ensuite revendue en tant que "station de transit".

Un VC s'est plaint auprès de nous : lors de la due diligence d'une entreprise, ils ont découvert ces "irrégularités" et ont demandé si leurs utilisateurs pouvaient vraiment consommer autant de tokens, mais le fondateur a seulement souligné le nombre d'utilisateurs ayant acheté ce forfait, évitant de parler de la consommation réelle.

Les investisseurs ne sont pas contents de cela ; une entreprise dont l'activité est inversement proportionnelle à l'engagement des utilisateurs et à la marge brute n'est pas une bonne affaire.

Les applications d'IA "naissent des tokens", soulevant une question qui ébranle les fondements de l'entreprise : les produits ne sont plus conçus uniquement autour de l'expérience utilisateur, mais de plus en plus autour de "comment faire en sorte que les utilisateurs consomment moins de tokens".

Bien sûr, il existe également des moyens d'ingénierie pour réduire les coûts tout en tenant compte de l'expérience utilisateur. Par exemple, en appelant d'abord des modèles vidéo moins chers pour générer des versions basse résolution, puis en utilisant des techniques de super-résolution pour améliorer la clarté. D'autres outils d'IA réduiront le nombre d'appels en utilisant des mots-clés, des flux de travail, des contrôles de paramètres, un post-traitement, un cache et un routage de modèles, économisant ainsi des tokens.

Parmi eux, OiiOii est l'une des entreprises qui a conçu son "contrôleur de tokens" de manière assez astucieuse.

OiiOii appelle les points que les utilisateurs achètent "boîtes-repas". Contrairement à LibTV, qui a tenté de voler des clients à des prix très agressifs, le modèle principal d'OiiOii (voir plusieurs images, 10 secondes pour 140 boîtes-repas) est calculé à 0,96 yuans/seconde, avec un coût total d'environ 0,99 yuans/seconde pour l'exportation en haute définition, ce qui est à peu près équivalent à vendre les tokens de Seedance 2.0 à prix coûtant, laissant un espace de marge brute qui peut à peine être dégagé, bien que toujours mince.

Il peut le faire grâce à des conceptions de "mécanismes" astucieuses : l'interface ne montre pas les spécifications vidéo et les réductions de points, mais pousse directement les utilisateurs dans le processus de création de scénario ------ personnage ------ scène ------ plan ------ vidéo, évitant ainsi de donner aux utilisateurs l'opportunité de "ressentir la douleur" à tout moment, et ne leur dit pas si, au cours du processus de création préliminaire, ils utilisent Seedance, Keling ou Sora 2, voire d'autres modèles moins chers. Ce n'est qu'à l'étape des plans que les utilisateurs choisissent eux-mêmes le modèle. Les utilisateurs ne peuvent ni optimiser leur consommation, ni comparer les prix unitaires avec d'autres, ils doivent simplement oublier temporairement le prix ; "l'opacité" est son mécanisme de protection de la marge brute.

Cependant, OiiOii ose fixer des prix et concevoir de tels mécanismes de tokens parce qu'il jouit d'une bonne réputation et d'une certaine notoriété parmi les groupes de production de vidéos professionnelles comme les séries animées. En dehors de la lutte pour la survie avec les tokens, il a établi une certaine unicité.

Un employé de BD d'un fournisseur de services cloud qui travaille beaucoup avec des clients de séries courtes et de séries animées nous a dit : OiiOii a une certaine notoriété dans le cercle des séries courtes et animées, et récemment, LibTV a également rattrapé son retard. Ces clients mentionnent que le flux de travail de LibTV est pratique et que la toile est facile à utiliser.

Auparavant, la raison principale de l'attention portée à LibTV était son "rapport qualité-prix" controversé et son "taux de perte brute". Cependant, avec l'amélioration et la percée des produits, LibTV, qui a toujours été marqué par la réduction des prix des tokens, a également acquis une certaine légitimité pour augmenter ses prix.

En juin, LibTV Agent a été lancé. Il fait passer la génération vidéo de la création d'un seul plan à la livraison d'un film complet, en complétant automatiquement la planification, les plans, la génération et le montage grâce à des compétences professionnelles, tout en conservant le storyboard et le flux de travail pour modification manuelle ; la scène 3D, la bibliothèque de personnages et la mémoire à long terme ont également amélioré la cohérence entre les personnages et les plans.

Ensuite, LibTV a exceptionnellement et audacieusement augmenté ses prix.

Auparavant, les abonnements annuels consécutifs pour les deux niveaux de la version suprême de LibTV coûtaient respectivement 8499 yuans et 10999 yuans pour la première année, et ils ont maintenant tous deux augmenté de 1000 yuans. Le prix d'appel correspondant pour Seedance 2.0 pouvait descendre jusqu'à 0,37 yuans par seconde, et maintenant le minimum est de 0,41 yuans par seconde.

Cela a suscité des plaintes de la part de certains utilisateurs sensibles aux prix, mais avec l'amélioration de l'expérience produit, c'était une mesure inévitable.

En plus d'augmenter les prix, il existe une approche plus directe, qui consiste à cibler directement le marché étranger avec un prix relativement élevé. Pour améliorer la marge brute, presque toutes les applications d'IA chinoises privilégient le marché mondial, en particulier les régions comme l'Europe, les États-Unis et le Japon, où la volonté de payer des utilisateurs est plus élevée. Lovart, une entreprise sous la direction de Yanyu Technology, est également un acteur actif dans ce domaine.

Selon des rapports précédents d'Elsewhere : Lovart a été fortement inspiré par Manus. Manus a rapidement encapsulé ses capacités de modèle en un produit agréable à utiliser lorsque celles-ci ont franchi un seuil critique, tandis que Lovart, ayant appris que GPT-image-1 serait lancé dans trois semaines, a mobilisé les meilleurs talents de l'entreprise pour un développement fermé à Shanghai. Manus a établi un démarrage à froid en contactant activement des influenceurs technologiques de la Silicon Valley, tandis que Lovart a profité de la diffusion par des blogueurs technologiques étrangers. Une affiche de Tesla Cybertruck générée par les utilisateurs a même reçu un like d'Elon Musk.

Cependant, l'expansion de Lovart à l'étranger n'a pas été un long fleuve tranquille. Dès son lancement en mai 2025, Lovart a constitué une équipe locale dans la Silicon Valley pour s'occuper de la croissance des utilisateurs et des opérations de marché, mais cette équipe a été marquée par des turbulences. À la fin de 2025, tous les membres de l'équipe américaine, y compris la cofondatrice de Lovart, COO Liang Xinrui (Elena Leung) et la cofondatrice Aimee Yang, avaient quitté l'entreprise, et les membres actuels de l'équipe sont tous des nouveaux arrivants qui ont rejoint au premier semestre 2026.

Dans la quête d'un utilisateur "net" plus élevé sur le marché mondial, d'améliorer les produits par l'ingénierie et le design pour augmenter les prix, et de peaufiner les "contrôleurs de tokens" des applications d'IA, de plus en plus d'équipes de startups d'IA font face à des choix difficiles. Concevoir des contrôleurs de tokens de manière précise est en effet l'option la plus contrôlable en termes de résultats.

Cependant, si toutes les startups d'applications d'IA doivent d'abord se concevoir comme des contrôleurs de tokens, elles ne pourront jamais offrir une véritable expérience utilisateur ni réellement améliorer la qualité de leurs produits. Dans une compétition de marché plus large, cela pourrait les rendre encore plus passives.

La menace la plus évidente vient des géants.

Lorsque des géants de l'Internet dotés de puissantes capacités de produit, grâce à leurs propres modèles et aux capacités de modèles tiers, établissent rapidement leur matrice de produits d'applications d'IA avec des moyens financiers considérables et sans crainte de consommer des tokens, l'avenir des startups est mis sous pression. L'émergence de Tencent WorkBuddy et l'expansion de ses capacités de produit en sont un exemple que les entrepreneurs d'applications d'IA doivent surveiller de près.

Depuis son lancement en version bêta en mars 2026, Tencent a élargi son exposition via des flux d'informations WeChat, des comptes publics, des publicités dans le métro et dans les bureaux, ainsi que des mesures pour réduire le coût d'essai des utilisateurs, telles que des bonus d'inscription, des récompenses de connexion, des modèles gratuits, des crédits doublés, attirant ainsi un grand nombre d'utilisateurs pour WorkBuddy. Les itérations fréquentes qui se produisent simultanément renforcent encore la position de WorkBuddy dans la vague de productivité de l'IA.

Rien qu'en juin 2026, ce produit a au moins réalisé 17 mises à jour de version, parfois même deux par jour. En plus de corriger rapidement les bugs, WorkBuddy a rapidement intégré des applications de l'écosystème Tencent telles que Tencent Docs et WeChat Work, et a amélioré ses capacités de collaboration multi-agent, de gestion de tâches cloud et de projets d'entreprise, devenant finalement une nouvelle étoile de l'IA au sein de Tencent, surpassant Yuanbao.

Lors de la publication des résultats du premier trimestre en mai, Tencent a déclaré sans détour qu'en termes de comptes actifs quotidiens, WorkBuddy était devenu le service d'IA le plus populaire en Chine. Selon les données d'Analysys, de mars à juin, le nombre de visites mensuelles sur la version PC de WorkBuddy est passé de 8,85 millions à 20,97 millions, plus que doublant.

C'est un résultat que toute entreprise d'application d'IA envie mais ne peut pas atteindre. WorkBuddy peut tirer parti de l'ensemble des ressources de trafic de Tencent, et surtout, il n'a pas besoin de gérer avec précision les interrupteurs de son contrôleur de tokens comme une startup.

Échapper à la mort

De plus en plus d'entrepreneurs d'applications d'IA commencent à explorer des voies en dehors des tokens.

Le célèbre entrepreneur Zhang Yueguang a posté sur Xiaohongshu en juin : pour évaluer si une application d'IA est viable, les trois principaux indicateurs sont la marge brute des utilisateurs payants, le taux de renouvellement et le CAC (coût d'acquisition client). Pour réaliser les deux premiers de manière saine, il faut soit transformer le modèle commercial de vente de tokens en un autre modèle commercial, soit vendre des tokens à des utilisateurs peu sensibles au prix des tokens. "Tous les produits qui vendent des tokens à des utilisateurs sensibles au prix ne peuvent être que des affaires de fournisseurs de modèles."

Le produit entrepreneurial de Zhang Yueguang correspond à deux solutions différentes qu'il recherche.

Une entreprise est Starry, qui tente de couvrir le coût des tokens par les revenus des jeux et de la propriété intellectuelle ; l'autre est Dokie, qui essaie de faire payer les utilisateurs pour un résultat utilisable, plutôt que de comparer le coût par appel de modèle. De plus, selon ses déclarations publiques, Dokie a complètement réduit le quota d'essai gratuit pour plus de 140 pays à zéro, ce qui n'a en réalité presque aucun impact sur les paiements.

Pendant longtemps, le "token Maxxing" a été considéré comme une référence, l'industrie poursuivant frénétiquement la consommation de tokens, la voyant comme un symbole de puissance du produit et de marché florissant. Mais tout le monde a finalement réalisé que la recherche de la consommation de tokens était une dérive, et que la structure de la marge brute était le véritable indicateur. En d'autres termes, les entreprises qui vivent réellement des tokens ne sont pas celles qui brûlent plus de tokens, mais celles qui trouvent une nouvelle manière de vendre des tokens.

Le cas le plus typique se trouve dans le domaine "matériel + application", avec Plaud comme représentant emblématique.

Selon nos informations, le bénéfice net des services d'IA non matériels de Plaud a déjà atteint des dizaines de millions de dollars par an. Son objectif de vente total pour 2026 est de 500 millions de dollars, avec plus de 2 millions d'utilisateurs installés.

Cela repose sur une structure de paiement différente.

Tout d'abord, il y a le matériel lui-même. Dans l'industrie de l'électronique grand public, le prix de vente au détail doit généralement atteindre trois fois le coût des matériaux (BOM) pour que l'entreprise puisse obtenir un espace de fonctionnement durable. Le prix du Plaud Note Pro est d'environ 179 à 189 dollars, avec un coût BOM d'environ 60 dollars, ce qui donne une marge brute matérielle d'environ 67 %, conforme à cette règle.

Plus important encore, il y a les revenus d'abonnement à l'IA. Les abonnements à l'IA se divisent en deux niveaux : Pro, avec un paiement annuel équivalent à environ 8,33 dollars par mois, et Unlimited, avec un paiement annuel équivalent à environ 20 dollars par mois. Ce prix n'est ni cher ni bon marché ; l'essentiel est que son utilisation de l'IA est légère, principalement pour la transcription et le résumé, et non pour la génération vidéo ou le raisonnement agent. Selon une estimation d'un fournisseur de Plaud : en calculant les revenus d'abonnement à 8-20 dollars par mois et par personne, le coût de traitement de l'IA de Plaud est d'environ 1-2 dollars par mois et par personne, ce qui permet à Plaud d'atteindre une marge brute logicielle d'environ 75 à 90 %.

Globalement, la situation du matériel est relativement meilleure que celle des logiciels, car il n'y a pas de concurrence directe avec les entreprises de modèles et les produits de modèles, et il y a de l'espace pour des prix plus élevés.

Un entrepreneur en matériel d'IA a classé les produits sur le marché en plusieurs catégories :

  1. Matériel auto-cohérent. Grâce à une tarification trois fois plus élevée en Chine qu'à l'étranger, le matériel ne perd pas d'argent, et avec les abonnements, il peut même gagner un peu.

  2. Matériel à faible marge + abonnement compensatoire. Plaud appartient à cette catégorie.

  3. Croissance par financement, de nombreuses entreprises de matériel d'IA en phase de démarrage appartiennent à cette catégorie ; enfin, il y a le matériel à bas prix + sans abonnement. Par exemple, la plupart des produits d'IA d'accompagnement/IA de jouets en Chine dépendent principalement du matériel pour gagner un peu, tout en subventionnant les coûts des tokens.

Cependant, selon cet entrepreneur, le matériel est également en train de devenir plus compétitif, et il devient difficile de maintenir des prix trois fois supérieurs au coût BOM. "Les marges sont trop faibles, et cela sera mangé par les canaux, le service après-vente et les retours ; si l'on ne vise que la marge brute du matériel, cela pourrait également faire grimper le prix d'achat initial, affectant le volume des ventes et la conversion des abonnements ultérieurs." Si tel est le cas, alors le matériel d'IA devra également chercher d'autres voies.

En dehors des méthodes de résolution des entreprises de matériel, certaines idées plus générales commencent également à émerger.

Une tendance récente est que de plus en plus d'applications d'IA, y compris des entreprises de matériel, commencent à "former" leurs propres modèles après coup.

Récemment, le produit matériel vedette, "AI Mushroom" Swoii, a été fondé par "Oncle He", qui nous a révélé qu'ils utilisaient des modèles auto-développés pour réaliser une personnalisation à faible coût, répondant aux besoins des utilisateurs en matière de contenu généré par les utilisateurs (UGC), et améliorant la satisfaction et la volonté de payer des utilisateurs.

L'entreprise d'application d'IA Mindverse, qui a fait parler d'elle avec Macaron, est en train de se transformer en entreprise de recherche de modèles, et son Mind Lab vient de publier et d'ouvrir les poids du modèle Macaron-V1, servant à la fois ses propres produits et commençant à fournir des modèles et des capacités de formation après coup à davantage d'applications B2B.

De plus, nous avons appris que l'entrepreneur en série connu, fondateur de Teambition, et ancien vice-président des produits de Feishu et responsable des produits PC de Doubao, Qi Junyuan, a de nouveau lancé une entreprise, et son équipe développe et teste un produit d'agent IA, qui repose également dans une large mesure sur des modèles auto-développés, afin de réduire au maximum la dépendance aux API et aux tokens des fournisseurs de modèles.

Bien que ces produits aient des scénarios différents, il existe une logique commune importante derrière ces différences : de plus en plus d'entrepreneurs dédiés à la création de bons produits d'IA réalisent qu'il est beaucoup plus rentable de former un modèle par eux-mêmes et d'intégrer le modèle et l'application, plutôt que d'acheter des tokens auprès de fournisseurs de modèles.

Particulièrement pour les entreprises d'applications d'IA ayant des scénarios clairs, des données riches et un volume d'appels stable, la création de modèles verticaux par la formation après coup offre la possibilité de remplacer les coûteux API de modèles SOTA généraux par des modèles spécialisés. À mesure que le volume des appels augmente, l'investissement unique dans la formation du modèle est amorti sur le long terme, ce qui peut considérablement réduire le coût unitaire des tokens.

Si cette voie est couronnée de succès, les applications d'IA seront plus populaires. En ce qui concerne le moment présent, les projets d'IA purement logiciels ont déjà perdu de l'attrait dans le cercle des investisseurs.

Des investisseurs ont déclaré qu'au premier semestre de cette année, l'accent de certains fonds de premier plan s'est déplacé vers l'intelligence incarnée et le matériel. Ce n'est pas qu'ils ne financent pas les logiciels. Ils continuent de regarder la direction B2B, en particulier les applications spécifiques visant les "petits patrons riches" qui sont très prisées. a16z a investi en juin dans plusieurs projets d'IA liés à la dentisterie, aux opérations médicales et aux services à domicile. Dans le programme de printemps de Qiji Chuangtan, un certain nombre d'entreprises similaires visant les usines, les marques et les entreprises à l'international ont également émergé.

Ce changement n'est pas difficile à comprendre. Bien que les "petits patrons riches" se soucient des prix, ils se soucient davantage de savoir si les outils peuvent les aider à produire plus et à conclure plus de transactions. Tant que les bénéfices générés par l'IA sont nettement supérieurs aux coûts d'utilisation, des frais annuels de plusieurs milliers de dollars, voire plus, en valent la peine. Les affaires d'IA qui leur sont destinées peuvent être "petites", mais elles peuvent réellement générer des bénéfices commerciaux.

De plus, la montée en puissance de FDE est également une réflexion et une percée de l'industrie face aux difficultés des tokens d'application d'IA. FDE déplace le point d'ancrage de la valeur du produit de "combien de tokens ont été appelés" vers "qu'est-ce qui a été accompli pour le client", offrant aux startups la possibilité de facturer réellement en fonction des résultats livrés. Lorsque les tokens eux-mêmes ne déterminent plus le plafond de valeur du produit, les applications d'IA ont également la possibilité de réaliser plus de bénéfices.

En fin de compte, les tokens n'achètent qu'un billet d'entrée, et non une barrière de protection. Si l'on ne peut pas échapper à cette situation, on ne peut que subir les conséquences des tokens.

Prix de --

--

Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

Vous pourriez aussi aimer

La "nature de jeu" des Coréens est en réalité le résultat d'une vie contrainte

Cedears en juillet : l'énergie a été la grande gagnante et la frénésie pour les puces s'est désamorcée, avec des baisses allant jusqu'à 30%

Après un premier semestre dominé par les semi-conducteurs, juillet a changé la carte des gagnants parmi les Cedears. L'énergie et certaines entreprises de logiciels ont mené les hausses, tandis que les fabricants de puces, de mémoires et d'équipements pour l'intelligence artificielle ont concentré l...

DNU migratoire de Milei : vives critiques sur sa possible inconstitutionnalité

Des experts en droit constitutionnel ont contesté l'outil utilisé par le gouvernement et ont averti du manque de fondements pour promulguer le décret.

[New York : Or, Obligations, Dollar] Le prix de l'or dépasse 4100 dollars grâce à la faiblesse du dollar... Le taux des obligations à 30 ans continue de grimper

Amazon réalise un bénéfice de 62 milliards de dollars au trimestre : ce qui explique la hausse

Vaca Muerta : pourquoi les sables premium remplacent ceux de proximité et le plan pour révolutionner la logistique avec des trains, des rivières et un régime fédéral

La décision de revenir à l'utilisation des sables d'Entre Ríos a rouvert un débat stratégique pour le schiste. Une analyse privée soutient que le problème n'est plus la qualité de la ressource, mais l'infrastructure pour approvisionner une industrie qui demandera jusqu'à 12 millions de tonnes par an...
...
iconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:bd@weex.com
Programme VIP:support@weex.com