La ligne de coupe des grands modèles chinois a été coupée

By: www.theblockbeats.info|08/10/2026 07:16:28

Titre original : « La ligne de coupe des grands modèles chinois a été coupée »
Auteur original : Sleepy

Le 8 octobre, Anthropic a lancé Haiku 5.5. Pour les requêtes courtes ne dépassant pas 100 000 tokens, le coût est de 0,1 USD par million de tokens en entrée et de 0,5 USD en sortie, soit seulement un dixième de la génération précédente, Haiku 4.5.

Ce matin-là, Haseeb Qureshi, associé directeur de Dragonfly, a posté sur X deux graphiques en nuage de points d'Artificial Analysis, accompagnés de la phrase :

« Si vous voulez les LLMs les moins chers, vous devriez maintenant acheter américain. »

L'axe horizontal du graphique représente le coût d'accomplissement d'une tâche de référence, tandis que l'axe vertical indique le score. La ligne pointillée reliant toutes les solutions optimales est appelée frontière de Pareto en microéconomie, chaque point sur cette ligne signifiant qu'il n'existe pas de modèle plus intelligent à coût égal.

Sur le graphique de juin, l'extrémité la moins chère de la ligne pointillée était occupée par les noms de modèles chinois tels que Xiaomi MiMo, DeepSeek V4 Pro, MiniMax-M3 et Zhizhu GLM-5.2.

Le 8 octobre, toute la ligne a été prise en charge par Anthropic et OpenAI. Le modèle chinois qui reste encore à la marge est MiMo, tandis que Zhizhu GLM-5.3-Flash et DeepSeek V4.1 Flash ont été repoussés dans le coin inférieur droit de Haiku 5.5, signifiant qu'ils coûtent plus cher et obtiennent un score plus bas en comparaison.

Lorsque la bourse de Hong Kong a ouvert ce jour-là, les actions des entreprises liées aux grands modèles ont chuté. À 10h26, MiniMax a vu sa baisse s'élargir à 10 %, tandis que Zhizhu a chuté de 5,6 %. L'indice Hang Seng Tech a baissé de 1,93 %, et les deux nouvelles entreprises de grands modèles ont sous-performé le marché de près de cinq fois.

Au cours des deux dernières années, les modèles open source et à coût élevé de la Chine ont établi une ligne de coupe dans le marché mondial des grands modèles. Tant que le prix est maintenu bas, les modèles fermés à volume élevé à l'étranger auront du mal à survivre. Les entreprises vedettes de la Silicon Valley se sont alignées pour remplacer leurs pipelines de base par des modèles open source chinois.

Aujourd'hui, la table a été renversée.

La ligne de coupe a été coupée.

Formation de la ligne de coupe

En mars 2023, lorsque GPT-4 a été lancé, le prix officiel de la version avec un contexte de 8K était de 30 USD par million d'entrées et de 60 USD par million de sorties.

L'intelligence était extrêmement rare, l'offre étant monopolisée par quelques oligopoles de la Silicon Valley, le prix étant entièrement un marché de vendeurs. C'était une lune de miel où l'on croyait que « l'intelligence pouvait être valorisée seule ».

C'est une équipe technique incubée par un fonds de couverture quantitatif chinois qui a brisé ce mythe. Le 6 mai 2024, DeepSeek a lancé V2. Avec 2360 milliards de paramètres au total, chaque token n'active que 21 milliards ; grâce à l'architecture MLA et à une ingénierie de pointe, l'équipe a réduit le cache KV de 93,3 %, augmentant le débit à 5,76 fois. La puissance de calcul économisée se traduit directement par un prix commercial, à 1 RMB par million d'entrées et 2 RMB par million de sorties.

Les grandes entreprises nationales ont presque été contraintes de participer à cette guerre des prix.

Le 15 mai, ByteDance a lancé Doubao avec un prix d'entreprise de 0,0008 RMB par millier de tokens pour son modèle principal, affirmant qu'il était 99,3 % moins cher que le prix moyen du secteur. Le 21 mai, Alibaba Cloud a annoncé une réduction drastique des prix pour la série Qianwen, avec un coût d'entrée de Qwen-Long équivalent à seulement 0,5 RMB par million de tokens ; quelques heures plus tard, Baidu Wenxin a annoncé que ses deux modèles principaux seraient gratuits.

En août, DeepSeek a introduit une technologie de cache de disque, facturant seulement 0,1 RMB par million de tokens pour les tokens d'entrée en cache.

À l'époque, de l'autre côté de l'océan, les géants n'avaient pas encore suivi l'ensemble du mouvement. En juillet 2024, OpenAI a lancé GPT-4o mini, avec des coûts d'entrée et de sortie réduits à 0,15 USD et 0,6 USD ; mais quatre mois plus tard, Anthropic a lancé Claude 3.5 Haiku, avec un prix quatre fois supérieur à la génération précédente. La logique de Dario Amodei à l'époque était que le modèle étant devenu plus intelligent, le prix devait refléter cette avancée intellectuelle.

Ce qui a réellement fait frémir la Silicon Valley, c'est le mois de janvier 2025.

DeepSeek-R1 a fait son apparition, avec des performances d'inférence approchant celles d'OpenAI o1, tout en ne coûtant que 2,19 USD par million de tokens, alors qu'à ce moment-là, le prix de o1 était de 60 USD.

Le 27 janvier, Nvidia a vu sa valeur boursière chuter de près de 589 milliards de dollars en une seule journée, établissant un record historique sur le marché boursier américain. Marc Andreessen a qualifié cela de moment Spoutnik dans le domaine de l'IA, et le PDG de Microsoft, Satya Nadella, a exprimé sur les réseaux sociaux que le paradoxe de Jevons s'était encore une fois révélé vrai.

La ligne de coupe s'est ainsi formée.

L'ouverture des poids a rendu cette arme encore plus tranchante. Face aux modèles fermés, les clients ne peuvent faire que des calculs entre quelques tableaux de prix monopolistiques ; mais une fois que les poids sont ouverts, les développeurs peuvent déployer en privé sur leur propre cluster ou exécuter le même modèle sur n'importe quel cloud d'inférence tiers. Avec un même modèle disponible chez plusieurs fournisseurs, les clients ont également plus d'options de déploiement privé, réduisant ainsi l'espace pour que les fournisseurs de modèles maintiennent une forte prime.

Un certain nombre d'entreprises américaines ont été les premières à traverser la rivière.

En octobre 2025, le PDG d'Airbnb, Brian Chesky, a déclaré publiquement que le service client intelligent de l'entreprise dépendait fortement d'Alibaba Qianwen, le système entier coordonnant 13 modèles, bien qu'il ait également intégré le dernier fleuron d'OpenAI, il était très rarement utilisé dans la chaîne de production, car il y avait des alternatives plus rentables.

Ce mois-là, Cognition a lancé SWE-1.5, affirmant qu'il était construit sur « une base open source leader dans l'industrie », ce que Zhizhu a ensuite confirmé comme étant GLM-4.6.

Peu après, le partenaire de a16z, Martin Casado, a révélé à The Economist qu'environ 80 % des startups d'IA américaines présentant des architectures de modèles open source utilisaient des bases chinoises.

En mars de cette année, l'éditeur de code Cursor a lancé Composer 2, avec un prix de 0,5 USD par million d'entrées et de 2,5 USD par million de sorties, l'équipe a finalement admis que l'optimisation de la base était basée sur Kimi K2.5 de Moonlight.

Les développeurs votent avec leur code et leur budget. Un rapport publié par Mozilla montre que la part de marché des modèles open source chinois sur OpenRouter est passée de moins de 2 % fin 2024 à plus de 45 % en avril 2026.

Dans l'écosystème des appels à volume et structurés, les modèles fermés, autrefois arrogants, n'avaient pas de chance de riposter.

Coût

Couper ses concurrents ne signifie pas nécessairement vivre dignement.

Dans le même rapport de Mozilla, il y a un ensemble de données comparatives. De mai à septembre 2025, les modèles ouverts représentaient environ 20 % de l'utilisation des modèles sur la plateforme OpenRouter, mais n'ont obtenu qu'environ 4 % des revenus des modèles. C'est un échantillon d'une plateforme à un moment donné, qui ne peut pas représenter le marché mondial, mais l'écart entre la part d'utilisation et la part de revenus est déjà très évident.

Créer de la valeur n'est jamais synonyme de capturer de la valeur.

En janvier de cette année, Zhizhu et MiniMax ont respectivement sonné la cloche. Les résultats intermédiaires qui ont suivi ont permis au public de voir clairement les coûts et les pertes derrière la croissance des revenus.

Zhizhu a enregistré un revenu de 9,54 milliards de RMB au premier semestre, dont 8,25 milliards de RMB provenaient de la plateforme ouverte et des revenus API, représentant 86,5 %. La marge brute de cette activité est déjà passée de négative à positive, atteignant 24,6 % ; mais l'entreprise a tout de même enregistré une perte nette d'environ 20,72 milliards de RMB, soit une réduction de 12,1 % par rapport à l'année précédente. Vendre plus de tokens commence à générer une marge brute, mais il reste encore un chemin à parcourir pour couvrir toutes les dépenses de l'entreprise.

MiniMax a enregistré un chiffre d'affaires d'environ 117 millions de dollars au premier semestre, en hausse de 283,1 % ; la perte nette était d'environ 358 millions de dollars, soit une réduction de 11 %. Après ajustement pour les paiements en actions, les variations de la juste valeur des passifs financiers et les frais d'introduction en bourse, la perte nette ajustée était d'environ 293 millions de dollars, soit une augmentation de 111,2 %.

Après l'introduction en bourse, la croissance due aux bas prix doit subir un autre examen. Combien de marge brute chaque appel peut-il réellement laisser, et cette marge peut-elle couvrir les dépenses de recherche et d'exploitation ? La croissance des revenus est rapide, mais l'entreprise est encore loin de la rentabilité globale.

Au printemps de cette année, la vague d'Agents a poussé la consommation de puissance de calcul à son point critique.

Le projet open source OpenClaw a envahi la communauté des développeurs du monde entier, atteignant plus de 8,52 billions de tokens consommés sur OpenRouter début mars, se plaçant en tête. Au cours d'une semaine de mi-mars, les modèles chinois ont généré 7,36 billions de tokens en une semaine, avec une augmentation de 56,9 % par rapport à la semaine précédente.

Le GLM-5, lancé le 12 février, a brièvement atteint le sommet des appels, la demande débordante a instantanément dépassé le quota d'infrastructure. Les développeurs étrangers et nationaux ont commencé à se plaindre intensément que le GLM Coding Plan présentait des délais de seconde et des limitations de fréquence, ce qui a été la première fois que les principales équipes d'IA chinoises ont publiquement demandé des ressources de calcul.

Le 23 février, le prix des actions de Zhizhu a chuté de près de 23 % en une seule journée, entraînant une perte de plus de 70 milliards de HKD de valeur boursière.

Ce qui a suivi a été une série d'augmentations de prix défensives.

Zhizhu a augmenté ses tarifs lors du lancement du GLM-5, et le prix du GLM-5-Turbo de mars a de nouveau augmenté de 20 %, coûtant en moyenne 83 % de plus que la génération précédente.

DeepSeek a lancé le V4-Pro le 24 avril avec 16 billions de paramètres au total, offrant immédiatement une remise de 75 % sur le pic. Ce feu a d'abord brûlé les concurrents, MiniMax ayant chuté de 9 % et 10 % au cours de deux jours de négociation consécutifs.

Mais à la mi-août, DeepSeek a également adopté une stratégie de tarification horaire, le coût de sortie du V4-Pro atteignant 3,96 USD par million de tokens en période de pointe, et le coût de cache a augmenté de plus de 12 fois.

En juillet, Moonlight a lancé Kimi K3, avec un prix API porté à 3 USD par million d'entrées et 15 USD par million de sorties, soit plus de trois fois le prix de K2.6.

Cependant, ce qui est surprenant, c'est que l'augmentation des prix n'a pas entraîné une perte de clients significative.

Le PDG de Zhizhu, Zhang Peng, a révélé publiquement qu'après une augmentation de prix de 83 % au premier trimestre, le volume des appels API a en fait explosé de 400 %. À la fin août, les revenus annuels de la plateforme MaaS de Zhizhu ont atteint 1,6 milliard de dollars, et la marge brute de l'activité API a miraculeusement atteint 24,6 %.

Dans une fenêtre de quelques mois où la demande en puissance de calcul a dépassé l'offre, l'équipe de modèles chinois a pour la première fois touché à un précieux pouvoir de tarification.

Cependant, cette ligne de coupe qui avait autrefois causé des nuits blanches aux géants étrangers a été, sans qu'ils s'en rendent compte, élevée par eux-mêmes.

Blitzkrieg

De l'autre côté de l'océan, un tournant stratégique a été achevé cet été.

À la fin juin, Anthropic a lancé Sonnet 5, marquant un prix promotionnel de lancement de 2 dollars pour chaque million d'entrées et 10 dollars pour les sorties, déclarant clairement qu'il reviendrait à 3 dollars et 15 dollars en septembre.

Mais en juillet, OpenAI a lancé la série GPT-5.6, et trois semaines plus tard, a soudainement déclenché une blitzkrieg, réduisant le prix de Luna de 80 %, avec un prix d'entrée tombant à 0,2 dollar et un prix de sortie à 1,2 dollar.

OpenAI a attribué cette baisse de prix à une reconstruction purement technique, le noyau GPU réécrit ayant réduit le coût de service de bout en bout d'environ 20 %, et le modèle de décodage spéculatif réentraîné ayant accéléré le débit de génération de plus de 15 %.

Le 10 août, Anthropic a retiré son annonce d'augmentation de prix, annonçant que Sonnet 5 serait définitivement verrouillé à un prix bas.

Le 22 septembre, Anthropic a présenté Opus 5.5, réduisant le coût d'utilisation global de 40 % ; le même jour, OpenAI a lancé GPT-6 Sol et Luna, avec un prix d'entrée fixé à 0,1 dollar et un prix de sortie à 0,5 dollar. Ensuite, est venu Haiku 5.5.

Il y a deux ans, Anthropic croyait fermement que "l'intelligence devait bénéficier d'une prime distincte", mais a maintenant arraché son propre étiquetage.

Maintenant, le discours lors du lancement des grands modèles a également changé. Ils ne se contentent plus de lister les légères victoires de MMLU, mais commencent à souligner à plusieurs reprises l'efficacité de l'ingénierie en termes de production par dollar, de latence et de consommation à chaque étape de raisonnement.

De plus, au moment du lancement de Haiku 5.5, Anthropic a annoncé qu'il fournirait des quotas API à tous les utilisateurs abonnés, offrant entre 100 et 200 dollars par mois pour le niveau Max, et jusqu'à 500 dollars de réduction pour les utilisateurs d'équipe d'entreprise.

Cette manœuvre est un coup dur. Les remises sur la liste des prix n'affectent que les décisions d'appel uniques, mais une fois que le code du client et l'orchestration de l'agent sont adaptés, les barrières à la migration seront aussi hautes que des murs.

Les géants américains osent déclencher cette guerre des prix grâce à un fonds et à des privilèges de chaîne d'approvisionnement insondables.

Les revenus d'exploitation annuels d'Anthropic sont passés d'environ 9 milliards de dollars fin 2025 à plus de 65 milliards de dollars fin juillet de cette année. Le financement de 65 milliards de dollars réalisé en mai a directement propulsé sa valorisation à 965 milliards de dollars.

Sur le plan de la puissance de calcul, Anthropic a annoncé en avril qu'il élargissait sa coopération avec Google et Broadcom, obtenant une capacité de calcul TPU de nouvelle génération de plusieurs gigawatts, qui devrait être mise en ligne progressivement à partir de 2027.

En comparaison, Zhizhu a difficilement levé plus de 70 milliards de dollars de Hong Kong cette année par le biais d'une émission et d'obligations convertibles, ce qui, en dollars, ne représente même pas un septième des munitions d'Anthropic.

Seuls les super géants peuvent se permettre de débourser de l'argent.

Le marché secondaire ne fait jamais de quartier.

Zhizhu a été introduit à la Bourse de Hong Kong le 8 janvier, avec un prix d'émission de 116,2 dollars de Hong Kong. La pénurie de puissance de calcul au printemps n'a pas pu arrêter l'enthousiasme des haussiers, et le 22 juin, son prix a grimpé à 2980 dollars de Hong Kong, atteignant une capitalisation boursière de 1,33 trillion de dollars de Hong Kong.

Puis est venue une longue chute.

Avec la levée de l'interdiction de vente en juillet, deux émissions ont fait chuter le prix d'émission de 1588 dollars de Hong Kong à 714 dollars de Hong Kong. Le 16 juillet, le Kimi K3 a été lancé, et le lendemain, Zhizhu a chuté de 28,48 %. Le 22 septembre, avec le lancement conjoint d'Opus 5.5 et GPT-6, Zhizhu a de nouveau chuté de plus de 10 %.

Le 25 septembre, Zhizhu a atteint un creux de 610,5 dollars de Hong Kong, avec une capitalisation boursière réduite à environ 300 milliards de dollars de Hong Kong, soit une baisse de près de 80 % par rapport à son sommet historique.

La trajectoire de MiniMax est tout aussi tragique. Tombant de son sommet de 1330 dollars de Hong Kong, il a chuté de 17,98 % le jour de la levée de l'interdiction, et a clôturé à 216 dollars de Hong Kong à la mi-juillet. Près de 60 % de ses revenus du premier semestre dépendaient de clients étrangers, et l'étranger est le champ de bataille le plus touché par la tempête de baisse de prix des géants américains.

Les critères de valorisation commencent également à se resserrer. Selon les médias, Jefferies a abaissé dans son rapport de recherche de septembre le multiple de valorisation des revenus annuels prévus pour 2026 de l'activité cloud de Zhizhu, de 50 fois à 30 fois, soit une baisse de 40 %.

Les modèles chinois avaient autrefois volé des parts de marché aux géants grâce à un rapport qualité-prix exceptionnel, mais maintenant, ce chemin est également ouvert de l'autre côté de l'océan. Les développeurs viennent pour le prix bas, et naturellement, ils partiront pour un prix encore plus bas.

Le fantôme de 0,1 dollar

Le 25 août 2006, Jeff Barr a écrit un article présentant la version bêta d'Amazon EC2 sur une plage chaude à Cabo San Lucas, au Mexique.

À la fin de la description technique, il a écrit un chiffre qui allait entrer dans l'histoire commerciale : les développeurs louaient une instance de calcul virtuelle pour 0,1 dollar de l'heure.

L'histoire qui a suivi est bien connue. AWS a réduit ses prix plus de cent fois au cours des dix années suivantes, et en 2014, le tarif de stockage S3 a été réduit de 51 %.

L'informatique en nuage n'a jamais réussi à établir sa domination en vendant des puissances de calcul équivalentes à des prix de plus en plus élevés. L'échelle, les puces développées en interne et l'exploitation optimale ont extrait chaque centime de profit marginal, qui a été continuellement réinvesti sur le marché final, attirant ainsi davantage de développeurs. AWS, qui a continuellement baissé ses prix, est finalement devenu une vache à lait avec des revenus annuels proches de 130 milliards de dollars et une marge opérationnelle de 35,4 %.

La guerre des prix est la dernière tactique d'encerclement des monopoles à grande échelle.

Aujourd'hui, ceux qui peuvent faire baisser le prix des modèles à un dixième et les publier immédiatement sur les trois grandes plateformes de cloud public ne se contentent pas de vendre des tokens, mais digèrent également les tokens. Anthropic, tout en réduisant les prix des API, utilise également sa grande puissance de calcul pour alimenter Claude Code, Cowork et ses propres produits d'agent de bout en bout.

Les équipes de grands modèles chinois n'ont toujours pas déposé les armes. En septembre, DeepSeek a de nouveau réduit les tarifs de la série Flash, Xiaomi a poussé MiMo-Flash à la limite de 1 yuan pour un million de tokens, et Zhizhu a également maintenu le prix de GLM-5.3-Flash dans une zone de faible profit. Mais les règles du jeu sur la table ont déjà été réécrites.

Le bas prix lui-même n'est plus une carte avec un fossé exclusif.

Sur ce graphique à points mis à jour en temps réel par Artificial Analysis, aucun des noms des entreprises chinoises n'est absent. GLM, DeepSeek, Kimi, Qianwen, MiniMax sont toujours présents.

Cependant, ils ne peuvent plus tracer cette ligne de coupe.

Lien original

Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

Vous pourriez aussi aimer

iconiconiconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:bd@weex.com
Programme VIP:support@weex.com