Titre original : « La Silicon Valley qui copie les devoirs de la Chine, la prochaine question est l'application de l'IA »
Auteur original : Dongcha Beating
La Silicon Valley a commencé à copier les devoirs de la Chine.
Récemment, une série de modèles ouverts à bas prix a émergé aux États-Unis, visant à rattraper les modèles open source chinois, avec des prix également réduits à un niveau similaire.
Le Thinking Machines Lab de Mira Murati a publié le mois dernier son premier modèle, Inkling. Dans l'annonce officielle, deux choses ont été mentionnées : l'architecture de base s'inspire de DeepSeek-V3, et les données d'entraînement ont été générées par Kimi K2.5.
Les personnes les plus chères de la Silicon Valley utilisent l'ossature des modèles open source chinois, alimentée par les données générées par ces modèles chinois. Il y a deux ans, cela ne se serait jamais produit.
Plus tôt cette année, Trinity-Large-Thinking d'Arcee AI a obtenu 91,9 points sur PinchBench, soit 1,4 point de moins que l'Opus d'Anthropic, mais à 4 % du prix de ce dernier.
Le PDG d'Arcee AI, Mark McQuade, a déclaré : « Nous travaillons dur pour que les États-Unis rattrapent et dépassent la Chine. »
La Silicon Valley ne copie pas seulement les modèles, mais aussi les prix fixés par les entreprises chinoises.
L'architecture peut être empruntée, les méthodes d'entraînement peuvent être reproduites, et les données peuvent être générées en masse par d'autres modèles. Une fois que les poids sont libérés, les développeurs peuvent continuer à développer. En ce qui concerne les prix, c'est encore plus simple : si une entreprise réduit ses prix, les autres devront tôt ou tard suivre.
Au cours des trois dernières années, les entreprises de modèles ont prospéré grâce aux paramètres, à la puissance de calcul et à la fermeture des sources. Maintenant, cet édifice est sur le point de s'effondrer.
Dans la nuit du 17 juillet, Moonlight a publié Kimi K3. Avec un total de 28 trillions de paramètres et un contexte de 1 million de tokens, c'est le plus grand modèle ouvert au monde.
Sur le classement de Frontend Code Arena, K3 a obtenu 1679 points, suivi de Claude Fable 5 et GPT-5.6 Sol. C'est la première fois qu'un modèle ouvert se classe devant un modèle fermé. Dans sept sous-catégories de développement frontend, il a remporté six premières places.
Elon Musk a laissé un commentaire sous les résultats : « Impressionnant ».
L'API de K3 n'est pas bon marché, facturant 100 yuans par million de tokens générés. Cependant, dans les tests horizontaux de SuperCLUE, son score de tâche est supérieur de 18 % à celui du deuxième, et le coût moyen pour terminer la même série de tâches est inférieur de 16 %.
Le coût d'un modèle ne se mesure pas à combien il coûte par million de tokens, mais à combien il faut pour réaliser une tâche complète. Plus ces deux chiffres s'éloignent, moins le prix a de signification.
Deux jours plus tard, dans la nuit, Moonlight a suspendu les abonnements des nouveaux utilisateurs C-end. Le volume de demandes sur 48 heures a largement dépassé les prévisions, et la puissance de calcul est devenue insuffisante.
Le 27 juillet, K3 a ouvert ses poids complets, accompagnés d'un rapport technique et des infrastructures de base.
Ensuite, c'était au tour de DeepSeek.
Le marché attendait depuis longtemps la version officielle de V4. Fin avril, DeepSeek a d'abord publié deux versions préliminaires, V4-Pro et V4-Flash, toutes deux prenant en charge un contexte de 1 million de tokens, que l'on appelle officiellement « l'ère de l'accessibilité des millions de contextes ». Après deux ou trois mois de silence, le 2 août, V4 Flash a été officiellement publié et ses poids ont été ouverts. Avec un total de 284 milliards de paramètres, une seule inférence active 13 milliards, et le score du test de programmation DeepSWE est passé de 7,3 à 54,4.
Le plus impressionnant reste le prix. Lors de la baisse de mai, V4-Pro a été réduit à un quart de son prix initial, ce qui était déjà la quatrième fois que DeepSeek ajustait ses prix en un mois. Lorsque Flash a été officiellement lancé, tout le monde a été surpris par son rapport qualité-prix.
« On en a pour son argent » était la règle du passé. Maintenant, les modèles chinois deviennent de plus en plus compétitifs, et les prix baissent de plus en plus. Les concurrents étrangers sont bien sûr mécontents, mais ils n'ont pas vraiment d'options. Les utilisateurs ont déjà vu des produits à la fois bon marché et efficaces, et personne ne veut revenir à des prix exorbitants.
Peu après, Alibaba a annoncé qu'il publierait les poids de Qwen3.8-Max la semaine suivante. La série Max, qui était auparavant en position de flagship fermé, commence également à s'ouvrir. Son prix international est d'environ 40 % de celui d'Opus 5, et sa sortie n'est que de 24 %.
Ces événements se sont produits en seulement 16 jours.
Les entreprises de modèles passées ont basé leurs prix sur la rareté, en disant : « Je suis le seul à pouvoir le faire, donc tu dois payer mon prix. » Sur le classement, une différence de quelques points peut entraîner des différences de prix de plusieurs dizaines de fois.
Kimi, DeepSeek et Qwen ont des routes technologiques différentes, mais ils font tous la même chose : ils augmentent leurs capacités, ouvrent leurs poids, réduisent leurs prix, puis intègrent rapidement cela dans leurs produits.
De l'autre côté de l'Atlantique, certaines personnes ont compris cette tendance.
À la fin de 2025, Arcee AI a presque tout misé sur son compte. En 33 jours, 2048 blocs B300, 20 millions de dollars, avec seulement 30 personnes dans l'entreprise. Le Trinity Large qu'ils ont produit a un total de 400 milliards de paramètres, une seule inférence active 13 milliards, et près de la moitié des données d'entraînement sont synthétiques. En juillet de cette année, Arcee a également signé un partenariat avec le département de l'énergie des États-Unis pour développer un modèle destiné à la recherche.
L'équipe, les résultats, les coûts, les commandes gouvernementales, tout y est. Pourtant, la porte du financement reste fermée.
Arcee a jusqu'à présent levé 50 millions de dollars, avec une valorisation de 240 millions de dollars. Dans le secteur des grands modèles d'aujourd'hui, cet argent ne suffit même pas à entrer dans la salle à manger, encore moins à accéder à une salle privée.
Le PDG Mark McQuade a déclaré : « Pratiquement tous les VC de premier plan nous ont refusés. »
Les modèles ouverts américains n'ont pas encore affronté la Chine, mais ils ont déjà été bloqués par leurs propres comités d'investissement.
Au premier trimestre 2026, les startups AI du monde entier ont levé 255,5 milliards de dollars, près des deux tiers étant concentrés dans trois transactions : 122 milliards pour OpenAI, 30 milliards pour Anthropic et 20 milliards pour xAI. L'argent a presque entièrement afflué vers des entreprises fermées.
Joe Floyd, partenaire d'Emergence Capital et investisseur précoce d'Arcee, a déclaré qu'il avait entendu des raisons similaires de refus de la part de nombreux VC :
« Je ne veux pas que ce modèle réussisse. Je ne veux pas investir, car cela nuirait à mes investissements dans Anthropic et OpenAI. »
Ceux qui sont vraiment prêts à dépenser de l'argent pour des modèles ouverts sont en fait des vendeurs de puces.
En mars de cette année, Nvidia a révélé dans un document SEC qu'elle prévoyait d'investir 26 milliards de dollars au cours des cinq prochaines années pour soutenir les poids ouverts. Reflection AI, Poolside et Thinking Machines Lab ont tous reçu de l'argent de sa part.
Jensen Huang comprend cela mieux que quiconque. Les modèles fermés gagnent de l'argent grâce aux API, tandis que les modèles ouverts consomment des cartes. Plus les modèles sont vendus à bas prix, plus les développeurs en utilisent, et mieux Nvidia vend ses cartes.
Le 24 juillet au soir, Jensen Huang a enregistré un compte X, et son premier tweet était le partage d'une lettre ouverte intitulée « Poids ouverts et leadership des États-Unis dans le domaine de l'IA ». La lettre stipule que pour que les États-Unis continuent de diriger ce secteur, il ne suffit pas d'avoir les modèles les plus avancés, mais aussi un écosystème capable de se diffuser dans tous les secteurs.
Plus tard, près de 200 fondateurs de startups américaines ont co-signé une lettre adressée au gouvernement Trump, s'opposant à l'interdiction des modèles ouverts chinois. Ce qui m'a le plus intéressé dans cette lettre, c'est qu'elle ne contient aucune belle phrase. Ils n'ont pas dit du bien de la Chine, ni brandi le drapeau du libre-échange, mais simplement que les modèles chinois bon marché sont devenus des outils de production, et s'ils sont vraiment interdits, ils devront retourner acheter des API américaines coûteuses.
McQuade a également déclaré dans une interview qu'il ne s'agissait que d'une question de temps avant que la large diffusion ne se produise.
La Silicon Valley débat encore de la nécessité de faire des poids ouverts, tandis que la Chine a déjà commencé à franchir la prochaine étape.
Les mots « année des applications IA » ont été répétés de nombreuses fois au cours des trois dernières années. Mais pour juger si une technologie est vraiment entrée dans sa phase d'application, il suffit de regarder deux choses : les utilisateurs sont-ils prêts à débourser de l'argent, et les entreprises l'intègrent-elles dans leurs activités.
Cette année, les revenus annuels de Claude Code et Cursor ont tous deux dépassé 1 milliard de dollars, et le taux de pénétration des outils de programmation IA parmi les développeurs individuels approche 50 %.
Les changements sont encore plus marquants du côté des entreprises. Selon une enquête de Sand Dune Think Tank, le taux d'adoption des agents IA par les entreprises chinoises est passé de 17,3 % fin 2024 à 40,3 % à la mi-2026.
Li Yanhong a proposé un nouvel indicateur, appelé DAA, le nombre d'agents actifs quotidiens. Auparavant, les entreprises Internet comptaient combien de personnes ouvraient leurs produits chaque jour, mais à l'avenir, elles compteront combien d'agents travaillent réellement et quels résultats ils livrent.
La courbe d'utilisation est encore plus impressionnante. Selon les statistiques de CCTV, le volume moyen quotidien d'appels de tokens en Chine est passé d'environ 100 milliards début 2024 à 140 trillions fin mars de cette année, multipliant par plus de mille en deux ans.
Les modèles deviennent de moins en moins chers, mais la puissance de calcul devient de plus en plus rare. En mars de cette année, Tencent Cloud, Alibaba Cloud et Baidu Intelligent Cloud ont successivement augmenté leurs prix de calcul en l'espace de dix jours, avec une augmentation d'environ 30 %. Au cours du premier semestre, avec l'explosion des agents, le prix de location de la puissance de calcul d'inférence a également augmenté de plus de 40 %.
La raison en est que la manière dont les gens utilisent l'IA a changé. Auparavant, il suffisait de poser une question pour obtenir une réponse, ce qui ne coûtait pas beaucoup de tokens. Maintenant, un agent doit vraiment accomplir une tâche, en utilisant le contexte, en ajustant plusieurs outils, en vérifiant plusieurs fois, et s'il se trompe, il doit tout recommencer. Le prix unitaire a baissé, mais la consommation a explosé.
La baisse des prix n'a pas réduit le marché, elle a intégré toute la demande qui était auparavant difficile à quantifier.
En 1981, IBM a ouvert l'architecture PC, et les machines compatibles ont rapidement envahi le marché, faisant chuter les prix du matériel. Au final, ceux qui ont vraiment gagné de l'argent ne sont pas ceux qui fabriquaient les machines, mais ceux qui ont développé des logiciels comme Lotus 1-2-3, WordPerfect, et plus tard Microsoft.
Aujourd'hui, ce chemin est presque identique. Tout le monde se concentre sur les capacités de base, tandis que les entreprises en haut de la chaîne commencent déjà à attirer des utilisateurs, à capturer des points d'entrée et à s'emparer des flux de travail.
Les entreprises américaines peuvent étudier l'architecture de DeepSeek, utiliser les données générées par Kimi, ou dépenser 20 millions de dollars pour entraîner un modèle ouvert avec de bons résultats. Mais l'application n'est pas si facile à reproduire.
Il n'y a pas de poids téléchargeables pour l'application, ni de benchmark. Ce qui détermine si elle peut fonctionner ou non, c'est l'expérience accumulée par une entreprise au fil des années.
Les grandes entreprises avaient l'habitude de faire des modèles des produits indépendants, attendant que les utilisateurs ouvrent spécifiquement une fenêtre de chat. Maintenant, les modèles commencent à s'intégrer dans DingTalk, Feishu et WeChat d'entreprise, l'Agent s'insérant directement dans les organisations et les processus existants.
Aux États-Unis, un Agent de bureau peut se développer le long de Gmail, Slack et Salesforce. En Chine, il commencera par DingTalk, Feishu et WeChat d'entreprise, puis se connectera aux logiciels de comptabilité, à la chaîne d'approvisionnement, aux systèmes d'usine et aux plateformes gouvernementales. Même si les deux côtés utilisent le même modèle, les produits finaux ne seront pas identiques.
De 2022 à 2025, les restrictions américaines sur les puces à destination de la Chine se sont intensifiées. H100 ne se vend pas, B300 ne se vend pas, les procédés avancés et les équipements de fabrication sont également contrôlés. Dans de telles conditions, les entreprises chinoises ont créé le plus grand modèle ouvert au monde.
En 2026, les États-Unis ont commencé à discuter des restrictions sur les poids des modèles chinois. OpenAI et Anthropic auraient déjà exprimé leurs préoccupations aux régulateurs, et le Congrès étudie si les poids des modèles peuvent encore circuler à l'international.
La lame n'est pas encore tombée, mais les gens de l'intérieur se plaignent déjà.
L'interdiction des puces bloque l'approvisionnement des entreprises chinoises, mais l'interdiction des modèles touche d'abord le coût des startups américaines. La lettre signée indique clairement que l'interdiction ne peut pas arrêter la diffusion, elle ne fera que forcer les développeurs à télécharger tous les modèles disponibles avant la fermeture.
Les puces sont des entités physiques, elles peuvent bloquer les commandes, la logistique et les usines de sous-traitance. Les poids, une fois sortis, peuvent être téléchargés, dupliqués, quantifiés, ajustés et distillés à l'infini.
Ce qui est encore plus difficile à contrôler, c'est le prix.
Les États-Unis restent en tête dans le domaine des modèles fermés de pointe. OpenAI et Anthropic sont toujours en première ligne, et l'entraînement des modèles les plus avancés dépend encore des cartes de Nvidia, et cela ne changera pas à court terme.
Cependant, dans le domaine de l'application, le succès ou l'échec n'est que rarement déterminé par un modèle particulier. Cela dépend de la compétitivité des prix des modèles, de l'existence d'une entrée numérique prête à l'emploi pour les entreprises, et de la capacité des développeurs à s'intégrer réellement dans les processus d'affaires.
En regardant les trente dernières années, la Chine a gagné de nombreuses fois, mais les méthodes étaient généralement les mêmes.
Les paiements mobiles, le commerce électronique, les livraisons, les diffusions en direct, tout cela consiste à intégrer des technologies inventées à l'extérieur dans le quotidien de plus d'un milliard de personnes, pour en faire des affaires de grande envergure. La base fondamentale a longtemps été fournie par d'autres. Les transistors viennent des laboratoires Bell, x86 appartient à Intel, TCP/IP a été financé par le gouvernement américain, Windows, Android et iOS ont tous émergé sur la côte ouest. Même les frameworks de deep learning les plus utilisés, TensorFlow et PyTorch, proviennent respectivement de Google et de Meta.
"L'invention vient des États-Unis, la mise à l'échelle vient de Chine", cette phrase a été répétée pendant trente ans, avec très peu d'exceptions réelles.
Maintenant, une exception est apparue.
La documentation technique de Thinking Machines Lab est très claire. L'une des nouvelles entreprises les plus en vue et les plus riches de la Silicon Valley a référencé l'architecture d'une entreprise chinoise pour sa base de modèle, et a utilisé les données générées par un autre modèle chinois après l'entraînement.
Dans le passé, la Silicon Valley achetait des capacités, recrutait des talents ou cherchait des marchés en Chine. Maintenant, elle commence à suivre directement les routes technologiques validées par les entreprises chinoises.
L'admiration de la Silicon Valley a bien sûr ses origines. Au cours des dernières décennies, la plupart des technologies de base les plus importantes de l'industrie informatique ont effectivement émergé de là. Des puces dans les machines aux IDE que les programmeurs ouvrent chaque jour, la Silicon Valley a longtemps été en amont de la chaîne technologique.
Mais dans le monde technologique, ce qui compte finalement, ce sont les résultats. Qui peut proposer de nouvelles architectures, qui peut réduire les coûts, qui peut inciter ses pairs à imiter, a le droit de redéfinir l'amont.
Maintenant, les noms des entreprises chinoises commencent à apparaître sur cette liste.
La Silicon Valley rattrapera probablement son retard, car elle dispose d'un nombre suffisant d'ingénieurs, de capitaux et de puces. Mais les applications qui ont déjà été intégrées dans des affaires réelles ne s'arrêteront pas pour attendre les autres. Celui qui s'intègre le premier dans les processus d'entreprise obtiendra d'abord les clients, les données et l'opportunité de la prochaine amélioration. La ligne de départ n'a jamais été la même.
L'ère de l'application de l'IA ne s'ouvrira pas avec des tambours et des fanfares. Elle apparaîtra d'abord dans les états financiers, dans l'augmentation explosive des appels, dans un programmeur qui a encore une fois épuisé son quota au milieu de la nuit.
La large diffusion n'est qu'une question de temps. Cette phrase a été prononcée par un Américain.
Lien vers l'article original
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.





























