Morgan Stanley interprète : Les prix des Tokens et des H100 baissent simultanément, les coûts de l'IA commencent-ils à se stabiliser ?
TL;DR
· Un suivi sectoriel de juillet 2026 montre que les prix des Tokens d'entrée et des locations de H100 ont chuté simultanément.
· La baisse des prix se produit dans un contexte où le volume d'appels a augmenté de plusieurs fois et où le taux d'utilisation des GPU reste élevé.
· La pression sur les coûts a déjà diminué, mais l'offre de Tokens de sortie, HBM et clusters haut de gamme limite encore l'ampleur de la baisse des prix.
Le rapport "Data Center Watch" publié par Morgan Stanley en juillet montre que les prix des appels d'IA et des locations de GPU haut de gamme ont simultanément commencé à se stabiliser.
La signification directe de cette information est que la phase la plus tendue de l'infrastructure IA commence à se relâcher. Pour les utilisateurs ordinaires et les clients d'entreprise, la baisse des prix des Tokens d'entrée rend l'appel à de grands modèles moins cher. Pour les entreprises d'applications IA et les fournisseurs de cloud, la baisse des loyers H100 indique que le marché de la puissance de calcul n'est plus aussi saturé qu'auparavant.
Cependant, cela ne signifie pas que la demande est en déclin. L'échantillon de suivi montre que le volume de traitement des Tokens LLM a déjà augmenté de plusieurs fois par rapport au début de l'année, et le taux d'utilisation des modèles principaux reste entre 70 % et 80 %, tandis que le taux d'utilisation des GPU hautes performances dépasse également 80 %. La baisse des prix semble davantage être le résultat d'une offre, de modèles open source et d'une efficacité d'inférence qui rattrapent la demande, plutôt qu'un affaiblissement soudain de la demande en IA.
Les prix des Tokens baissent légèrement, mais la consommation continue d'augmenter
En juillet 2026, les prix des Tokens d'entrée des modèles principaux continuent de baisser. Selon l'échantillon du rapport, le prix des Tokens d'entrée pour certains modèles principaux se situe généralement entre 0,2 et 5 dollars par million de Tokens, avec une baisse moyenne d'environ 3 % par rapport au mois précédent.

Cette fourchette nécessite des précisions. Les prix des Tokens de sortie des modèles fermés hautes performances comme GPT-4o et Claude 3.5 Sonnet sont généralement nettement plus élevés que ceux des Tokens d'entrée, et les prix des modèles légers comme GPT-4o mini ne peuvent pas être directement comparés aux modèles phares. En d'autres termes, les prix bas mentionnés dans le rapport reflètent davantage les Tokens d'entrée, les modèles légers ou les échantillons de fournisseurs, et ne doivent pas être interprétés comme une baisse des coûts d'appel pour tous les modèles principaux.
Cela dit, la direction reste claire. Pour les entreprises d'applications IA, le coût unitaire d'inférence pour les mêmes questions-réponses, génération de code, recherche améliorée ou appels de service client est en baisse. Au cours des dernières années, l'un des aspects les plus difficiles à évaluer dans la commercialisation des grands modèles a été "plus on utilise, plus on perd", la baisse du prix unitaire des Tokens d'entrée rapproche au moins certaines applications à haute fréquence d'une fourchette de coûts plus abordable.
Plus important encore, la baisse des prix se produit dans un contexte d'augmentation du volume d'appels. De janvier à juillet 2026, le volume de traitement des Tokens LLM dans l'échantillon du rapport a augmenté de plusieurs fois par rapport au début de l'année, certaines niches ayant connu une croissance de plus de 4 fois. Les taux d'utilisation des modèles principaux tels qu'OpenAI, Anthropic et Meta restent stables entre 70 % et 80 %, et la libération des modèles à poids ouverts de la série Llama est également une raison importante de l'augmentation du volume d'appels.
Ce que le marché observe n'est pas "personne ne les utilise donc les prix baissent", mais plutôt qu'avec un volume d'appels plus important, les fournisseurs de services de modèles, l'écosystème de poids ouverts et l'offre d'infrastructure ont tous contribué à faire baisser le prix unitaire.
Les modèles à poids ouverts ne se contentent plus de rivaliser par les bas prix
La croissance rapide des modèles à poids ouverts est une autre tendance majeure du marché des Tokens en juillet.
Le rapport indique que l'utilisation des Tokens des modèles à poids ouverts a augmenté de 26 % par rapport au mois précédent en juillet, atteignant 63 fois le niveau de l'année précédente ; leur prix moyen pondéré par le volume a augmenté de 36 % par rapport au mois précédent, et les dépenses en Tokens ont augmenté de 71 %.
Cela signifie que les modèles à poids ouverts ne se contentent pas de faire pression sur les modèles fermés par des prix bas. À mesure que leurs performances se rapprochent progressivement des niveaux de pointe, les prix d'appel, les volumes d'utilisation et les dépenses de certains modèles à poids ouverts augmentent simultanément.
En juillet, la part des dépenses des modèles à poids ouverts a atteint 20 %, contre 12 % en juin et 10 % en mai. Bien que les modèles fermés ne représentent que 29 % du volume total des Tokens, ils contribuent encore à 80 % des dépenses, ce qui montre que les modèles fermés hautes performances détiennent toujours la majeure partie de la valeur commerciale, mais les modèles à poids ouverts rattrapent rapidement.
En termes de volume d'utilisation des Tokens, les cinq modèles les mieux classés en juillet sont MiMo v2.5, DeepSeek v4 Flash, GLM 5.2, DeepSeek v4 Pro et MiniMax M3, représentant ensemble 50 % du volume total des Tokens.
En termes de dépenses en Tokens, les cinq premiers sont Claude Opus 4.8, Claude Opus 4.7, Fable 5, Kimi K3 et GPT-5.6 Sol, représentant ensemble 54 % des dépenses totales. Parmi eux, l'entrée de Kimi K3 dans le top cinq des dépenses signifie que les modèles à poids ouverts commencent à entrer dans des segments de haute valeur qui étaient auparavant dominés par des modèles fermés.

Pour les clients d'entreprise, une plus grande variété de modèles disponibles aide à réduire la dépendance à un seul fournisseur fermé. Mais d'après ce rapport, les changements apportés par les modèles à poids ouverts ne se limitent pas à la baisse des prix, mais incluent également la concurrence pour des scénarios d'appel et des budgets de plus grande valeur.
La baisse des loyers H100, mais les cartes haut de gamme ne sont pas en surplus
Le marché de la location de GPU a également connu une différenciation structurelle similaire.
En juillet 2026, le prix moyen de location des H100 sur le marché des fournisseurs de cloud non hyperscale était de 2,68 dollars par GPU-heure, en baisse de 1,1 % par rapport au mois précédent. C'est la première baisse mensuelle après sept mois de hausse continue des loyers H100.
Cette baisse est bien inférieure à 15 % à 25 %, et ne peut pas être décrite comme "les loyers H100 ont baissé de 20 %". Le rapport suit toujours le prix moyen mensuel de location calculé par GPU-heure, et non le loyer hebdomadaire par carte.
Cela montre que l'offre commence à réagir. Plus de GPU entrent sur le marché de la location cloud, la concurrence entre les fournisseurs de services cloud et les plateformes de puissance de calcul s'intensifie, et les prix de location à court terme ne sont plus uniquement déterminés par une pénurie extrême. Par rapport à la phase de pénurie de GPU haut de gamme, la pression de ne pas pouvoir acheter, louer ou faire la queue pour obtenir des cartes s'est quelque peu atténuée.
Cependant, les ressources haut de gamme restent coûteuses. Les prix des H100 sont toujours nettement supérieurs à ceux des A100, et le taux d'utilisation global des GPU reste entre 75 % et 90 %, avec un taux d'utilisation des GPU hautes performances dépassant 80 %. Tant que le taux d'utilisation reste dans cette fourchette, la baisse des loyers ressemble davantage à une réduction d'une partie de la prime de pénurie, plutôt qu'à une surabondance totale de l'offre de puissance de calcul.

Pour les entreprises d'IA, ce changement entraîne deux impacts.
D'une part, le coût des affaires d'inférence devient plus facile à réduire. L'inférence nécessite une fourniture de puissance de calcul continue, stable et à faible latence, et la baisse des loyers GPU améliorera la structure des coûts des fournisseurs de services API, des recherches IA, des assistants de code et des produits d'agents intelligents d'entreprise.
D'autre part, la pression sur les coûts de formation de grands modèles est difficile à éliminer simultanément. La formation haut de gamme dépend non seulement du nombre de GPU, mais aussi de l'interconnexion des clusters, de la bande passante mémoire, de l'efficacité de la planification et de l'alimentation stable. La baisse des loyers H100 ne signifie pas que les coûts de formation à grande échelle diminuent dans la même mesure, ni que toutes les startups IA peuvent obtenir des ressources de cluster de qualité équivalente à bas prix.
La hausse des prix de la mémoire ralentit, la baisse des clusters haut de gamme n'est pas aussi directe que celle des locations à court terme
Le segment où les prix sont les moins flexibles est celui de la mémoire.
En mai-juin 2026, l'échantillon du rapport montre que les prix au comptant de la DRAM ont rapidement augmenté, avec des hausses cumulées de plus de 90 % à 100 % pour des catégories comme le DDR5 16Gb, et ce n'est qu'en juillet qu'ils ont commencé à se stabiliser. En revanche, le HBM reste élevé en raison de la demande d'accélérateurs IA, et les prix contractuels seront en retard par rapport aux prix au comptant de 1 à 2 trimestres.
Pour les accélérateurs IA haut de gamme, les puces GPU ne sont pas le seul goulot d'étranglement, le HBM, l'emballage avancé et la livraison des centres de données affectent également l'offre réelle. Même si les prix de certains GPU sur le marché de la location baissent, l'offre globale de coûts continuera d'être limitée par la bande passante mémoire, l'emballage avancé et le rythme de livraison des nouvelles générations de GPU.

C'est pourquoi dire que "le moment le plus tendu pour la puissance de calcul commence à se relâcher" ne peut pas être directement interprété comme "la pénurie de puissance de calcul est terminée". La baisse des prix sur le marché de la location indique qu'une partie de la pression d'offre à court terme a été atténuée. Cependant, les clusters de formation haut de gamme et les clusters d'inférence à grande échelle restent soumis à des contraintes de bande passante mémoire, d'emballage avancé et de rythme de livraison des GPU de nouvelle génération.
Il est important de noter le cadre temporel. Ce rapport reflète les changements de prix et de taux d'utilisation dans l'échantillon de juillet 2026, et est plus adapté pour représenter un aperçu de la détente de la tension sur la puissance de calcul IA à mi-2026, plutôt que de résumer les prix de tous les fournisseurs de cloud, toutes les régions et tous les contrats à long terme.
Les coûts ont baissé, mais la pression sur les bénéfices des fournisseurs de modèles a changé de forme
La baisse des prix des Tokens et des locations de GPU est bénéfique pour les entreprises d'applications IA, mais pas nécessairement pour les fournisseurs de modèles.
Des prix d'appel plus bas aident à stimuler la demande, à élargir l'utilisation des API, et permettent à plus d'entreprises d'intégrer de grands modèles dans leurs processus commerciaux réels. Le problème est que si la baisse des prix dépasse l'amélioration de l'efficacité d'inférence, les marges bénéficiaires des fournisseurs de modèles et des plateformes cloud seront comprimées. Surtout dans un contexte où les modèles à poids ouverts rattrapent leur retard et où le pouvoir de négociation des clients augmente, l'espace de prix élevé des API fermées continuera d'être remis en question.
Pour les fournisseurs de matériel et de services cloud, la baisse des prix de location H100 représente également une normalisation des rendements extrêmement élevés qui étaient auparavant dus à une pénurie extrême. Les contrats à long terme, les différences régionales, les échelles de volume et les variations de prix au comptant font que les prix réels obtenus par différents clients peuvent varier considérablement. En se basant uniquement sur la moyenne des loyers hebdomadaires, on ne peut pas directement conclure que les revenus de tous les fournisseurs de cloud vont diminuer simultanément.
Le signal le plus clair de ce suivi des prix est qu'à la mi-2026, l'offre d'infrastructure IA a déjà rattrapé une partie de la demande, et les coûts d'appel et de location à court terme commencent à se stabiliser. Mais les limites sont également claires : l'utilisation des Tokens continue d'augmenter rapidement, le taux d'utilisation des GPU haut de gamme reste élevé, les prix des Tokens de sortie sont plus chers, et le HBM reste tendu. La baisse des coûts se produit d'abord dans les segments plus facilement commercialisables, tandis que les clusters haut de gamme et l'offre de mémoire en amont restent les plus difficiles à assouplir.
Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.
Vous pourriez aussi aimer

Cérémonie de signature de partenariat stratégique entre HSK Chain et Morpho tenue à Hong Kong

Ceux qui ont éliminé les intermédiaires deviennent maintenant des intermédiaires pour l'IA

La demande de Bitcoin nécessite un manque de 127 000 BTC en termes de contrats au comptant et à terme, selon un analyste

Strategy suspend son acquisition de Bitcoin pendant 5 semaines, utilisant 25 millions de dollars pour racheter discrètement ses propres actions à prix réduit

La taille des actions tokenisées a augmenté de 56 % en trois mois : comment la cryptographie peut-elle résoudre le problème de la fragmentation de la liquidité ?

Incident de la stablecoin « WEMIX Dollar » de WEMIX : détournement de contrat intelligent et émission non autorisée

À l'intérieur de la bataille entre la CME et la CFTC sur les contrats à terme perpétuels on-chain

NVIDIA investit 1 milliard de dollars dans Naver, devenant indirectement actionnaire d'Upbit ?

Le satiriste de HBO "s'attaque" à Trump et à son empire cryptographique

WLD reçoit à nouveau un soutien institutionnel, peut-il retrouver son sommet grâce à l'imagination de valorisation d'OpenAI ?

Adieu à plus de 100 projets : la maturité de l'industrie se mesure aussi par ses fermetures

Comparaison des livres blancs de Sui et Aptos : Architecture, Consensus et Scalabilité expliqués

BitMEX : un recours collectif exige le remboursement de 622,66 BTC le jour de l'annonce de la fermeture

Kalshi perd sa demande d'injonction d'urgence devant le tribunal fédéral

Dix ans de soutien pour un retour de mille milliards : le grand gagnant de l'introduction en bourse de Changxin à Hefei

Pourquoi les tokens sont-ils échangés ? Le modèle « T-C-T' » dérivé du « Capital » de Marx (Épisode 11 de « C'était ça la blockchain » avec Yoshihiko Uchida, Yuya Sakai et Shinya Otsuka)

Kimi s'approche + chute des actions, les factions américaines de l'IA s'unissent rapidement dans les deux semaines

trade.xyz, le plus grand concurrent de Hyperliquid avec 90 % du volume RWA ?

Pourquoi KIMI ne peut-il pas célébrer dans une boîte de nuit ?

CME lance des contrats à terme sur actions individuelles, les contrats à terme sur actions s'alignent sur les matières premières

Le prix maximum de FWA peut atteindre 2000 fois, avec un revenu de 1000 ETH en une semaine

Stratégie : vente d'actions pour 89,2 milliards de yens | Achat de BTC reporté

Le Stable Vault d'Aave

La croissance ne suffit plus... Alea Research explique pourquoi le marché parie désormais sur une "croissance monétisable"

Abraxas Capital, l'institution qui fait frémir les analystes on-chain

Franco Colapinto aura un dernier test avec Alpine avant la pause estivale

De star d'Hollywood à magnat de l'immobilier : la fortune de 400 millions de dollars de Jack Nicholson

Crise chez les jeunes : plus de 4 millions vivent dans des conditions vulnérables, n'arrivent pas à joindre les deux bouts et souffrent de dépression

Industrie en crise : l'activité a de nouveau chuté en juin, selon les estimations de l'UIA


