JPMorgan interpretiert: Sinkende Preise für Token und H100 – Beginnt die Kosten für KI zu sinken?

By: rootdata|2026/07/28 08:31:02

TL;DR
· Ein Branchenbericht aus Juli 2026 zeigt, dass die Preise für Eingabetoken und die Mietpreise für H100-GPUs gleichzeitig gesunken sind.
· Der Preisrückgang erfolgt vor dem Hintergrund eines mehrfach gestiegenen Anrufvolumens und einer weiterhin hohen GPU-Auslastung.
· Der Kostendruck hat sich bereits verringert, aber die Preise für Ausgabetoken, HBM und hochrangige Cluster bleiben weiterhin begrenzt.


Der im Juli von JPMorgan veröffentlichte Bericht "Data Center Watch" zeigt, dass die Preise für KI-Inferenzanrufe und die Mietpreise für hochrangige GPUs zu diesem Zeitpunkt gesunken sind.


Die direkte Bedeutung dieser Information ist, dass die angespannteste Phase der KI-Infrastruktur zu lockern beginnt. Für normale Benutzer und Unternehmenskunden bedeutet der Rückgang der Eingabetokenpreise, dass die Nutzung großer Modelle günstiger wird. Für KI-Anwendungsunternehmen und Cloud-Anbieter zeigt der Rückgang der H100-Mieten, dass der Markt für Rechenleistung nicht mehr so knapp ist wie in der vorhergehenden Phase.


Dies ist jedoch kein Signal für einen Rückgang der Nachfrage. Die Stichprobe zeigt, dass das Volumen der LLM-Token-Verarbeitung im Vergleich zu Beginn des Jahres um mehrere Male gestiegen ist, die Auslastung der führenden Modelle weiterhin im Bereich von 70%-80% liegt und die Auslastung der leistungsstarken GPUs ebenfalls über 80% liegt. Der Preisrückgang scheint eher eine Reaktion auf das Angebot, Open-Source-Modelle und die Effizienz der Inferenz zu sein, die der Nachfrage hinterherhinken, als dass die KI-Nachfrage plötzlich schwächer geworden ist.


Eingabetokenpreise sinken leicht, Nutzung nimmt zu


Im Juli 2026 sanken die Preise für Eingabetoken der führenden Modelle weiter. Laut der Stichprobe des Berichts liegt der Preis für einige führende Modelle bei etwa 0,2-5 USD pro Million Eingabetoken, was einem durchschnittlichen Rückgang von etwa 3% im Vergleich zum Vormonat entspricht.


![](https://public.chaincatcher.info/upload/news/202607/c46305d0d77c48beb28f63b14a76e491.png)

Dieser Bereich benötigt eine Einschränkung. Die Preise für Ausgabetoken hochleistungsfähiger, geschlossener Modelle wie GPT-4o und Claude 3.5 Sonnet liegen normalerweise deutlich über den Preisen für Eingabetoken, und die Preise für leichtere Modelle wie GPT-4o mini können nicht direkt mit den Flaggschiffmodellen verglichen werden. Das heißt, die niedrigen Preise im Bericht spiegeln eher die Eingabetoken, leichtere Modelle oder die Stichprobe von Hosting-Anbietern wider und sollten nicht als vollständige Kosten für alle führenden Modelle verstanden werden.


Dennoch ist die Richtung klar. Für KI-Anwendungsunternehmen sinken die Kosten pro Inferenz für dieselben Fragen, Codegenerierung, Suchverbesserungen oder Kundenanfragen. In den letzten Jahren war eine der schwierigsten Rechnungen bei der Kommerzialisierung großer Modelle, dass "je mehr man nutzt, desto mehr verliert man". Der Rückgang des Preises pro Eingabetoken bringt zumindest einige hochfrequente Anwendungen näher an ein tragbares Kosteniveau.


Wichtiger ist, dass der Rückgang der Preise vor dem Hintergrund eines steigenden Anrufvolumens erfolgt. Im ersten Halbjahr 2026 bis Juli hat das Volumen der LLM-Token-Verarbeitung in der Stichprobe des Berichts im Vergleich zu Beginn des Jahres um mehrere Male zugenommen, wobei einige Nischenmärkte um mehr als das Vierfache gewachsen sind. Die Auslastung der führenden Modelle wie OpenAI, Anthropic und Meta bleibt stabil im hohen Bereich von 70%-80%, und die Verbreitung der offenen Gewichtungsmodelle der Llama-Serie ist ebenfalls ein wichtiger Grund für den Anstieg des Anrufvolumens.


Der Markt sieht nicht "niemand nutzt es, also sinken die Preise", sondern dass unter einem größeren Anrufvolumen die Modellanbieter, das Open-Weight-Ökosystem und das Angebot an Infrastruktur gemeinsam die Einheitspreise gesenkt haben.


Schnelles Wachstum offener Gewichtungsmodelle


Das schnelle Wachstum offener Gewichtungsmodelle ist eine weitere Hauptlinie des Token-Marktes im Juli.


Der Bericht zeigt, dass das Volumen der Token-Nutzung offener Gewichtungsmodelle im Juli im Vergleich zum Vormonat um 26% gestiegen ist und im Vergleich zum Vorjahr 63-mal höher ist; der volumengewichtete Durchschnittspreis ist im Vergleich zum Vormonat um 36% gestiegen, und die Token-Ausgaben sind um 71% gestiegen.


Das bedeutet, dass offene Gewichtungsmodelle nicht nur durch niedrige Preise geschlossene Modelle verdrängen. Mit der schrittweisen Annäherung an die Spitzenleistung steigen die Anrufpreise, die Nutzung und die Ausgaben für einige offene Gewichtungsmodelle synchron.


Im Juli stieg der Anteil der Ausgaben für offene Gewichtungsmodelle auf 20%, höher als die 12% im Juni und die 10% im Mai. Geschlossene Modelle machen zwar nur 29% des gesamten Token-Volumens aus, tragen jedoch immer noch 80% der Ausgaben, was zeigt, dass hochleistungsfähige geschlossene Modelle weiterhin den Großteil des kommerziellen Wertes kontrollieren, aber offene Gewichtungsmodelle schnell aufholen.


Nach dem Volumen der Token-Nutzung sind die fünf führenden Modelle im Juli MiMo v2.5, DeepSeek v4 Flash, GLM 5.2, DeepSeek v4 Pro und MiniMax M3, die zusammen 50% des gesamten Token-Volumens ausmachen.


Nach den Token-Ausgaben sind die fünf führenden Modelle Claude Opus 4.8, Claude Opus 4.7, Fable 5, Kimi K3 und GPT-5.6 Sol, die zusammen 54% der Gesamtausgaben ausmachen. Darunter ist Kimi K3 in die Top 5 der Ausgaben eingetreten, was bedeutet, dass offene Gewichtungsmodelle in den zuvor hauptsächlich von geschlossenen Modellen dominierten hochpreisigen Bereich eindringen.


![](https://public.chaincatcher.info/upload/news/202607/b9daa298e87a4426b668f3f318867b46.png)

Für Unternehmenskunden bedeutet die größere Auswahl an Modellen, dass die Abhängigkeit von einem einzelnen geschlossenen Anbieter verringert werden kann. Aber aus diesem Bericht geht hervor, dass die Veränderungen, die offene Gewichtungsmodelle mit sich bringen, nicht nur die Preise senken, sondern auch um wertvollere Anrufsz Szenarien und Budgets konkurrieren.


Rückgang der H100-Mieten, aber hochrangige Karten sind nicht im Überfluss


Auch der Markt für GPU-Vermietungen zeigt eine ähnliche strukturelle Differenzierung.


Im Juli 2026 betrug der durchschnittliche Mietpreis für H100 in Märkten außerhalb der hyperskaligen Cloud-Anbieter 2,68 USD pro GPU-Stunde, was einem Rückgang von 1,1% im Vergleich zum Vormonat entspricht. Dies ist der erste Rückgang nach sieben Monaten kontinuierlichen Anstiegs der H100-Mieten.


Dieser Rückgang ist weit geringer als 15% bis 25% und kann nicht als "H100-Mieten sind um 20% gesunken" beschrieben werden. Der Bericht verfolgt weiterhin den durchschnittlichen monatlichen Mietpreis pro GPU-Stunde und nicht die wöchentliche Mietgebühr pro Karte.


Dies zeigt, dass die Angebotsseite zu reagieren beginnt. Mehr GPUs treten in den Cloud-Vermietungsmarkt ein, der Wettbewerb zwischen Cloud-Anbietern und Rechenleistungsplattformen nimmt zu, und die Mietpreise werden nicht mehr nur durch extreme Knappheit bestimmt. Im Vergleich zur Phase der Knappheit bei hochrangigen GPUs hat sich der Druck, keine Karten zu bekommen, nicht mieten zu können und in Warteschlangen zu stehen, verringert.


Aber hochrangige Ressourcen sind weiterhin nicht billig. Die Preise für H100 liegen weiterhin deutlich über denen von A100, die gesamte GPU-Auslastung bleibt bei 75%-90%, und die Auslastung leistungsstarker GPUs übersteigt 80%. Solange die Auslastung in diesem Bereich bleibt, sieht der Rückgang der Mieten eher aus wie das Abdrängen eines Teils des Knappheitsaufschlags, als dass das Angebot an Rechenleistung bereits vollständig im Überfluss ist.


![](https://public.chaincatcher.info/upload/news/202607/c2cb6d4a5640469e820e4f89624881d3.png)

Für KI-Unternehmen bringt diese Veränderung zwei Auswirkungen mit sich.


Erstens wird es einfacher, die Kosten für Inferenzgeschäfte zu senken. Inferenz erfordert eine kontinuierliche, stabile und latenzarme Versorgung mit Rechenleistung, der Rückgang der GPU-Mieten wird die Kostenstruktur von API-Anbietern, KI-Suchdiensten, Code-Assistenten und Unternehmensintelligenzprodukten verbessern.


Zweitens wird der Kostendruck für das Training großer Modelle nicht gleichzeitig verschwinden. Hochrangiges Training hängt nicht nur von der Anzahl der GPUs ab, sondern auch von der Clustervernetzung, dem Speicherbandbreite, der Planungseffizienz und der stabilen Stromversorgung. Der Rückgang der H100-Mieten bedeutet nicht, dass die Kosten für großflächiges Training im gleichen Maße sinken, noch bedeutet es, dass alle KI-Startups zu niedrigen Preisen gleichwertige Clusterressourcen erhalten können.


---Preis

--

Preiserhöhungen bei Speicher verlangsamen sich, hochrangige Clusterpreise sinken nicht so schnell wie kurzfristige Mieten


Der am wenigsten umfassend gelockerte Bereich sind die Speicherpreise.


Im Mai und Juni 2026 zeigt die Stichprobe des Berichts, dass die Spotpreise für DRAM schnell gestiegen sind, wobei die kumulierten Preiserhöhungen für DDR5 16Gb und ähnliche Kategorien über 90%-100% liegen, und erst im Juli stabilisiert haben. Im Vergleich dazu bleibt HBM aufgrund der Nachfrage nach KI-Beschleunigern auf hohem Niveau, die Vertragspreise werden weiterhin 1-2 Quartale hinter den Spotpreisen zurückbleiben.


Für hochrangige KI-Beschleuniger sind GPU-Chips nicht der einzige Engpass; HBM, fortschrittliche Verpackung und die Lieferung von Rechenzentren beeinflussen ebenfalls das tatsächliche Angebot. Selbst wenn die Preise für einige GPUs auf dem Vermietungsmarkt sinken, werden die Preise für Speicher und die Lieferung hochrangiger Cluster weiterhin die Geschwindigkeit der Gesamtkostenreduzierung einschränken.



Das ist auch der Grund, warum "die angespannteste Zeit der Rechenleistung beginnt sich zu lockern" nicht direkt als "das Ende der Rechenleistungsknappheit" interpretiert werden kann. Der Rückgang der Preise auf dem Vermietungsmarkt zeigt, dass ein Teil des kurzfristigen Angebotsdrucks nachgelassen hat. Aber hochrangige Trainings- und großflächige Inferenzcluster sind weiterhin durch Speicherbandbreite, fortschrittliche Verpackung und den Rhythmus der Auslieferung neuer GPUs eingeschränkt.


Es ist wichtig, den zeitlichen Rahmen zu beachten. Dieser Bericht spiegelt die Preis- und Auslastungsänderungen in der Stichprobe von Juli 2026 wider und eignet sich besser als Momentaufnahme für das Nachlassen der KI-Rechenleistungsknappheit Mitte 2026, als als Zusammenfassung der Preise aller Cloud-Anbieter, aller Regionen und aller langfristigen Verträge.


Die Kosten sind gesunken, der Druck auf die Gewinne der Modellanbieter hat sich auf andere Weise verändert


Der Rückgang der Preise für Token und GPU-Vermietungen ist vorteilhaft für KI-Anwendungsunternehmen, aber nicht unbedingt für die Modellanbieter.


Niedrigere Anrufpreise helfen, die Nachfrage zu stimulieren, das API-Nutzungsvolumen zu erhöhen und mehr Unternehmen dazu zu bringen, große Modelle in echte Geschäftsprozesse zu integrieren. Das Problem ist, dass, wenn die Preise schneller sinken als die Effizienz der Inferenz steigt, die Gewinnmargen der Modellanbieter und Cloud-Plattformen unter Druck geraten. Besonders im Kontext des Aufholens offener Gewichtungsmodelle und der gestiegenen Verhandlungsmacht der Kunden wird der hohe Preisraum für geschlossene APIs weiterhin herausgefordert.


Für Hardware- und Cloud-Anbieter bedeutet der Rückgang der H100-Mieten auch, dass die extrem hohen Renditen, die durch die extreme Knappheit erzielt wurden, beginnen, sich zu normalisieren. Langfristige Verträge, regionale Unterschiede, unterschiedliche Mengen und Spotpreisdefinitionen führen dazu, dass die tatsächlichen Preise, die verschiedene Kunden erhalten, erheblich variieren. Allein die Betrachtung des durchschnittlichen wöchentlichen Mietpreises lässt nicht direkt darauf schließen, dass die Einnahmen aller Cloud-Anbieter gleichzeitig sinken werden.


Das klarste Signal dieser Preistracking-Studie ist, dass die KI-Infrastrukturversorgung Mitte 2026 bereits teilweise mit der Nachfrage Schritt gehalten hat und die Kosten für Einheiten und kurzfristige Vermietungen zu sinken beginnen. Aber die Grenzen sind ebenfalls klar: Das Volumen der Token-Nutzung wächst weiterhin schnell, die Auslastung der hochrangigen GPUs bleibt hoch, die Preise für Ausgabetoken sind teurer, und HBM bleibt angespannt. Der Kostenrückgang erfolgt zuerst in den Bereichen, die leichter marktfähig sind, während die schwierigsten Bereiche weiterhin hochrangige Cluster und die Versorgung mit Speicher sind.

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:bd@weex.com
VIP-Programm:support@weex.com