top of page

Chinas günstige KI-Modelle können das Compute-Geschäft des Silicon Valley stärken

11. Aug.
13 Min. Lesezeit

DeepSeek hat leistungsfähige künstliche Intelligenz günstiger gemacht, doch der daraus resultierende Preisdruck hat das Silicon Valley nicht davon abgehalten, mehr Recheninfrastruktur aufzubauen.

Dieser scheinbare Widerspruch steht im Zentrum der Debatte über das Jevons-Paradoxon, die derzeit in Google News auftaucht. Wenn eine Ressource günstiger nutzbar wird, verbrauchen Menschen oft mehr davon. Die Gesamtnachfrage kann steigen, obwohl jede einzelne Aufgabe weniger Ressourcen benötigt.

Auf KI angewandt klingt das Argument beruhigend für Nvidia, Cloud-Plattformen und Betreiber von Rechenzentren. Effiziente chinesische KI-Modelle verringern den Rechenaufwand für eine einzelne Antwort, machen aber zugleich weitaus mehr Anwendungen wirtschaftlich praktikabel.

Für Unternehmen, die Zugang zu proprietären Modellen verkaufen, wirkt dieselbe Entwicklung deutlich weniger komfortabel. DeepSeek, Alibaba, Moonshot AI und andere chinesische Entwickler machen leistungsfähige Modelle zu günstigen, austauschbaren Komponenten. Das schwächt Premiumpreise und erleichtert den Wechsel.

Der zentrale Wettbewerb lautet daher nicht in jedem Teil des KI-Markts China gegen die Vereinigten Staaten. Es geht um günstigen, reichlich verfügbaren Modelloutput gegen die Premium-Modellökonomie, die führende amerikanische Labore bevorzugen.

Das Silicon Valley kann von diesem Wettbewerb profitieren, ohne dass jedes Unternehmen im Silicon Valley gewinnt. Infrastrukturprovider können ein größeres Arbeitsvolumen verarbeiten, während Modellentwickler mit niedrigeren Margen, härterem Wettbewerb und geringerer Kundenbindung konfrontiert sind.

Günstige chinesische KI ist von einer Warnung zu einer Marktmacht geworden

Chinesische KI-Modelle stellen nicht mehr nur eine technische Herausforderung dar. Sie verändern die erwarteten Kosten dafür, Intelligenz in gewöhnliche Software zu integrieren.

DeepSeek zeigte im Januar 2025 mit seinem Reasoning-Modell R1 die Richtung auf. Die Veröffentlichung stellte die Annahme infrage, dass wettbewerbsfähige Reasoning-Systeme dieselben Ausgabenmuster wie führende amerikanische Modelle erfordern.

Die erste Marktreaktion konzentrierte sich auf Knappheit. Wenn Modelle weniger fortschrittliche Chips benötigten, so die Überlegung von Investoren, könnten Technologieunternehmen ihre Infrastrukturausgaben senken. Nvidia-Aktien fielen deutlich, als der Markt infrage stellte, ob effiziente Software die Nachfrage nach seiner Hardware schwächen würde.

Diese Interpretation behandelte jede eingesparte Rechenoperation als entgangenen Umsatz. Sie berücksichtigte nicht Anwendungen, die Unternehmen abgelehnt hatten, weil der Modelleinsatz zu teuer, zu langsam oder zu schwer skalierbar war.

DeepSeek trieb das Effizienzargument 2026 weiter voran. Seine V4-Familie umfasste laut den V4 release notes Pro- und Flash-Modelle mit Kontextfenstern von einer Million Tokens. Ein Kontextfenster bezeichnet die Menge an Informationen, die ein Modell bei einer Anfrage berücksichtigen kann.

DeepSeek erklärt, V4 nutze Sparse Attention, eine Methode, die begrenzt, welche Teile des Kontexts intensiv verarbeitet werden. Das Unternehmen stellt dieses Design als Weg dar, den Speicher- und Rechenbedarf bei langen Anfragen zu senken.

Diese Angaben müssen bei realen Workloads unabhängig bewertet werden. Benchmark-Ergebnisse von Modellentwicklern erfassen selten Zuverlässigkeit, Latenz, Sicherheitsvorkehrungen oder die Kosten für den Betrieb eines Produktionsdienstes.

Das kommerzielle Signal bleibt dennoch klar. DeepSeek positionierte V4-Flash für hochvolumige Nutzung und setzte Account-Grenzen für Gleichzeitigkeit von bis zu 2.500 parallelen Verbindungen. Das ist nicht bloß eine Forschungsdemonstration. Es ist eine Einladung, kundenorientierte Dienste auf günstigem Modelloutput aufzubauen.

Andere chinesische Entwickler verstärken dieselbe Richtung. Alibabas Qwen-Familie hat Entwickler durch offene Veröffentlichungen, breite Sprachunterstützung und Modelle in mehreren Größen angezogen. Moonshot AI hat Kimi-Modelle rund um lange Kontexte und agentische Aufgaben beworben.

Agentische Systeme sind Anwendungen, die einem Modell erlauben, Schritte zu planen, Software-Tools aufzurufen und auf ein Ziel hinzuarbeiten. Sie können weitaus mehr Modelloutput verbrauchen als ein herkömmlicher Chatbot, weil eine Nutzeranfrage viele interne Austauschvorgänge auslösen kann.

Die jüngste Berichterstattung von Google News hat diese Veröffentlichungen als sich ausweitenden Preiskrieg dargestellt. Diese Beschreibung erfasst einen Teil des Geschehens, verfehlt aber die größere Veränderung. Niedrigere Kosten erweitern die Bandbreite an Software, die KI wirtschaftlich den ganzen Tag über einsetzen kann.

Ein Support-Bot hätte früher vielleicht eine Antwort erzeugt, nachdem ein Kunde ein Ticket eingereicht hatte. Ein günstigerer Agent kann das Ticket klassifizieren, Dokumente abrufen, eine Antwort entwerfen, die Kontohistorie prüfen und überwachen, ob das Problem erneut auftritt.

Jeder Schritt kann ein effizienteres Modell nutzen. Der vollständige Workflow kann dennoch mehr Rechenleistung insgesamt verbrauchen als die ältere, einfachere Interaktion.

Diese Unterscheidung macht aus chinesischer KI-Effizienz eine Nachfragefrage und nicht bloß eine direkte Bedrohung für Hardware.

Google News verfolgt einen Einbruch der KI-Kosten

Die Kosten für nützlichen Modelloutput sind schnell genug gefallen, um zu verändern, was Entwickler bauen können – und nicht nur, was sie für bestehende Anwendungen bezahlen.

Der Trend begann, bevor DeepSeek weltweit bekannt wurde. Der AI Index 2025 von Stanford stellte fest, dass die Kosten für die Abfrage eines Modells mit GPT-3.5-ähnlicher Benchmark-Leistung zwischen November 2022 und Oktober 2024 um mehr als das 280-Fache gesunken sind.

Stanford stellte außerdem fest, dass das kleinste Modell, das einen gängigen Schwellenwert beim Sprachverständnis überschritt, von 540 Milliarden Parametern im Jahr 2022 auf 3,8 Milliarden im Jahr 2024 schrumpfte. Parameter sind erlernte Werte, die einem Modell helfen, eine Eingabe in eine Ausgabe umzuwandeln.

Diese Zahlen, zusammengefasst in den AI Index findings, zeigen, dass Modelleffizienz nicht die isolierte Leistung eines einzelnen Unternehmens ist. Hardwareverbesserungen, Softwareoptimierung, Modellkompression und bessere Trainingsmethoden wirken zusammen.

Chinesische KI-Labore verstärken diesen Trend, weil sie anderen Beschränkungen unterliegen. Exportkontrollen der Vereinigten Staaten haben ihren Zugang zu bestimmten fortschrittlichen Prozessoren eingeschränkt. Dieser Druck gibt ihnen einen starken Anreiz, aus verfügbarer Hardware mehr Leistung herauszuholen.

Mixture-of-Experts-Architekturen sind eine Reaktion darauf. Diese Modelle enthalten viele spezialisierte Komponenten, aktivieren aber für jeden Token nur einen Teil davon. Ein Token ist eine kleine Texteinheit, die von einem Modell verarbeitet wird.

Sparse Attention bietet einen weiteren Weg. Sie verringert die Menge des früheren Kontexts, die vollständig detailliert untersucht wird, und reduziert damit Speicherverkehr, der lange Anfragen verlangsamen kann.

Modelldestillation kann zudem Verhalten von einem größeren System auf ein kleineres übertragen. Das kleinere Modell büßt meist etwas Leistungsfähigkeit ein, kann aber wesentlich günstiger betrieben werden.

Keine dieser Methoden beseitigt den Bedarf an Rechenleistung. Sie verändern die Menge und Art der für jede Aufgabe benötigten Ressourcen.

Dieser Unterschied ist wichtig, weil sich die KI-Nachfrage zunehmend vom Training zur Inferenz verlagert. Training erstellt oder aktualisiert ein Modell. Inferenz findet jedes Mal statt, wenn das fertige Modell Text schreibt, ein Bild analysiert, Code erzeugt oder eine Aktion auswählt.

Trainingskosten entstehen in großen, sichtbaren Projekten. Inferenz summiert sich durch wiederholte Nutzung. Ein erfolgreiches Verbraucherprodukt, ein Coding-Agent oder ein Unternehmensassistent kann kontinuierlich Anfragen von Millionen Nutzern erzeugen.

Google-News-Berichte über sinkende Modellkosten stehen daher neben Schlagzeilen über wachsende Rechenzentren. Die Entwicklungen wirken nur dann widersprüchlich, wenn angenommen wird, dass die KI-Nutzung konstant bleibt.

Die Nutzung bleibt nicht konstant. Niedrigere Kosten ermutigen Entwickler, mehr Modellaufrufe hinzuzufügen, längere Kontexte beizubehalten, mehrere Antwortkandidaten zu erzeugen und Verifikationsmodelle einzusetzen, um die erste Antwort zu prüfen.

Reasoning-Modelle fügen einen weiteren Multiplikator hinzu. Sie erzeugen oft interne Tokens, während sie ein Problem bearbeiten, bevor sie eine sichtbare Antwort zurückgeben. Ein Nutzer kann eine kurze Antwort sehen, nachdem das System eine wesentlich längere Berechnung abgeschlossen hat.

Agenten verlängern die Schleife erneut. Ein Coding-Agent kann ein Repository prüfen, eine Änderung planen, Dateien bearbeiten, Tests ausführen, Fehler lesen und seine Arbeit überarbeiten. Eine Anweisung kann zu Dutzenden von Inferenzoperationen werden.

Deshalb führen günstigere Tokens nicht automatisch zu niedrigeren Rechenrechnungen. Entwickler investieren die Einsparungen oft in leistungsfähigeres Verhalten.

Die wirtschaftliche Frage lautet, ob die Nachfrage schneller wächst als die Kosten pro Aufgabe fallen. Das Jevons-Paradoxon gilt nur, wenn die steigende Nutzung den Effizienzgewinn mehr als ausgleicht.

Die aktuellen Hinweise deuten in diese Richtung, entscheiden die Frage jedoch nicht für jedes Modell, jeden Kunden oder jeden Chipanbieter.

Das Jevons-Paradoxon begünstigt Compute stärker als Modellanbieter

Günstigere Intelligenz kann den Infrastrukturmarkt erweitern und zugleich die Wirtschaftlichkeit von Unternehmen untergraben, die die Modelle selbst entwickeln.

William Stanley Jevons entwickelte sein ursprüngliches Argument im Zusammenhang mit dem Kohleverbrauch im Großbritannien des 19. Jahrhunderts. Effizientere Dampfmaschinen senkten die Kohlemenge, die für eine Arbeitseinheit benötigt wurde, machten Dampfkraft jedoch auch für mehr Branchen nutzbar.

Das Ergebnis war ein höherer Gesamtverbrauch an Kohle, nicht ein geringerer. Der moderne Rebound-Effekt verlangt nicht, dass KI diese Geschichte exakt wiederholt. Er erfordert eine ausreichend starke Reaktion auf sinkende Kosten.

Für Cloud-Plattformen ist der Mechanismus leicht zu erkennen. Ein Kunde, der zuvor eine teure Anfrage stellte, kann mehrere günstigere Anfragen ausführen, mehr Nutzer bedienen oder ein Modell kontinuierlich betreiben.

Amazon Web Services, Microsoft Azure, Google Cloud und Oracle können profitieren, wenn diese zusätzliche Aktivität in ihren Rechenzentren verbleibt. Sie erzielen Umsätze mit Rechenleistung, Speicher, Netzwerken und verwalteten Diensten rund um das Modell.

Nvidia kann profitieren, wenn die gesamte Inferenz schnell genug wächst, um mehr Beschleuniger zu erfordern. Die Geschäftszahlen des Unternehmens für das Geschäftsjahr 2026 stützen die Ansicht, dass Effizienz das Infrastrukturwachstum bislang nicht gestoppt hat.

Nvidia meldete für das Gesamtjahr einen Data-Center-Umsatz von 193,7 Milliarden US-Dollar, ein Anstieg von 68 Prozent. Der Data-Center-Umsatz im vierten Quartal erreichte 62,3 Milliarden US-Dollar, 75 Prozent mehr als im Vorjahr, laut den fiscal 2026 results.

Das Unternehmen erklärte zudem, seine Rubin-Plattform könne die Kosten pro Inferenz-Token gegenüber Blackwell um bis zu das Zehnfache senken. Nvidia betrachtet niedrigere Kosten pro Token nicht als Grund, weniger Systeme zu verkaufen. Das Unternehmen macht Effizienz zu einem Teil des Arguments für den Kauf der nächsten Generation.

Diese Strategie setzt voraus, dass Kunden Einsparungen in höhere Nutzung reinvestieren. Sie setzt außerdem voraus, dass Nvidia einen bedeutenden Anteil der daraus entstehenden Workloads behält.

Die erste Annahme wirkt zunehmend plausibel. KI-Produkte wandern von optionalen Chatfenstern in Coding, Werbung, Kundensupport, Sicherheitsanalyse, Dokumentenverarbeitung und wissenschaftliche Forschung.

Die zweite Annahme ist weniger sicher. Effiziente Modelle können auf einer breiteren Palette von Hardware laufen, darunter Beschleuniger von AMD, speziell entwickelte Inferenzchips und Systeme von Cloud-Anbietern.

Chinesische KI-Entwickler könnten zudem für Huawei-Hardware oder andere heimische Prozessoren optimieren. Ein globaler Anstieg der KI-Inferenz garantiert nicht, dass jede zusätzliche Aufgabe auf einem Nvidia-Chip landet.

Das Jevons-Argument gilt am unmittelbarsten für den gesamten Computing-Markt. Es wird schwächer, wenn es als Versprechen über den Marktanteil eines einzelnen Anbieters verwendet wird.

Modelllabore stehen vor einem anderen Problem. OpenAI, Anthropic, Google DeepMind und andere Frontier-Entwickler investieren erheblich in Training, Forscher, Daten, Sicherheitsarbeit und Infrastruktur.

Traditionell wurden fortschrittliche Fähigkeiten als Grundlage für Premiumzugang erwartet. Günstige chinesische KI-Modelle setzen diese Prämie unter Druck, indem sie Entwicklern akzeptable Alternativen für Routineaufgaben bieten.

Ein Unternehmen kann ein führendes proprietäres Modell für seine schwierigsten Anfragen reservieren und Zusammenfassungen, Klassifizierung, Extraktion und einfache Codeänderungen an günstigere Systeme weiterleiten.

Diese Praxis wird als Model Routing bezeichnet. Software bewertet jede Anfrage und sendet sie an das Modell, das für die Aufgabe als ausreichend eingestuft wird.

Routing lässt Modelle auf Ebene einzelner Anfragen konkurrieren. Markentreue zählt weniger, wenn Nutzer nie sehen, welches Modell einen bestimmten Schritt bearbeitet hat.

Axios beschrieb diesen Wandel als Wettlauf hin zu einer standardisierten Intelligenz, bei dem Routing zu einer wertvollen Schicht über den Modellen werden könnte. Seine Analyse des KI-Preiskriegs bezeichnete Anthropic zudem als einen prominenten Verteidiger von Premiumpreisen.

Daraus ergibt sich die zentrale Umkehrung. Günstige chinesische KI kann die Infrastrukturinvestitionen des Silicon Valley bestätigen und zugleich die Premium-Modellerlöse untergraben, mit denen ein Teil dieser Investitionen gerechtfertigt werden soll.

Gewinner und Verlierer sitzen auf unterschiedlichen Ebenen

Das Jevons-Paradoxon rettet nicht die gesamte KI-Branche. Es verteilt Wertschöpfung hin zu den Ebenen um, die Nachfrage, Vertrieb und knappe Infrastruktur kontrollieren.

Ein Entwickler, der zwischen Modellen wählt, achtet auf Ausgabequalität, Zuverlässigkeit, Latenz, Datenschutz und Kosten. Wenn mehrere Systeme die Mindestanforderungen erfüllen, wird das Modell selbst leichter ersetzbar.

Offene Gewichte beschleunigen diesen Prozess. Modelle mit offenen Gewichten stellen trainierte Parameter zum Herunterladen und Betreiben bereit, auch wenn ihre Trainingsdaten und der vollständige Entwicklungsprozess weiterhin geschlossen bleiben können.

Unternehmen können diese Modelle auf ihrer eigenen Infrastruktur einsetzen, ihr Verhalten anpassen und die Abhängigkeit von einem einzelnen API-Anbieter vermeiden. Zudem können sie mit kommerziellen Anbietern aus einer stärkeren Position heraus verhandeln.

Das bedroht Labore, deren wichtigstes Produkt der Zugang zu Modellen ist. Ein Spitzenmodell kann technisch überlegen bleiben und dennoch nur einen begrenzten Anteil der Routine-Inferenz abdecken.

Infrastrukturanbieter nehmen eine stärkere Position ein, wenn sich die Nachfrage auf viele Modelle verteilt. Jede Option benötigt weiterhin irgendwo Prozessoren, Speicher, Storage, Netzwerke und Strom.

Cloud-Anbieter können außerdem konkurrierende Modelle über eine einzige verwaltete Plattform anbieten. So können sie Workload-Umsätze erzielen, selbst wenn Kunden das zugrunde liegende Modell wechseln.

Anwendungsunternehmen können einen weiteren Vorteil gewinnen. Wenn die Modellkosten sinken, können sie ihre Ausgaben auf Kundenbeziehungen, proprietäre Daten, Workflow-Design und Vertrieb konzentrieren.

Ein Buchhaltungsassistent wird beispielsweise nicht allein dadurch nützlich, dass sein Modell schlussfolgern kann. Er muss mit Unterlagen verbunden sein, Berechtigungen respektieren, einen Prüfpfad bewahren und erkennen, wann eine menschliche Prüfung erforderlich ist.

Ein Coding-Assistent muss ein Repository verstehen, Tools sicher ausführen, Projektkonventionen befolgen und Entwicklern zeigen, was sich geändert hat. Diese umgebenden Fähigkeiten schaffen einen Wert, den Benchmark-Ergebnisse nicht messen können.

Günstige chinesische KI-Modelle können Verhandlungsmacht daher von Modelllaboren hin zu Anwendungen verschieben. Das Modell wird zu einer Komponente innerhalb eines größeren Systems.

Dieses Ergebnis ähnelt früheren Cloud-Märkten. Open-Source-Datenbanken und Standardserver haben Technologieausgaben nicht beseitigt. Sie verlagerten Wertschöpfung hin zu Managed Services, Developer Experience und Plattformen, die die Betriebskomplexität senkten.

Die Analogie hat Grenzen. Modelle können inkonsistente Antworten erzeugen, Datenverzerrungen übernehmen und sensible Informationen offenlegen. Organisationen können sie nicht wie perfekt austauschbaren Strom behandeln.

Sicherheits- und Governance-Anforderungen können Raum für Premiumanbieter erhalten. Eine Bank könnte vertragliche Schutzmaßnahmen, regionales Hosting, Monitoring und vorhersehbares Modellverhalten stärker schätzen als die niedrigsten Betriebskosten.

Unternehmen sehen sich zudem mit Wechselkosten konfrontiert. Prompts, Evaluierungssysteme, Retrieval-Pipelines und Sicherheitsregeln müssen häufig angepasst werden, wenn sich das zugrunde liegende Modell ändert.

Dennoch ist ein Wechsel leichter geworden. Viele Anbieter unterstützen kompatible Schnittstellen, während unabhängige Plattformen Anfragen zwischen mehreren Modellen weiterleiten können.

Die Dokumentation von DeepSeek unterstützt ausdrücklich sowohl Schnittstellen im OpenAI-Stil als auch im Anthropic-Stil. Schnittstellenkompatibilität reduziert den Entwicklungsaufwand, der nötig ist, um eine Alternative zu testen, auch wenn Verhaltensunterschiede bestehen bleiben.

Dieser Druck trifft amerikanische Labore unterschiedlich.

Google kann Gemini über Suche, Android, Workspace und Google Cloud vertreiben. Microsoft kann Modelle mit Azure, Microsoft 365, GitHub und Unternehmens-Identitätssystemen verbinden. Amazon kann Infrastruktur und verwalteten Zugang verkaufen, ohne dass ein einzelnes Modell dominieren muss.

OpenAI und Anthropic verfügen über starke Produkte und hohe Bekanntheit bei Entwicklern, haben jedoch weniger Kontrolle über Betriebssysteme, Arbeitsplatzsoftware oder öffentliche Cloud-Infrastruktur. Ihre Modelle müssen einen größeren Teil der kommerziellen Last tragen.

Nvidia ist gegenteilig exponiert. Das Unternehmen benötigt nicht den Sieg eines bestimmten Modells. Es braucht wachsende Gesamtnachfrage nach beschleunigtem Computing und eine Plattform, die der bevorzugte Ort für diese Arbeit bleibt.

Die Bewertung nach DeepSeek des Peterson Institute for International Economics argumentiert, dass steigende Umsätze entlang der Computing-Lieferkette die Jevons-Interpretation stützen.

Diese Schlussfolgerung sollte nicht zu der pauschalen Behauptung werden, Effizienz garantiere Gewinne. Die Nachfrage kann wachsen, während Margen sinken. Umsätze können steigen, während der Kapitalbedarf noch schneller wächst.

Ein Markt kann zudem zu viel Kapazität aufbauen. Wenn Rechenzentren entstehen, bevor Anwendungen genügend zahlende Nutzung erzeugen, könnten Betreiber trotz langfristig wachsender Nachfrage schwache Renditen erzielen.

Das Jevons-Paradoxon erklärt den Verbrauch. Es bestimmt nicht, welches Unternehmen die beste Rendite auf die Vermögenswerte erzielt, die diesen Verbrauch ermöglichen.

Was das Jevons-Argument nicht beweist

Die optimistische Infrastrukturthese hängt von tatsächlicher Nutzung ab, nicht allein von Benchmark-Verbesserungen oder niedrigeren beworbenen Preisen.

Die erste Unsicherheit ist die Qualität. Ein günstiges Modell hat wenig Wert, wenn Fehler Menschen dazu zwingen, Arbeit zu wiederholen, jede Antwort zu prüfen oder beschädigte Daten zu reparieren.

Entwickler bewerten Modelle zunehmend anhand konkreter Aufgaben statt breiter Bestenlisten. Ein Modell, das bei Coding-Benchmarks gut abschneidet, kann mit der privaten Codebasis eines Unternehmens oder einer seltenen Programmiersprache Schwierigkeiten haben.

Langer Kontext liefert ein weiteres Beispiel. Die Unterstützung eines großen Kontextfensters bedeutet nicht, dass das Modell jeden Teil dieses Kontexts präzise nutzt. Die Retrieval-Qualität kann nachlassen, wenn entscheidende Informationen zwischen vielen irrelevanten Dokumenten liegen.

Die zweite Unsicherheit ist die Nachfrageelastizität, also wie stark der Verbrauch auf eine Preisänderung reagiert. Das Jevons-Paradoxon setzt voraus, dass die Nutzung ausreichend stark steigt, um die Effizienzeinsparungen zu übertreffen.

Das kann bei Coding-Agenten, Recherchetools und Content-Systemen geschehen, in denen Software wiederholte Anfragen erzeugen kann. In Anwendungen, die durch menschliche Aufmerksamkeit begrenzt sind, muss es nicht eintreten.

Eine Person kann nicht unbegrenzt viele Berichte lesen, nur weil Zusammenfassungen günstiger werden. Ein Rechtsteam kann nicht unendlich viele Verträge genehmigen. Ein Unternehmen kann die Nutzung aufgrund von Datenschutz, Governance oder operativem Risiko begrenzen.

Die dritte Unsicherheit ist die Umsatzqualität. Anbieter können mehr Tokens verarbeiten und dabei weniger Umsatz pro Token erzielen. Die Auslastung der Infrastruktur kann steigen, ohne attraktive Margen zu erzeugen.

Wettbewerb verschärft dieses Risiko. Nvidia, AMD, von Cloud-Anbietern entwickelte Chips, Inferenz-Startups und chinesische Beschleuniger wollen alle einen Anteil an der wachsenden Nachfrage.

Workloads können zudem zu kleineren lokalen Systemen wandern. Ein Laptop oder Smartphone, auf dem ein effizientes Modell läuft, erledigt Aufgaben, ohne für jede Anfrage ein großes Rechenzentrum aufzurufen.

On-Device-Inferenz erweitert die KI-Nutzung, verändert jedoch, wer den daraus entstehenden Wert abschöpft. Sie kann Gerätehersteller und Anbieter von Edge-Chips gegenüber öffentlichen Cloud-Plattformen begünstigen.

Die vierte Unsicherheit ist Energie. Effizienteres Computing senkt den Stromverbrauch pro Aufgabe, doch Jevons-artiges Nachfragewachstum kann den Gesamtstromverbrauch erhöhen.

Der AI Index 2026 von Stanford schätzt, dass die Kapazität von KI-Rechenzentren 29,6 Gigawatt erreicht hatte. Diese Größenordnung macht Stromversorgung, Netzanschlüsse, Kühlung und Wasserzugang zu strategischen Beschränkungen.

Effizienz kann einem Rechenzentrum helfen, innerhalb eines festen Stromrahmens mehr Anfragen zu bedienen. Sie kann Betreiber auch dazu ermutigen, jedes verfügbare Megawatt auszuschöpfen.

Die Umweltwirkung hängt von der Energiequelle und dem Umfang des Rebound-Effekts ab. Ein geringerer Fußabdruck pro Anfrage garantiert keine niedrigeren Gesamtemissionen.

Die fünfte Unsicherheit betrifft den Zugang zu Chips. Exportkontrollen der Vereinigten Staaten haben die Entwicklung chinesischer Modelle geprägt und Nvidias Fähigkeit eingeschränkt, Kunden in China zu bedienen.

Nvidia schloss Rechenzentrums-Computing-Umsätze aus China aus seinem Ausblick für das erste Quartal des Geschäftsjahres 2027 aus. Günstige chinesische Modelle können globale Inferenznachfrage schaffen, während geopolitische Regeln einen amerikanischen Anbieter daran hindern, einen Teil davon abzuschöpfen.

Es gibt auch ein Verifikationsproblem. Modellentwickler veröffentlichen Benchmark-Ergebnisse unter unterschiedlichen Bedingungen, und vollständige Trainings- oder Betriebskosten werden selten offengelegt.

Die Effizienzbehauptungen von DeepSeek liefern wertvolle Hinweise auf die technische Richtung. Sie stellen keinen vollständigen, unabhängig geprüften Vergleich mit jedem amerikanischen Modell dar.

Leser von Google News sollten daher drei Aussagen auseinanderhalten, die häufig gemeinsam erscheinen.

Erstens haben chinesische Labore zunehmend leistungsfähige und preiswerte Modelle veröffentlicht. Verfügbare Produkte und Dokumentation stützen diese Aussage.

Zweitens fördern niedrigere Kosten eine breitere KI-Einführung. Sinkende Inferenzkosten und der zunehmende Einsatz von Agenten stützen diese Richtung, auch wenn der genaue Rebound je nach Anwendung unterschiedlich ausfällt.

Drittens wird jede größere Investition des Silicon Valley eine attraktive Rendite erzielen. Weder das Jevons-Paradoxon noch das gegenwärtige Umsatzwachstum beweisen diese Behauptung.

Die Unterscheidung ist wichtig, weil ein technologischer Boom enormen Verbrauch schaffen und zugleich für einige Anbieter Wert vernichten kann.

Drei Signale werden die These der günstigen KI prüfen

Die nächste Phase wird durch gemessenes Inferenzwachstum, Model Routing und Infrastruktur-Renditen entschieden, nicht durch eine weitere Runde medienwirksamer Benchmarks.

Das erste Signal ist das von Cloud- und Chipunternehmen gemeldete Inferenzvolumen. Investoren sollten auf nachhaltiges Wachstum bei eingesetzten Workloads, Beschleunigerauslastung und Token-Verarbeitung achten.

Steigende Infrastrukturumsätze bei zugleich sinkenden Stückkosten würden die Jevons-These stärken. Das würde zeigen, dass neue Nachfrage Effizienzverbesserungen absorbiert, statt lediglich Kundenrechnungen zu senken.

Stagnierende Nutzung bei niedrigeren Preisen würde die These schwächen. Dieses Ergebnis würde nahelegen, dass Unternehmen Effizienz hauptsächlich einsetzen, um bei bestehenden Aufgaben Geld zu sparen.

Das zweite Signal ist die Einführung von Model Routing. Entwickler haben inzwischen starke Anreize, einfache Aufgaben an günstigere Systeme zu senden und Spitzenmodelle für schwierige Arbeit zu reservieren.

Mehr Routing würde bestätigen, dass Modellausgaben im unteren Segment zu einer Ware werden. Es würde auch zeigen, wohin sich Wertschöpfung bewegt: zu Cloud-Plattformen, Anwendungsentwicklern und Software, die zwischen Modellen auswählt.

Beobachten Sie, ob große Unternehmensplattformen Routing-Steuerungen, automatische Evaluierungen und Fallback-Modelle bereitstellen. Solche Funktionen würden Wechsel zur Routine statt zur Ausnahme machen.

Das Ergebnis würde Premiumanbieter unter Druck setzen, zu beweisen, dass bessere Zuverlässigkeit, Sicherheit oder Schlussfolgerungsfähigkeit ihre Position rechtfertigt. Ein Benchmark-Vorsprung allein würde kommerziell weniger bedeutsam.

Das dritte Signal ist die Rendite neuer Rechenzentren. Investitionsausgaben zeigen Lesern, wie stark Technologieunternehmen an die künftige Nachfrage glauben. Auslastung und Umsatz zeigen, ob dieser Glaube richtig war.

Nvidias jüngstes Wachstum zeigt, dass der Infrastrukturzyklus nach dem ursprünglichen DeepSeek-Schock robust geblieben ist. Die angekündigte Senkung der Inferenzkosten zeigt zudem, dass amerikanische Hardwareunternehmen am selben Effizienzwettlauf teilnehmen.

Entscheidend ist, ob Anwendungen schnell genug wachsen, um neue Systeme auszulasten. Verzögerte Rechenzentrumsprojekte, eine geringere Auslastung oder sinkende Cloud-Margen würden die optimistischste Interpretation schwächen.

Anhaltendes Umsatzwachstum, höhere Inferenzkapazitäten und mehr Agenten-Deployments würden sie dagegen stärken. Diese Ergebnisse würden zeigen, dass günstige KI den Markt schneller erweitert, als sie die Ausgaben pro Einheit reduziert.

Für Entwickler und Unternehmenskäufer ist die unmittelbare Lehre praktisch: Die Wahl eines Modells sollte eine Entscheidung nach Arbeitslast sein, keine dauerhafte Bindung.

Teams sollten Genauigkeit, Latenz, Datenschutz und die Gesamtkosten des Workflows anhand ihrer eigenen Daten bewerten. Zudem sollten sie die Möglichkeit bewahren, den Anbieter zu wechseln, wenn sich der Markt weiterentwickelt.

Wissensarbeiter stehen vor einem ähnlichen Wandel. Niedrigere Modellkosten werden Anwendungen ermöglichen, größere Bestände an Meetings, Dokumenten und Projekthistorien zu analysieren. Der schwierige Teil wird darin bestehen, nützlichen Kontext und vertrauenswürdiges Quellenmaterial zu erhalten.

Eine strukturierte KI-Wissensdatenbank wird wertvoller, wenn Agenten es sich leisten können, viele Suchen, Vergleiche und Verifizierungsschritte durchzuführen.

Die Frage, die sich daher in Google News stellt, lautet nicht, ob Chinas günstige KI-Modelle dem Silicon Valley schaden oder helfen. Je nach Ebene tun sie beides.

Sie bedrohen die Margen von Premium-Modellen, stärken Käufer und senken die technischen Hürden für Anwendungsunternehmen. Gleichzeitig können sie mehr Arbeit für Chips, Clouds, Netzwerke und Rechenzentren erzeugen.

Beobachten Sie, wo die nächsten Milliarden Modellaufrufe ausgeführt werden, welches System sie weiterleitet und ob Kunden genug zahlen, um die zugrunde liegende Infrastruktur zu tragen. Die Antworten darauf werden zeigen, ob die KI-Variante des Jevons-Paradoxons dauerhaften Wert schafft oder nur zu mehr Verbrauch führt.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page