top of page

Scale-Across-Networking trifft auf die Kostenmauer von KI-Rechenzentren

11. Aug.
11 Min. Lesezeit

Google News machte am 11. August auf einen zentralen Konflikt aufmerksam: KI-Cluster benötigen mehr Fläche und Strom, doch die Verbindung mehrerer Standorte kann ihre wirtschaftlichen Vorteile zunichtemachen.

Die zugrunde liegende Diskussion stammte von Data Center Dynamics und einer Branchenrunde zu Data Center Interconnect, kurz DCI, das Datenverkehr zwischen Einrichtungen transportiert. Google, Meta, Nokia, Lumen Technologies und Zayo nahmen an der Sitzung im März 2026 teil. Ihr gemeinsames Problem war folgenreicher als ein weiterer Anstieg der Schlagzeilenbandbreite.

KI-Entwickler wollen zunehmend, dass mehrere Gebäude wie ein einziges Computersystem funktionieren. Dieser als Scale-Across-Networking bezeichnete Ansatz kann die physischen Grenzen eines einzelnen Standorts überwinden. Zugleich setzt er jedoch wertvolle Beschleuniger Glasfaserausfällen, Überlastung, Entfernung und Synchronisationsverzögerungen aus.

Im Kern geht es daher um Kosten gegen Leistung. Betreiber können Rechenkapazität in der Nähe verfügbarer Energie platzieren und auf mehrere Standorte verteilen. Dann müssen sie ein optisches Netzwerk aufbauen, das schnell und zuverlässig genug ist, um teure Prozessoren produktiv zu halten.

Google und Meta beschreiben bereits Architekturen, die Gebäudegrenzen überschreiten. Ausrüstungsanbieter werben für schnellere kohärente Optik, die Daten zur Übertragung über längere Strecken auf Licht moduliert. Nichts davon garantiert, dass verteiltes Training im Produktionsmaßstab wirtschaftlich bleibt.

Google News zeigt eine Netzwerkarchitektur auf dem Weg in die Produktion

Scale-Across-Networking entwickelt sich von einem Branchenvorschlag zu einer Designanforderung für die größten KI-Cluster.

Das OFC panel program bezeichnete DCI als das am schnellsten wachsende Netzwerksegment mit einem jährlichen Wachstum von mehr als 50 Prozent. Es identifizierte Scale-Across zudem als eigenständigen Back-End-Anwendungsfall und nicht als gewöhnlichen standortübergreifenden Datenverkehr.

Traditionelles DCI transportiert Anwendungs-, Speicher-, Replikations- und Kundendatenverkehr zwischen Einrichtungen. Diese Datenströme können hohe Kapazitäten erfordern, tolerieren jedoch meist stärkere Schwankungen als synchronisiertes KI-Training.

Ein Back-End-KI-Netzwerk verbindet Beschleuniger, während sie an derselben Trainings- oder Inferenzaufgabe arbeiten. Jeder Prozessor tauscht wiederholt Modellparameter, Zwischenergebnisse und Synchronisationsnachrichten aus. Verzögerter Datenverkehr kann dazu führen, dass Prozessoren warten, obwohl lokale Rechenressourcen verfügbar bleiben.

Scale-Across erweitert dieses Back-End-Fabric über ein Gebäude hinaus. Die beteiligten Einrichtungen bilden eine größere Rechendomäne, obwohl sie durch Glasfaser und geografische Distanz getrennt sind.

Diese Unterscheidung ist wichtig, weil Betreiber nicht mehr nur unabhängige Rechenzentren für Resilienz oder Datenbewegung verbinden. Sie versuchen, Beschleuniger standortübergreifend als Komponenten einer einzigen Maschine zu koordinieren.

Nokias Darstellung der Diskussionsrunde teilte KI-Konnektivität in drei Dimensionen ein. Scale-Up verbindet Prozessoren innerhalb eines Racks, Scale-Out verknüpft Racks innerhalb einer Einrichtung, und Scale-Across verbindet Cluster über eine Einrichtung hinaus.

Diese Kategorien bringen unterschiedliche technische Anforderungen mit sich. Innerhalb von Racks sind kurze Kupferverbindungen weiterhin üblich, während optische Verbindungen längere Strecken dominieren. Scale-Across ergänzt das KI-Fabric um kohärente Übertragung, Leitungssysteme, Glasfasertrassen und betriebliche Steuerungen.

Google-Ingenieur Kevin Croussore nahm gemeinsam mit Vertretern von Meta, Zayo, Lumen Technologies und Nokia an der Diskussionsrunde teil. Ihre Beteiligung zeigte, dass das Problem Cloud-Betreiber, Netzbetreiber und Ausrüstungsanbieter gleichermaßen betrifft.

Auch der Zeitpunkt ist bedeutsam. Im April 2026 stellte Google Virgo Network vor, sein neues Scale-Out-Fabric für den AI Hypercomputer. Google erklärte, dass die Trainingsanforderungen inzwischen die in einzelnen Rechenzentren verfügbare Stromversorgung und Fläche übersteigen.

Die Virgo architecture verwendet eine flache, zweistufige Topologie und unabhängige Steuerungsdomänen. Google entwickelte sie, um Netzwerkebenen zu reduzieren und gleichzeitig vorhersehbare Latenz sowie Fehlerisolation bereitzustellen.

Virgo macht nicht jedes entfernte Rechenzentrum einem lokalen Rack gleichwertig. Es zeigt jedoch, dass Google einen Campus nun als eine Rechenumgebung und nicht als Sammlung isolierter Gebäude behandelt.

Dieser Architekturwandel erzeugt die zentrale Spannung des Artikels. Die Aufteilung eines Clusters auf mehrere Einrichtungen kann Strom und Fläche erschließen. Sie führt jedoch auch ein Netzwerk ein, dessen Kosten und Verhalten die nutzbare Rechenleistung direkt beeinflussen.

Betreiber können DCI nicht länger allein anhand der Rohkapazität bewerten. Sie müssen fragen, wie viel Beschleunigerzeit das Netzwerk erhält, wie schnell es sich erholt und wie viel Energie jedes transportierte Bit verbraucht.

Stromknappheit zwingt KI-Cluster über Gebäudegrenzen hinweg

Der Druck entsteht durch ein Missverhältnis zwischen konzentriertem Rechenbedarf und dem langsameren Ausbau strombereiter Rechenzentrumskapazitäten.

Große KI-Systeme bündeln Tausende Beschleuniger, Speichergeräte, Switches, Kühlkomponenten und Stromwandlungssysteme. Mehr Prozessoren erhöhen auch die benötigte unterstützende Infrastruktur, um sie mit Strom zu versorgen, zu kühlen und zu verbinden.

Ein einzelnes Gebäude stößt schließlich an Grenzen durch Energieversorgung, Umspannwerke, Kühlsysteme, Bauzeiten und lokale Genehmigungen. Betreiber können dichtere Racks planen, doch höhere Dichte schafft keine zusätzliche Netzkapazität.

Daten zu bewegen ist oft praktischer, als elektrische Energie über lange Strecken zu transportieren. Glasfaser wird dadurch zu einem Werkzeug, um separat versorgte Einrichtungen zu einem größeren Ressourcenpool zusammenzufassen.

Google beschrieb dieses Prinzip im Mai 2026 direkt. Das Unternehmen erklärte, es platziere Rechenzentren in der Nähe von Energieressourcen und verteile KI-Workloads anschließend über sein Netzwerk auf mehrere Campus.

Seine globale Infrastruktur verdeutlicht den Umfang dieser Investition. Google zufolge stieg die Bandbreite seines Wide-Area-Netzwerks zwischen 2020 und 2025 auf das Siebenfache. Dieses Netzwerk unterstützt Verbraucherdienste, Cloud-Datenverkehr, Trainingsdaten und KI-Rechenressourcen.

Meta steht vor derselben physischen Einschränkung in einem anderen Maßstab. Sein Prometheus-Cluster ist für eine Kapazität von einem Gigawatt über mindestens fünf Rechenzentrumsgebäude hinweg ausgelegt.

Prometheus integriert laut Metas Infrastrukturbericht auch angrenzende Colocation-Flächen und temporäre wetterfeste Strukturen. Diese Anordnung macht das Netzwerk zu einem Bestandteil des grundlegenden Bauplans des Clusters.

Metas größeres Hyperion-Projekt soll 2028 schrittweise in Betrieb gehen. Das Unternehmen erklärt, dass der fertiggestellte Cluster bis zu fünf Gigawatt unterstützen wird.

Diese Zahlen zeigen, warum Scale-Across jetzt an Aufmerksamkeit gewinnt. Einrichtungen dieser Größe können nicht von einer konventionellen einzelnen Rechenzentrumshalle oder einem einzigen lokalen Switching-Fabric abhängen.

Metas Back-End-Aggregationssystem BAG verbindet mehrere KI-Fabrics über Einrichtungen hinweg. BAG ist eine zentralisierte Ethernet-Super-Spine-Schicht, das heißt, sie verbindet die oberen Ebenen separater Netzwerk-Fabrics.

Das Unternehmen erklärt, dass back-end aggregation Zehntausende von Prometheus genutzte GPUs miteinander verbinden wird. Sie muss außerdem zwei unterschiedliche Meta-Fabric-Designs überbrücken.

Dieser Ansatz setzt nicht nur Hyperscaler unter Druck. Cloud-Anbieter benötigen ausreichend standortübergreifende Kapazität, um große Beschleunigerpools anzubieten. Netzbetreiber brauchen Routen mit vorhersehbarer Latenz, physischer Diversität und schnellerer Bereitstellung.

Optische Anbieter müssen die Kapazität steigern, ohne dass Stromverbrauch, Modulkosten oder Ausfallraten im selben Tempo wachsen. Rechenzentrumsentwickler müssen zudem Glasfasertrassen planen, bevor Gebäude eröffnet werden.

Unternehmenskäufer spüren eine indirekte Folge. Ihre Kosten für KI-Dienste hängen teilweise davon ab, wie effizient Anbieter Beschleuniger einsetzen. Ein verteiltes Cluster mit schlechter Netzwerkauslastung kann teure Rechenkapazität verschwenden.

Die erzwungene Reaktion ist langfristig. Betreiber müssen Standortwahl, Energiebeschaffung, Glasfasertrassen, Rechenarchitektur und Workload-Software Jahre vor der Inbetriebnahme eines großen Clusters koordinieren.

Scale-Across-Networking eröffnet ihnen eine weitere Designoption, beseitigt jedoch die Knappheit nicht. Es tauscht eine konzentrierte Energieeinschränkung gegen ein Problem verteilter Systeme ein.

Kosteneffizientes Scale-Across-Networking hängt von nutzbarer GPU-Zeit ab

Die günstigste Netzwerkkomponente ist nicht zwangsläufig das Netzwerk mit den niedrigsten Trainingskosten.

KI-Training erfolgt durch wiederholte Berechnung und Kommunikation. Beschleuniger berechnen Ergebnisse lokal, tauschen Informationen aus und warten auf andere Teilnehmer, bevor sie fortfahren.

Dieses Verhalten macht Tail-Latenz besonders wichtig. Tail-Latenz misst die langsamsten Antworten innerhalb einer Gruppe, nicht die durchschnittliche Antwortzeit über den gesamten Datenverkehr.

Eine verzögerte Verbindung, ein überlasteter Pfad oder ein schwächelnder Knoten kann einen deutlich größeren Auftrag ausbremsen. Die Kosten zeigen sich als ungenutzte Beschleunigerzeit und nicht als einfache Netzwerkgebühr.

Deshalb bietet Rohbandbreite nur ein unvollständiges Maß für die Scale-Across-Ökonomie. Eine Verbindung mit hoher Kapazität kann dennoch inkonsistente Abschlusszeiten, schwache Fehlerwiederherstellung oder übermäßigen Energieverbrauch liefern.

Google entwickelte Virgo rund um deterministische Latenz, hohe Bisection-Bandbreite und Hardware-Fehlerisolation. Bisection-Bandbreite misst, wie viel Datenverkehr gleichzeitig zwischen zwei Hälften eines Netzwerks übertragen werden kann.

Diese Merkmale sollen verteilte Aufgaben vorhersehbar in Bewegung halten. Sie veranschaulichen auch, wie sich KI-Netzwerke von Best-Effort-Anwendungsverkehr unterscheiden.

Meta begegnet dem Problem durch Änderungen am Netzwerk und an der Software. Die Prometheus-Arbeit umfasst Twine und MAST, Systeme zur Unterstützung von Training über geografisch verteilte Rechenzentren hinweg.

Die Planung wird entscheidend, weil nicht jeder Workload jede Distanz überqueren sollte. Ein Betreiber kann eng synchronisierte Aufgaben innerhalb einer Lokalität platzieren und weniger sensible Phasen über eine größere Region verteilen.

Kohärente Optik ermöglicht längere Verbindungen mit hoher Kapazität. Die Technologie nutzt anspruchsvolle Modulation und Signalverarbeitung, um Daten über Glasfaserverbindungen zu erhalten, die über gewöhnliche Rechenzentrumsdistanzen hinausreichen.

Moderne kohärente Module können in steckbare, switchseitige Formate passen. Das verringert bei einigen Anwendungen die Abhängigkeit von separaten Transport-Racks und kann Bereitstellungen vereinfachen.

Die Anschaffungskosten eines Moduls sind jedoch nur ein Teil der Netzwerkökonomie. Betreiber müssen Glasfaserverfügbarkeit, Leitungssysteme, Verstärkung, Überwachung, Austauschaufwand, Sicherheit und Reservekapazität berücksichtigen.

Das Netzwerk verbraucht zudem Energie, die andernfalls die Rechenleistung unterstützen könnte. Ein Design, das die Bandbreite steigert und zugleich mehr optische und Switching-Ausrüstung erfordert, kann die ursprüngliche Energieeinschränkung des Standorts verschärfen.

Ciena bewirbt in seinem DCI-Portfolio Systeme mit 400G, 800G und 1.6T. Marvell hat in ähnlicher Weise 1.6T-kohärente Module für aufkommende Scale-Across-Bereitstellungen beschrieben.

Diese Roadmaps signalisieren erhebliches Kapazitätswachstum. Sie belegen jedoch nicht, dass jeder KI-Workload diese Kapazität effizient über mehrere Einrichtungen hinweg nutzen kann.

Software muss Platzierung, Routing, Überlastungssteuerung, Checkpointing und Wiederherstellung koordinieren. Betreiber benötigen außerdem Transparenz über Rechen- und Transportschichten hinweg, die zuvor als getrennte Systeme verwaltet wurden.

Ein ausgefallener optischer Pfad sollte nicht dazu führen, dass ein großer Trainingsauftrag von Beginn an neu gestartet werden muss. Netzwerk und Workload-Scheduler benötigen koordinierte Wiederherstellungsstrategien, die verlorene Arbeit begrenzen.

Diese Anforderung verändert, wie Käufer verschiedene Designs vergleichen sollten. Die Kosten pro transportiertem Bit bleiben nützlich, doch die Kosten pro abgeschlossenem Trainingsschritt liegen näher am Geschäftsergebnis.

Jobabschlusszeit, Auslastung der Beschleuniger, optische Leistungsaufnahme und Wiederherstellungsdauer gehören in dieselbe Analyse. Sie als getrennte Beschaffungskennzahlen zu behandeln, kann die tatsächlichen Kosten verschleiern.

Scale-across wird erst dann kosteneffizient, wenn das Netzwerk genügend produktive Prozessorzeit erhält, um seine zusätzliche Infrastruktur zu rechtfertigen. Schnellere Optik unterstützt dieses Ziel, doch Architektur und Betrieb entscheiden über das Ergebnis.

Offenes Ethernet steht unter Leistungsdruck proprietärer Systeme

Scale-across-Netzwerke verschärfen den Wettbewerb zwischen interoperablen Ethernet-Systemen und eng kontrollierten Accelerator-Fabrics.

Ethernet verfügt über eine enorme installierte Basis, einen breiten Zuliefermarkt und ausgereifte Betriebssysteme. Diese Vorteile können die Abhängigkeit von einzelnen Anbietern verringern und Betreibern mehr Auswahl bei Komponenten geben.

Metas BAG-Design nutzt Ethernet, um verschiedene Back-End-Fabrics zusammenzuführen. Diese Entscheidung zeigt, wie ein Hyperscaler eine gemeinsame Verbindungsebene beibehalten und darunter spezialisierte Systeme entwickeln kann.

Auch Google entwickelt vertikal über Chips, Systeme, Netzwerk-Fabrics, Software und Cloud-Dienste hinweg. Vertikale Kontrolle erlaubt es dem Unternehmen, mehrere Schichten auf seine Workloads abzustimmen, selbst wenn einzelne Schnittstellen etablierte Standards nutzen.

Nvidia bietet mit NVLink, InfiniBand, Spectrum-X Ethernet und seinen Rack-Scale-Systemen einen anderen Referenzpunkt. Sein Portfolio verbindet Beschleuniger, Switches, Schnittstellenhardware und Software in einer abgestimmten Architektur.

Engere Integration kann eine vorhersehbarere Leistung ermöglichen und Unsicherheit bei der Bereitstellung verringern. Sie kann jedoch auch den Austausch von Komponenten begrenzen und Entscheidungen über die Roadmap bei einem Anbieter konzentrieren.

Offene Systeme versprechen Flexibilität, doch Interoperabilität garantiert kein effizientes verteiltes Training. Geräte unterschiedlicher Anbieter können dieselbe nominelle Linkrate unterstützen und sich unter Überlastung oder bei Ausfällen dennoch unterschiedlich verhalten.

Betreiber stehen daher vor einer schwierigen Kaufentscheidung. Eine stärker integrierte Architektur kann den Engineering-Aufwand reduzieren, während ein offenes Design die Beschaffungsflexibilität und die langfristige Verhandlungsposition verbessern kann.

Die Debatte erstreckt sich auch auf optische Schnittstellen. Steckbare Module ermöglichen Austauschbarkeit und Lieferantenwahl, während Co-Packaged Optics optische Engines näher an das Switching-Silizium bringen.

Co-Packaged Optics können die elektrische Distanz zwischen einem Switch-Chip und seiner optischen Verbindung verringern. Kürzere elektrische Wege können bei hohen Datenraten die Signalintegrität und Energieeffizienz verbessern.

Die Wartbarkeit wird schwieriger, wenn Optik und Switching-Hardware enger integriert sind. Der Austausch eines kleinen defekten Moduls ist einfacher als die Wartung einer optischen Engine, die mit einem teuren Switch-Package verbunden ist.

Lineare steckbare Optik entfernt einen digitalen Signalprozessor aus dem Modul. Dieser Ansatz kann Energieverbrauch und Latenz senken, verlagert jedoch mehr Verantwortung für die Signalverarbeitung auf die Host-Ausrüstung.

Data Center Dynamics nannte in seiner Analyse der Netzwerkkomplexität die Zuverlässigkeit optischer Komponenten und Tail-Latenz als aufkommende Einschränkungen. Zudem wurde darauf hingewiesen, dass schnellere Erneuerungszyklen den Druck auf Design- und Installationsteams erhöhen.

Die physische Schicht wird leicht übersehen. Mehr Glasfaser bedeutet größere Kabelbündel, dichtere Panels, engere Verlustbudgets und anspruchsvollere Testverfahren.

Ein logisches Netzwerkdiagramm kann zwei Standorte zeigen, die über redundante Pfade verbunden sind. In der Praxis können beide Pfade dieselben Rohrtrassen, Brücken, Stromsysteme oder Baurisiken teilen, sofern Betreiber die physische Diversität nicht überprüfen.

Standards können Kosten senken, indem sie größere Komponentenmärkte schaffen. Sie können sich jedoch auch langsamer entwickeln als proprietäre Systeme, die sich am Zeitplan eines einzelnen Anbieters orientieren.

Deshalb bleibt der zentrale Wettbewerb Kosten gegen Leistung, nicht Ethernet gegen einen bestimmten Wettbewerber. Die Lieferantenstrategie unterstützt diesen Wettbewerb, ersetzt ihn aber nicht.

Ein offenes Netzwerk, das Prozessoren unbeschäftigt lässt, ist teuer. Ein proprietäres Netzwerk, das Käufer an ungünstige Upgrades bindet, kann ebenfalls teuer werden.

Der erfolgreiche Ansatz wird vorhersehbare Jobleistung liefern und zugleich beherrschbare Anforderungen an Energie, Wartung und Beschaffung bewahren. Keine einzelne Schnittstellenspezifikation beweist dieses Ergebnis für sich allein.

Die optische Roadmap muss sich noch bei der Zuverlässigkeit bewähren

Die größte Unsicherheit besteht darin, ob neue optische Systeme ihre beworbene Kapazität unter kontinuierlichen KI-Workloads liefern können, ohne neue Betriebskosten zu verursachen.

Optische Verbindungen transportieren bereits Traffic innerhalb und zwischen großen Rechenzentren. Scale-across verändert das Verkehrsmuster, die Ausfallanfälligkeit und die erwartete Auslastung dieser Verbindungen.

KI-Back-End-Traffic kann dauerhaft und synchronisiert sein. Er kann Links über lange Zeit auslasten und weniger Spielraum für Wartungsereignisse oder unvorhersehbare Leistung lassen.

Höhere Signalisierungsraten verkleinern zudem die technischen Spielräume. Komponenten müssen die Signalqualität in dichten, heißen und energiebegrenzten Umgebungen bewahren.

Die Branche bewegt sich von 400G hin zu 800G-Coherent-Pluggables, während Anbieter 1.6T-Produkte vorbereiten. Jeder Übergang betrifft Switches, Module, Testausrüstung, Glasfaserdesigns und Betriebspraktiken.

IEEE Spectrum berichtete, dass Optikanbieter zudem Dense Wavelength Division Multiplexing für kürzere KI-Verbindungen entwickeln. DWDM überträgt mehrere optische Wellenlängen über eine Faser.

Ein Design aus dem Jahr 2026 verteilt den Traffic auf acht Kanäle mit niedrigeren Datenraten und zielt auf aggregierte Geschwindigkeiten von bis zu 1,6 Terabit pro Sekunde. Die Entwickler planen eine breitere Produktion vor den erwarteten Bereitstellungen im Jahr 2028.

Die Roadmap für optische Skalierung ist vielversprechend, doch Lieferantenziele sind kein Produktionsnachweis. Fertigungsausbeute, thermisches Verhalten, Fehlerraten und Langzeitzuverlässigkeit müssen weiterhin im Feld validiert werden.

Dieselbe Vorsicht gilt für Leistungsversprechen der Anbieter. Eine geringere Leistungsaufnahme eines Moduls senkt nicht automatisch den Gesamtenergieverbrauch des Systems, wenn die Architektur mehr Links oder Reservekapazität erfordert.

Höhere Bandbreite garantiert keine kürzere Jobabschlusszeit. Überlastungssteuerung, Workload-Platzierung und Software-Wiederherstellung können bei Ausfällen die Ergebnisse dominieren.

Entfernung schafft eine weitere feste Einschränkung. Licht ist schnell, doch Laufzeitverzögerungen lassen sich weder durch Software noch durch bessere Modulation beseitigen.

Zusätzliche Switches, optische Konvertierungen, Warteschlangen und Fehlerkorrektur erhöhen die Verzögerung weiter. Betreiber können diese Nachteile reduzieren, aber eine entfernte Anlage nicht exakt wie ein benachbartes Rack verhalten lassen.

Das begrenzt die für Scale-across geeigneten Workloads. Einige Trainingsjobs können eine breitere Verteilung tolerieren, insbesondere mit Software, die auf Lokalität und Checkpointing ausgelegt ist.

Andere Aufgaben erfordern extrem häufige Synchronisierung. Ihre Wirtschaftlichkeit kann sich verschlechtern, wenn Netzwerkdistanz die Prozessoren wiederholt ausbremst.

Zuverlässigkeit hat auf Cluster-Ebene zudem eine andere Bedeutung. Eine Komponente mit einer niedrigen individuellen Ausfallrate kann dennoch häufige Vorfälle verursachen, wenn sie über eine enorme Anzahl von Links eingesetzt wird.

Dann zählt die Reparaturzeit ebenso stark wie die Ausfallhäufigkeit. Techniker müssen möglicherweise beschädigte Fasern lokalisieren, Module austauschen, Steckverbinder reinigen und Pfade über mehrere Anlagen hinweg erneut testen.

Operative Kompetenzen können zum Engpass werden. Dichte optische Anlagen erfordern spezialisierte Verfahren für Installation, Dokumentation, Messung und Fehlersuche.

Lieferketten schaffen weitere Unsicherheit. Eine beschleunigte Einführung kohärenter Module, Laser, Steckverbinder und Glasfaserausrüstung kann Engpässe oder uneinheitliche Qualität verursachen.

Die skeptische Schlussfolgerung lautet nicht, dass Scale-across scheitern wird. Google, Meta und ihre Lieferanten haben klare Gründe, darin zu investieren.

Die offene Frage ist, ob verteilte Cluster nach Berücksichtigung realer Ausfälle, Wartung und Software-Overhead eine hohe Auslastung aufrechterhalten können. Öffentliche Kapazitätsspezifikationen beantworten diese Frage nicht.

Käufer sollten Kostensenkungsversprechen als architekturspezifisch behandeln. Ein Ergebnis aus dem kundenspezifischen Netzwerk eines Hyperscalers lässt sich möglicherweise nicht auf einen kleineren Betreiber mit anderen Einrichtungen, Glasfasertrassen und Software übertragen.

Worauf Google-News-Leser als Nächstes achten sollten

Drei Signale werden zeigen, ob Scale-across-Netzwerke zu einem wirtschaftlichen Produktionsmodell statt zu einer teuren Übergangslösung werden.

Das erste Signal sind gemessene Auslastungswerte aus betriebenen Clustern über mehrere Gebäude hinweg. Metas Prometheus-Bereitstellung bietet einen besonders relevanten Test, da ihre geplante Kapazität von einem Gigawatt mehrere Bauwerke umfasst.

Meta hat seine Netzwerktopologie erläutert, doch die entscheidenden Belege werden aus anhaltender Workload-Leistung kommen. Nützliche Offenlegungen würden Jobabschlusszeit, Auslastung der Beschleuniger, Wiederherstellungsdauer und netzwerkbedingte Unterbrechungen umfassen.

Eine hohe Auslastung über mehrere Gebäude hinweg würde das Argument stützen, dass Glasfaser ungenutzte Stromkapazität erschließen kann, ohne Rechenressourcen zu verschwenden. Häufige Synchronisierungsunterbrechungen würden es schwächen.

Das zweite Signal ist die Verfügbarkeit von 1.6T-Coherent-Modulen in der Produktion. Anbieter haben Produkte und Sampling-Zeitpläne angekündigt, doch Betreiber benötigen Verfügbarkeit in großen Stückzahlen und Zuverlässigkeit im Feld.

Achten Sie auf Qualifizierung durch Hyperscaler, Carrier-Bereitstellungen, Interoperabilitätstests und Leistungsmessungen auf Ebene des Gesamtsystems. Modulspezifikationen allein sagen wenig über die Bereitstellungskosten aus.

Eine erfolgreiche Qualifizierung durch mehrere Anbieter würde Kapazitäts- und Beschaffungsoptionen verbessern. Verzögerungen, schwache Ausbeuten oder hohe Ausfallraten würden die Wirtschaftlichkeit von 800G-Systemen länger erhalten.

Das dritte Signal ist, wie Google, Meta und Nvidia Workloads über Netzwerkdomänen hinweg aufteilen. Ihre Softwareentscheidungen werden zeigen, wo Scale-across Mehrwert schafft und wo physische Lokalität notwendig bleibt.

Google erklärt, dass sein Netzwerk das Fabric innerhalb des AI Hypercomputer, das Fabric darüber hinweg und sein globales Backbone umfasst. Meta verbindet unterschiedliche Trainings-Fabrics über BAG.

Nvidia entwickelt weiterhin integrierte Systeme für Scale-up-, Scale-out- und Scale-across-Umgebungen. Die Grenzen zwischen diesen Domänen werden ebenso wichtig sein wie ihre Höchstgeschwindigkeiten.

Eine Bewegung hin zu lokalitätsbewusster Planung würde bestätigen, dass Entfernung eine harte Designbeschränkung bleibt. Eine breite Platzierung synchronisierter Jobs über verschiedene Anlagen hinweg würde darauf hindeuten, dass Netzwerk- und Softwareverbesserungen diesen Nachteil verringern.

Google News ist hier als Entdeckungskanal nützlich, nicht als technischer Beleg. Leser sollten den zugrunde liegenden Engineering-Publikationen, Bereitstellungsberichten und unabhängigen Tests folgen.

Für Entwickler betrifft der Wandel die verfügbare Beschleunigerkapazität und das Verhalten verteilter Trainingsplattformen. Für Unternehmenskäufer kann er die Zuverlässigkeit von Diensten, regionale Verfügbarkeit und die Kosten für KI-Computing beeinflussen.

Netzwerkarchitekten sollten vollständige Workload-Ergebnisse bewerten, statt Linkraten isoliert zu vergleichen. Beschaffungsteams sollten zudem Nachweise zu Fehlerwiederherstellung, Energieverbrauch und Interoperabilität anfordern.

Die wichtigste Frage ist praktisch: Erzeugt ein weiteres angebundenes Gebäude einen proportionalen Rechenwert, nachdem Netzwerkkosten und Verzögerungen berücksichtigt wurden?

Beobachten Sie diese drei Signale, bevor Sie Behauptungen akzeptieren, dass Scale-across das Kostenproblem von KI-Rechenzentren gelöst hat. Das Netzwerk muss beweisen, dass verteilte Stromkapazität zu produktivem Computing wird und nicht zu ungenutzter Kapazität, die durch teure Glasfaser verbunden ist.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page