top of page

Panmnesia CXL-Scale-Up-Fabric erweitert KI-Server über das Rack hinaus

14. Sept.
13 Min. Lesezeit

Panmnesia hat eine CXL-Scale-Up-Fabric vorgeschlagen, die kohärente Kommunikation über Racks hinweg ausdehnt – trotz der Grenzen elektrischer Übertragungsdistanzen, die CXL-Implementierungen bislang begrenzt haben. Das Design bringt CPUs, Beschleuniger und Speicher in einer größeren gemeinsamen Domäne zusammen. Laut den Autoren kann eine Konfiguration 960 Beschleuniger umfassen.

Damit erhält Compute Express Link, kurz CXL, eine deutlich ambitioniertere Rolle als bei den heute in Servern eingesetzten Speichererweiterungsprodukten. CXL ist ein offener Interconnect, über den Prozessoren und Geräte Speicher gemeinsam nutzen können, während die Hardware die Datenkonsistenz wahrt. Panmnesia und zwei Meta-Forscher fragen, ob sich diese Semantik auf wesentlich größere Teile eines KI-Rechenzentrums ausweiten lässt.

Der Vorschlag belegt nicht, dass Meta eine solche Fabric einsetzen will. Er zeigt auch kein vollständiges System mit 960 Beschleunigern unter Produktivlast. Im Kern geht es um den Wettbewerb zwischen hardwarekohärentem Scale-Up und den Ethernet- oder InfiniBand-Netzwerken, die Ressourcen heute rackübergreifend verbinden.

Die Panmnesia CXL-Scale-Up-Fabric denkt die Rack-Grenze neu

Der Vorschlag betrachtet Rack-Grenzen als technische Einschränkungen, nicht als dauerhafte Grenzen eines kohärenten Computers.

Die Architektur erschien in einem am 10. August 2026 online veröffentlichten Übersichtsartikel in Nature Reviews Electrical Engineering. Zehn Autoren sind Panmnesia zugeordnet, während Kayvon Shakeri und Han Wang bei Meta Infra tätig sind.

Der CXL-Scale-Up-Überblick beschreibt ein Rechenzentrum „wie ein einziger Chip“. Das bedeutet nicht, dass Racks buchstäblich zu einem Prozessor werden. Gemeint ist, vertraute Eigenschaften auf Chipebene – einschließlich gemeinsamer Adressierung und geordneter Transaktionen – auf ein größeres physisches System zu übertragen.

Die meisten Produktivserver organisieren Ressourcen weiterhin um einen relativ fest definierten Knoten herum. Ein Host-Prozessor verwaltet lokalen Speicher und ist über kurze elektrische Verbindungen mit Beschleunigern verbunden. Ethernet oder InfiniBand transportieren Daten, sobald eine Arbeitslast die Server- oder Rack-Grenze überschreitet.

Dieses Modell skaliert zu enormen Clustern, doch entfernte Kommunikation verhält sich anders als ein lokaler Speicherzugriff. Software muss Nachrichten vorbereiten, Daten durch Netzwerk-Stacks bewegen und Kopien oder Synchronisierung koordinieren. Überlastung und wechselnde Routen können zudem zu variierenden Abschlusszeiten führen.

Die vorgeschlagene Fabric versucht, speicherähnlichen Zugriff über einen größeren Bereich hinweg zu bewahren. Sie kombiniert einen hochgradig vernetzten, nicht blockierenden Switch, eine Link Acceleration Unit und einen Fabric-Controller. Diese Komponenten koordinieren Datenverkehr, Kohärenz, Wiederherstellung und Ressourcenplatzierung.

Panmnesia zufolge könnte eine CPU in der untersuchten Konfiguration 16 Beschleuniger direkt koordinieren, gegenüber zwei in der Referenzanordnung. Die Autoren beschreiben zudem eine Kohärenzdomäne mit bis zu 960 Beschleunigern, rund dem 13-Fachen der genannten Referenzplattform.

Eine Kohärenzdomäne ist eine Gruppe von Komponenten, die eine konsistente Sicht auf den Speicher teilen. Wenn ein Gerät zwischengespeicherte Daten verändert, stellt das System sicher, dass andere Beteiligte keine veraltete Version weiterverwenden. Die Ausweitung dieses Verhaltens reduziert einen Teil der Softwarekoordination, überträgt dem Interconnect jedoch mehr Zustandsverantwortung.

Die Autoren schätzen außerdem Round-Trip-Zugriffe über mehrere Server hinweg auf mehrere hundert Nanosekunden. Herkömmliche netzwerkbasierte Pfade können im Mikrosekundenbereich liegen. Diese Werte veranschaulichen die angestrebte Wirkung der Architektur und sind keine unabhängig gemessene Leistung eines vollständig aufgebauten Rechenzentrums.

Dieser Unterschied ist wichtig. Der Vorschlag erweitert eine bestehende technische Entwicklungslinie, doch seine größte Konfiguration bleibt ein Designziel. Die physischen Komponenten und das rechenzentrumsweite System befinden sich in unterschiedlichen Validierungsphasen.

Warum KI-Infrastruktur mehr als schnellere Beschleuniger benötigt

KI-Server stehen unter Druck, weil installierte Rechenleistung, Speicher und Bandbreite selten im selben Verhältnis skalieren.

KI-Training und Inferenz verteilen Arbeit auf Prozessoren, weil kein einzelner Beschleuniger jedes Modell, jede Aktivierung und jeden Cache großer Arbeitslasten aufnehmen kann. Zusätzliche Beschleuniger erhöhen die theoretische Rechenleistung, doch diese Geräte müssen fortlaufend Parameter, Zwischenergebnisse und Speicherinhalte austauschen.

Die Inferenz großer Sprachmodelle stellt ein besonders ausgeprägtes Speicherproblem dar. Jede aktive Sequenz erzeugt einen Key-Value-Cache, der die Aufmerksamkeitsdaten speichert, die zur Generierung späterer Tokens erforderlich sind. Längere Kontexte und mehr gleichzeitige Nutzer vergrößern diesen Cache, selbst wenn das Modell unverändert bleibt.

Betreiber können Server mit festen Verhältnissen von CPUs, Speicher und Beschleunigern kaufen. Benötigt eine Arbeitslast jedoch zusätzlichen Speicher, kann sie sie dazu zwingen, weitere Rechenleistung zu beschaffen, die anschließend ungenutzt bleibt. Umgekehrt hilft freier Speicher in einem Knoten einer speicherarmen Aufgabe an anderer Stelle kaum.

CXL-Pooling entkoppelt einige dieser Beschaffungsentscheidungen. Ein CXL-Type-3-Gerät stellt einem Host beispielsweise Speicher bereit, ohne selbst wie ein weiterer Universalserver zu agieren. Switching kann mehreren Hosts Zugriff auf Pools ermöglichen, statt jede Ressource dauerhaft einer einzelnen Maschine zuzuweisen.

Meta hat bereits einen enger gefassten Produktiveinsatz beschrieben. Das Vistara-Projekt bindet zurückgewonnenen DDR4-Speicher über einen kundenspezifischen CXL-Speichererweiterungschip an neuere Server an. Nach den auf der ISCA 2026 präsentierten Ergebnissen benötigten evaluierte verteilte Inferenz-Workloads bis zu 25 Prozent weniger Server.

Meta berichtete zudem, dass eine verteilte Cache-Workload die durchschnittliche Zeit zur Verarbeitung von Abfragen um etwa 29 Prozent verringerte. Diese Ergebnisse betreffen praktische Speichererweiterungen innerhalb von Servern. Sie validieren nicht Panmnesias vollständige rackübergreifende Architektur.

Dennoch liefert Vistara einen wichtigen Grund, den umfassenderen Vorschlag ernst zu nehmen. CXL ist nicht länger nur eine Spezifikation, die auf nützliche Hardware wartet. Ein Hyperscaler hat gezeigt, dass kohärente Speichererweiterung unter Produktionsbedingungen Serverzahlen und Workload-Leistung verändern kann.

Panmnesia verfolgt die andere Seite dieses Weges. Das Unternehmen entwickelt Controller- und Switching-Technologie, die die Zahl der Geräte erhöhen soll, die CXL verbinden kann. Auf der ISCA 2026 präsentierte das Unternehmen Siliziumergebnisse für einen latenzarmen Controller und einen Switch mit portbasierter Weiterleitung.

Die Siliziumevaluierung berichtete einen stabilen Betrieb in Konfigurationen mit bis zu 64 Knoten. Dieses Ergebnis gehört zu Panmnesias Controller- und Switch-Forschung, nicht zum vorgeschlagenen Einsatz mit 960 Beschleunigern.

Zusammen schließen die Projekte von Meta und Panmnesia zwei unterschiedliche Lücken. Meta zeigt, warum ein Betreiber CXL in realer Infrastruktur einsetzen könnte. Panmnesia zeigt, wie spezialisierte Hardware über direkt angebundenen Speicher hinaus skalieren kann, ohne sämtliche Latenzkosten konventioneller PCIe-Designs zu übernehmen.

Der Druck betrifft auch Beschleunigeranbieter und Netzwerkausrüster. Wenn kohärente Fabrics mehr Kommunikation innerhalb eines KI-Systems abdecken, könnte ein Teil des Datenverkehrs den Netzwerk-Stack umgehen. Ethernet und InfiniBand blieben unverzichtbar, doch die Grenze zwischen Speicherzugriff und Vernetzung würde sich verschieben.

Hardware mit fester Hop-Zahl zielt auf Netzwerkvariabilität

Der zentrale Mechanismus ist nicht allein die reine Link-Geschwindigkeit. Es geht um einen besser vorhersehbaren Pfad für Daten- und Kohärenzoperationen.

Vernetzte KI-Systeme überbrücken Distanzen, indem sie mehrere Abstraktionsebenen akzeptieren. Eine Anfrage kann Software, Netzwerkschnittstellen-Controller, Switches, Warteschlangen und Protokollverarbeitung durchlaufen, bevor sie entfernten Speicher oder einen anderen Beschleuniger erreicht. Diese Flexibilität ermöglicht riesige Bereitstellungen, führt aber auch zu Latenzschwankungen.

Der Überblick bezeichnet diese Streuung zwischen schnelleren und langsameren Anfragen als Hindernis auf Systemebene. Synchronisierte KI-Aufgaben warten häufig auf den langsamsten Beteiligten, bevor sie fortfahren können. Die durchschnittliche Latenz kann akzeptabel wirken, während die Tail-Latency die Auslastung der Beschleuniger weiterhin verringert.

Panmnesias Architektur organisiert Prozessoren, Beschleuniger und Speicher in Trays und Pods. Anschließend verbindet sie diese Einheiten über eine strukturierte Fabric, die eine feste oder begrenzte Zahl von Hops beibehalten soll. Die Ressourcenplatzierung folgt Konzepten aus dem Chip-Floorplanning, bei dem die physische Position die Kommunikationszeit beeinflusst.

Ein nicht blockierender Switch ist darauf ausgelegt, verfügbare Eingänge und Ausgänge zu verbinden, ohne unabhängige Übertragungen auf dieselbe interne Route warten zu lassen. Hoher Fan-out ermöglicht es einem Switching-Element, viele Endpunkte zu erreichen. Keine der beiden Eigenschaften beseitigt Engpässe, doch beide können das Systemverhalten planbarer machen.

Die Link Acceleration Unit übernimmt Operationen, die andernfalls langsamere Eingriffe erfordern würden. Panmnesia beschreibt Hardware für Cache-Kohärenzfunktionen, einschließlich der Verfolgung relevanter zwischengespeicherter Daten und der Invalidierung veralteter Kopien. Ein Fabric-Controller liefert Koordination auf Systemebene und Ressourcenmanagement.

Panmnesias Controller-Arbeit zielt außerdem auf Overhead innerhalb des CXL-Protokollpfads. Viele frühe Implementierungen übernahmen PCIe-orientierte Controller-Designs, da CXL die physische Schicht von PCIe nutzt. Das vereinfachte die Entwicklung, behielt jedoch Puffer- und Synchronisierungsentscheidungen bei, die für Peripherieverkehr konzipiert waren.

Das Unternehmen erklärt, sein Controller teile Puffer über interne Schichten hinweg und entferne einen Teil der Synchronisierung zwischen ihnen. Sein Switch nutzt portbasierte Weiterleitung, die Datenverkehr anhand von Endpunktkennungen weiterleitet. Konventionelle hierarchiebasierte Weiterleitung beschränkt Geräte auf eine baumartige Organisation.

Portbasierte Weiterleitung ermöglicht flexiblere Topologien und Routenauswahl. Der Switch unterstützt beide Ansätze und erlaubt so Kompatibilität, wo eine Hierarchie weiterhin sinnvoll ist. Panmnesia argumentiert, dass diese Änderungen einen Großteil der Latenz ausgleichen, die entsteht, wenn Datenverkehr einen Switch durchquert.

Das Controller-Design ist wichtig, weil jeder zusätzliche Hop das Wertversprechen von CXL gefährdet. Eine Fabric, die Ressourcen gemeinsam nutzbar macht, Speicher jedoch unvorhersehbar langsam werden lässt, kann den Engpass verlagern, ohne ihn zu beseitigen.

Hardwarekohärenz kann auch wiederholte Datenkopien vermeiden. Eine CPU und ein Beschleuniger können mit gemeinsamem Speicher arbeiten, während Controller die Konsistenz erzwingen. Software benötigt weiterhin Zuweisungs- und Planungsrichtlinien, muss aber nicht jede Übertragung als expliziten Netzwerkaustausch implementieren.

Man denke an einen Inferenzdienst, dessen Beschleuniger einen großen gemeinsamen Cache benötigen. Ein netzwerkbasiertes System könnte den Cache partitionieren, Einträge kopieren oder entfernte Blöcke über Remote Direct Memory Access abrufen. Eine kohärente Fabric stellt den Speicher stattdessen als adressierbare Kapazität dar, die von Hardwareprotokollen gesteuert wird.

Dadurch wird entfernter Speicher nicht lokal. Distanz, Switches, Medienkonvertierung und Speichergeräte erhöhen weiterhin die Latenz. Der Vorteil liegt in einem stabilen Zugriffsmodell, das Software erkennen und bei der Planung berücksichtigen kann.

Hier unterscheidet sich die Panmnesia CXL-Scale-Up-Fabric von einem bloß schnelleren Kabel. Sie verlagert Steuerungsfunktionen in die Fabric und ordnet dann physische Ressourcen so an, dass Kommunikationspfade regelmäßig bleiben. Ihr Erfolg hängt davon ab, dass das gesamte System diese Eigenschaften auch beim Wachstum bewahrt.

CXL über Optik vergrößert die Reichweite, verändert jedoch die technische Gleichung

Optische Verbindungen lösen das Problem der elektrischen Reichweite, bringen aber Kosten-, Energie-, Zuverlässigkeits- und Integrationsfragen mit sich, die der Vorschlag noch nicht geklärt hat.

Hochgeschwindigkeits-Elektrosignalisierung funktioniert über kurze Verbindungen gut, einschließlich Leiterbahnen innerhalb eines Servers und Kabeln zwischen nahe beieinanderstehenden Geräten. Mit steigenden Datenraten und Distanzen wird der Signalverlust schwieriger zu beherrschen. Retimer können Signale wiederherstellen, doch jede zusätzliche Komponente verbraucht Energie und erhöht die Latenz.

Glasfaser überträgt Datenverkehr mit hoher Bandbreite über größere Entfernungen und mit geringeren distanzbedingten Verlusten. CXL over optics wandelt das elektrische Protokoll für die Übertragung in optische Signale um und wandelt diese Signale nahe dem empfangenden Endpunkt wieder zurück. Dieser Ansatz kann CXL über die praktische Reichweite von Kupfer hinaus tragen.

Die Übersichtsarbeit beschreibt die elektrisch-optische Integration als Weg über die heutigen Verbindungsgrenzen hinaus. Das ist wichtig, weil eine kohärente Domäne über mehrere Racks hinweg nicht auf idealisierten elektrischen Verbindungen beruhen kann. Das physische Medium wird Teil der Architektur und nicht zu einem Detail, das den Deployment-Teams überlassen bleibt.

Optical CXL ist technisch glaubwürdig. Rambus, Samtec und Viavi demonstrierten zuvor eine Anordnung zur entfernten CXL-Speichererweiterung mit optischer Verkabelung. MACOM hat zudem einen Chipsatz vorgestellt, der PCIe- und CXL-Datenverkehr über Glasfaser transportieren soll.

Marvell hat optische PCIe- und CXL-Konnektivität in seinem breiteren Data-Center-Portfolio gezeigt. Eine Forschungsarbeit von Marvell-Autoren aus dem Jahr 2026 schlug eine photonische CXL-Speicher-Appliance für die Cache-Speicherung großer Sprachmodelle vor. Die berichteten Ergebnisse basierten auf Emulation und Simulation, nicht auf einem allgemein eingesetzten Produkt.

Der breitere Markt bewegt sich in dieselbe Richtung. NVIDIA nutzt bereits optische Transceiver in seinen InfiniBand- und Ethernet-Netzwerksystemen. Die Optical Compute Interconnect Group entwickelt eine offene, protokollagnostische optische Verbindung für Scale-up-KI-Systeme.

Diese Bemühungen stärken das Argument für Optik in Rechennähe. Sie schaffen jedoch auch Wettbewerb. Ein Data-Center-Betreiber könnte eine optische Schicht bevorzugen, die mehrere Protokolle transportiert, statt einer Architektur, die eng mit CXL-Semantik verbunden ist.

Die CXL 4.0 specification erhöhte die Bandbreite und führte Fähigkeiten ein, die für größere Systeme vorgesehen sind. Eine Spezifikation garantiert jedoch nicht, dass optische Module, Switches, Hosts und Management-Software verschiedener Anbieter bei der erforderlichen Latenz interoperabel zusammenarbeiten.

Jede elektrisch-optische Umwandlung schafft einen neuen potenziellen Ausfallpunkt. Laser altern, Steckverbinder sammeln Verunreinigungen an, und thermische Bedingungen beeinflussen Komponenten. Ingenieure müssen bestimmen, ob sich ein ausgefallener optischer Lane isolieren lässt, ohne eine größere kohärente Domäne zu beeinträchtigen.

Auch der Energiebedarf ist eine Einschränkung. Bei ausreichender Distanz und Bandbreite kann Optik effizienter werden als elektrische Verbindungen. Transceiver und Umwandlungselektronik verbrauchen jedoch weiterhin Energie. Der Schwellenpunkt hängt von Reichweite, Lane-Rate, Packaging, Auslastung und Kühlung ab.

Kostenvergleiche erfordern dieselbe Sorgfalt. Pooling kann gebundene, ungenutzte Ressourcen verringern, doch optische Fabrics fügen Switches, Module, Controller, Glasfaser und operative Komplexität hinzu. Einsparungen durch weniger Server müssen die vollständigen Kosten des Fabrics über dessen Nutzungsdauer übersteigen.

Auch Latenz hat mehr Dimensionen als die Laufzeit. Ein sauberer optischer Kanal beseitigt weder Warteschlangen, Protokollwiederholungen, Adressübersetzung noch Kohärenzverkehr. Der behauptete Bereich von mehreren hundert Nanosekunden muss unter Last, bei Ausfällen und bei gemischten Zugriffsmustern bestehen.

Diese Fragen widerlegen CXL über große Distanzen nicht. Sie definieren die Arbeit, die nötig ist, um aus einer Architektur Infrastruktur zu machen. Die entscheidenden Belege werden aus Ende-zu-Ende-Systemen kommen, nicht aus isolierten Verbindungsmessungen.

Der eigentliche Wettbewerb lautet: kohärentes Scale-up gegen vernetztes Scale-out

CXL muss Ethernet oder InfiniBand nicht ersetzen, um relevant zu sein, aber es muss die Kontrolle über Datenverkehr gewinnen, den diese Netzwerke heute abwickeln.

Scale-up verbindet Komponenten so, dass sie sich wie ein größerer, eng gekoppelter Computer verhalten. Scale-out verbindet unabhängige Computer über ein Netzwerk. KI-Rechenzentren nutzen beides: kurze proprietäre Verbindungen innerhalb von Systemen und Netzwerk-Fabrics, die Systeme miteinander verbinden.

NVIDIAs NVLink und NVLink Switch ermöglichen eng gekoppelte Accelerator-Kommunikation innerhalb unterstützter Plattformen. UALink soll einen offenen Scale-up-Interconnect für Accelerators etablieren. Ethernet und InfiniBand bleiben die wichtigsten Optionen für die Übertragung von KI-Datenverkehr über Racks und große Cluster hinweg.

CXL begann aus einer anderen Ausgangsposition. Sein früher Reiz lag in Speichererweiterung, Tiering und Pooling. Es stellt cache-kohärente Protokolle über der physischen PCIe-Schicht bereit und unterstützt Geräte, die über Accelerators allein hinausgehen.

Panmnesias Vorschlag versucht, diesen Aufgabenbereich zu erweitern. Wenn CPUs über Racks hinweg mehr Accelerators und gemeinsamen Speicher adressieren können, beginnt ein CXL-Fabric, einer System-Backplane für einen vollständigen KI-Pod zu ähneln. Das Netzwerk verbindet diese kohärenten Pods dann über größere Entfernungen.

Das stärkste Argument für diese Aufteilung betrifft Workloads mit häufigen, feingranularen Speicherzugriffen. Viele kleine Anfragen über einen softwarelastigen Netzwerkpfad zu senden, kann erhebliche Overheads verursachen. Hardware-Kohärenz kann diese Zugriffe direkter und vorhersehbarer machen.

Vernetztes Scale-out bleibt besser für lose gekoppelte Dienste und Fehlerisolierung geeignet. Ein Server kann neu starten, ohne notwendigerweise jeden Peer zu stören. Betreiber kennen das Ethernet-Management, und der Markt bietet eine breite Palette kompatibler Hardware.

Eine riesige Kohärenzdomäne bringt eigene Koordinationskosten mit sich. Controller müssen Eigentümerschaft und zwischengespeicherte Kopien nachverfolgen, wenn mehr Geräte teilnehmen. Der durch diese Mechanismen erzeugte Datenverkehr kann Bandbreite verbrauchen, selbst wenn Anwendungen keine nützlichen Daten bewegen.

Das Verhalten bei Fehlern wird besonders wichtig. Die Übersichtsarbeit sieht vor, ein ausgefallenes Gerät zu ersetzen, statt einen gesamten Server außer Betrieb zu nehmen. Um dieses Ergebnis zu erreichen, sind präzise Fehlerisolierung, konsistente Zustandswiederherstellung und Software erforderlich, die sich an eine veränderte Topologie anpassen kann.

Auch Sicherheitsgrenzen verschieben sich. Speichersemantischer Zugriff kann Ressourcen anders freilegen als paketbasierte Dienste mit expliziten Endpunkten. Zugriffskontrolle, Isolation, Verschlüsselung und Beobachtbarkeit müssen über das gesamte Fabric hinweg funktionieren.

Die offizielle CXL architecture bietet standardisierte Protokollgrundlagen, doch Betreiber benötigen weiterhin Orchestrierung darüber. Scheduler müssen verstehen, welcher Speicher lokal, welcher entfernt ist und welche Accelerators die kürzesten Pfade teilen.

Anwendungen können nicht davon ausgehen, dass jedes Byte in einem einheitlichen Adressraum identische Leistung bietet. Seitenplatzierung und Speicher-Tiering werden bestimmen, ob ein Workload von gepoolter Kapazität profitiert. Schlechte Platzierung kann komfortable Adressierung in wiederholte Verzögerungen bei Remote-Zugriffen verwandeln.

Das schafft eher eine Chance für Netzwerkanbieter als eine automatische Niederlage. Intelligente Network Interface Controller, Remote Direct Memory Access und optimierte Collective Libraries senken weiterhin den Scale-out-Overhead. Ethernet-Anbieter ergänzen zudem Staukontrolle und Telemetrie für KI-Workloads.

Das wahrscheinliche Ergebnis ist eine Hierarchie. Proprietäre Accelerator-Verbindungen könnten die kürzeste Scale-up-Domäne dominieren. CXL kann Speicher und heterogene Ressourcen über einen breiteren Pod hinweg verbinden. Ethernet oder InfiniBand können Pods, Gebäude und geografisch getrennte Einrichtungen zusammenschließen.

Panmnesias Design ist wichtig, weil es dafür argumentiert, die Grenze zwischen diesen Schichten zu verschieben. Das Unternehmen bietet nicht lediglich mehr Speichersteckplätze an. Es schlägt vor, dass CXL einen größeren Teil der Kommunikations- und Steuerungsebene des KI-Systems übernimmt.

Eine Übersichtsarbeit ist kein Deployment mit 960 Accelerators

Die Belege stützen eine ernstzunehmende architektonische Richtung, aber kein fertiges Data-Center-Produkt und keinen erklärten Deployment-Plan von Meta.

Die Nature-Veröffentlichung ist eine Übersichtsarbeit, kein Bericht über ein abgeschlossenes System, das im vollen vorgeschlagenen Maßstab betrieben wird. Sie kombiniert Architekturanalyse, bestehende Technologien und validierte Komponenten. Leser sollten jede Belegkategorie getrennt betrachten.

Panmnesia erklärt, dass sein Controller und seine Link Acceleration Unit die Siliziumvalidierung abgeschlossen haben. Sein Fabric Switch wurde gefertigt, und Pre-Release-Silizium wurde bereitgestellt. Separate ISCA-Arbeiten berichteten über stabiles Verhalten mit bis zu 64 Nodes.

Diese Meilensteine sind für ein fabless Halbleiterunternehmen bedeutsam. Sie zeigen, dass Teile der Architektur über Diagramme und Softwaremodelle hinausgegangen sind. Sie bestätigen keinen kohärenten Betrieb über 960 Accelerators und mehrere optische Racks hinweg.

Die Vergleiche bei großem Maßstab und bei der Latenz beschreiben, was die Architektur leisten soll. Unabhängige Workloads, anhaltender Datenverkehr, Komponentenausfälle und Hardware mehrerer Anbieter könnten Einschränkungen offenlegen, die kleinere Tests übersehen.

Auch Metas Rolle verdient präzise Formulierungen. Zwei Meta-Infra-Forscher haben die Übersichtsarbeit mitverfasst und zu ihrer Diskussion beigetragen. Die Veröffentlichung enthält keine Zusage von Meta, Panmnesias vorgeschlagenes Fabric zu bauen.

Metas öffentlich beschriebenes CXL-Deployment ist Vistara, ein Speichererweiterungssystem, das DDR4-Module in neueren Servern wiederverwendet. Sein Data-Center-Netzwerk stützt sich für Kommunikation über einzelne Systeme hinaus weiterhin auf Ethernet-basierte Infrastruktur.

Eine Forschungskooperation kann zukünftige Designs beeinflussen, ohne zu einer Produkt-Roadmap zu werden. Meta bewertet viele Technologien, und Hyperscaler veröffentlichen häufig vielversprechende Arbeiten, die nie einen flächendeckenden Einsatz erhalten.

Panmnesia hat zudem ein direktes kommerzielles Interesse an einer breiteren CXL-Adoption. Zehn Autoren sind mit dem Unternehmen verbunden, und die Erklärung zu konkurrierenden Interessen der Übersichtsarbeit weist auf diese Beziehungen hin. Das entkräftet das technische Argument nicht, macht aber externe Validierung unverzichtbar.

Die Zahl von 960 Accelerators wirft praktische Fragen auf. Wie viel Directory-Zustand muss das System verwalten? Wie wächst der Kohärenzverkehr bei gemeinsam genutzten Schreibzugriffen? Wie schnell erholt sich das Fabric nach einem Ausfall von Switch, Verbindung oder Endpunkt?

Software stellt einen weiteren Test dar. Betriebssysteme können CXL-Speicher bereitstellen, doch KI-Frameworks und Scheduler müssen entscheiden, wann sie ihn verwenden. Ein nominell gemeinsamer Pool liefert wenig Wert, wenn Software latenzempfindliche Daten wiederholt weit entfernt von dem Accelerator platziert, der sie verarbeitet.

Interoperabilität könnte sich als ebenso schwierig erweisen. Ein nützliches Fabric sollte Prozessoren, Accelerators, Speichergeräte, Switches und optische Verbindungen mehrerer Zulieferer kombinieren. Proprietäre Erweiterungen könnten eine Konfiguration verbessern und zugleich das wirtschaftliche Argument für einen offenen Standard schwächen.

Die Branche sollte daher zwei Abkürzungen widerstehen. Sie sollte die Arbeit nicht abtun, weil das vollständige System nicht existiert. Sie sollte architektonische Schätzungen aber auch nicht als Produktions-Benchmarks beschreiben.

Die glaubwürdigste Lesart liegt zwischen diesen Extremen. Panmnesia hat relevantes Silizium validiert und ein System formuliert, das ein reales Kommunikationsproblem adressiert. Seine größten Leistungs- und Skalierungsansprüche benötigen weiterhin Ende-zu-Ende-Nachweise.

Drei Signale werden zeigen, ob CXL über große Distanzen bereit ist

Die nächste Phase hängt von Vollsystemvalidierung, optischer Interoperabilität und Softwareadoption ab, nicht von einem weiteren Architekturdiagramm.

Das erste Signal ist ein Rack-übergreifender Prototyp mit repräsentativen KI-Workloads. Er sollte Prozessoren, Accelerators und gepoolten Speicher über die vorgeschlagene Switch-Hierarchie verbinden. Veröffentlichte Ergebnisse müssen Median- und Tail-Latenz, Bandbreite unter Konkurrenz, Energieverbrauch und Wiederherstellung nach Fehlern umfassen.

Ein Test, der sich dem Ziel von 960 Accelerators nähert, würde Panmnesias Argument deutlich stützen. Ein kleineres System kann dennoch wertvoll sein, wenn es erklärt, welche Grenzen physischer, architektonischer oder wirtschaftlicher Natur sind. Auf Simulation beschränkte Ergebnisse würden die zentrale Deployment-Frage offenlassen.

Das zweite Signal ist eine CXL-over-optics-Demonstration mehrerer Anbieter. Sie sollte Host-Silizium, Switches, optische Module und Speichergeräte unabhängiger Zulieferer kombinieren. Die Einhaltung von Standards zählt am meisten, wenn Betreiber eine Komponente austauschen können, ohne das Fabric neu zu gestalten.

Eine solche Demonstration sollte Reichweite und Lane-Rate zusammen mit Umwandlungslatenz und Energie pro übertragenem Bit berichten. Sie sollte außerdem Link-Wiederherstellung und Fehlerbehandlung zeigen. Optische Reichweite ist nur dann nützlich, wenn das daraus entstehende System beherrschbar bleibt.

Das dritte Signal ist Softwareunterstützung, die kohärente Ressourcen als Leistungshierarchie behandelt. Betriebssysteme, Scheduler und KI-Frameworks benötigen Topologiebewusstsein. Sie müssen Modellzustände und Cache-Daten anhand von Latenz, Kapazität und aktueller Auslastung platzieren.

Entwickler sollten auf Praxisberichte aus Produktionsumgebungen achten, die diese Software mit messbaren Anwendungsergebnissen verbinden. Zu den hilfreichen Kennzahlen zählen die Zeit bis zum ersten Token, Tokens pro Sekunde, die Auslastung von Beschleunigern und die pro Workload benötigte Serverzahl.

Für Unternehmenskäufer lautet die zentrale Frage nicht, ob CXL technisch interessant ist. Entscheidend ist, ob composable Infrastructure die Auslastung verbessern kann, ohne Fehlersuche und Kapazitätsplanung zu erschweren.

Für Ingenieure verändert der Vorschlag, was als Servergrenze gilt. Ein Dienst könnte letztlich Ressourcen über mehrere Racks hinweg adressieren, während die Hardware die Kohärenz unterhalb seines Software-Stacks verwaltet. Das kann eine Ebene vereinfachen, macht Topologiebewusstsein jedoch an anderer Stelle unverzichtbar.

Für Wissensarbeiter und KI-Nutzer beeinflussen diese Hardwareentscheidungen die Reaktionsfähigkeit von Diensten und die Kontextkapazität. Größere gemeinsam genutzte Speicherpools können längere Gespräche oder mehr gleichzeitige Anfragen ermöglichen – allerdings nur, wenn Datenbewegungen vorhersehbar bleiben.

Teams, die diese Aussagen bewerten, sollten die zugrunde liegenden Fachbeiträge, Benchmark-Details und Herstellerangaben aufbewahren. Eine durchsuchbare technische Wissensdatenbank kann helfen, zukünftige Ergebnisse mit den heutigen Architekturversprechen zu vergleichen.

Das Panmnesia-CXL-Scale-up-Fabric hat einen glaubwürdigen Weg über die durch Racks begrenzte Kohärenz hinaus aufgezeigt. Nun benötigt die Branche ein vollständiges optisches System, unabhängige Workload-Daten und Software, die ihre Topologie intelligent nutzen kann. Welcher Anbieter wird diese Belege zuerst veröffentlichen?

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page