d-Matrix NVLink Fusion bringt Raptor in NVIDIAs Rack-Strategie
d-Matrix setzt für Raptor auf NVIDIA NVLink Fusion, obwohl das Unternehmen einen Inferenzbeschleuniger entwickelt, der eine Alternative zu herkömmlichen GPU-Designs bieten soll. Die Vereinbarung bindet den künftigen Prozessor an NVIDIAs Rack-Architektur, Netzwerke, CPUs und Infrastruktur-Lieferkette an. Zugleich legt sie die zentrale Spannung hinter der Partnerschaft von d-Matrix und NVIDIA NVLink Fusion offen.
Spezialisierte Beschleuniger können NVIDIAs Compute-Silizium herausfordern, ohne den Rest der Plattform zu verdrängen. Für d-Matrix bietet diese Vereinbarung einen schnelleren Weg von einem ambitionierten Chipdesign zu bereitstellbarer Infrastruktur. Für NVIDIA stärkt jede neue über NVLink angebundene XPU seine Position rund um das Rack.
Die Entscheidung fällt, bevor Raptor zu einem kommerziellen Produkt wird. d-Matrix erwartet den Tape-out des Chips noch vor Ende 2026; integrierte MGX-Systeme sollen zunächst im vierten Quartal 2027 verfügbar sein. Dieser Zeitplan macht die Ankündigung zu einer Roadmap-Mitteilung, nicht zu einem Nachweis von Produktionsleistung.
Zugleich positioniert sie d-Matrix neben einer wachsenden Gruppe von Unternehmen, die NVIDIA-Infrastruktur für spezialisierte Prozessoren einsetzen. Zu diesen Partnern gehören etablierte Siliziumanbieter, Cloud-Provider und Inferenzspezialisten. Der alternative Weg ist ein offenes Rack, das auf Technologien wie AMDs Helios-Architektur, UALink und Ultra Ethernet basiert.
Was die Vereinbarung zwischen d-Matrix und NVLink Fusion verändert
d-Matrix entwickelt Raptor nicht länger als isolierte Beschleunigerkarte. Das Unternehmen konzipiert den Prozessor als Teil eines von NVIDIA definierten Racks.
Die Unternehmen gaben ihre Zusammenarbeit am 10. September 2026 bekannt. Laut der Raptor-Ankündigung umfasst die Vereinbarung eine mehrjährige Produkt-Roadmap und nicht nur einen einzelnen Interoperabilitätstest.
Raptor wird für die Scale-up-Kommunikation innerhalb eines eng gekoppelten Systems an NVLink-Switches angeschlossen. Scale-up-Netzwerke ermöglichen es mehreren Beschleunigern, sich stärker wie eine große Rechenressource zu verhalten, mit geringeren Kommunikationsverzögerungen als bei gewöhnlichen Rechenzentrumsnetzen.
Für die Scale-out-Vernetzung zwischen Systemen soll das Rack außerdem Spectrum-X Ethernet nutzen. Diese Ebene verbindet separate Racks oder Cluster und bewältigt dabei Überlastungen und Verkehrsmuster, die mit verteilten KI-Workloads verbunden sind.
Das vorgeschlagene Design umfasst NVIDIA Vera CPUs, BlueField-4-Datenverarbeitungseinheiten und ConnectX-9 SuperNICs. Es nutzt zudem NVIDIA MGX, eine modulare Referenzarchitektur für physische Einschübe, Stromversorgung, Kühlung und Systemintegration.
Astera Labs wird Verbindungstechnologie bereitstellen, die einen Datentransport mit hohem Durchsatz im gesamten System aufrechterhalten soll. d-Matrix erklärt, das Rack werde modulare, kabellose Einschübe aus dem bestehenden MGX-Fertigungsökosystem verwenden.
Dieser Umfang ist bedeutsam, weil ein Prozessor allein noch keinen nutzbaren KI-Service ergibt. Käufer benötigen Server, Firmware, Netzwerke, Orchestrierung, Kühlung, Reparaturverfahren und einen verlässlichen Nachschub an Ersatzteilen.
Ein Startup muss diese Elemente in der Regel selbst entwickeln oder Partner davon überzeugen, sie zu entwickeln. Anschließend muss es das vollständige System für Kunden qualifizieren, die keine unerwarteten Ausfallzeiten tolerieren können.
NVLink Fusion verändert diese Abfolge. NVIDIA ermöglicht den Zugang zu ausgewählten Elementen seines Scale-up-Fabric und seiner Rack-Designs, sodass die XPU eines anderen Unternehmens in dasselbe Infrastrukturgerüst eingebunden werden kann.
Der Begriff XPU bezeichnet allgemein einen spezialisierten Prozessor, der für Workloads optimiert ist, die nicht zu einer Allzweck-CPU passen. Bei Raptor liegt der Schwerpunkt auf generativer KI-Inferenz, insbesondere auf latenzsensibler Token-Generierung.
Die d-Matrix Raptor XPU kann zudem neben NVIDIA-GPU-Systemen arbeiten, einschließlich Vera Rubin NVL72. NVIDIA bezeichnet diese Anordnung als disaggregierte Inferenz, bei der unterschiedliche Prozessoren verschiedene Phasen oder Arten von Serving-Aufgaben übernehmen.
Dieses Nebeneinander sorgt für die Wendung der Geschichte. d-Matrix muss NVIDIA nicht in einem gesamten Rechenzentrum ersetzen, um eine Inferenzbereitstellung zu gewinnen. Das Unternehmen kann um ausgewählte Workloads konkurrieren und sich gleichzeitig überall um seinen Chip herum auf NVIDIA-Komponenten stützen.
NVIDIA gewinnt etwas ebenso Wichtiges. Das Unternehmen kann kundenspezifische Beschleuniger aufnehmen, ohne die Kontrolle über die umgebende Systemarchitektur abzugeben. Die Wettbewerbsgrenze verschiebt sich vom Chip zum Rack.
Die Vereinbarung ist daher mehr als ein weiteres Kompatibilitätssiegel. Sie prüft, ob NVIDIA Drittanbieter-Beschleuniger dazu bringen kann, die Nachfrage nach seiner Infrastruktur zu steigern, selbst wenn diese Beschleuniger mit seinen GPUs konkurrieren.
Warum Rack-Integration zur eigentlichen Hürde geworden ist
Die knappe Fähigkeit besteht nicht mehr darin, einen beeindruckenden Beschleuniger zu entwickeln. Sie besteht darin, dieses Silizium in Infrastruktur zu verwandeln, die Kunden verlässlich bereitstellen können.
KI-Inferenz stellt andere Anforderungen an Hardware als Modelltraining. Beim Training stehen umfangreiche parallele Berechnungen über viele Beschleuniger hinweg im Vordergrund. Die Inferenz muss zudem Antwortzeiten, gleichzeitige Nutzer, Modellspeicher und einen unvorhersehbaren Strom von Anfragen bewältigen.
Reasoning-Modelle verstärken diesen Druck, weil sie vor der Ausgabe einer Antwort weit mehr Tokens generieren können. Anwendungen mit langem Kontext halten zudem große Key-Value-Caches vor, die Informationen speichern, welche während der Token-Generierung benötigt werden.
Diese Workloads machen die Datenbewegung zu einer zentralen Einschränkung. Ein Beschleuniger kann reichlich Rechenkapazität bieten, während seine Recheneinheiten dennoch auf Modellgewichte oder zwischengespeicherten Kontext warten.
d-Matrix geht dieses Problem mit speicherzentriertem Computing an. Die Architektur platziert Matrixoperationen näher an den gespeicherten Daten und verringert so die Strecke, die Informationen während der Inferenz zurücklegen.
Doch die Lösung des Speicherengpasses innerhalb eines Prozessors löst nicht dessen Bereitstellung außerhalb des Prozessors. Systeme auf Rack-Ebene müssen Beschleuniger, Hosts, Speicher, Netzwerke, Stromversorgung und Kühlung unter realen Betriebsbedingungen koordinieren.
Jede Komponente bringt Qualifizierungsaufwand mit sich. Ingenieure müssen Signalintegrität, thermisches Verhalten, Firmware-Kompatibilität, kollektive Kommunikation, Fehlerbehebung und Serviceverfahren validieren.
Flüssigkeitsgekühlte Racks fügen eine weitere Betriebsebene hinzu. Ein neuer Anbieter muss sich in etablierte Gebäudekonzepte einfügen, ohne Kunden dazu zu zwingen, Stromversorgung und Kühlung für einen einzelnen Prozessor neu aufzubauen.
NVIDIAs ursprüngliche Einführung von NVLink Fusion ging dieses Problem direkt an. Das Unternehmen stellte die Plattform im Mai 2025 für teilkundenspezifische KI-Infrastruktur mit externen CPUs und XPUs vor.
Die ursprüngliche Partnerliste deckte mehrere Teile der Designkette ab. MediaTek, Marvell, Alchip, Astera Labs, Synopsys und Cadence unterstützten kundenspezifisches Silizium, Konnektivität oder geistiges Eigentum.
Fujitsu und Qualcomm planten kundenspezifische CPUs, die mit NVIDIA-GPUs arbeiten konnten. Spätere Kooperationen erweiterten die Plattform auf zusätzliche Prozessoren und Cloud-Designs.
Diese wachsende Liste erhöht den Druck auf jeden unabhängigen Beschleunigeranbieter. Ein Chiphersteller kann einem etablierten Rack-Ökosystem beitreten, ein gleichwertiges System allein aufbauen oder sich an einem konkurrierenden offenen Standard ausrichten.
Der erste Weg senkt das Integrationsrisiko, schafft jedoch strategische Abhängigkeit. Der zweite bewahrt mehr Kontrolle, verlangt aber Kapital, Zeit und Kundenvertrauen. Der dritte hängt davon ab, dass ein anderes Ökosystem eine vergleichbare Reife erreicht.
d-Matrix hat für Raptor Geschwindigkeit und Bereitstellbarkeit gewählt. Sein Chief Executive Sid Sheth formulierte die Einschränkung klar: Die Inferenznachfrage steigt, während Kapital, Zeit und Energie begrenzt bleiben.
Die Entscheidung des Unternehmens spiegelt auch seinen Entwicklungsstand wider. d-Matrix begann vor der Einführung von Raptor mit der Auslieferung seiner Corsair-Plattform, bleibt jedoch deutlich kleiner als die Infrastrukturanbieter, die es herausfordern will.
Eine neue Rack-Plattform parallel zu einer neuen Speicherarchitektur aufzubauen, würde die Umsetzungsrisiken vervielfachen. Durch die Nutzung von MGX kann das Unternehmen mehr Engineering-Ressourcen auf seinen Prozessor, Compiler und seine Inferenzsoftware konzentrieren.
Diese Entscheidung beseitigt die Qualifizierung nicht. Raptor muss NVLink weiterhin korrekt implementieren, mit NVIDIAs anderen Geräten funktionieren und Leistungs- sowie Zuverlässigkeitsziele auf Systemebene erfüllen.
Sie begrenzt jedoch die Zahl neuer Elemente, die Kunden gleichzeitig akzeptieren müssen. Ein vertrautes Rack kann es einem Infrastrukturteam erleichtern, einen unbekannten Beschleuniger zu bewerten.
Das Ergebnis setzt konkurrierende Beschleunigerunternehmen ebenso unter Druck wie GPU-Anbieter. Ein Startup, das nur einen schnellen Chip anbietet, tritt nun gegen Prozessoren an, die in validierten, wartungsfähigen Rack-Designs verpackt sind.
Wie NVLink Fusion rund um Raptor funktioniert
NVLink Fusion trennt die Prozessorwahl vom Rack-Aufbau, hält NVIDIAs Interconnect jedoch im Zentrum des Systems.
Die Architektur verfügt über zwei Netzwerkeebenen. NVLink verbindet Beschleuniger innerhalb einer Scale-up-Domäne, während Spectrum-X Datenverkehr über einen größeren Scale-out-Cluster transportiert.
Innerhalb des Racks ermöglichen NVLink-Switches eine Kommunikation mit hoher Bandbreite und geringer Latenz zwischen Raptor-Geräten. Diese Verbindung ist wichtig, wenn ein Modell oder seine Arbeitsdaten nicht auf einem einzelnen Beschleuniger verbleiben können.
Außerhalb dieser Domäne verbinden ConnectX SuperNICs und Spectrum-X Ethernet Systeme im gesamten Rechenzentrum. BlueField DPUs können Infrastrukturaufgaben wie Vernetzung, Isolierung und Datenbewegung übernehmen.
Vera CPUs fungieren als Host-Prozessoren. MGX definiert den mechanischen und elektrischen Rahmen, der diese Elemente in bereitstellbare Einschübe und Racks integriert.
Um die Funktionsweise von NVLink Fusion zu verstehen, muss zwischen Zugang und Standardisierung unterschieden werden. NVIDIA öffnet sein Fabric für zugelassenes Silizium von Drittanbietern, doch NVLink bleibt eine von NVIDIA kontrollierte Technologie.
Das Design ist daher horizontal inklusiv, ohne herstellerneutral zu werden. Partner erhalten Zugang zur Plattform, während NVIDIA Einfluss auf Schnittstellen, Qualifizierung, Roadmaps und umgebende Komponenten behält.
Dieses Modell bietet praktische Vorteile. Ein gemeinsames Rack kann unterschiedliche Beschleunigertypen unterstützen, ohne einen Betreiber dazu zu zwingen, für jeden Prozessor ein separates physisches Design zu entwickeln.
Ein Rechenzentrumsbauer kann Stellfläche, Kühlungsanschlüsse, Stromverteilung und Wartungspraktiken standardisieren. Die Rechenkapazität kann dann je nach Workload-Anforderungen variieren.
NVIDIA bringt außerdem ein etabliertes Fertigungsnetzwerk mit. Originalgerätehersteller und Auftragsfertiger produzieren bereits Systeme, die von MGX und NVIDIAs GPU-Plattformen auf Rack-Ebene abgeleitet sind.
Die technische Erklärung des Unternehmens beschreibt den Zugang zu NVLink-Schnittstellen, Chiplets, Switches, Verkabelung und Rack-Technologie. Sie umfasst zudem Stromversorgungs- und Flüssigkühlungsdesigns.
Für d-Matrix geht diese Infrastruktur ein Problem an, das reine Beschleuniger-Benchmarks nicht erfassen können. Kunden, die Inferenzkapazität erwerben, bewerten neben Tokens pro Sekunde auch Bereitstellungspläne, Wartungsfreundlichkeit, Auslastung und Betriebsrisiko.
Ein Prozessor, der spät erscheint oder ein einzigartiges Rack erfordert, kann selbst bei günstigen Laborergebnissen verlieren. Infrastrukturkonsistenz kann einen begrenzten Leistungsvorteil überwiegen.
Der Ansatz ermöglicht es Kunden außerdem, spezialisierte Inferenz mit GPU-basierten Workloads zu kombinieren. NVIDIA erklärt, Raptor-Racks könnten neben Vera Rubin NVL72-Systemen arbeiten, statt sie zu ersetzen.
Eine mögliche Bereitstellung könnte latenzsensible Token-Generierung an Raptor leiten und andere Modellphasen auf GPUs belassen. Die Unternehmen haben keine vollständige Produktionskonfiguration veröffentlicht, die diesen Workflow belegt.
Software bleibt für eine solche Aufteilung unverzichtbar. Modelllaufzeiten müssen Arbeit korrekt platzieren, Speicher verwalten und Daten bewegen, ohne die Vorteile spezialisierter Hardware zunichtezumachen.
d-Matrix hat für Corsair und Raptor einen eigenen Software-Stack entwickelt. Die Integration in das breitere NVIDIA-Umfeld wird darüber entscheiden, ob Käufer eine handhabbare Plattform oder zwei nebeneinanderstehende Systeme erleben.
Diese Unterscheidung wird für Entwickler wichtig sein. Hardware-Heterogenität ermöglicht eine bessere Zuordnung von Workloads, kann jedoch separate Compiler, Überwachungswerkzeuge, Leistungsprofile und Debugging-Pfade mit sich bringen.
NVLink verringert die Kommunikationshürden zwischen Geräten. Es macht ihre Programmiermodelle nicht automatisch identisch.
Der Wert der Partnerschaft hängt daher von der Koordination oberhalb der physischen Verbindung ab. Die Unternehmen müssen kompatible Komponenten in wiederholbare Bereitstellungsmuster verwandeln, die Cloud-Betreiber als Dienste anbieten können.
Raptores Speicherdesign ist die Wette im Rack
NVIDIA liefert das Systemfundament, doch Raptor muss weiterhin begründen, warum Kunden einen weiteren Inferenzprozessor benötigen.
Raptor erweitert den speicherzentrierten Ansatz der früheren Corsair-Plattform von d-Matrix. Sein prägendes Merkmal ist ein dreidimensionales Paket, bei dem ein Compute-Die direkt über kundenspezifischem DRAM platziert wird.
DRAM bietet eine höhere Dichte als SRAM, der schnellere Speicher, der in Corsair umfangreich eingesetzt wird. Herkömmlicher DRAM liegt jedoch weiter vom Rechenwerk entfernt und benötigt in der Regel mehr Energie, um jedes Bit zu bewegen.
Das Design von d-Matrix legt viele kleine Speicherbänke über dichte vertikale Verbindungen direkt an Rechenwerke an. Ziel ist es, DRAM-Kapazität mit deutlich höherer lokaler Bandbreite zu verbinden.
Auf der Hot Chips 2026 präsentierte das Unternehmen ein Paket mit einem über einem kundenspezifischen DRAM-Die gebondeten 4-Nanometer-Compute-Die von TSMC. Die Schnittstelle nutzt einen Verbindungsabstand von 36 Mikrometern.
Das gezeigte Design bietet 32GB pro Karte und eine angegebene interne Bandbreite von 100 Terabyte pro Sekunde. Diese Werte beschreiben Datenbewegungen innerhalb des Pakets, nicht die Netzwerkbandbreite zwischen getrennten Beschleunigern.
Unabhängige Berichte über das 3D-DRAM-Design hoben zudem eine wichtige Einschränkung hervor. Viele veröffentlichte Leistungsergebnisse bleiben Projektionen auf Basis früher Siliziumversionen.
d-Matrix maß für die vertikale Schnittstelle 0,37 Picojoule pro Bit. Das Unternehmen verglich diesen Wert mit etwa 2,4 Picojoule für die Übertragung in einen HBM4-Basis-Die.
Ein zugehöriges Forschungspapier prognostizierte etwa 4,7-mal mehr Durchsatz pro Karte als HBM-basierte Designs. Weder eine Projektion noch eine Schnittstellenmessung belegt die Leistung eines vollständigen Produktionssystems.
Das Wärmemanagement stellt eine weitere Herausforderung dar. Der Logik-Die befindet sich oben, damit eine Kühlplatte ihn direkt kontaktieren kann, während der darunterliegende DRAM zugleich als Interposer dient.
Das vollständige Paket hat ein veröffentlichtes Leistungsbudget von 422 Watt. Die vertikale Speicherschnittstelle entfällt bei Betrieb mit voller Kapazität auf 296 Watt.
Wärme beeinflusst die DRAM-Retention, die bestimmt, wie lange Speicherzellen Daten vor einer Auffrischung bewahren. Bei der angegebenen Betriebstemperatur erfordert das Design deutlich häufigere Refresh-Vorgänge.
d-Matrix erklärt, kleinere Speicherbänke begrenzten die daraus resultierenden Bandbreitenkosten. Darüber hinaus umfasst das Design Ersatzbänke, Fehlerkorrektur und Redundanz, um einen zuverlässigen Betrieb aufrechtzuerhalten.
Diese Details erklären, warum die Integration in ein ausgereiftes flüssigkeitsgekühltes Rack wichtig ist. Die Architektur von Raptor benötigt nicht lediglich einen Anschluss. Sie erfordert Stromversorgung, Kühlung und Validierung, die auf ein ungewöhnliches Paket ausgelegt sind.
Die Technologie zielt auf die Token-Generierung, weil diese Phase häufig Modellgewichte wiederholt bewegt und dabei pro Byte vergleichsweise wenig Rechenarbeit ausführt. Mehr lokale Speicherbandbreite kann die Recheneinheiten auslasten.
Prefill, bei dem ein eingehender Prompt verarbeitet wird, hat ein anderes Leistungsprofil. Es kann mehr Rechenleistung verlangen und eine andere Beschleunigerkonfiguration begünstigen.
Dieser Unterschied stützt das Argument für disaggregierte Inferenz. Betreiber könnten separate Prozessoren für Prefill und Decoding zuweisen, sofern Software und Netzwerk die Übergabe effizient halten.
Der Wert von Raptor lässt sich jedoch nicht allein aus der Bandbreite ableiten. Nutzbare Leistung hängt von Modellunterstützung, Zahlenformaten, Scheduling, Batch-Größe, Kontextlänge und akzeptabler Antwortlatenz ab.
Auch die Speicherkapazität ist wichtig. Eine 32GB-Karte kann nicht jedes große Modell eigenständig aufnehmen, sodass größere Workloads auf mehrere Geräte verteilt werden müssen.
Diese Anforderung macht die NVLink-Scale-up-Domain wichtiger. Raptores internes Speicherdesign und das externe Fabric von NVIDIA müssen zusammenarbeiten, ohne einen neuen Engpass zu schaffen.
Der d-Matrix Raptor XPU ist daher eine kombinierte Wette. Sein 3D-Paket muss mit produktionsreifer Ausbeute funktionieren, und das Rack muss dieses Paket in verlässliche Anwendungsleistung umsetzen.
NVIDIAs offene Plattform hat weiterhin Grenzen
Der zentrale Wettbewerb findet nicht zwischen d-Matrix und NVIDIA GPUs statt. Er betrifft NVIDIA-kontrollierte Integration gegenüber herstellerneutraler Rack-Infrastruktur.
NVIDIA beschreibt seine KI-Plattform als vertikal integriert und horizontal offen. Die Formulierung erfasst die Strategie, doch Käufer sollten prüfen, was jeder Teil bedeutet.
Vertikale Integration verbindet NVIDIA-Prozessoren, Switches, Netzwerkadapter, DPUs, Software, Rack-Designs und Lieferbeziehungen. Horizontale Offenheit ermöglicht ausgewählten externen CPUs und XPUs den Eintritt in dieses Umfeld.
Diese Struktur erweitert die Prozessorauswahl innerhalb eines Systems, dessen essenzielles Fabric weiterhin von NVIDIA kontrolliert wird. Sie ist offener als ein reines GPU-Rack, aber weniger neutral als ein branchenübergreifend verwaltetes Interconnect.
Diese Grenze ist für NVIDIA kommerziell nützlich. Wenn kundenspezifische Beschleuniger Marktanteile gewinnen, kann das Unternehmen weiterhin hochwertige Netzwerk- und Infrastrukturkomponenten um sie herum liefern.
Zugleich kann es NVLink zentral halten, während sich KI-Systeme von Servern hin zu rackgroßen Computern entwickeln. Das Rack wird zum Produkt, während einzelne Prozessoren zu konfigurierbaren Elementen werden.
d-Matrix profitiert, weil das Unternehmen Käufer erreichen kann, die ihre Einrichtungen bereits auf NVIDIA-Ausrüstung vorbereiten. Die Partnerschaft senkt die organisatorischen Kosten, einen weniger vertrauten Prozessor zu testen.
Allerdings übernimmt d-Matrix damit auch eine Abhängigkeit von NVIDIAs Qualifizierungsprozess und Infrastruktur-Roadmap. Änderungen bei Switches, CPUs, Software oder kommerziellen Bedingungen können seine Systempläne beeinflussen.
Die Unternehmen haben die finanzielle Struktur der Partnerschaft nicht offengelegt. Sie haben auch nicht erläutert, welche Softwareschichten gemeinsam genutzt werden oder wie Kunden vollständige Racks beschaffen und unterstützen werden.
Diese unbeantworteten Fragen sind wichtig, weil Offenheit mehrere Dimensionen hat. Hardware kann physisch interoperabel sein, während Beschaffung, Verwaltung und Entwicklung weiterhin eng an einen Anbieter gebunden bleiben.
Das konkurrierende Modell betont offene Branchenstandards. AMDs Helios-Rack-Design nutzt OCP Open Rack Wide, UALink für Scale-up-Konnektivität und Ultra Ethernet für größere Cluster.
Helios kombiniert AMD Instinct-Beschleuniger, EPYC-Prozessoren und Pensando-Netzwerktechnik. Sein veröffentlichtes Design umfasst 72 Beschleuniger und entspricht damit der Branchenbewegung hin zu dichten Rack-Scale-Systemen.
UALink soll mehreren Anbietern ermöglichen, Beschleuniger über eine gemeinsame Spezifikation zu verbinden. Dieser Ansatz verspricht eine größere Portabilität, obwohl eine offene Spezifikation keine gleichwertige Produktreife oder Bereitstellungsmenge garantiert.
NVIDIAs Vorteil besteht darin, dass NVLink bereits über mehrere Generationen ausgelieferter Systeme hinweg betrieben wird. Seine Fertigungspartner verfügen zudem über praktische Erfahrung mit dichten, flüssigkeitsgekühlten Racks.
Der offene Weg bietet größere theoretische Unabhängigkeit. Der NVIDIA-Weg bietet einen etablierten Integrationspfad unter der Architekturführung eines Unternehmens.
Keine der beiden Entscheidungen beseitigt Lock-in vollständig. Ein Käufer, der Raptor einsetzt, ist auch von der d-Matrix-Software, dessen 3D-Speicherlieferkette und der Fähigkeit des Start-ups abhängig, künftige Produkte zu unterstützen.
Zum größeren Wettbewerbsfeld gehören Groq, Cerebras, AMD, Intel und von Hyperscalern entwickelte Beschleuniger. Ein Überblick über den Inferenzmarkt nannte diese Unternehmen zuvor als Alternativen für Workloads, die von GPUs dominiert werden.
Mehrere haben sich inzwischen umfassenden Systemangeboten angenähert. Groq ist beispielsweise ebenfalls in NVIDIAs wachsende Strategie für Inferenzinfrastruktur eingestiegen.
Dieses Muster legt nahe, dass NVIDIA Spezialisierung integrieren statt ihr widerstehen möchte. Ein erfolgreicher XPU kann zu einem weiteren Grund werden, NVIDIAs Netzwerk- und Rack-Technologie einzusetzen.
Für d-Matrix ist der Beitritt zu dieser Plattform pragmatisch. Er bedeutet jedoch auch, dass die Herausforderung des Unternehmens für NVIDIA enger gefasst ist, als eine einfache Erzählung von rivalisierenden Chips vermuten lässt.
Die Partnerschaft entscheidet darüber, welcher Prozessor Inferenz ausführt. Sie stellt nicht infrage, wer große Teile der umgebenden Infrastruktur definiert.
Auslieferung, Benchmarks und Kunden werden über den Ausgang entscheiden
Die Ankündigung legt die architektonische Absicht fest. Sie belegt weder Produktionsreife, kommerzielle Nachfrage noch Leistung im Produktivbetrieb.
Der erste Beobachtungspunkt ist Raptores geplantes Tape-out vor Ende 2026. Tape-out bezeichnet den Zeitpunkt, an dem ein Chipdesign für die Fertigung finalisiert wird.
Das Erreichen dieses Meilensteins würde den aktuellen Zeitplan stützen. Ein Verfehlen würde die Zeit für Fertigung, Packaging, Tests, Softwarearbeit und Rack-Qualifizierung vor Ende 2027 verkürzen.
Das zweite Signal ist unabhängig reproduzierbare Systemleistung. Käufer benötigen Ergebnisse aus vollständigen Raptor-Racks, nicht isolierte Bandbreitenwerte oder prognostizierte Modellläufe.
Diese Bewertungen sollten Modelle, Kontextlängen, Batch-Größen, Latenzziele, Genauigkeitseinstellungen und Energieverbrauch offenlegen. Tokens pro Sekunde ohne diese Bedingungen können wesentliche Kompromisse verschleiern.
Die Leistung pro Nutzer wird für den Premium-Token-Service-Ansatz des Unternehmens besonders relevant sein. Hoher Gesamtdurchsatz bedeutet weniger, wenn einzelne Anfragen in großen Batches warten.
Energiemessungen sollten das gesamte Rack abdecken. Die Effizienz auf Paketebene kann durch CPUs, Switches, Kühltechnik, Netzwerk und ungenutzte Kapazität abgeschwächt werden.
Das dritte Signal ist ein namentlich genannter Kundeneinsatz. d-Matrix erklärt, Raptor werde von Hyperscalern und führenden Forschungslaboren evaluiert, hat diese Organisationen jedoch nicht benannt.
Eine verbindliche Cloud-Instanz, ein verwalteter Inferenzdienst oder ein angekündigter Produktionscluster würde den kommerziellen Fall der Partnerschaft stärken. Evaluierungen allein zeigen keine Kaufabsicht.
Die erste Verfügbarkeit ist weiterhin für das vierte Quartal 2027 geplant. Dieses lange Zeitfenster gibt konkurrierenden Systemen Gelegenheit, Speicher, Netzwerktechnik und Inferenzsoftware zu verbessern.
Es setzt d-Matrix zudem Fertigungsunsicherheit aus. Das Unternehmen muss einen kundenspezifischen DRAM-Die herstellen, ihn mit fortschrittlicher Logik verbinden, akzeptable Ausbeuten erzielen und das Paket unter anhaltender Hitze validieren.
Die Angabe von mehr als 100 Patenten beantwortet diese Produktionsfragen nicht. Patente schützen technische Ideen, während Kunden zuverlässige Stückzahlen und planbaren Service benötigen.
Auch NVIDIA hat noch Arbeit vor sich. Die relevanten Vera-, BlueField-, ConnectX-, Spectrum-X- und NVLink-Komponenten müssen nach kompatiblen Zeitplänen die erforderliche Reife erreichen.
Astera Labs muss seine Konnektivitätskomponenten als Teil des integrierten Designs liefern. Rack-Hersteller müssen anschließend kabellose Trays, Kühlung, Firmware und Systemmanagement qualifizieren.
Die Software folgt einem parallelen Zeitplan. d-Matrix muss aktuelle Modelle und Frameworks unterstützen, wenn Raptor ausgeliefert wird, und nicht nur jene, die während der Entwicklung verfügbar waren.
Modellarchitekturen können sich schnell ändern. Sparse Mixtures of Experts, längere Kontextfenster, multimodale Workloads und neue Decoding-Techniken verändern Speicher- und Kommunikationsmuster.
Ein spezialisierter Prozessor ist dann erfolgreich, wenn seine Architektur trotz dieser Veränderungen relevant bleibt. Zudem benötigt er Compiler-Updates, die schnell genug erfolgen, um mit weit verbreiteten Modellen Schritt zu halten.
NVIDIAs Plattform kann das physische Bereitstellungsrisiko verringern, garantiert jedoch keine Softwareakzeptanz. Entwickler und Cloud-Betreiber brauchen weiterhin einen Grund, Workloads auf Raptor auszurichten.
Das überzeugendste Argument würde geringe Latenzen pro Nutzer, konkurrenzfähigen Energieverbrauch und eine unkomplizierte Modellintegration verbinden. Schwächen in nur einem dieser Bereiche können die Auslastung begrenzen.
Käufer sollten zudem beobachten, wie NVIDIA Raptor neben den eigenen GPUs und anderen Inferenzprodukten positioniert. Gleichberechtigter technischer Zugang führt nicht zwangsläufig zu gleicher kommerzieller Sichtbarkeit.
Ein weiterer Punkt ist die Plattformkonzentration. Die Unterstützung externer XPUs gibt Kunden mehr Prozessorauswahl, während zugleich mehr Rack-Entscheidungen unter NVIDIAs Einfluss geraten.
Dieses Ergebnis ist weder reine Offenheit noch eine einfache Abschottung. Es entsteht ein mehrschichtiger Markt, in dem Wettbewerb innerhalb einer zunehmend gemeinsamen Infrastrukturgrenze fortbesteht.
Die Zusammenarbeit von d-Matrix und NVLink Fusion wird dann relevant, wenn Raptor diese Grenze als ausgelieferter, messbarer und breit verfügbarer Service überschreitet. Bis dahin liegt ihre Bedeutung in der Strategie.
d-Matrix hat akzeptiert, dass ein besserer Inferenzchip ohne ein glaubwürdiges Rack nicht ausreicht. NVIDIA hat akzeptiert, dass spezialisierte Prozessoren in seine Plattform aufgenommen werden können, ohne seine Infrastrukturposition zu schwächen.
In den kommenden Monaten sollten Sie in dieser Reihenfolge auf den Tape-out, Benchmarks vollständiger Systeme und namentlich genannte Bereitstellungen achten. Jeder Meilenstein wird zeigen, ob aus dieser Roadmap ein Produkt wird.
Für Infrastrukturkäufer lautet die relevante Frage nicht, ob Raptor jede GPU schlägt. Entscheidend ist, ob es ein wertvolles Inferenzprofil bietet, ohne inakzeptable betriebliche Komplexität hinzuzufügen. Diese Belege werden bestimmen, ob NVIDIAs Rack zum Sprungbrett für Accelerator-Auswahl wird oder zu einem weiteren dauerhaften Abhängigkeitspunkt.



