top of page

d-Matrix tritt der NVIDIA NVLink Fusion Platform bei, doch Raptor muss sich erst noch beweisen

13. Sept.
13 Min. Lesezeit

d-Matrix tritt mit einem mehrjährigen Plan für Raptor der NVIDIA NVLink Fusion Platform bei, obwohl die ersten integrierten Racks noch mehr als ein Jahr entfernt sind. Das Unternehmen für Inferenzchips erwartet, dass Raptor vor Ende 2026 sein Tape-out erreicht. Die erste Verfügbarkeit von NVIDIA-MGX-Racks ist für das vierte Quartal 2027 vorgesehen.

Die Partnerschaft eröffnet d-Matrix einen direkten Zugang zu NVIDIAs Rack-Architektur, Netzwerk, Kühlung und Lieferkette. Sie legt jedoch auch eine härtere Realität des Wettbewerbs mit NVIDIA offen. Ein differenzierter Beschleuniger allein reicht nicht mehr aus. Kunden erwarten zunehmend ein vollständiges, einsatzbereites System mit erprobtem Netzwerk und Software.

NVIDIA profitiert von dieser Anforderung. NVLink Fusion ermöglicht maßgeschneiderten Prozessoren den Zugang zu seiner Infrastruktur, ohne die umgebenden NVIDIA-Komponenten zu verdrängen. Für d-Matrix verringert die Vereinbarung den technischen Aufwand, Raptor zu skalieren. Für NVIDIA erweitert sie die Reichweite seiner Plattform auf Racks mit Prozessoren, die als Alternativen zu universell einsetzbaren GPUs entwickelt wurden.

Damit dreht sich die Ankündigung weniger um eine einzelne Interconnect-Lizenz als um die Kontrolle über das AI-Rack. Raptor verspricht spezialisierte, speicherzentrierte Inferenz. NVIDIA liefert große Teile des Systems, das den Prozessor zur Infrastruktur macht. Offen bleibt, ob d-Matrix in diesem Umfeld einen bedeutenden technischen und wirtschaftlichen Vorteil bewahren kann.

d-Matrix tritt der NVIDIA NVLink Fusion Platform mit einem Ziel für 2027 bei

Die Vereinbarung überführt Raptor von einer eigenständigen Chip-Roadmap in NVIDIAs Bereitstellungsmodell auf Rack-Ebene, macht Raptor jedoch nicht zu einem bereits verfügbaren Produkt.

d-Matrix kündigte die Zusammenarbeit am 10. September 2026 an. Seine mehrjährige Roadmap beginnt mit Raptor, der Inferenz-XPU der nächsten Generation des Unternehmens. Eine XPU ist ein arbeitsspezifischer Beschleuniger, der ausgewählte Rechenaufgaben effizienter als ein universeller Prozessor bewältigen soll.

Raptor wird über NVLink Fusion angebunden, NVIDIAs Technologie zur Integration externer CPUs und kundenspezifischer Beschleuniger in sein Scale-up-Fabric. Scale-up-Netzwerke verbinden Prozessoren innerhalb einer eng gekoppelten Rechendomäne. Das Design wird zudem Spectrum-X Ethernet für Scale-out-Netzwerke zwischen Systemen nutzen.

Das geplante Rack umfasst weit mehr als Silizium von d-Matrix. Die angekündigte Konfiguration enthält NVIDIA Vera CPUs, NVLink-Switches, BlueField-4-Datenverarbeitungseinheiten, ConnectX-9 SuperNICs und Spectrum-X-Netzwerke. Sie folgt der NVIDIA-MGX-Referenzarchitektur, einschließlich modularer, kabelloser Compute-Trays.

Astera Labs wird Konnektivitätslösungen bereitstellen, die einen Datentransport mit hohem Durchsatz im gesamten System unterstützen sollen. Das ist relevant, weil die Leistung eines Beschleunigers hinter Kommunikationsengpässen verschwinden kann, sobald ein Workload Prozessoren, Trays und Racks überspannt.

NVIDIA beschreibt die Vereinbarung als Weg von kundenspezifischem Silizium zur Bereitstellung im großen Maßstab. Sein Plan für Racks im großen Maßstab positioniert Raptor neben NVIDIA-Infrastruktur, statt ihn als isoliertes Appliance-System zu behandeln. Betreiber erhielten ein einheitliches Rack-Design, das GPUs, CPUs und spezialisierte XPUs unterstützen kann.

Der erste vorgesehene Workload ist disaggregierte Inferenz, bei der unterschiedliche Phasen der Modellausführung auf verschiedene Prozessoren verteilt werden. Bei AI-Coding könnten NVIDIA-GPUs die rechenintensive Prefill-Phase verarbeiten. Raptor könnte anschließend die latenzsensitive Decode-Phase übernehmen, die Token nacheinander erzeugt.

Diese Aufteilung spiegelt einen realen architektonischen Unterschied wider. Prefill verarbeitet die Eingabe des Nutzers und erstellt den Arbeitszustand des Modells. Decode liest wiederholt Modellgewichte und erzeugt die Antwort. Die Decode-Leistung kann durch Speicherbewegungen begrenzt sein, insbesondere wenn Nutzer schnelle, interaktive Ausgaben erwarten.

d-Matrix adressiert diese Begrenzung mit einem speicherzentrierten Design. Raptor soll einen DRAM-Speicherchip mit einem SRAM-Rechenchip in einem vertikal gestapelten Package kombinieren. SRAM ermöglicht schnellen Zugriff in der Nähe der Rechenlogik, während DRAM eine höhere Kapazität bietet. Das Unternehmen erklärt, die zweistöckige Konfiguration verkürze Datenpfade und erhöhe die nutzbare Bandbreite.

Das angekündigte Rack bleibt jedoch eine Roadmap. d-Matrix erwartet für Raptor ein Tape-out vor Ende 2026. Tape-out markiert den Abschluss eines Chipdesigns vor der Fertigung, nicht die kommerzielle Auslieferung. Danach folgen weiterhin Herstellung, Packaging, Validierung, Software-Qualifizierung und Rack-Integration.

Das Unternehmen erwartet erste Raptor-MGX-Systeme im vierten Quartal 2027. Dieser Zeitplan definiert die zentrale Spannung. d-Matrix hat einen glaubwürdigen Weg in NVIDIA-basierte Rechenzentren gesichert, doch Kunden können das fertige Rack noch nicht messen.

Für Käufer verändert die Ankündigung daher eher das Vertrauen in die Architektur als die unmittelbar verfügbare Kapazität. Raptor verfügt nun über einen benannten Interconnect, eine CPU, einen Netzwerk-Stack, ein Rack-Format und ein Bereitstellungsziel. Das tatsächliche Produkt muss die Lücke zwischen Designzusage und validierter Infrastruktur noch schließen.

NVIDIA macht die Wahl eines Beschleunigers zu einer Plattformanforderung

d-Matrix erhält Zugang zu einem ausgereiften Bereitstellungssystem, während NVIDIA seine Infrastruktur für Kunden, die Nicht-NVIDIA-Beschleuniger wählen, schwerer vermeidbar macht.

NVIDIA stellte NVLink Fusion im Mai 2025 als Möglichkeit vor, teilkundenspezifische AI-Infrastruktur aufzubauen. Beim ersten Start von NVLink Fusion nannte das Unternehmen MediaTek, Marvell, Alchip Technologies, Astera Labs, Synopsys, Cadence, Fujitsu und Qualcomm als beteiligte Unternehmen.

Das Programm trennt die Entscheidung für einen Beschleuniger vom Rest des Racks. Ein Cloud-Anbieter kann eine kundenspezifische XPU wählen und zugleich NVIDIAs Prozessoren, Interconnects, Switches, Netzwerkadapter, Datenverarbeitungseinheiten und Referenzdesigns beibehalten. NVIDIA kann somit beteiligt bleiben, selbst wenn seine GPU nicht die einzige Recheneinheit ist.

Das ist strategisch wichtig, weil Hyperscaler und AI-Labore spezialisierte Chips entwickeln, um die Abhängigkeit von einem einzelnen Beschleunigeranbieter zu verringern. Kundenspezifische Chips ermöglichen es Betreibern zudem, Hardware auf bestimmte Workloads, Leistungsgrenzen und Serviceanforderungen abzustimmen.

NVLink Fusion reagiert auf diese Entwicklung, indem Spezialisierung mit NVIDIAs Plattform kompatibel wird. Es verlangt nicht, dass jeder Prozessor eine NVIDIA-GPU ist. Es ermutigt dazu, diese Prozessoren innerhalb eines von NVIDIA entwickelten Systems zu betreiben.

Für ein kleineres Chipunternehmen ist dieser Tausch attraktiv. Der Aufbau eines wettbewerbsfähigen Beschleunigers erfordert bereits Siliziumdesign, Compiler, Kernel, Runtime-Software, Modellunterstützung, Packaging und Fertigung. Die Bereitstellung auf Rack-Ebene ergänzt Stromversorgung, Flüssigkühlung, Kabel, Switches, Wartbarkeit, Zertifizierung und Vor-Ort-Support.

Jede zusätzliche Schicht liefert einem Käufer einen weiteren Grund, die Einführung zu verschieben. Ein Beschleuniger kann in einem Labor gut abschneiden, aber ungewohnte Server oder ein separates Netzwerk erfordern. Rechenzentrumsbetreiber müssten dann einen neuen Stack qualifizieren und zugleich die bestehende NVIDIA-Infrastruktur aufrechterhalten.

MGX reduziert diese Reibung durch wiederverwendbare Rack- und Serverspezifikationen. d-Matrix kann mehr technische Arbeit auf Raptor und seinen Aviator-Software-Stack konzentrieren. Zudem kann das Unternehmen Käufern Komponenten und Betriebsmuster präsentieren, die bereits in anderen NVIDIA-Deployments vorkommen.

Der Preis dafür ist eine stärkere architektonische Abhängigkeit. d-Matrix verbindet sich nicht lediglich am Rand des Racks mit einem offenen Netzwerk. Sein vorgeschlagenes System integriert NVIDIA-Technologien über die Scale-up-, Scale-out-, CPU-, Netzwerkschnittstellen- und Datenmanagementebenen hinweg.

Eine unabhängige Einschätzung wäre hier hilfreich, doch der zentrale Zielkonflikt wird bereits anhand der angekündigten Stückliste sichtbar. d-Matrix gewinnt an Glaubwürdigkeit bei der Bereitstellung, indem es NVIDIAs Rack als Betriebsumgebung akzeptiert.

Das macht die XPU nicht irrelevant. Der Beschleuniger bestimmt weiterhin, wie effizient gezielte Modelloperationen ausgeführt werden. NVIDIA kontrolliert jedoch viele Schnittstellen, die darüber entscheiden, ob isolierte Chip-Leistung zu nachhaltiger Anwendungsleistung wird.

Deshalb setzt d-Matrix konkurrierende Infrastrukturwege stärker unter Druck, als es NVIDIA direkt unter Druck setzt. Ein Startup könnte auf Ethernet, PCI Express oder ein eigenes Fabric setzen. Dann müsste es Kunden davon überzeugen, dass die Alternative genug Unabhängigkeit oder Effizienz bietet, um den zusätzlichen Integrationsaufwand zu rechtfertigen.

Raptor trifft Käufer stattdessen dort, wo ein großer Teil ihrer AI-Infrastruktur bereits betrieben wird. Diese Entscheidung kann Beschaffungs- und Qualifizierungszyklen verkürzen. Sie stärkt zudem NVLink als gemeinsame Scale-up-Option für kundenspezifische Prozessoren.

NVIDIA erweitert damit faktisch seine adressierbare Plattform. Wenn universell einsetzbare GPUs jeden Workload behalten, gewinnt NVIDIA. Wenn spezialisierte Beschleuniger ausgewählte Workloads übernehmen, sich jedoch auf NVLink, MGX, Spectrum-X und BlueField stützen, besetzt NVIDIA weiterhin kritische Teile des Systems.

Das Ergebnis ist eine subtilere Wettbewerbslandschaft. Die Auswahl an Beschleunigern wächst, doch die Infrastrukturkonvergenz kann zunehmen. NVIDIAs Einfluss verlagert sich vom Besitz jedes einzelnen Rechengeräts hin zur Definition, wie heterogene Geräte zu einer AI-Fabrik werden.

Raptors Mechanismus zielt auf den Decode-Engpass

Raptor ist nur dann relevant, wenn seine Speicherarchitektur geringere Datenbewegungen in bessere Anwendungslatenz, Energieeffizienz und Rack-Ökonomie umsetzt.

d-Matrix hat seine Marktposition um Inferenz statt Modelltraining aufgebaut. Training erzeugt oder aktualisiert Modellparameter durch umfangreiche parallele Berechnungen. Inferenz wendet diese Parameter an, wenn ein bereitgestelltes Modell auf Nutzer reagiert.

Diese Phasen belohnen nicht immer identische Hardware. GPUs bleiben hochflexibel und profitieren von ausgereifter Software, breiter Modellunterstützung und umfangreicher Bereitstellung. Spezialisierte Inferenzprozessoren können Silizium- und Speicherressourcen auf wiederkehrende Operationen konzentrieren, die den Produktivbetrieb dominieren.

Raptor erweitert die Architektur hinter dem aktuellen Corsair-Produkt von d-Matrix. Corsair verwendet digitales In-Memory-Computing, bei dem Rechenoperationen nahe gespeicherten Modelldaten stattfinden. Ziel ist es, die Energie und Verzögerung zu reduzieren, die mit der wiederholten Übertragung von Gewichten zwischen Speicher- und Recheneinheiten verbunden sind.

Datenbewegung ist während der Token-Generierung relevant, weil große Modelle kontinuierlich auf umfangreiche Parametersätze zugreifen müssen. Ein Prozessor mit reichlich Rechenkapazität kann dennoch auf den Speicher warten. Die These von d-Matrix lautet, dass eine Verlagerung der Berechnung näher an die Modellgewichte schnellere Inferenz bei kleinen Batches ermöglicht.

Kleine Batches sind für interaktive Anwendungen wichtig. Ein Anbieter kann die Hardwareauslastung erhöhen, indem er viele Anfragen zu einem größeren Batch bündelt. Das Warten auf die Zusammenstellung dieses Batches kann Latenz hinzufügen, während die Verarbeitung einzelner Anfragen herkömmliche Hardware unzureichend auslasten kann.

Coding-Assistenten, Live-Chatbots und Sprachagenten machen diesen Zielkonflikt unmittelbar sichtbar. Nutzer bemerken die Verzögerung bis zur ersten nützlichen Ausgabe und den Takt der folgenden Token. Plattformbetreiber bemerken die Menge an Hardware und Energie, die erforderlich ist, um diese Reaktionsfähigkeit über parallele Sitzungen hinweg aufrechtzuerhalten.

d-Matrix bezeichnet diesen Markt als Premium-Token-Dienste. Der Begriff beschreibt Inferenz, bei der Kunden niedrige Latenz so hoch bewerten, dass sie spezialisierte Infrastruktur rechtfertigt. Es handelt sich um eine Einordnung des Unternehmens, nicht um eine etablierte Wirtschaftskategorie mit unabhängig ausgewiesener Marktgröße.

Der vorgeschlagene Raptor-Entwurf soll die für diesen Ansatz verfügbare Speicherkapazität erweitern. d-Matrix erklärt, DRAM über einem SRAM-Compute-Chip zu stapeln und damit einen kurzen physikalischen Pfad zwischen Kapazität und Verarbeitung zu schaffen. Das unterscheidet sich von herkömmlichen Beschleunigerdesigns, bei denen Logik mit separaten High-Bandwidth-Memory-Stacks verbunden wird.

Das Unternehmen hat seinen 3D-Speicheransatz öffentlich vorgestellt, doch ein technisches Konzept ist kein Rack-Benchmark. Thermisches Verhalten, Fertigungsausbeute, Speicherkapazität, Compiler-Unterstützung und Interconnect-Effizienz werden das endgültige System beeinflussen.

NVLink Fusion adressiert einen weiteren Teil des Mechanismus. Ein einzelnes Raptor-Gerät kann nicht jede große oder verteilte Arbeitslast allein bedienen. Durch die Verbindung mehrerer XPUs in einer Domäne mit hoher Bandbreite und niedriger Latenz kann d-Matrix größere Modelle und mehr gleichzeitige Anfragen verfolgen.

Spectrum-X verbindet anschließend Racks oder Systemdomänen über Ethernet. Diese Aufteilung zwischen Scale-up und Scale-out eröffnet d-Matrix einen Weg von einem spezialisierten Gerät bis hin zu einer Rechenzentrumsbereitstellung. NVIDIA bündelt diese Netzwerkschichten bereits als Teil seiner KI-Infrastruktur.

Heterogene Disaggregation liefert den deutlichsten vorgeschlagenen Anwendungsfall. Eine GPU übernimmt das Prefill, bei dem parallele Berechnungen wertvoll sind. Raptor übernimmt das Decode, bei dem Speicherzugriff und Latenz pro Nutzer stärker ins Gewicht fallen. Die beiden Prozessortypen müssen den Modellzustand effizient genug austauschen, damit der Vorteil erhalten bleibt.

Diese letzte Bedingung verdient Aufmerksamkeit. Die Aufteilung einer Arbeitslast erzeugt Kommunikations- und Orchestrierungs-Overhead. Wenn die Übertragung des Zustands zwischen GPUs und XPUs zu viel Zeit beansprucht, kann das kombinierte System den Vorteil verlieren, der bei jedem Prozessor einzeln gemessen wurde.

Die Software entscheidet darüber, ob die Aufteilung beherrschbar bleibt. Betreiber benötigen Scheduling, Modellunterstützung, Monitoring, Fehlerbehandlung und vorhersehbare Leistung bei wechselnden Anfrageprofilen. Sie benötigen außerdem Entwickler, die Modelle bereitstellen können, ohne für jede Hardwarekombination separate Pipelines pflegen zu müssen.

Die Aviator-Software von d-Matrix muss diese Anforderungen überbrücken. Die NVIDIA-Systemkomponenten helfen bei Netzwerk- und Rack-Betrieb, sorgen jedoch nicht automatisch dafür, dass Modelle auf Raptor gut laufen. Kernel-Qualität, Quantisierungsunterstützung, Framework-Kompatibilität und Observability in der Produktion bleiben Verantwortung von d-Matrix.

Corsair liefert einige Hinweise darauf, dass das Unternehmen über die Simulation hinausgegangen ist. d-Matrix erklärte im Juni 2026, Corsair sei in die volle Produktion eingetreten; Volumenlieferungen an ausgewählte Kunden seien geplant. Das Corsair production update beschrieb zudem luftgekühlte Karten und Rack-Systeme.

Das Unternehmen verwies auf Tests von Gimlet Labs, bei denen eine GPU- und Corsair-Konfiguration eine Basisantwort von 24 Sekunden auf unter zwei Sekunden verkürzte. Dieses Ergebnis bezog sich auf ein bestimmtes Setup für spekulatives Decoding. Es sollte nicht auf jedes Modell, jedes Anfrageprofil oder jedes konkurrierende GPU-System verallgemeinert werden.

Dennoch verschafft Corsair Raptor einen Vorgänger mit funktionierendem Silizium und einer Softwarebasis. d-Matrix schlägt nicht seinen ersten Beschleuniger vor. Der schwierigere Schritt besteht darin, diese Erfahrung in ein neues 3D-Paket und ein NVIDIA-integriertes Rack zu übertragen.

Das ist der Mechanismus hinter der Entscheidung von d-Matrix für NVLink Fusion. Raptor liefert spezialisierte Decode-Kapazität. NVLink und MGX stellen die Verbindung und das physische System bereit. GPUs bleiben für Phasen verfügbar, für die sie besser geeignet sind.

Wenn die Kombination funktioniert, könnten Käufer unterschiedliche Modellphasen unterschiedlichen Prozessoren zuweisen, ohne eine separate Rechenzentrumsarchitektur aufzubauen. Wenn sie scheitert, wird die zusätzliche XPU zu einer weiteren Komponente, die gekauft, programmiert, überwacht und unterstützt werden muss.

Der Liefertermin 2027 lässt die zentralen Behauptungen unbewiesen

Die Partnerschaft reduziert das Integrationsrisiko, bestätigt jedoch weder Raptors Leistung, Produktionsreife noch die Wirtschaftlichkeit für Kunden.

Raptors erster angekündigter Meilenstein ist der Tape-out vor Ende 2026. Ein erfolgreicher Tape-out würde das Design für die Fertigung festschreiben. Er würde weder die Produktionsausbeute noch Taktfrequenzen, Stromverbrauch, Kühlanforderungen oder nachhaltige Anwendungsleistung belegen.

Die nächste Herausforderung ist das gestapelte Speicherpaket. Die Kombination unterschiedlicher Speichertechnologien und Logik-Dies erfordert eine präzise Kontrolle der Fertigungs- und thermischen Bedingungen. Ein Design, das elektrische Wege verkürzt, kann zugleich Wärme konzentrieren und die Verpackungskomplexität erhöhen.

d-Matrix erklärt, dass Raptor von KI-Hyperscalern und führenden Forschungslaboren evaluiert wird. Das Unternehmen hat diese Evaluatoren in der Ankündigung nicht benannt. Eine Evaluierung unterscheidet sich zudem von einer Bestellung, einer Produktionsbereitstellung oder einer wiederkehrenden Zusage für Arbeitslasten.

Dieselbe Vorsicht gilt für die vom Unternehmen genannte Patentanzahl. d-Matrix erklärt, Raptor sei durch mehr als 100 Patente abgesichert. Patente können Implementierungsentscheidungen schützen, belegen jedoch nicht, dass ein System herstellbar oder wirtschaftlich überlegen ist.

Unabhängige Tests werden vollständige Systeme statt isolierter Komponenten vergleichen müssen. Nützliche Messgrößen umfassen die Zeit bis zum ersten Token, Inter-Token-Latenz, nachhaltigen Durchsatz, Tail-Latenz, Energie pro Token, Rack-Leistung, Speicherkapazität und Auslastung.

Die Modellqualität muss bei diesen Vergleichen konstant bleiben. Quantisierung, spekulatives Decoding, Batching und Modelländerungen können die Geschwindigkeit erhöhen, während sie die Ausgabe verändern oder Arbeit an andere Stellen verlagern. Käufer benötigen transparente Konfigurationen, um zu verstehen, wodurch jedes Ergebnis zustande kam.

Der aussagekräftigste Benchmark würde einen Produktionsdienst unter realistischer Parallelität nachbilden. Er sollte die Kommunikation zwischen NVIDIA-GPUs und Raptor-XPUs einschließen, nicht nur einen Decode-Kernel, der auf einem Gerät läuft. Zudem sollte er die Leistung über mehrere Modellgrößen und Architekturen hinweg ausweisen.

Die Reife der Software schafft eine weitere Unsicherheit. NVIDIA-GPUs unterstützen eine breite Palette an Frameworks, Bibliotheken und Betriebswerkzeugen. Ein spezialisierter Beschleuniger benötigt nicht dieselbe Breite, muss jedoch die Arbeitslasten unterstützen, die seinen Einsatz rechtfertigen.

Schnelle Modellveränderungen können diese Aufgabe erschweren. Neue Attention-Mechanismen, Mixture-of-Experts-Designs, längere Kontextfenster und unterschiedliche Zahlenformate können das Gleichgewicht zwischen Rechenleistung und Speicher verschieben. Die Raptor-Architektur muss nützlich bleiben, während sich diese Arbeitslasten weiterentwickeln.

Der Zeitplan für 2027 gibt Wettbewerbern Zeit zu reagieren. NVIDIA wird seine eigene Inferenzleistung durch GPUs, Software, Speicher und Rack-Designs weiter verbessern. Andere spezialisierte Anbieter können geringere Latenz mit anderen Prozessor- und Speicherarchitekturen verfolgen.

Cerebras nutzt Wafer-Scale-Systeme, um die Kommunikation zwischen separaten Chips zu reduzieren. Groq konzentriert sich auf deterministische Ausführung und Token-Generierung mit niedriger Latenz. Hyperscaler wie Amazon und Google entwickeln eigene Beschleuniger rund um vertikal integrierte Cloud-Dienste.

Der breitere inference-chip competition zeigt, warum die Bereitstellung ebenso wichtig ist wie die Architektur. Start-ups müssen nicht nur mit Benchmark-Ergebnissen konkurrieren, sondern auch mit Hardwareverfügbarkeit, Entwicklervertrautheit, Cloud-Zugang und Vertrauen bei der Beschaffung.

Die NVIDIA-Plattform kann d-Matrix helfen, mehrere dieser Hürden zu bewältigen. Sie kann jedoch die Kosten für das Hinzufügen eines weiteren Prozessortyps nicht beseitigen. Käufer werden weiterhin fragen, ob der Gewinn bei Latenz oder Effizienz die Integrations-, Lager-, Software- und Betriebskosten übersteigt.

Kommerzielle Bedingungen bleiben unveröffentlicht. Die Unternehmen haben keine erwarteten Rack-Konfigurationen, verfügbare Speicherkapazität, Leistungsrahmen, Servicevereinbarungen oder Kundenzusagen publiziert. Diese Details werden den tatsächlichen Wert der Zusammenarbeit prägen.

Es besteht zudem ein Risiko strategischer Abhängigkeit. d-Matrix positioniert Raptor als Ergänzung zu GPUs, doch sein Rack stützt sich auf zahlreiche NVIDIA-Komponenten. Änderungen bei NVIDIA-Roadmaps, Lizenzierung, Lieferzuteilung oder Schnittstellenprioritäten können daher d-Matrix-Bereitstellungen beeinflussen.

Diese Abhängigkeit macht die Partnerschaft nicht ungültig. Jedes Infrastrukturunternehmen baut auf Lieferanten und Standards auf. Sie bedeutet jedoch, dass Behauptungen über eine größere Auswahl an Beschleunigern neben der Konzentration der umgebenden Technologie bewertet werden sollten.

Die entscheidende Unterscheidung liegt zwischen architektonischer und marktseitiger Validierung. Die Beteiligung von NVIDIA bestätigt Raptor als ernsthaften Kandidaten für die Integration. Marktvalidierung erfordert ausgelieferte Systeme, reproduzierbare Messungen, unterstützte Modelle und Kunden mit dauerhaftem Produktionsverkehr.

Bis diese Signale erscheinen, bleibt d-Matrix Joins the NVIDIA NVLink Fusion Platform eine Roadmap-Geschichte. Es ist eine bedeutungsvolle Roadmap, weil sie die Komponenten, die Aufteilung der Arbeitslast und das Verfügbarkeitsfenster benennt. Sie ist kein Beleg dafür, dass Raptor einen Anteil an der Produktionsinferenz gewonnen hat.

Drei Signale werden zeigen, ob die Partnerschaft relevant ist

Tape-out, Benchmarks auf Rack-Ebene und namentlich genannte Produktionsadoption werden bestimmen, ob aus der Ankündigung Infrastruktur wird oder sie ein Integrationsplan bleibt.

Das erste Signal ist Raptors Tape-out. d-Matrix erwartet diesen Meilenstein vor Ende 2026. Seine Erreichung würde darauf hindeuten, dass Architektur, NVLink-Schnittstelle und physisches Design bereit für die Fertigung sind.

Eine Verzögerung würde das Vertrauen in das Verfügbarkeitsziel für das vierte Quartal 2027 schwächen. Auf den Tape-out folgen Fertigung, erste Siliziumtests, Überarbeitungen, Verpackungsqualifizierung und Systemvalidierung. Jede Phase lässt nur begrenzten Spielraum für Verzögerungen, wenn das kommerzielle System bereits terminiert ist.

Die Qualität des ersten Siliziums ist ebenso wichtig wie der Zeitplan. d-Matrix muss zeigen, dass das 3D-Speicherpaket mit den vorgesehenen Leistungs- und Energiewerten arbeitet. Wesentliche Überarbeitungen nach der Fertigung würden den Lieferplan zusätzlich unter Druck setzen.

Das zweite Signal ist ein End-to-End-Benchmark des Raptor-MGX-Racks. Er sollte GPU-only-Serving mit heterogenem Prefill und Decode bei identischen Modellen, Präzisionseinstellungen, Anfrageprofilen und Qualitätszielen vergleichen.

Ein glaubwürdiges Ergebnis muss den gesamten Datenpfad einschließen. Dazu gehören GPU-Verarbeitung, Zustandsübertragung, Raptor-Decoding, NVLink-Kommunikation, Netzwerk und Scheduling. Behauptungen zur Bandbreite auf Komponentenebene können nicht beantworten, ob Nutzer schnellere Antworten erhalten.

Der Tail-Latenz gebührt besondere Aufmerksamkeit. Die durchschnittliche Ausgabegeschwindigkeit kann langsame Anfragen verbergen, die interaktive Dienste beeinträchtigen. Betreiber sollten Perzentilmessungen bei wechselnder Parallelität, Kontextlängen und Ausgabelängen prüfen.

Energie und Auslastung sollten neben der Latenz ausgewiesen werden. Eine spezialisierte XPU kann eine beeindruckende Antwortzeit liefern, während sie in anderen Phasen der Arbeitslast ungenutzt bleibt. Messungen auf Rack-Ebene zeigen, ob das kombinierte System die Gesamteffizienz verbessert.

Diese Benchmarks würden die Argumentation stärken, wenn unabhängige Evaluatoren sie reproduzieren können. Sie würden sie schwächen, wenn die Gewinne von engen Modellgruppen, ungewöhnlich kleinen Batches oder Konfigurationen abhängen, die Ausgabequalität opfern.

Das dritte Signal ist eine namentlich genannte Produktionsadoption. d-Matrix erklärt, Hyperscaler und führende Forschungslabore evaluierten Raptor, hat jedoch keine fest zugesagten Kunden für das NVLink-Fusion-Rack offengelegt.

Ein namentlich genannter Betreiber, der einen echten Coding-Assistenten, Sprachdienst oder Chatbot betreibt, würde stärkere Belege liefern als eine weitere Architekturpräsentation. Eine Produktionsadoption würde zeigen, dass der Latenzvorteil neue Hardware, Software und Betriebsverfahren rechtfertigt.

Die Tiefe der Adoption wird entscheidend sein. Ein begrenzter Test bestätigt Kompatibilität. Eine wiederkehrende Bereitstellung über mehrere Racks bestätigt Servicezuverlässigkeit und Wirtschaftlichkeit. Eine Ausweitung nach dem Test würde den stärksten Beleg für den Kundennutzen liefern.

Käufer sollten zudem beobachten, welche Modellphasen Kunden Raptor zuweisen. Eine konsistente Nutzung für Decode würde die speicherzentrierte These von d-Matrix stützen. Breitere Inferenzaufgaben würden darauf hindeuten, dass die Architektur mehr Flexibilität besitzt, als die ursprüngliche Ankündigung betont.

d-Matrix tritt der NVIDIA NVLink Fusion Platform zu, zu einem Zeitpunkt, an dem Accelerator-Startups vor einem Systemproblem stehen. Unverwechselbares Silizium zu entwickeln, ist nur der Anfang. Das Produkt muss in die Netzwerk-, Rack-, Software-, Kühlungs- und Beschaffungsumgebung passen, die Kunden bereits betreiben.

NVIDIA bietet dieses Umfeld Unternehmen an, deren Chips die Nachfrage nach NVIDIA GPUs bei ausgewählten Workloads senken können. Das wirkt nur widersprüchlich, wenn man NVIDIAs Geschäft als einzelnen Prozessor betrachtet. Als Plattformstrategie betrachtet, ist die Logik unmittelbar.

d-Matrix erhält einen schnelleren Weg zu glaubwürdigen Rack-Skalierungs-Deployments. NVIDIA erweitert seine Infrastruktur auf heterogene Systeme. Kunden gewinnen eine weitere Accelerator-Option, ohne den sie umgebenden NVIDIA-Stack aufgeben zu müssen.

Die ungeklärte Frage lautet, wer den daraus entstehenden Wert abschöpft. Raptor muss genügend Verbesserungen bei Latenz oder Effizienz liefern, um sich neben GPUs seinen Platz zu verdienen. NVIDIA muss NVLink Fusion attraktiv halten, ohne Partner innerhalb seiner Architektur ununterscheidbar zu machen.

Für Entwickler und Unternehmenskäufer lautet die praktische Antwort: Evidenz verfolgen, nicht Topologiediagramme. Achten Sie auf Tape-out, verlangen Sie vollständige Rack-Benchmarks und suchen Sie nach namentlich genannten Produktions-Deployments. Diese drei Signale zeigen, ob die Partnerschaft echte Wahlmöglichkeiten bei Rechenleistung erweitert oder hauptsächlich NVIDIAs Einfluss auf diese Wahl ausbaut.

Der nächste Schritt liegt bei d-Matrix. Kann das Unternehmen einen Design-Meilenstein für 2026 bis Ende 2027 in validierte Raptor-Racks mit messbaren Verbesserungen bei Produktionsmodellen verwandeln? Bis dahin ist das wichtigste Ergebnis des Deals klar: Alternative KI-Hardware erreicht das Rechenzentrum zunehmend über eine Infrastruktur, die NVIDIA definiert.

 
 

Kostenlos loslegen

Ein Local-First-KI-Assistent mit persönlichem Wissensmanagement

Für ein besseres KI-Erlebnis

unterstützt remio derzeit nur Windows 10+ (x64) und M-Chip Macs.

Ihr KI-Partner bei der Arbeit
Mehr schaffen mit remio

Planen. Erstellen. Liefern.
Alles an einem Ort.

bottom of page