Umowa d-Matrix NVLink Fusion wprowadza Raptor do strategii szaf rack NVIDIA
d-Matrix wdrożył NVIDIA NVLink Fusion dla Raptor, mimo że tworzy akcelerator inferencyjny mający stanowić alternatywę dla konwencjonalnych konstrukcji GPU. Porozumienie łączy przyszły procesor z architekturą szaf rack NVIDIA, siecią, CPU oraz łańcuchem dostaw infrastruktury. Ujawnia też zasadnicze napięcie stojące za partnerstwem d-Matrix NVLink Fusion.
Wyspecjalizowane akceleratory mogą rzucać wyzwanie krzemowym układom obliczeniowym NVIDIA, nie wypierając pozostałej części jej platformy. Dla d-Matrix taka wymiana oferuje szybszą drogę od ambitnego projektu układu do infrastruktury gotowej do wdrożenia. Dla NVIDIA każde nowe XPU podłączone przez NVLink wzmacnia jej pozycję wokół szafy rack.
Decyzja zapada, zanim Raptor stanie się produktem komercyjnym. d-Matrix oczekuje tape-outu układu przed końcem 2026 roku, a zintegrowane systemy MGX mają być początkowo dostępne w czwartym kwartale 2027 roku. Ten harmonogram oznacza, że jest to zapowiedź planu rozwoju, a nie dowód wydajności produkcyjnej.
Stawia to również d-Matrix obok rosnącej grupy firm korzystających z infrastruktury NVIDIA dla wyspecjalizowanych procesorów. Wśród tych partnerów są uznani dostawcy układów scalonych, dostawcy chmury oraz specjaliści od inferencji. Alternatywną drogą jest otwarta szafa rack zbudowana wokół technologii takich jak architektura Helios firmy AMD, UALink i Ultra Ethernet.
Co zmienia porozumienie d-Matrix NVLink Fusion
d-Matrix nie projektuje już Raptor jako odizolowanej karty akceleratora. Projektuje procesor jako część szafy rack zdefiniowanej przez NVIDIA.
Firmy ogłosiły współpracę 10 września 2026 roku. Zgodnie z ogłoszeniem Raptor, porozumienie obejmuje wieloletni plan rozwoju produktów, a nie pojedynczy test interoperacyjności.
Raptor połączy się z przełącznikami NVLink, aby zapewnić komunikację scale-up wewnątrz ściśle połączonego systemu. Sieć scale-up umożliwia wielu akceleratorom działanie bardziej jak jeden duży zasób obliczeniowy, z mniejszymi opóźnieniami komunikacji niż w zwykłej sieci centrum danych.
Szafa rack będzie również wykorzystywać Spectrum-X Ethernet do sieci scale-out między systemami. Ta warstwa łączy oddzielne szafy rack lub klastry, obsługując przeciążenia i wzorce ruchu związane z rozproszonymi obciążeniami AI.
Proponowana konstrukcja obejmuje CPU NVIDIA Vera, jednostki przetwarzania danych BlueField-4 oraz SuperNIC ConnectX-9. Wykorzystuje także NVIDIA MGX — modułową architekturę referencyjną obejmującą fizyczne tace, dostarczanie energii, chłodzenie oraz integrację systemu.
Astera Labs dostarczy technologię łączności przeznaczoną do utrzymania wysokoprzepustowego przesyłu danych w całym systemie. d-Matrix podaje, że szafa rack będzie korzystać z modułowych tac bezkablowych z istniejącego ekosystemu produkcyjnego MGX.
Ten zakres ma znaczenie, ponieważ sam procesor nie jest użyteczną usługą AI. Nabywcy potrzebują serwerów, firmware’u, sieci, orkiestracji, chłodzenia, procedur naprawczych oraz niezawodnego przepływu części zamiennych.
Startup zazwyczaj musi sam zbudować te elementy albo przekonać partnerów, by je zbudowali. Następnie musi zakwalifikować kompletny system dla klientów, którzy nie mogą tolerować nieoczekiwanych przestojów.
NVLink Fusion zmienia tę sekwencję. NVIDIA zapewnia dostęp do wybranych elementów swojej sieci scale-up i projektów szaf rack, umożliwiając XPU innej firmy wejście do tego samego środowiska infrastrukturalnego.
Termin XPU szeroko odnosi się do wyspecjalizowanego procesora zoptymalizowanego pod obciążenia, które nie pasują do CPU ogólnego przeznaczenia. W przypadku Raptor celem jest inferencja generatywnej AI, zwłaszcza wrażliwe na opóźnienia generowanie tokenów.
XPU d-Matrix Raptor może także działać obok systemów NVIDIA GPU, w tym Vera Rubin NVL72. NVIDIA określa ten układ jako rozdzieloną inferencję, w której różne procesory obsługują odmienne etapy lub rodzaje zadań obsługi modeli.
To współistnienie odwraca narrację. d-Matrix nie musi zastępować NVIDIA w całym centrum danych, aby wygrać wdrożenie inferencyjne. Może konkurować o wybrane obciążenia, opierając się jednocześnie na komponentach NVIDIA wszędzie wokół swojego układu.
NVIDIA zyskuje coś równie ważnego. Może obsługiwać niestandardowe akceleratory bez rezygnacji z kontroli nad otaczającą architekturą systemu. Granica konkurencji przesuwa się z układu do szafy rack.
Umowa oznacza zatem więcej niż kolejną odznakę kompatybilności. Sprawdza, czy NVIDIA może sprawić, by akceleratory firm trzecich zwiększały popyt na jej infrastrukturę, nawet gdy konkurują z jej GPU.
Dlaczego integracja szafy rack stała się rzeczywistą barierą
Deficytową zdolnością nie jest już projektowanie imponującego akceleratora. Jest nią przekształcenie tego krzemu w infrastrukturę, którą klienci mogą wdrażać przewidywalnie.
Inferencja AI stawia sprzętowi inne wymagania niż trenowanie modeli. Trening kładzie nacisk na wielkie równoległe obliczenia na wielu akceleratorach. Inferencja musi też zarządzać czasem odpowiedzi, współbieżnymi użytkownikami, pamięcią modelu oraz nieprzewidywalnym strumieniem żądań.
Modele rozumujące nasilają tę presję, ponieważ mogą wygenerować znacznie więcej tokenów przed zwróceniem odpowiedzi. Aplikacje z długim kontekstem utrzymują również duże pamięci podręczne klucz-wartość, które przechowują informacje potrzebne podczas generowania tokenów.
Takie obciążenia sprawiają, że przemieszczanie pamięci staje się kluczowym ograniczeniem. Akcelerator może oferować znaczną moc arytmetyczną, podczas gdy jednostki obliczeniowe czekają na wagi modelu lub zapisany kontekst.
d-Matrix rozwiązuje ten problem poprzez obliczenia zorientowane na pamięć. Jego architektura umieszcza operacje macierzowe bliżej przechowywanych danych, zmniejszając dystans, jaki informacje pokonują podczas inferencji.
Jednak rozwiązanie wąskiego gardła pamięci wewnątrz procesora nie rozwiązuje problemu wdrożenia poza nim. Systemy w skali szafy rack muszą koordynować akceleratory, hosty, pamięć masową, sieć, zasilanie i chłodzenie w rzeczywistych warunkach operacyjnych.
Każdy komponent wprowadza pracę kwalifikacyjną. Inżynierowie muszą zweryfikować integralność sygnału, zachowanie termiczne, kompatybilność firmware’u, komunikację zbiorową, odzyskiwanie po awarii oraz procedury serwisowe.
Szafy rack chłodzone cieczą dodają kolejną warstwę operacyjną. Nowy dostawca musi dopasować się do ustalonych projektów obiektów, nie wymagając od klientów przebudowy zasilania i chłodzenia wokół jednego procesora.
Pierwotna premiera NVLink Fusion firmy NVIDIA bezpośrednio odpowiadała na ten problem. Firma wprowadziła platformę w maju 2025 roku dla półniestandardowej infrastruktury AI wykorzystującej zewnętrzne CPU i XPU.
Jej początkowa lista partnerów obejmowała kilka elementów łańcucha projektowego. MediaTek, Marvell, Alchip, Astera Labs, Synopsys i Cadence wspierały niestandardowy krzem, łączność lub własność intelektualną.
Fujitsu i Qualcomm planowały niestandardowe CPU zdolne do pracy z NVIDIA GPU. Późniejsze współprace rozszerzyły platformę o dodatkowe procesory i projekty chmurowe.
Rosnące grono partnerów wywiera presję na każdego niezależnego dostawcę akceleratorów. Producent układów może dołączyć do istniejącego ekosystemu szaf rack, samodzielnie zbudować równoważny system albo dostosować się do konkurencyjnego otwartego standardu.
Pierwsza droga ogranicza ryzyko integracji, ale tworzy strategiczną zależność. Druga zachowuje większą kontrolę, lecz wymaga kapitału, czasu i zaufania klientów. Trzecia zależy od osiągnięcia przez inny ekosystem porównywalnej dojrzałości.
d-Matrix wybrał dla Raptor szybkość i możliwość wdrożenia. Dyrektor generalny firmy, Sid Sheth, jasno ujął ograniczenie: popyt na inferencję rośnie, podczas gdy kapitał, czas i energia pozostają ograniczone.
Decyzja firmy odzwierciedla również jej etap rozwoju. d-Matrix rozpoczął dostawy platformy Corsair przed wprowadzeniem Raptor, lecz pozostaje znacznie mniejszy od dostawców infrastruktury, którym ma nadzieję rzucić wyzwanie.
Budowanie nowej platformy szaf rack obok nowej architektury pamięci zwielokrotniłoby ryzyko wykonawcze. Wykorzystanie MGX pozwala firmie skoncentrować więcej zasobów inżynieryjnych na procesorze, kompilatorze i oprogramowaniu inferencyjnym.
Ten wybór nie eliminuje kwalifikacji. Raptor nadal musi prawidłowo implementować NVLink, współpracować z innymi urządzeniami NVIDIA oraz spełniać systemowe cele wydajności i niezawodności.
Ogranicza jednak liczbę nowych elementów, które klienci muszą zaakceptować jednocześnie. Znana szafa rack może ułatwić zespołowi infrastruktury ocenę nieznanego akceleratora.
Rezultat wywiera presję na konkurencyjne firmy produkujące akceleratory równie mocno jak na dostawców GPU. Startup oferujący jedynie szybki układ konkuruje teraz z procesorami zapakowanymi w zweryfikowane, serwisowalne projekty szaf rack.
Jak NVLink Fusion działa wokół Raptor
NVLink Fusion oddziela wybór procesora od konstrukcji szafy rack, lecz utrzymuje interkonekt NVIDIA w centrum systemu.
Architektura ma dwa poziomy sieci. NVLink łączy akceleratory w domenie scale-up, podczas gdy Spectrum-X przenosi ruch przez większy klaster scale-out.
Wewnątrz szafy rack przełączniki NVLink zapewniają komunikację o wysokiej przepustowości i niskich opóźnieniach między urządzeniami Raptor. To połączenie ma znaczenie, gdy model lub jego dane robocze nie mogą pozostać na jednym akceleratorze.
Poza tą domeną SuperNIC ConnectX i Spectrum-X Ethernet łączą systemy w całym centrum danych. DPU BlueField mogą obsługiwać zadania infrastrukturalne, takie jak sieć, izolacja i przesył danych.
CPU Vera pełnią rolę procesorów hosta. MGX definiuje mechaniczne i elektryczne ramy, które pakują te elementy w gotowe do wdrożenia tace i szafy rack.
Zrozumienie działania NVLink Fusion wymaga rozróżnienia między dostępem a standaryzacją. NVIDIA otwiera swoją sieć dla zatwierdzonych układów krzemowych firm trzecich, ale NVLink pozostaje technologią kontrolowaną przez NVIDIA.
Projekt jest więc horyzontalnie inkluzywny, nie stając się neutralny wobec dostawców. Partnerzy uzyskują dostęp do platformy, podczas gdy NVIDIA zachowuje wpływ na interfejsy, kwalifikację, plany rozwoju i otaczające komponenty.
Model oferuje praktyczne zalety. Wspólna szafa rack może obsługiwać różne typy akceleratorów bez zmuszania operatora do tworzenia osobnej konstrukcji fizycznej dla każdego procesora.
Twórca centrum danych może standaryzować przestrzeń na podłodze, przyłącza chłodzenia, dystrybucję zasilania i praktyki konserwacyjne. Moc obliczeniowa może następnie różnić się zależnie od wymagań obciążenia.
NVIDIA wnosi również ugruntowaną sieć produkcyjną. Producenci oryginalnego sprzętu i producenci projektowi już wytwarzają systemy oparte na MGX i platformach GPU NVIDIA w skali szafy rack.
Techniczne wyjaśnienie firmy opisuje dostęp do interfejsów NVLink, chipletów, przełączników, okablowania i technologii szaf rack. Obejmuje także projekty zasilania i chłodzenia cieczą.
Dla d-Matrix infrastruktura ta rozwiązuje problem, którego nie oddają surowe benchmarki akceleratorów. Klienci kupujący moc inferencyjną oceniają harmonogramy wdrożeń, łatwość serwisowania, wykorzystanie i ryzyko operacyjne obok liczby tokenów na sekundę.
Procesor, który pojawia się późno lub wymaga unikalnej szafy rack, może przegrać nawet przy korzystnych wynikach laboratoryjnych. Spójność infrastruktury może przeważyć nad wąską przewagą wydajności.
Podejście pozwala również klientom łączyć wyspecjalizowaną inferencję z obciążeniami opartymi na GPU. NVIDIA twierdzi, że szafy rack Raptor mogą działać obok systemów Vera Rubin NVL72, zamiast je zastępować.
Jedno z możliwych wdrożeń kierowałoby wrażliwe na opóźnienia generowanie tokenów do Raptor, pozostawiając inne etapy modelu GPU. Firmy nie opublikowały kompletnej konfiguracji produkcyjnej potwierdzającej taki przepływ pracy.
Oprogramowanie pozostaje niezbędne w każdym takim podziale. Środowiska wykonawcze modeli muszą właściwie przydzielać zadania, zarządzać pamięcią i przenosić dane bez niwelowania korzyści płynących ze specjalistycznego sprzętu.
d-Matrix opracował własny stos oprogramowania dla Corsair i Raptor. Integracja z szerszym środowiskiem NVIDIA zdecyduje o tym, czy nabywcy otrzymają jedną łatwą w zarządzaniu platformę, czy dwa sąsiadujące systemy.
To rozróżnienie będzie istotne dla deweloperów. Heterogeniczność sprzętowa umożliwia lepsze dopasowanie do obciążeń, ale może wprowadzać odrębne kompilatory, narzędzia monitorujące, profile wydajności i ścieżki debugowania.
NVLink zmniejsza trudności komunikacyjne między urządzeniami. Nie sprawia jednak automatycznie, że ich modele programowania stają się identyczne.
Wartość partnerstwa zależy zatem od koordynacji ponad fizycznym łączem. Firmy muszą przekształcić kompatybilne komponenty w powtarzalne wzorce wdrożeń, które operatorzy chmurowi będą mogli oferować jako usługi.
Architektura pamięci Raptor jest stawką wewnątrz szafy rack
NVIDIA dostarcza fundament systemu, ale Raptor wciąż musi uzasadnić, dlaczego klienci potrzebują kolejnego procesora do inferencji.
Raptor rozwija podejście skoncentrowane na pamięci, zastosowane we wcześniejszej platformie Corsair firmy d-Matrix. Jego cechą definiującą jest trójwymiarowy pakiet, w którym układ obliczeniowy znajduje się bezpośrednio nad niestandardową pamięcią DRAM.
DRAM oferuje większą gęstość niż SRAM, szybsza pamięć szeroko wykorzystywana w Corsair. Jednak konwencjonalna pamięć DRAM znajduje się dalej od jednostek obliczeniowych i zwykle wymaga więcej energii do przesunięcia każdego bitu.
Konstrukcja d-Matrix udostępnia wiele małych banków pamięci bezpośrednio silnikom obliczeniowym za pośrednictwem gęstych połączeń pionowych. Celem jest połączenie pojemności DRAM ze znacznie większą lokalną przepustowością.
Podczas Hot Chips 2026 firma zaprezentowała pakiet z układem obliczeniowym TSMC w procesie 4 nm, połączonym nad niestandardowym układem DRAM. Interfejs wykorzystuje rozstaw połączeń wynoszący 36 mikronów.
Zaprezentowana konstrukcja oferuje 32GB na kartę oraz deklarowane 100 terabajtów na sekundę wewnętrznej przepustowości. Dane te opisują transfer wewnątrz pakietu, a nie przepustowość sieciową między oddzielnymi akceleratorami.
Niezależne doniesienia dotyczące konstrukcji 3D DRAM również podkreślały istotne zastrzeżenie. Wiele opublikowanych wyników wydajności pozostaje prognozami opartymi na wczesnych wersjach krzemu.
d-Matrix zmierzył zużycie energii interfejsu pionowego na poziomie 0,37 pikodżula na bit. Firma porównała tę wartość z około 2,4 pikodżula dla transferu do matrycy bazowej HBM4.
Powiązany artykuł badawczy prognozował około 4,7 razy większą przepustowość na kartę niż w konstrukcjach opartych na HBM. Ani prognoza, ani pomiar interfejsu nie potwierdzają pełnej wydajności systemu produkcyjnego.
Zarządzanie termiczne stanowi kolejne wyzwanie. Układ logiczny znajduje się na górze, aby płyta chłodząca mogła stykać się z nim bezpośrednio, natomiast umieszczona pod nim pamięć DRAM pełni również funkcję interposera.
Cały pakiet ma ujawniony budżet mocy wynoszący 422 waty. Pionowy interfejs pamięci odpowiada za 296 watów podczas pracy z pełną pojemnością.
Ciepło wpływa na retencję DRAM, która określa, jak długo komórki pamięci zachowują dane przed odświeżeniem. Przy deklarowanej temperaturze pracy konstrukcja wymaga znacznie częstszych operacji odświeżania.
d-Matrix twierdzi, że mniejsze banki pamięci ograniczają wynikający z tego koszt przepustowości. W rozwiązaniu uwzględniono także zapasowe banki, korekcję błędów i redundancję, mające zapewnić niezawodne działanie.
Te szczegóły wyjaśniają, dlaczego integracja z dojrzałą szafą rack chłodzoną cieczą ma znaczenie. Architektura Raptor nie wymaga jedynie złącza. Wymaga zasilania, chłodzenia i walidacji zaprojektowanych wokół nietypowego pakietu.
Technologia jest skierowana na generowanie tokenów, ponieważ ta faza często wielokrotnie przenosi wagi modelu, wykonując przy tym stosunkowo niewiele operacji arytmetycznych na bajt. Większa lokalna przepustowość pamięci może utrzymać jednostki obliczeniowe w stanie aktywności.
Prefill, czyli przetwarzanie nadchodzącego promptu, ma inny profil wydajnościowy. Może wymagać większej liczby obliczeń i preferować inną konfigurację akceleratorów.
Ta różnica wspiera argument za rozproszoną inferencją. Operatorzy mogliby przypisywać oddzielne procesory do prefill i dekodowania, pod warunkiem że oprogramowanie i sieć zapewnią sprawne przekazanie zadania.
Mimo to wartości Raptor nie można wywnioskować wyłącznie na podstawie przepustowości. Użyteczna wydajność zależy od obsługi modeli, formatów numerycznych, harmonogramowania, rozmiaru batcha, długości kontekstu i akceptowalnego opóźnienia odpowiedzi.
Znaczenie ma również pojemność pamięci. Karta 32GB nie może samodzielnie pomieścić każdego dużego modelu, więc większe obciążenia wymagają podziału między kilka urządzeń.
Wymóg ten sprawia, że domena skalowania NVLink nabiera większego znaczenia. Wewnętrzna architektura pamięci Raptor i zewnętrzna infrastruktura NVIDIA muszą współpracować bez tworzenia nowego wąskiego gardła.
XPU d-Matrix Raptor jest zatem złożonym zakładem. Jego pakiet 3D musi działać z wydajnością produkcyjną, a szafa rack musi przekształcić ten pakiet w niezawodną wydajność aplikacyjną.
Otwarta platforma NVIDIA wciąż ma granice
Główną rywalizacją nie jest d-Matrix przeciwko GPU NVIDIA. Jest nią integracja kontrolowana przez NVIDIA przeciwko neutralnej wobec dostawców infrastrukturze rackowej.
NVIDIA opisuje swoją platformę AI jako pionowo zintegrowaną i poziomo otwartą. To sformułowanie oddaje jej strategię, ale nabywcy powinni przeanalizować znaczenie każdej z tych części.
Integracja pionowa łączy procesory NVIDIA, przełączniki, adaptery sieciowe, DPU, oprogramowanie, projekty szaf rack i relacje w łańcuchu dostaw. Otwartość pozioma pozwala wybranym zewnętrznym CPU i XPU wejść do tego środowiska.
Ta struktura rozszerza wybór procesorów w systemie, którego kluczowa infrastruktura pozostaje kontrolowana przez NVIDIA. Jest bardziej otwarta niż szafa rack wyłącznie z GPU, lecz mniej neutralna niż interconnect zarządzany przez branżę.
Ta granica jest korzystna komercyjnie dla NVIDIA. Jeśli niestandardowe akceleratory zyskają udział w rynku, firma nadal będzie mogła dostarczać otaczające je wysokowartościowe komponenty sieciowe i infrastrukturalne.
Może również utrzymać NVLink w centrum uwagi, gdy systemy AI przechodzą od serwerów do komputerów w skali szafy rack. Produktem staje się szafa rack, a poszczególne procesory — konfigurowalnymi elementami.
d-Matrix zyskuje, ponieważ może dotrzeć do nabywców już przygotowujących obiekty na sprzęt NVIDIA. Partnerstwo obniża organizacyjny koszt testowania mniej znanego procesora.
Jednak d-Matrix dziedziczy również zależność od procesu kwalifikacji NVIDIA i planu rozwoju infrastruktury tej firmy. Zmiany w przełącznikach, CPU, oprogramowaniu lub warunkach handlowych mogą wpłynąć na jego plany systemowe.
Firmy nie ujawniły struktury finansowej partnerstwa. Nie przedstawiły także szczegółów dotyczących współdzielonych warstw oprogramowania ani sposobu, w jaki klienci będą kupować i otrzymywać wsparcie dla kompletnych szaf rack.
Te niewyjaśnione kwestie mają znaczenie, ponieważ otwartość ma kilka wymiarów. Sprzęt może być fizycznie interoperacyjny, podczas gdy zakup, zarządzanie i rozwój pozostają ściśle związane z jednym dostawcą.
Konkurencyjny model kładzie nacisk na otwarte interfejsy branżowe. Projekt Helios rack firmy AMD wykorzystuje OCP Open Rack Wide, UALink do łączności scale-up oraz Ultra Ethernet dla większych klastrów.
Helios łączy akceleratory AMD Instinct, procesory EPYC i sieci Pensando. Opublikowany projekt obejmuje 72 akceleratory, odpowiadając ruchowi branży w kierunku gęstych systemów w skali szafy rack.
UALink ma umożliwiać wielu dostawcom łączenie akceleratorów za pośrednictwem wspólnej specyfikacji. Podejście to obiecuje większą przenośność, choć otwarta specyfikacja nie gwarantuje jednakowej dojrzałości produktów ani skali wdrożeń.
Przewaga NVIDIA polega na tym, że NVLink działa już w kilku generacjach dostarczanych systemów. Jej partnerzy produkcyjni mają także praktyczne doświadczenie z gęstymi szafami rack chłodzonymi cieczą.
Otwarta ścieżka oferuje większą teoretyczną niezależność. Ścieżka NVIDIA oferuje ugruntowany sposób integracji pod architektonicznym kierunkiem jednej firmy.
Żadna z tych opcji nie eliminuje całkowicie uzależnienia od dostawcy. Nabywca wdrażający Raptor zależy również od oprogramowania d-Matrix, jego łańcucha dostaw pamięci 3D oraz zdolności startupu do wspierania przyszłych produktów.
Szersze pole konkurencji obejmuje Groq, Cerebras, AMD, Intel oraz akceleratory projektowane przez hyperscalerów. Przegląd rynku inferencji wcześniej wskazywał te firmy jako alternatywy ukierunkowane na obciążenia zdominowane przez GPU.
Od tego czasu kilka z nich zbliżyło się do ofert pełnosystemowych. Groq na przykład również dołączył do rozwijającej się strategii NVIDIA w zakresie infrastruktury inferencyjnej.
Ten wzorzec sugeruje, że NVIDIA chce wchłaniać specjalizację, zamiast się jej przeciwstawiać. Udany XPU może stać się kolejnym powodem, by wdrożyć technologię sieciową i rackową NVIDIA.
Dla d-Matrix dołączenie do tej platformy jest pragmatyczne. Oznacza też, że wyzwanie, jakie firma rzuca NVIDIA, jest węższe, niż sugeruje prosta narracja o rywalizujących chipach.
Partnerstwo rozstrzyga, który procesor wykonuje inferencję. Nie kwestionuje tego, kto definiuje znaczną część otaczającej infrastruktury.
Dostawy, benchmarki i klienci zdecydują o wyniku
Ogłoszenie ustanawia zamiar architektoniczny. Nie potwierdza gotowości produkcyjnej, popytu komercyjnego ani wydajności produkcyjnej.
Pierwszym punktem obserwacyjnym jest planowany tape-out Raptor przed końcem 2026 roku. Tape-out to moment, w którym projekt chipu zostaje sfinalizowany do produkcji.
Osiągnięcie tego kamienia milowego wsparłoby obecny harmonogram. Jego niedotrzymanie skróciłoby czas na produkcję wafli, pakowanie, testy, prace nad oprogramowaniem i kwalifikację szaf rack przed końcem 2027 roku.
Drugim sygnałem jest niezależnie powtarzalna wydajność systemu. Nabywcy potrzebują wyników kompletnych szaf rack Raptor, a nie odizolowanych danych dotyczących przepustowości czy prognozowanych uruchomień modeli.
Takie oceny powinny ujawniać modele, długości kontekstu, rozmiary batchy, cele opóźnień, ustawienia dokładności i zużycie energii. Liczba tokenów na sekundę bez tych warunków może ukrywać istotne kompromisy.
Wydajność przypadająca na użytkownika będzie szczególnie istotna dla oferty firmy dotyczącej usług tokenowych premium. Wysoka łączna przepustowość ma mniejsze znaczenie, jeśli indywidualne zapytania czekają w dużych batchach.
Pomiary energii powinny obejmować całą szafę rack. Efektywność na poziomie pakietu może zostać osłabiona przez CPU, przełączniki, sprzęt chłodzący, sieć i niewykorzystaną pojemność.
Trzecim sygnałem są wskazane z nazwy wdrożenia klientów. d-Matrix twierdzi, że Raptor jest oceniany przez hyperscalerów i wiodące laboratoria, ale nie zidentyfikował tych organizacji.
Potwierdzona instancja chmurowa, zarządzana usługa inferencyjna lub ogłoszony klaster produkcyjny wzmocniłyby komercyjne uzasadnienie partnerstwa. Same oceny nie wskazują na zamiar zakupu.
Początkowa dostępność nadal jest planowana na czwarty kwartał 2027 roku. Ten długi okres daje konkurencyjnym systemom czas na ulepszenie ich pamięci, sieci i oprogramowania inferencyjnego.
Naraża też d-Matrix na niepewność produkcyjną. Firma musi wyprodukować niestandardowy układ DRAM, połączyć go z zaawansowaną logiką, osiągnąć akceptowalną wydajność uzysku i zwalidować pakiet przy długotrwałym oddziaływaniu ciepła.
Jej deklaracja dotycząca ponad 100 patentów nie rozstrzyga tych pytań produkcyjnych. Patenty chronią pomysły techniczne, podczas gdy klienci potrzebują niezawodnych wolumenów i przewidywalnej obsługi.
NVIDIA również ma pracę do wykonania. Odpowiednie komponenty Vera, BlueField, ConnectX, Spectrum-X i NVLink muszą osiągnąć wymaganą dojrzałość w zgodnych harmonogramach.
Astera Labs musi dostarczyć elementy łączności jako część zintegrowanego projektu. Producenci szaf rack muszą następnie zakwalifikować tace bez kabli, chłodzenie, firmware i zarządzanie systemem.
Oprogramowanie stanowi równoległy harmonogram. d-Matrix musi obsługiwać aktualne modele i frameworki w chwili wprowadzenia Raptor na rynek, a nie tylko te dostępne podczas projektowania.
Architektury modeli mogą szybko się zmieniać. Rzadkie mieszaniny ekspertów, dłuższe okna kontekstu, obciążenia multimodalne i nowe techniki dekodowania zmieniają wzorce wykorzystania pamięci i komunikacji.
Wyspecjalizowany procesor odnosi sukces, gdy jego architektura pozostaje użyteczna mimo tych zmian. Potrzebuje także aktualizacji kompilatora wystarczająco szybkich, by nadążać za powszechnie używanymi modelami.
Platforma NVIDIA może ograniczyć ryzyko związane z fizycznym wdrożeniem, ale nie gwarantuje adopcji oprogramowania. Deweloperzy i operatorzy chmurowi nadal potrzebują powodu, by kierować obciążenia do Raptor.
Najmocniejsze uzasadnienie łączyłoby niskie opóźnienia dla pojedynczego użytkownika, konkurencyjne zużycie energii oraz prosty proces wdrażania modeli. Słabość w którymkolwiek z tych obszarów może ograniczyć wykorzystanie.
Nabywcy powinni również obserwować, jak NVIDIA pozycjonuje Raptor obok własnych GPU i innych produktów do inferencji. Równy dostęp techniczny nie musi przekładać się na równą widoczność komercyjną.
Ostatnią kwestią jest koncentracja platformy. Obsługa zewnętrznych XPU daje klientom większy wybór procesorów, jednocześnie przenosząc więcej decyzji dotyczących szaf rackowych pod wpływ NVIDIA.
Taki rezultat nie oznacza ani pełnej otwartości, ani prostego wykluczenia. To wielowarstwowy rynek, na którym konkurencja przetrwa w ramach coraz bardziej wspólnej granicy infrastrukturalnej.
Współpraca d-Matrix NVLink Fusion będzie miała znaczenie, jeśli Raptor przekroczy tę granicę jako dostarczana, mierzalna i szeroko dostępna usługa. Do tego czasu jej znaczenie leży w strategii.
d-Matrix uznało, że lepszy układ do inferencji nie wystarczy bez wiarygodnej szafy rackowej. NVIDIA uznała, że wyspecjalizowane procesory mogą wejść do jej platformy bez osłabiania jej pozycji infrastrukturalnej.
W nadchodzących miesiącach warto obserwować tape-out, benchmarki kompletnych systemów oraz nazwane wdrożenia — w tej kolejności. Każdy kamień milowy pokaże, czy ta mapa drogowa staje się produktem.
Dla nabywców infrastruktury kluczowe pytanie nie brzmi, czy Raptor pokona każde GPU. Należy zapytać, czy zapewnia wartościowy profil inferencji bez dodawania niedopuszczalnej złożoności operacyjnej. To właśnie te dowody zdecydują, czy szafa rackowa NVIDIA stanie się platformą startową dla wyboru akceleratorów, czy kolejnym trwałym punktem zależności.



