top of page

L'accordo d-Matrix NVLink Fusion inserisce Raptor nella strategia rack di NVIDIA

12 set
Tempo di lettura: 15 min

d-Matrix ha adottato NVIDIA NVLink Fusion per Raptor, pur sviluppando un acceleratore per l'inferenza pensato come alternativa alle architetture GPU convenzionali. L'accordo collega il futuro processore all'architettura rack, al networking, alle CPU e alla catena di fornitura dell'infrastruttura di NVIDIA. Mette inoltre in luce la tensione centrale alla base della partnership d-Matrix NVLink Fusion.

Gli acceleratori specializzati possono sfidare il silicio di calcolo di NVIDIA senza sostituire il resto della sua piattaforma. Per d-Matrix, questo compromesso offre una via più rapida da un progetto di chip ambizioso a un'infrastruttura implementabile. Per NVIDIA, ogni nuova XPU collegata tramite NVLink rafforza la sua posizione attorno al rack.

La decisione arriva prima che Raptor diventi un prodotto commerciale. d-Matrix prevede il tape-out del chip entro la fine del 2026, con sistemi MGX integrati inizialmente disponibili nel quarto trimestre del 2027. Questa tempistica rende l'annuncio una dichiarazione di roadmap, non una prova delle prestazioni in produzione.

Colloca inoltre d-Matrix accanto a un gruppo in espansione di aziende che utilizzano l'infrastruttura NVIDIA per processori specializzati. Tra questi partner figurano fornitori di silicio affermati, provider cloud e specialisti dell'inferenza. Il percorso alternativo è un rack aperto assemblato attorno a tecnologie quali l'architettura Helios di AMD, UALink e Ultra Ethernet.

Cosa cambia con l'accordo d-Matrix NVLink Fusion

d-Matrix non sta più progettando Raptor come scheda acceleratrice isolata. Sta progettando il processore come parte di un rack definito da NVIDIA.

Le aziende hanno annunciato la collaborazione il 10 settembre 2026. Secondo l'annuncio di Raptor, l'intesa comprende una roadmap di prodotto pluriennale, anziché un singolo test di interoperabilità.

Raptor si collegherà agli switch NVLink per le comunicazioni scale-up all'interno di un sistema strettamente connesso. Il networking scale-up consente a più acceleratori di comportarsi più come un'unica grande risorsa di calcolo, con ritardi di comunicazione inferiori rispetto al normale networking dei data center.

Il rack utilizzerà inoltre Spectrum-X Ethernet per il networking scale-out tra sistemi. Questo livello collega rack o cluster separati, gestendo al contempo congestione e modelli di traffico associati ai carichi di lavoro AI distribuiti.

Il progetto proposto include CPU NVIDIA Vera, unità di elaborazione dati BlueField-4 e SuperNIC ConnectX-9. Utilizza inoltre NVIDIA MGX, un'architettura di riferimento modulare che copre tray fisici, distribuzione dell'alimentazione, raffreddamento e integrazione di sistema.

Astera Labs fornirà tecnologia di connettività progettata per mantenere un movimento di dati ad alta velocità nell'intero sistema. d-Matrix afferma che il rack utilizzerà tray modulari senza cavi dell'attuale ecosistema produttivo MGX.

Questa portata è importante perché un processore da solo non costituisce un servizio AI utilizzabile. Gli acquirenti hanno bisogno di server, firmware, networking, orchestrazione, raffreddamento, procedure di riparazione e un flusso affidabile di ricambi.

Una startup deve in genere sviluppare questi elementi o convincere partner a realizzarli. Deve poi qualificare il sistema completo per clienti che non possono tollerare tempi di inattività imprevisti.

NVLink Fusion cambia questa sequenza. NVIDIA fornisce accesso a elementi selezionati della propria fabric scale-up e dei progetti rack, consentendo alla XPU di un'altra azienda di entrare nello stesso framework infrastrutturale.

Il termine XPU indica in senso ampio un processore specializzato ottimizzato per carichi di lavoro che non si adattano a una CPU general-purpose. Nel caso di Raptor, l'obiettivo è l'inferenza AI generativa, soprattutto la generazione di token sensibile alla latenza.

La XPU d-Matrix Raptor può operare anche accanto a sistemi GPU NVIDIA, incluso Vera Rubin NVL72. NVIDIA descrive questa configurazione come inferenza disaggregata, in cui processori diversi gestiscono fasi o tipologie distinte del lavoro di serving.

Questa coesistenza ribalta la narrazione. d-Matrix non deve sostituire NVIDIA nell'intero data center per ottenere un'implementazione nell'inferenza. Può competere per carichi di lavoro selezionati facendo affidamento sui componenti NVIDIA ovunque attorno al proprio chip.

NVIDIA ottiene qualcosa di altrettanto importante. Può accogliere acceleratori personalizzati senza rinunciare al controllo dell'architettura di sistema circostante. Il confine competitivo si sposta dal chip al rack.

L'accordo rappresenta quindi più di un semplice ulteriore bollino di compatibilità. Verifica se NVIDIA possa fare in modo che acceleratori di terze parti aumentino la domanda della sua infrastruttura, anche quando tali acceleratori competono con le sue GPU.

Perché l'integrazione rack è diventata il vero ostacolo

La capacità scarsa non è più progettare un acceleratore impressionante. È trasformare quel silicio in un'infrastruttura che i clienti possano implementare in modo prevedibile.

L'inferenza AI impone requisiti hardware diversi dall'addestramento dei modelli. L'addestramento enfatizza calcoli paralleli su larga scala distribuiti su molti acceleratori. L'inferenza deve anche gestire tempi di risposta, utenti simultanei, memoria del modello e un flusso imprevedibile di richieste.

I modelli di ragionamento intensificano questa pressione perché possono generare molti più token prima di restituire una risposta. Anche le applicazioni a contesto lungo mantengono grandi cache chiave-valore, che archiviano le informazioni necessarie durante la generazione dei token.

Questi carichi di lavoro rendono il movimento della memoria un vincolo centrale. Un acceleratore può offrire un'ampia capacità aritmetica lasciando però le unità di calcolo in attesa dei pesi del modello o del contesto memorizzato nella cache.

d-Matrix affronta questo problema attraverso il calcolo centrato sulla memoria. La sua architettura colloca le operazioni matriciali più vicino ai dati memorizzati, riducendo la distanza percorsa dalle informazioni durante l'inferenza.

Tuttavia, risolvere il collo di bottiglia della memoria all'interno di un processore non risolve l'implementazione al suo esterno. I sistemi rack-scale devono coordinare acceleratori, host, storage, networking, alimentazione e raffreddamento in condizioni operative reali.

Ogni componente introduce lavoro di qualificazione. Gli ingegneri devono convalidare integrità del segnale, comportamento termico, compatibilità del firmware, comunicazione collettiva, ripristino dai guasti e procedure di assistenza.

I rack raffreddati a liquido aggiungono un ulteriore livello operativo. Un nuovo fornitore deve adattarsi ai progetti degli impianti esistenti senza richiedere ai clienti di ricostruire alimentazione e raffreddamento attorno a un singolo processore.

Il lancio originale di NVLink Fusion da parte di NVIDIA affrontava direttamente questo problema. L'azienda ha introdotto la piattaforma nel maggio 2025 per infrastrutture AI semi-personalizzate che utilizzano CPU e XPU esterne.

Il suo elenco iniziale di partner copriva varie parti della catena progettuale. MediaTek, Marvell, Alchip, Astera Labs, Synopsys e Cadence supportavano silicio personalizzato, connettività o proprietà intellettuale.

Fujitsu e Qualcomm pianificavano CPU personalizzate in grado di funzionare con le GPU NVIDIA. Collaborazioni successive hanno esteso la piattaforma a processori aggiuntivi e progetti cloud.

Questa rosa in crescita esercita pressione su ogni fornitore indipendente di acceleratori. Un produttore di chip può entrare in un ecosistema rack consolidato, costruire autonomamente un sistema equivalente o allinearsi a uno standard aperto concorrente.

La prima strada riduce il rischio di integrazione ma crea dipendenza strategica. La seconda conserva maggiore controllo, ma richiede capitale, tempo e fiducia dei clienti. La terza dipende dal raggiungimento di una maturità comparabile da parte di un altro ecosistema.

d-Matrix ha scelto velocità e implementabilità per Raptor. Il suo amministratore delegato, Sid Sheth, ha formulato chiaramente il vincolo: la domanda di inferenza è in aumento, mentre capitale, tempo ed energia restano risorse finite.

La decisione dell'azienda riflette anche il suo stadio di sviluppo. d-Matrix ha iniziato a spedire la propria piattaforma Corsair prima di introdurre Raptor, ma rimane molto più piccola dei fornitori di infrastrutture che spera di sfidare.

Costruire una nuova piattaforma rack insieme a una nuova architettura di memoria moltiplicherebbe i rischi di esecuzione. L'uso di MGX consente all'azienda di concentrare maggiori risorse ingegneristiche sul processore, sul compilatore e sul software di inferenza.

Questa scelta non elimina la qualificazione. Raptor deve comunque implementare correttamente NVLink, funzionare con gli altri dispositivi NVIDIA e raggiungere obiettivi di prestazioni e affidabilità a livello di sistema.

Riduce però il numero di nuovi elementi che i clienti devono accettare contemporaneamente. Un rack familiare può rendere più facile per un team infrastrutturale valutare un acceleratore non familiare.

Il risultato mette sotto pressione le aziende rivali di acceleratori tanto quanto i fornitori di GPU. Una startup che offre soltanto un chip veloce ora compete con processori confezionati in progetti rack convalidati e manutenibili.

Come NVLink Fusion opera attorno a Raptor

NVLink Fusion separa la scelta del processore dalla costruzione del rack, ma mantiene l'interconnessione NVIDIA al centro del sistema.

L'architettura presenta due livelli di networking. NVLink collega gli acceleratori all'interno di un dominio scale-up, mentre Spectrum-X trasporta il traffico attraverso un cluster scale-out più ampio.

All'interno del rack, gli switch NVLink forniscono comunicazioni ad alta larghezza di banda e bassa latenza tra dispositivi Raptor. Questa connessione è importante quando un modello o i suoi dati di lavoro non possono rimanere su un solo acceleratore.

Al di fuori di quel dominio, le SuperNIC ConnectX e Spectrum-X Ethernet collegano i sistemi attraverso il data center. Le DPU BlueField possono gestire attività infrastrutturali quali networking, isolamento e movimento dei dati.

Le CPU Vera fungono da processori host. MGX definisce il framework meccanico ed elettrico che riunisce questi elementi in tray e rack implementabili.

Comprendere il funzionamento di NVLink Fusion richiede di distinguere l'accesso dalla standardizzazione. NVIDIA apre la propria fabric al silicio di terze parti approvato, ma NVLink resta una tecnologia controllata da NVIDIA.

Il progetto è quindi orizzontalmente inclusivo senza diventare neutrale rispetto ai fornitori. I partner ottengono accesso alla piattaforma, mentre NVIDIA mantiene influenza su interfacce, qualificazione, roadmap e componenti circostanti.

Questo modello offre vantaggi pratici. Un rack condiviso può supportare diversi tipi di acceleratori senza costringere un operatore a creare un progetto fisico separato per ogni processore.

Un costruttore di data center può standardizzare spazio a pavimento, connessioni di raffreddamento, distribuzione dell'alimentazione e pratiche di manutenzione. La capacità di calcolo può quindi variare in base ai requisiti del carico di lavoro.

NVIDIA porta inoltre una rete produttiva consolidata. I produttori di apparecchiature originali e i produttori su progetto realizzano già sistemi derivati da MGX e dalle piattaforme GPU rack-scale di NVIDIA.

La spiegazione tecnica dell'azienda descrive l'accesso a interfacce NVLink, chiplet, switch, cablaggi e tecnologia rack. Include anche progetti di alimentazione e raffreddamento a liquido.

Per d-Matrix, questa infrastruttura affronta un problema che i benchmark grezzi degli acceleratori non possono cogliere. I clienti che acquistano capacità di inferenza valutano programmi di implementazione, manutenibilità, utilizzo e rischio operativo insieme ai token al secondo.

Un processore che arriva tardi o richiede un rack unico può perdere anche con risultati di laboratorio favorevoli. La coerenza dell'infrastruttura può superare un ristretto vantaggio prestazionale.

L'approccio consente inoltre ai clienti di combinare l'inferenza specializzata con carichi di lavoro basati su GPU. NVIDIA afferma che i rack Raptor possono operare accanto ai sistemi Vera Rubin NVL72 anziché sostituirli.

Una possibile implementazione potrebbe indirizzare la generazione di token sensibile alla latenza verso Raptor, mantenendo al contempo altre fasi del modello sulle GPU. Le aziende non hanno pubblicato una configurazione di produzione completa che dimostri questo flusso di lavoro.

Il software rimane essenziale per qualsiasi separazione di questo tipo. I runtime dei modelli devono collocare correttamente i carichi di lavoro, gestire la memoria e spostare i dati senza annullare i vantaggi dell'hardware specializzato.

d-Matrix ha sviluppato il proprio stack software per Corsair e Raptor. L'integrazione con l'ecosistema NVIDIA più ampio determinerà se gli acquirenti sperimenteranno una piattaforma gestibile o due sistemi adiacenti.

Questa distinzione sarà rilevante per gli sviluppatori. L'eterogeneità dell'hardware consente un migliore abbinamento ai carichi di lavoro, ma può introdurre compilatori separati, strumenti di monitoraggio, profili prestazionali e percorsi di debugging.

NVLink riduce l'attrito nelle comunicazioni tra dispositivi. Non rende automaticamente identici i rispettivi modelli di programmazione.

Il valore della partnership dipende quindi dal coordinamento al di sopra del collegamento fisico. Le aziende devono trasformare componenti compatibili in modelli di implementazione ripetibili, che gli operatori cloud possano offrire come servizi.

Il design della memoria di Raptor è la scommessa all'interno del rack

NVIDIA fornisce le fondamenta del sistema, ma Raptor deve comunque dimostrare perché i clienti abbiano bisogno di un altro processore per l'inferenza.

Raptor estende l'approccio incentrato sulla memoria adottato dalla precedente piattaforma Corsair di d-Matrix. La sua caratteristica distintiva è un package tridimensionale che colloca un die di calcolo direttamente sopra una DRAM personalizzata.

La DRAM offre una densità maggiore rispetto alla SRAM, la memoria più veloce utilizzata ampiamente in Corsair. Tuttavia, la DRAM convenzionale si trova più lontano dal calcolo e di norma richiede più energia per spostare ciascun bit.

Il design di d-Matrix espone molti piccoli banchi di memoria direttamente ai motori di calcolo attraverso dense connessioni verticali. L'obiettivo è combinare la capacità della DRAM con una larghezza di banda locale molto superiore.

A Hot Chips 2026, l'azienda ha presentato un package con un die di calcolo TSMC a 4 nanometri collegato sopra un die DRAM personalizzato. L'interfaccia utilizza un passo di connessione di 36 micron.

Il design mostrato offre 32GB per scheda e una larghezza di banda interna dichiarata di 100 terabyte al secondo. Queste cifre descrivono il movimento all'interno del package, non la larghezza di banda di rete tra acceleratori separati.

La reportistica indipendente sul design 3D DRAM ha inoltre evidenziato un'importante precisazione. Molti risultati prestazionali pubblicati restano proiezioni basate su silicio iniziale.

d-Matrix ha misurato l'interfaccia verticale a 0,37 picojoule per bit. L'azienda ha confrontato questa cifra con circa 2,4 picojoule per lo spostamento verso un die base HBM4.

Un documento di ricerca associato ha previsto circa 4,7 volte più throughput per scheda rispetto ai design basati su HBM. Né una proiezione né una misurazione dell'interfaccia dimostrano le prestazioni di un sistema completo in produzione.

La gestione termica rappresenta un'altra sfida. Il die logico si trova in cima affinché una piastra fredda possa entrare in contatto diretto con esso, mentre la DRAM sottostante funge anche da interposer.

Il package completo ha un budget di potenza dichiarato di 422 watt. L'interfaccia di memoria verticale assorbe 296 watt quando opera a piena capacità.

Il calore influenza la ritenzione della DRAM, che determina per quanto tempo le celle di memoria preservano i dati prima del refresh. Alla temperatura operativa dichiarata, il design richiede operazioni di refresh sostanzialmente più frequenti.

d-Matrix afferma che banchi di memoria più piccoli limitano il conseguente costo in termini di larghezza di banda. Include inoltre banchi di riserva, correzione degli errori e ridondanza pensate per mantenere un funzionamento affidabile.

Questi dettagli spiegano perché l'integrazione con un rack maturo raffreddato a liquido sia importante. L'architettura di Raptor non richiede semplicemente un connettore. Richiede alimentazione, raffreddamento e validazione progettati attorno a un package insolito.

La tecnologia punta alla generazione di token perché questa fase sposta spesso ripetutamente i pesi del modello, eseguendo al contempo una quantità relativamente modesta di calcoli per byte. Una maggiore larghezza di banda della memoria locale può mantenere occupate le unità di calcolo.

Il prefill, che elabora un prompt in ingresso, presenta un profilo prestazionale diverso. Può richiedere più calcolo e favorire una configurazione di acceleratori differente.

Questa differenza sostiene l'argomentazione a favore dell'inferenza disaggregata. Gli operatori potrebbero assegnare processori separati al prefill e alla decodifica, a condizione che software e rete mantengano efficiente il passaggio di consegne.

Tuttavia, il valore di Raptor non può essere dedotto dalla sola larghezza di banda. Le prestazioni utili dipendono dal supporto dei modelli, dai formati numerici, dalla pianificazione, dalla dimensione dei batch, dalla lunghezza del contesto e dalla latenza di risposta accettabile.

Anche la capacità di memoria è importante. Una scheda da 32GB non può contenere autonomamente ogni modello di grandi dimensioni, quindi i carichi di lavoro più grandi richiedono una partizione su più dispositivi.

Questo requisito rende più rilevante il dominio scale-up di NVLink. Il design della memoria interna di Raptor e il fabric esterno di NVIDIA devono lavorare insieme senza creare un nuovo collo di bottiglia.

L'XPU d-Matrix Raptor è quindi una scommessa composita. Il suo package 3D deve funzionare con rese produttive adeguate, e il rack deve trasformare quel package in prestazioni applicative affidabili.

La piattaforma aperta di NVIDIA ha comunque dei confini

La competizione principale non è d-Matrix contro le GPU NVIDIA. È l'integrazione controllata da NVIDIA contro l'infrastruttura rack indipendente dai fornitori.

NVIDIA descrive la propria piattaforma AI come verticalmente integrata e orizzontalmente aperta. La formula cattura la sua strategia, ma gli acquirenti dovrebbero esaminare il significato di ciascuna parte.

L'integrazione verticale unisce processori NVIDIA, switch, adattatori di rete, DPU, software, design dei rack e relazioni nella catena di fornitura. L'apertura orizzontale consente a CPU e XPU esterne selezionate di entrare in questo ambiente.

Questa struttura amplia la scelta dei processori all'interno di un sistema il cui fabric essenziale resta controllato da NVIDIA. È più aperta di un rack basato solo su GPU, ma meno neutrale di un'interconnessione governata dall'industria.

Questo confine è commercialmente utile per NVIDIA. Se gli acceleratori personalizzati guadagnano quote di mercato, l'azienda può comunque fornire componenti di rete e infrastruttura ad alto valore attorno a essi.

Può inoltre mantenere NVLink centrale mentre i sistemi AI passano dai server verso computer su scala rack. Il rack diventa il prodotto, mentre i singoli processori diventano elementi configurabili.

d-Matrix ne beneficia perché può raggiungere acquirenti che stanno già preparando le proprie strutture per apparecchiature NVIDIA. La partnership riduce il costo organizzativo di testare un processore meno conosciuto.

Tuttavia, d-Matrix eredita anche una dipendenza dal processo di qualificazione di NVIDIA e dalla roadmap infrastrutturale dell'azienda. Cambiamenti a switch, CPU, software o condizioni commerciali possono influire sui suoi piani di sistema.

Le aziende non hanno divulgato la struttura finanziaria della partnership. Non hanno inoltre dettagliato quali livelli software saranno condivisi né come i clienti acquisiranno e riceveranno supporto per rack completi.

Queste domande senza risposta sono importanti perché l'apertura ha diverse dimensioni. L'hardware può essere fisicamente interoperabile mentre approvvigionamento, gestione e sviluppo restano strettamente legati a un singolo fornitore.

Il modello concorrente enfatizza interfacce industriali aperte. Il design rack Helios di AMD utilizza OCP Open Rack Wide, UALink per la connettività scale-up e Ultra Ethernet per cluster più grandi.

Helios combina acceleratori AMD Instinct, processori EPYC e networking Pensando. Il suo design pubblicato include 72 acceleratori, in linea con il movimento dell'industria verso sistemi densi su scala rack.

UALink mira a consentire a più fornitori di connettere acceleratori attraverso una specifica condivisa. Questo approccio promette una portabilità più ampia, sebbene una specifica aperta non garantisca pari maturità del prodotto né volumi di implementazione equivalenti.

Il vantaggio di NVIDIA è che NVLink opera già in diverse generazioni di sistemi commercializzati. I suoi partner produttivi hanno inoltre esperienza pratica con rack densi raffreddati a liquido.

Il percorso aperto offre una maggiore indipendenza teorica. Il percorso NVIDIA offre un'integrazione consolidata sotto la direzione architetturale di un'unica azienda.

Nessuna delle due scelte elimina completamente il lock-in. Un acquirente che adotta Raptor dipende anche dal software d-Matrix, dalla sua catena di fornitura della memoria 3D e dalla capacità della startup di supportare prodotti futuri.

Il più ampio panorama competitivo include Groq, Cerebras, AMD, Intel e acceleratori progettati dagli hyperscaler. Una panoramica del mercato dell'inferenza aveva precedentemente identificato queste aziende come alternative rivolte a carichi di lavoro dominati dalle GPU.

Da allora, diverse si sono avvicinate a offerte di sistema complete. Groq, per esempio, è entrata anch'essa nella strategia in espansione di NVIDIA per l'infrastruttura di inferenza.

Questo schema suggerisce che NVIDIA voglia assorbire la specializzazione anziché contrastarla. Un'XPU di successo può diventare un ulteriore motivo per adottare la tecnologia di networking e rack di NVIDIA.

Per d-Matrix, entrare in quella piattaforma è pragmatico. Significa anche che la sfida dell'azienda a NVIDIA è più circoscritta di quanto suggerisca una semplice narrazione di chip rivali.

La partnership mette in discussione quale processore esegua l'inferenza. Non mette in discussione chi definisca gran parte dell'infrastruttura circostante.

Consegne, benchmark e clienti decideranno l'esito

L'annuncio stabilisce un intento architetturale. Non dimostra la prontezza produttiva, la domanda commerciale o le prestazioni in produzione.

Il primo punto di osservazione è il tape-out previsto per Raptor prima della fine del 2026. Il tape-out è il momento in cui il design di un chip viene finalizzato per la produzione.

Rispettare questa tappa sosterrebbe il calendario attuale. Mancarla comprimerebbe il tempo per fabbricazione, packaging, test, lavoro software e qualificazione dei rack prima della fine del 2027.

Il secondo segnale è una prestazione di sistema riproducibile in modo indipendente. Gli acquirenti hanno bisogno di risultati da rack Raptor completi, non di cifre di larghezza di banda isolate o di esecuzioni di modelli previste.

Tali valutazioni dovrebbero divulgare modelli, lunghezze del contesto, dimensioni dei batch, obiettivi di latenza, impostazioni di accuratezza e consumo energetico. I token al secondo, senza queste condizioni, possono nascondere compromessi importanti.

Le prestazioni per utente saranno particolarmente rilevanti per la proposta dell'azienda sui servizi token premium. Un elevato throughput aggregato conta meno se le singole richieste attendono in batch di grandi dimensioni.

Le misurazioni energetiche dovrebbero coprire l'intero rack. L'efficienza a livello di package può essere diluita da CPU, switch, apparecchiature di raffreddamento, networking e capacità inattiva.

Il terzo segnale è l'implementazione presso clienti identificati. d-Matrix afferma che Raptor è in valutazione presso hyperscaler e laboratori di frontiera, ma non ha identificato tali organizzazioni.

Un'istanza cloud impegnata, un servizio di inferenza gestito o un cluster di produzione annunciato rafforzerebbero il caso commerciale della partnership. Le sole valutazioni non dimostrano l'intenzione di acquisto.

La disponibilità iniziale resta prevista per il quarto trimestre del 2027. Questo lungo intervallo concede ai sistemi concorrenti il tempo di migliorare memoria, networking e software di inferenza.

Espone inoltre d-Matrix all'incertezza produttiva. L'azienda deve produrre un die DRAM personalizzato, collegarlo a logica avanzata, ottenere rese accettabili e validare il package sotto calore prolungato.

La sua affermazione di possedere oltre 100 brevetti non risolve queste questioni produttive. I brevetti proteggono idee tecniche, mentre i clienti necessitano di volumi affidabili e di un servizio prevedibile.

Anche NVIDIA ha del lavoro da completare. I componenti Vera, BlueField, ConnectX, Spectrum-X e NVLink pertinenti devono raggiungere la maturità richiesta secondo calendari compatibili.

Astera Labs deve fornire i propri componenti di connettività nell'ambito del design integrato. I produttori di rack devono quindi qualificare vassoi senza cavi, raffreddamento, firmware e gestione del sistema.

Il software presenta una tempistica parallela. d-Matrix deve supportare i modelli e i framework attuali quando Raptor verrà commercializzato, non soltanto quelli disponibili durante la progettazione.

Le architetture dei modelli possono cambiare rapidamente. Miscele sparse di esperti, finestre di contesto più lunghe, carichi di lavoro multimodali e nuove tecniche di decodifica modificano i modelli di memoria e comunicazione.

Un processore specializzato ha successo quando la sua architettura rimane utile nonostante questi cambiamenti. Ha inoltre bisogno di aggiornamenti del compilatore abbastanza rapidi da tenere il passo con i modelli più diffusi.

La piattaforma NVIDIA può ridurre il rischio della distribuzione fisica, ma non può garantire l'adozione del software. Sviluppatori e operatori cloud hanno comunque bisogno di una ragione per indirizzare i carichi di lavoro verso Raptor.

L'argomentazione più convincente combinerebbe una bassa latenza per utente, consumi energetici competitivi e un'integrazione dei modelli semplice e diretta. Una debolezza in uno qualsiasi di questi ambiti può limitarne l'utilizzo.

Gli acquirenti dovrebbero inoltre osservare come NVIDIA posiziona Raptor accanto alle proprie GPU e agli altri prodotti per l'inferenza. Un accesso tecnico paritario non produce necessariamente una visibilità commerciale equivalente.

Un'ultima preoccupazione riguarda la concentrazione della piattaforma. Il supporto a XPU esterne offre ai clienti una maggiore scelta di processori, ma sposta al contempo un numero maggiore di decisioni relative ai rack sotto l'influenza di NVIDIA.

Questo risultato non rappresenta né pura apertura né semplice preclusione. È un mercato stratificato, in cui la concorrenza sopravvive entro un confine infrastrutturale sempre più comune.

La collaborazione d-Matrix NVLink Fusion conterà se Raptor oltrepasserà quel confine come servizio effettivamente distribuito, misurabile e ampiamente disponibile. Fino ad allora, la sua rilevanza risiede nella strategia.

d-Matrix ha riconosciuto che un chip per l'inferenza migliore non è sufficiente senza un rack credibile. NVIDIA ha riconosciuto che i processori specializzati possono entrare nella sua piattaforma senza indebolire la sua posizione nell'infrastruttura.

Nei prossimi mesi, seguite nell'ordine il tape-out, i benchmark di sistemi completi e le distribuzioni con nomi dichiarati. Ogni traguardo mostrerà se questa roadmap sta diventando un prodotto.

Per gli acquirenti di infrastrutture, la domanda utile non è se Raptor sconfigga ogni GPU. Occorre chiedersi se offra un profilo di inferenza di valore senza aggiungere una complessità operativa inaccettabile. Saranno queste evidenze a stabilire se il rack di NVIDIA diventerà una piattaforma di lancio per la scelta degli acceleratori o un altro duraturo punto di dipendenza.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page