Tornano le valutazioni ClusterMAX 3.0, e i cloud GPU economici affrontano un test più severo
Le valutazioni ClusterMAX 3.0 hanno sottoposto 77 provider di cloud GPU a un esame più ampio, nonostante un settore che continua a vendere infrastrutture basandosi su semplici promesse di disponibilità e costo. SemiAnalysis ha pubblicato la nuova valutazione il 23 settembre 2026, dopo aver testato cluster gestiti e intervistato oltre 200 utenti di neocloud.
La conclusione centrale non è che un provider possieda la GPU più veloce. È che la capacità di calcolo effettivamente utilizzabile dipende da tutto ciò che circonda quella GPU. Reti, storage, scheduler, monitoraggio, sicurezza e supporto determinano se costosi acceleratori producono lavoro utile o restano inattivi.
Questa distinzione mette sotto pressione i provider che competono principalmente attraverso basse tariffe di noleggio o accesso a hardware scarso. CoreWeave rimane un punto di riferimento tecnico, mentre Nebius l'ha raggiunta nella fascia più alta. Anche Google Cloud è migliorato, ma diversi provider noti sono scesi o non sono più risultati disponibili per i test.
Le valutazioni ClusterMAX 3.0 alzano l'asticella per 77 provider
ClusterMAX 3.0 trasforma la valutazione dei cloud GPU in un test operativo, non in un confronto tra nomi degli acceleratori e tariffe pubblicizzate.
La nuova edizione copre 77 provider valutati ed estende la più ampia panoramica di mercato di SemiAnalysis a 323 aziende. La precedente versione principale aveva valutato 84 provider, monitorandone 209. Solo 19 provider hanno ricevuto una valutazione con medaglia nell'ultima analisi.
Questi numeri richiedono un'interpretazione attenta. Un gruppo più ristretto di provider valutati non significa necessariamente che il mercato si sia contratto. SemiAnalysis monitora altre aziende che restano non testabili, non hanno rilevanza sufficiente, servono mercati limitati o non hanno lanciato un servizio gestito idoneo.
La valutazione si concentra sui cluster gestiti. Si tratta di ambienti in cui il provider cura importanti livelli operativi oltre alla fornitura di server fisici. Questo lavoro può comprendere orchestrazione, monitoraggio, rilevamento dei guasti, sostituzione dell'hardware, storage, gestione della rete e supporto tecnico continuativo.
L'ambito esclude diverse attività adiacenti. Il semplice noleggio bare-metal, i servizi di inferenza basati su token, le piattaforme di post-training e i servizi sandbox per agenti non ricevono un trattamento equivalente. Un'azienda può gestire un'infrastruttura GPU utile senza qualificarsi come valido provider di cluster gestiti.
Questo confine è importante perché il termine “GPU cloud” oggi copre prodotti molto diversi. Un fornitore può consegnare server e aspettarsi che il cliente gestisca ogni livello software. Un altro può mantenere lo scheduler, indagare sui nodi guasti e tenere disponibile capacità sostitutiva.
SemiAnalysis valuta queste differenze attraverso dieci categorie. Includono sicurezza, gestione del ciclo di vita, orchestrazione, storage, rete, affidabilità, monitoraggio, prezzi, partnership e disponibilità. I suoi criteri di valutazione pubblici descrivono le capacità previste in ciascuna categoria.
I livelli risultanti sono relativi, non certificazioni universali. Un provider conquista la propria posizione confrontandosi favorevolmente con i concorrenti secondo la metodologia attuale. Standard più elevati possono quindi spingere un'azienda verso il basso anche quando il suo servizio non è visibilmente peggiorato.
ClusterMAX 3.0 ha aggiunto una categoria Participation Ribbon tra Bronze e Underperforming. Quindici provider sono entrati in quel livello. SemiAnalysis la usa per servizi che soddisfano requisiti di base senza offrire la maturità operativa attesa dai cluster gestiti consigliati.
Il rapporto ha prodotto anche cambiamenti rilevanti ai vertici. Nebius è passata da Gold a Platinum insieme a CoreWeave. Google Cloud si è unita a Oracle in Gold, mentre Azure è passata a Silver. GMI è salita da Bronze a Silver.
Altri movimenti sono stati meno favorevoli. Crusoe è scesa a Bronze, mentre Fluidstack è entrata nella categoria Unavailable perché SemiAnalysis non è riuscita a completare una verifica adeguata. Lambda, Firmus e TensorWave sono rimaste in Silver.
Questi cambiamenti definiscono il conflitto principale del rapporto. I provider possono assicurarsi nuove GPU e annunciare grandi strutture, ma rimanere comunque indietro sui sistemi meno visibili che mantengono produttivi i cluster.
Il rapporto completo ClusterMAX 3.0 è anche più di una classifica. Collega i test tecnici alle interviste con i clienti, alle aspettative contrattuali e ai risultati operativi specifici di ciascun provider.
Questa combinazione offre agli acquirenti un punto di partenza più solido rispetto a una classifica basata sui risultati di benchmark di picco. Offre inoltre ai provider una checklist pubblica delle capacità che i clienti più sofisticati si aspettano sempre più spesso.
L'affidabilità conta più delle prestazioni GPU di picco
Un cluster veloce perde il suo vantaggio quando i componenti guasti restano schedulabili, i job si riavviano ripetutamente o il supporto non riesce a ripristinare rapidamente la capacità.
SemiAnalysis ha richiesto 32 GPU a ciascun provider partecipante. La configurazione preferita era composta da quattro nodi HGX da otto GPU oppure otto nodi da quattro GPU all'interno di un deployment NVL72. Ha inoltre richiesto networking ad alta larghezza di banda e due forme di storage.
Ogni ambiente doveva disporre di almeno 10 terabyte di file storage ad alte prestazioni e almeno 10 terabyte di object storage compatibile con S3. Ai provider è stato inoltre chiesto di fornire una dashboard di monitoraggio.
I test hanno coperto sia Slurm sia Kubernetes. Slurm è uno scheduler ampiamente utilizzato per grandi job di calcolo, mentre Kubernetes gestisce applicazioni containerizzate nei cluster. SemiAnalysis ha richiesto cinque giorni con ciascun ambiente, anche se i provider potevano eseguire tali periodi in parallelo.
Anche il requisito hardware è avanzato. SemiAnalysis ha considerato accettabili sistemi Nvidia B200, B300, GB200 e GB300, insieme all'infrastruttura AMD MI355X. Per questa valutazione ha trattato i sistemi H100 come una generazione precedente.
Il processo inizia con un audit della configurazione. Tale audit esamina l'inventario hardware, firmware, driver, supporto dei container, impostazioni dello scheduler, rete, storage, monitoraggio e sicurezza. Il suo strumento pubblico di audit dei cluster segnala controlli superati, avvisi, errori e verifiche saltate.
I test delle prestazioni esaminano poi il calcolo GPU, il comportamento della rete, lo storage, le operazioni del ciclo di vita, il training e l'inferenza. SemiAnalysis utilizza sia microbenchmark sia carichi di lavoro pensati per evidenziare le interazioni nell'intero cluster.
I test di training includono il pretraining di Llama 3.1 8B e un carico di lavoro mixture-of-experts. Un modello mixture-of-experts attiva reti di componenti selezionate per ciascun input, creando schemi di comunicazione impegnativi tra acceleratori.
Quel secondo carico di lavoro aiuta a rivelare problemi di rete che benchmark GPU isolati possono non rilevare. Un server può produrre ottimi risultati nella moltiplicazione di matrici, mentre il cluster perde tempo durante la comunicazione collettiva tra nodi.
I test di inferenza hanno uno scopo simile. Esaminano condizioni limitate dal calcolo, dalla memoria e dalla comunicazione. Se una rete non supera test collettivi prolungati, il sistema non può mantenere una produttività di token utile su larga scala.
ClusterMAX va poi oltre la velocità, concentrandosi sull'affidabilità. SemiAnalysis esegue un burn-in di otto ore che sollecita simultaneamente GPU e rete. Il test monitora temperature, potenza, frequenze di clock, calcolo, latenza, larghezza di banda, connettività ed errori del kernel.
Lo stress simultaneo è importante perché i carichi di lavoro reali riscaldano insieme molteplici componenti. Testare GPU e rete separatamente può non rilevare guasti causati da interazioni termiche o elettriche sotto un carico prolungato che coinvolge l'intero cluster.
I valutatori iniettano anche guasti. Possono inserire messaggi di errore Nvidia sintetici nel log del kernel o attivare un autentico errore di connessione attraverso il bridge PCIe. Misurano quindi rilevamento e ripristino.
Un servizio capace dovrebbe identificare un nodo guasto, smettere di schedulare lavoro su di esso e avviare la correzione. Per i cluster HGX convenzionali, la risposta ideale include spesso la sostituzione del nodo interessato con una riserva pronta all'uso.
I sistemi NVL72 su scala rack creano un problema più difficile. Le loro GPU condividono un dominio NVLink strettamente connesso, quindi gli operatori non possono sempre sostituire una piccola unità senza influire sul rack più ampio. I provider necessitano di procedure operative diverse per i sistemi degradati.
SemiAnalysis si aspetta generalmente che i controlli di integrità rilevino un nodo non sano entro due minuti. Questo obiettivo trasforma l'“affidabilità” da un'affermazione di marketing in un processo di risposta osservabile.
Il solo rilevamento dei guasti non è sufficiente. Il monitoraggio deve identificare il componente guasto, i job interessati, lo stato dello scheduler e l'aggiornamento di ciascun controllo di integrità. Una dashboard verde diventa fuorviante quando i dati sottostanti non sono aggiornati.
L'autoriparazione aggiunge un ulteriore livello. Il sistema può isolare un nodo, reimpostare una GPU, riavviare il software o avviare una riparazione hardware. La risposta corretta dipende dall'errore, e riavvii automatici possono distruggere lavoro sano se applicati con leggerezza.
Nvidia documenta codici di errore GPU che coprono molte condizioni di guasto distinte. Errori sovrapposti rendono il ripristino una questione di giudizio operativo, non semplicemente di installazione di software di monitoraggio.
Per questo la velocità di picco è una metrica d'acquisto incompleta. Gli acquirenti ricevono in ultima analisi goodput, ossia il lavoro utile completato dopo aver considerato guasti, riavvii e ritardi operativi.
Un cluster più economico può diventare più costoso quando i ricercatori devono diagnosticare ripetutamente problemi dell'infrastruttura. Il tempo perso comprende GPU inattive, esperimenti interrotti, rilasci di modelli ritardati e lavoro ingegneristico sottratto allo sviluppo del prodotto.
I cloud GPU economici ora competono sul costo operativo totale
ClusterMAX 3.0 sposta la domanda d'acquisto dalle tariffe orarie al costo per ottenere calcolo affidabile e utilizzabile.
Le tariffe di noleggio pubblicate restano facili da confrontare. Affidabilità, qualità del supporto e tempi di ripristino sono più difficili da inserire in una scheda di approvvigionamento. Eppure questi fattori spesso determinano il costo finale di una grande esecuzione di training.
Consideriamo un team che noleggia un cluster multi-nodo per lo sviluppo di modelli. Una GPU guasta può rallentare ogni partecipante a un job sincronizzato. Un processo in ritardo, spesso chiamato straggler, costringe il resto del sistema ad attendere.
Il cliente continua a consumare capacità mentre le prestazioni diminuiscono. Gli ingegneri possono trascorrere ore a cercare nei log, isolare nodi e rieseguire test. Una bassa tariffa pubblicizzata offre scarsa protezione contro tale spreco.
CoreWeave resta Platinum perché SemiAnalysis ha rilevato che i suoi cluster sono solidi nelle categorie cruciali. Il rapporto afferma che i suoi controlli di integrità hanno funzionato come previsto e che la maggior parte dei test ha raggiunto i valori attesi senza ampi interventi.
L'azienda ha inoltre aggiunto il rilevamento degli straggler GPU. Secondo la sua documentazione di monitoraggio, la funzionalità analizza la telemetria delle comunicazioni per aiutare a identificare i worker che rallentano i job distribuiti.
Questa funzionalità illustra l'argomento a favore dei servizi premium. Il prodotto di valore non è soltanto l'accesso a un acceleratore. È un sistema che individua problemi sottili prima che gli utenti effettuino una ricerca manuale nell'intera flotta.
Nebius ora affianca CoreWeave in Platinum. SemiAnalysis la descrive come costantemente solida in tutte le categorie e attiva nel mercato dei cluster a più breve termine. Questo posizionamento è importante per le startup senza impegni delle dimensioni degli hyperscaler.
L'ascesa di Google Cloud a Gold presenta un confronto diverso. Gli hyperscaler apportano una vasta esperienza infrastrutturale, programmi di sicurezza più ampi e portafogli di servizi maturi. Tuttavia, le loro piattaforme generaliste non ottimizzano sempre ogni flusso di lavoro attorno a cluster AI gestiti.
Oracle ha mantenuto Gold e ha ricevuto riconoscimenti per il suo design di rete scale-out. Il networking scale-out connette sistemi oltre un singolo server o rack strettamente integrato, consentendo ai job di addestramento di operare su un numero molto maggiore di GPU.
Azure è passata a Silver, dimostrando che la scala aziendale non produce automaticamente la migliore esperienza di cluster gestito secondo questa metodologia. ClusterMAX valuta l'ambiente effettivamente erogato, non il budget complessivo di ingegneria del provider.
I risultati mettono inoltre in discussione un'assunzione comune sui neocloud più recenti. La specializzazione può aiutarli a costruire servizi attorno ai carichi di lavoro AI. Non garantisce una buona orchestrazione, storage affidabile, software aggiornato o supporto rapido.
Alcuni provider restano interessanti per gli acquirenti di bare metal. I grandi laboratori AI dispongono spesso di team interni in grado di gestire scheduler, monitoraggio e ripristino. Questi clienti potrebbero preferire il controllo diretto e accettare un minor numero di funzionalità gestite.
I laboratori più piccoli affrontano un calcolo diverso. Potrebbero non disporre di specialisti che comprendano topologia di rete, gestione degli errori GPU, storage distribuito e pianificazione dei job. Un servizio gestito può sostituire competenze che non riescono facilmente ad assumere.
La programmazione agentica complica questa divisione. SemiAnalysis ha rilevato che gli agenti di coding hanno aiutato il suo team a superare documentazione mancante e attività amministrative ripetitive. Questo può rendere un'infrastruttura poco gestita più tollerabile per operatori esperti.
Gli stessi agenti hanno prodotto anche configurazioni errate. Talvolta selezionavano la rete sbagliata, testavano lo storage locale anziché quello condiviso o pianificavano carichi GPU su nodi CPU.
L'assistenza AI non elimina quindi il valore della conoscenza operativa. Amplifica le capacità dei team che comprendono già il risultato desiderato. Gli utenti meno esperti possono ricevere istruzioni plausibili che invalidano silenziosamente i test sulle prestazioni.
Per gli acquirenti, il confronto pratico ha quattro livelli:
Erogazione del calcolo
Il provider fornisce la generazione e la configurazione di acceleratori promesse?
Le prestazioni di calcolo misurate corrispondono a aspettative ragionevoli?
Integrazione del cluster
Rete, storage, Slurm e Kubernetes funzionano insieme sotto un carico realistico?
Gli utenti possono riprodurre buoni risultati senza un'estesa ottimizzazione manuale?
Ripristino operativo
La piattaforma rileva l'hardware difettoso e lo rimuove dalla pianificazione?
Il provider può ripristinare capacità utilizzabile senza un prolungato intervento del cliente?
Responsabilità commerciale
Il contratto definisce downtime, test di accettazione, crediti di servizio e diritti di uscita?
Il provider comunica chiaramente quando è necessaria una riparazione fisica?
Questo quadro rende il prezzo pubblicizzato solo uno degli elementi. Il denominatore significativo è il lavoro completato, non il tempo GPU riservato.
La sicurezza fa parte delle prestazioni del GPU Cloud
Un cluster non può essere considerato pronto per la produzione quando software obsoleto, isolamento debole o controlli di accesso inadeguati espongono modelli e dati di valore.
La sicurezza riceve una rilevanza insolita in ClusterMAX 3.0. SemiAnalysis sostiene che la spesa per l'infrastruttura AI abbia superato le pratiche difensive di base presso molti neocloud.
Il rischio inizia dalla complessità del cluster. Gli ambienti gestiti combinano sistemi operativi, driver, scheduler, container, storage, reti ad alta velocità, dashboard e strumenti amministrativi. Ogni livello crea credenziali, autorizzazioni e software che gli operatori devono mantenere.
Un nodo di gestione compromesso può esporre più di una macchina. Potrebbe offrire percorsi verso sistemi vicini, storage condiviso, checkpoint dei modelli, dataset proprietari o credenziali usate altrove nell'ambiente del cliente.
Le reti di cluster ad alta larghezza di banda presuppongono inoltre una fiducia sostanziale tra i componenti. Tale fiducia supporta il calcolo distribuito ad alta velocità, ma una segmentazione insufficiente può aumentare i danni causati da un singolo sistema compromesso.
La sicurezza influisce quindi sulle prestazioni utilizzabili in diversi modi. Una violazione può interrompere il lavoro, attivare la risposta a un incidente, corrompere i risultati o imporre patching d'emergenza. Controlli deboli possono inoltre rendere un provider inaccettabile prima ancora che inizi qualsiasi benchmark.
SemiAnalysis include nella sua verifica iniziale le versioni di software e firmware, la configurazione degli accessi, i container, le impostazioni di rete e il monitoraggio. Il processo non sostituisce un test di penetrazione completo, ma intercetta segnali di allarme operativi.
La valutazione esamina anche certificazioni e controlli documentati. Certificazioni come SOC 2 o ISO 27001 non dimostrano che ogni cluster sia sicuro. La loro assenza può comunque indicare che un provider non dispone di processi organizzativi di base.
Gli acquirenti dovrebbero esaminare l'isolamento su più confini. Questi includono la separazione tra clienti, i privilegi all'interno di un tenant, l'accesso da parte dei dipendenti del provider e i controlli su snapshot e backup dello storage.
La gestione delle credenziali merita uguale attenzione. Chiavi SSH, token cloud, account di servizio e autorizzazioni dello scheduler possono restare attivi più a lungo del previsto. Un offboarding debole trasforma un normale cambio di personale in un'esposizione persistente.
Il monitoraggio crea un proprio compromesso di sicurezza. I provider necessitano di telemetria dettagliata per identificare guasti hardware e anomalie nelle prestazioni. Questa raccolta deve evitare di esporre informazioni sensibili sui job o di concedere un accesso eccessivo alle dashboard.
La pressione aumenta man mano che gli agenti AI ottengono maggiore accesso operativo. Un agente in grado di modificare utenti, inviare job o risolvere problemi dei nodi può far risparmiare tempo. Può anche eseguire un comando errato su un'infrastruttura di valore.
SemiAnalysis riporta che gli agenti erano più utili quando l'ambiente offriva criteri di successo chiari e contesto dettagliato. Questa osservazione collega la qualità della documentazione alla sicurezza. Buone istruzioni riducono l'improvvisazione e rendono più facili da esaminare le azioni automatizzate.
La critica del report richiede comunque dei limiti. ClusterMAX non divulga pubblicamente ogni test di sicurezza né ogni risultato dei provider. Gli acquirenti non dovrebbero trattare il suo sistema a livelli come un sostituto del proprio modello di minaccia.
I provider servono anche clienti con requisiti diversi. Un prototipo di ricerca, un carico di lavoro enterprise regolamentato e l'addestramento di un modello frontier non comportano rischi identici. Una sola classifica non può codificare la tolleranza di ogni organizzazione.
Tuttavia, la conclusione generale è difficile da respingere. I GPU cloud ospitano potenza di calcolo concentrata, preziosa proprietà intellettuale e software sempre più autonomo. I fallimenti di sicurezza possono annullare qualsiasi vantaggio ottenuto grazie a costi inferiori o migliori prestazioni nei benchmark.
La classifica è utile, ma non è un verdetto universale
ClusterMAX offre prove insolitamente dettagliate, tuttavia i suoi risultati restano un'istantanea testata, modellata da ambito, accesso e metodologia.
La prima limitazione riguarda la dimensione della configurazione. SemiAnalysis ha generalmente richiesto 32 GPU, mentre i principali clienti possono gestire cluster con molte più macchine. I problemi di prestazioni e affidabilità spesso cambiano con la scalabilità dei sistemi.
Un provider che ottiene buoni risultati su quattro nodi può incontrare sfide diverse di congestione, scheduler o riparazione su centinaia di nodi. SemiAnalysis integra i test con interviste ai clienti anche perché una singola valutazione non può riprodurre ogni deployment.
La seconda limitazione è il tempo. Il report fotografa gli ambienti durante una particolare finestra di test. I provider aggiornano driver, sostituiscono hardware, modificano sistemi di storage e riscrivono gli strumenti di orchestrazione.
SemiAnalysis afferma che le sue valutazioni vengono aggiornate con l'evoluzione del mercato. Anche così, gli acquirenti dovrebbero confermare che una configurazione esaminata corrisponda alla regione, alla generazione hardware e allo stack software loro offerti.
La terza limitazione è l'accesso. Alcuni provider non potevano o non volevano fornire un cluster adeguato. Una classificazione Unavailable può indicare capacità limitata, restrizioni geografiche, un lancio ritardato o l'impossibilità di verificare il servizio.
Questa categoria non coincide con Underperforming. Una riflette l'assenza di prove, mentre l'altra riflette carenze osservate. I team di procurement dovrebbero preservare questa distinzione.
La quarta limitazione riguarda la cooperazione del provider. SemiAnalysis comunica con le aziende durante i test, soprattutto quando l'iniezione di guasti richiede un monitoraggio compatibile. Ciò aiuta a produrre risultati validi, ma differisce dall'acquisto anonimo.
I provider sanno che i valutatori stanno ispezionando l'ambiente. Hanno incentivi a fornire una configurazione favorevole e a rispondere rapidamente. I clienti ordinari necessitano di contratti e referenze che confermino un trattamento simile.
La quinta limitazione è l'ambito commerciale. ClusterMAX valuta cluster gestiti, quindi può sottovalutare un fornitore che si specializza intenzionalmente nel bare metal. Quel servizio può comunque essere adatto a team con personale infrastrutturale solido.
Esiste anche il problema opposto. Un portale sofisticato o un processo di onboarding reattivo può generare fiducia prima che inizino carichi di lavoro sostenuti. L'affidabilità a lungo termine resta più difficile da verificare di un'esperienza iniziale curata.
Le interviste ai clienti rafforzano la metodologia, ma introducono un'altra incertezza. I lettori pubblici non possono ispezionare in modo indipendente ogni intervista, reclamo o decisione di ponderazione. SemiAnalysis controlla la sintesi finale.
Il titolo “standard di settore” dovrebbe quindi essere inteso come il posizionamento dell'editore, supportato da un utilizzo visibile nel settore. Non è uno standard governativo né un quadro formale di certificazione.
Tuttavia, la metodologia migliora la trasparenza in un mercato pieno di confronti difficili. La panoramica della valutazione pubblica spiega che il processo combina test pratici, revisione della documentazione e feedback degli utenti.
La struttura di valutazione relativa incoraggia inoltre il miglioramento continuo. Un provider non può presumere che la configurazione di ieri rimanga competitiva quando i concorrenti aggiungono monitoraggio migliore, remediation più rapida o contratti più chiari.
Per i clienti, la risposta corretta non è copiare direttamente la classifica in una decisione d'acquisto. È usare il report come un elenco di domande alle quali i vendor devono rispondere con prove.
Il provider può riprodurre le proprie prestazioni sul carico di lavoro previsto dal cliente? Può mostrare dati recenti sul ripristino? Il contratto misura il downtime a livello di nodo, rack, cluster e sito?
Chi controlla la riparazione fisica quando l'apparecchiatura si trova in una struttura di colocation? Sono disponibili hot spare? Cosa accade quando un guasto di rete provoca rallentamenti intermittenti anziché un'interruzione completa?
Come gestisce il provider le patch di sicurezza senza creare downtime non definito? A quale accesso può accedere il personale di supporto? Il cliente può esportare log e dati di monitoraggio per una revisione indipendente?
Queste domande rivelano perché la classifica conta anche quando un acquirente seleziona un provider di livello inferiore. ClusterMAX fornisce ai clienti un vocabolario per negoziare garanzie anziché accettare promesse generiche.
ClusterMAX 3.0 rende supporto e contratti funzionalità tecniche
Il cambiamento più rilevante è il trattamento degli obblighi di supporto come parti misurabili dell'architettura del cluster.
Gli accordi per GPU cloud spesso separano le specifiche tecniche dalle protezioni commerciali. Un contratto elenca hardware, capacità e disponibilità, mentre i dettagli operativi restano vaghi.
ClusterMAX 3.0 riduce questo divario. SemiAnalysis ha sviluppato concetti standardizzati di livelli di servizio per sistemi HGX convenzionali e architetture rack-scale. Questi riguardano nodi, rack, cluster e siti.
Il quadro definisce il downtime anziché lasciare il termine aperto all'interpretazione. Descrive inoltre i test di accettazione su calcolo GPU, rete, storage e software prima che un cliente accetti la consegna.
L’accettazione è importante perché un cluster può essere acceso senza essere pronto per la produzione. Reti configurate in modo errato, storage inaccessibile, driver obsoleti o un’integrazione difettosa con lo scheduler possono ritardare l’avvio del lavoro utile dopo l’inizio della fatturazione.
Un accordo credibile dovrebbe indicare quando il servizio diventa accettabile. Dovrebbe inoltre descrivere cosa accade quando il provider non rispetta tale data.
SemiAnalysis raccomanda revisioni ricorrenti delle prestazioni rispetto ai livelli di servizio. Questo trasforma l’affidabilità in un obbligo continuativo, anziché in una promessa valutata solo dopo una controversia rilevante.
Il framework riconosce inoltre esclusioni legittime. Aggiornamenti pianificati, patch di sicurezza e manutenzione fisica possono richiedere tempi di inattività. Il contratto dovrebbe definire queste eccezioni invece di permettere che ogni interruzione scompaia in un’ampia clausola di manutenzione.
La qualità del supporto diventa misurabile attraverso il percorso che va dal rilevamento alla riparazione. Un provider deve sapere quale componente ha subito un guasto, impedire che nuovo lavoro vi venga indirizzato e comunicare il piano di ripristino.
La proprietà della struttura influenza tale percorso. Un operatore che controlla il proprio data center può gestire direttamente tecnici, componenti e procedure. Un provider che usa il colocation può dipendere dal programma di assistenza remota di un’altra azienda.
Nessuno dei due modelli prevale automaticamente. La domanda rilevante è se l’assetto operativo garantisce il ripristino entro la finestra promessa.
Questa distinzione diventa più netta con i sistemi rack Grace Blackwell. Il raffreddamento diretto a liquido, l’elevata potenza per rack, i processori host basati su Arm e NVLink su scala rack aggiungono dipendenze che le precedenti implementazioni GPU non condividevano.
Un componente guasto può influire su un’unità di capacità più ampia. Le procedure di riparazione devono tenere conto di tray e rack strettamente interconnessi, anziché trattare ogni server a otto GPU come intercambiabile.
La prossima generazione Vera Rubin aumenterà nuovamente i requisiti di alimentazione e rete. SemiAnalysis prevede che la transizione architetturale sarà meno dirompente del passaggio da Hopper a Grace Blackwell, ma i provider dovranno comunque affrontare lavoro operativo.
Per gli acquirenti, il supporto rientra quindi nella valutazione tecnica. Un team di risposta competente, procedure collaudate, componenti sostitutivi disponibili e telemetria accurata determinano le prestazioni erogate nel tempo.
Lo stesso principio si applica ai prezzi. Una tariffa che esclude un supporto utile trasferisce il rischio operativo al cliente. Una tariffa più elevata può offrire un valore migliore quando protegge il tempo degli ingegneri e preserva il completamento dei job.
ClusterMAX non elimina la negoziazione. Rende più facili da identificare le parti nascoste di quella negoziazione.
Cosa dovrebbero osservare ora gli acquirenti di GPU cloud
Il prossimo banco di prova sarà capire se i leader di ClusterMAX riusciranno a preservare il loro vantaggio mentre hardware, carichi di lavoro e modelli di acquisto cambiano insieme.
Il primo segnale sarà la riproduzione indipendente delle nuove valutazioni. I clienti dovrebbero confrontare i propri test di accettazione e job di lunga durata con le conclusioni di SemiAnalysis. Risultati coerenti rafforzerebbero il valore della classifica oltre una singola finestra di valutazione.
Il secondo segnale sarà il comportamento dei provider durante l’implementazione di Vera Rubin. Le aziende che hanno mantenuto sistemi Grace Blackwell affidabili dovrebbero partire in vantaggio. Le nuove esigenze di alimentazione, rete e raffreddamento possono comunque rivelare debolezze nella pianificazione della capacità e nel supporto.
Osservate se i provider pubblicano calendari di consegna chiari e obiettivi operativi. Gli annunci di marketing contano meno di cluster stabili che eseguono i carichi di lavoro dei clienti. Ritardi, modifiche di configurazione e accesso regionale limitato riveleranno quanto sia realmente maturo ogni rollout.
Il terzo segnale sarà l’espansione di ClusterMAX verso endpoint di inferenza, infrastrutture per reinforcement learning e sandbox per agenti. Questi prodotti introducono colli di bottiglia diversi rispetto ai tradizionali cluster di addestramento.
I servizi di inferenza devono bilanciare latenza, throughput, caricamento dei modelli e domanda imprevedibile. I sistemi di reinforcement learning coordinano generazione, esecuzione in sandbox, addestramento e frequenti aggiornamenti dei modelli. Una debolezza in qualsiasi fase può lasciare le GPU inattive.
Questa espansione potrebbe rafforzare ClusterMAX riflettendo il modo in cui i team AI oggi consumano infrastruttura. Potrebbe anche rendere il framework più difficile da interpretare, perché i cluster gestiti e i servizi basati su token risolvono problemi diversi.
Gli acquirenti dovrebbero inoltre monitorare le divulgazioni sulla sicurezza. Evidenze più dettagliate riguardo isolamento, patching, credenziali e risposta agli incidenti renderebbero i confronti tra provider più difendibili. Incidenti gravi esporrebbero lacune che i test sulle prestazioni non possono cogliere.
Infine, monitorate la divisione tra servizi gestiti e bare metal. I grandi laboratori stanno acquistando ampia capacità gestendo autonomamente una quota maggiore dello stack software. I team più piccoli hanno ancora bisogno che i provider assorbano questa complessità.
Gli agenti AI renderanno più semplice parte dell’amministrazione, ma non elimineranno la necessità di sistemi affidabili. I test del report mostrano che l’automazione può risolvere problemi di routine creando al contempo con sicurezza nuovi problemi.
Le valutazioni ClusterMAX 3.0 chiedono in definitiva agli acquirenti di ridefinire il prodotto. Non stanno noleggiando chip isolati. Stanno noleggiando calcolo completato, procedure di ripristino, controlli di sicurezza e accesso a operatori esperti.
Prima di firmare il prossimo accordo GPU cloud, chiedete al provider di dimostrare questi livelli in caso di guasto. Richiedete benchmark specifici per il carico di lavoro, evidenze di sicurezza aggiornate, registri di ripristino e termini di accettazione precisi. Quindi confrontate il lavoro completato che ogni opzione può offrire, non soltanto la capacità che ciascuna promette.



