I benchmark di AMD EPYC Venice sfidano Nvidia, ma le note a piè di pagina contano
AMD ha pubblicato benchmark dettagliati di AMD EPYC Venice, sostenendo che la sua CPU per server a 256 core offra oltre il doppio del throughput intero di Nvidia Vera.
L'azienda afferma inoltre che un processore Venice ad alta frequenza da 96 core offra prestazioni per core superiori di circa il 20% rispetto alla CPU a 88 core di Nvidia. Queste dichiarazioni ampliano il confronto competitivo presentato da AMD quando ha svelato la sua famiglia EPYC di sesta generazione nel luglio 2026.
I numeri principali offrono ad AMD una risposta forte al tentativo di Nvidia di ridefinire la CPU per data center attorno all'AI agentica. Tuttavia, AMD definisce le rilevanti cifre SPEC CPU 2026 come stime interne, non risultati pubblicati in modo indipendente.
Questa distinzione definisce la vera storia. AMD sta sfidando Nvidia sul throughput totale, la velocità per core, la larghezza di banda della memoria e il design dell'infrastruttura AI. Nvidia, nel frattempo, sostiene che le sessioni AI completate contino più del numero di core o dei punteggi aggregati dei benchmark.
Cosa dichiarano realmente i nuovi numeri dei benchmark AMD
La nuova comunicazione di AMD trasforma un'ampia promessa sulle prestazioni in diverse affermazioni specifiche e verificabili.
Il confronto centrale utilizza SPECrate 2026 Integer Base. Questo benchmark misura il throughput eseguendo più copie di carichi di lavoro interi su un sistema.
AMD stima un punteggio di 2.070 per un sistema EPYC 9996 a doppio socket. Il processore dispone di 256 core Zen 6c per socket, portando il server testato a 512 core fisici.
Per un sistema Nvidia Vera a doppio socket, AMD indica un punteggio stimato di 925. Ogni processore Vera contiene 88 core Arm personalizzati, creando una configurazione server da 176 core.
Queste cifre attribuiscono a EPYC 9996 un throughput intero stimato pari a circa 2,24 volte quello di Vera. AMD descrive il risultato come prestazioni superiori di circa 2,2 volte.
Il confronto favorisce il design a più alta densità di AMD, ma non è una sfida core per core. Una macchina EPYC 9996 a doppio socket contiene quasi tre volte più core fisici del sistema Vera.
AMD ha quindi pubblicato un ulteriore confronto che coinvolge il suo processore Venice ad alta frequenza da 96 core. La sua stima assegna a quel sistema a doppio socket un punteggio di 1.210, contro i 925 di Vera.
I valori risultanti per core sono 6,3 per Venice e 5,3 per Vera. AMD presenta questo dato come prestazioni per core pari a circa 1,2 volte quelle di Vera.
Secondo la comunicazione di AMD, entrambi i processori hanno utilizzato GCC 15.2 per questo specifico confronto. Il dettaglio è importante perché le versioni del compilatore e le impostazioni di ottimizzazione possono influire materialmente sui risultati dei benchmark CPU.
Le cifre più recenti rendono inoltre più nitida la narrazione generazionale di AMD. Secondo quanto riportato, l'EPYC 9996 a 256 core ottiene un punteggio superiore di circa il 78% rispetto all'EPYC 9965 a 192 core nello stesso confronto di throughput.
Questo guadagno non deriva soltanto dall'architettura. Venice aumenta la densità di core, le capacità di memoria e la potenza della piattaforma insieme alla transizione da Zen 5 a Zen 6.
La panoramica delle CPU per server di AMD identifica ogni dato SPEC CPU 2026 come una proiezione preliminare di engineering. L'azienda afferma che tali stime restano soggette a modifiche.
La distinzione tra una stima e un risultato presentato è cruciale. SPEC consente metriche prestazionali stimate, ma richiede ai fornitori di identificarle chiaramente come stime.
Nessuna submission SPEC esaminata in modo indipendente risolve attualmente il confronto tra AMD e Nvidia. Le nuove cifre sono più dettagliate delle precedenti dichiarazioni di AMD, ma restano proiezioni del fornitore.
Ciò rende questi benchmark di AMD EPYC Venice preziosi come dichiarazione di intenti competitivi. Non li rende un verdetto definitivo sui sistemi commercializzati.
Perché i benchmark di AMD EPYC Venice mettono Nvidia sulla difensiva
AMD sta attaccando l'idea che Nvidia debba controllare sia l'acceleratore sia il livello del processore host di un server AI.
Nvidia ha costruito la propria posizione nei data center attorno a GPU, networking e uno stack software sempre più integrato. Vera estende questa strategia al mercato delle CPU general-purpose.
Il processore Arm a 88 core è progettato per accompagnare la generazione di acceleratori Rubin di Nvidia. Offre inoltre a Nvidia maggiore controllo sul comportamento della memoria, sul movimento dei dati e sull'ottimizzazione a livello di sistema.
AMD ha un interesse commerciale diverso. Vuole che cloud provider e imprese continuino a considerare la CPU host una decisione di acquisto indipendente.
Un vantaggio credibile di Venice contribuirebbe a preservare questa scelta. Consentirebbe inoltre ad AMD di vendere processori EPYC per server costruiti attorno ad acceleratori di diversi fornitori.
Per questo AMD sottolinea i carichi di lavoro che vanno oltre l'addestramento e l'inferenza dei modelli. I sistemi AI instradano anche richieste, recuperano documenti, interrogano database, eseguono codice, chiamano API e gestiscono lo storage.
Queste fasi spesso vengono eseguite sulle CPU. Possono determinare il tempo di risposta complessivo anche quando una GPU esegue il principale passaggio di ragionamento del modello.
AMD descrive l'AI agentica come un carico di lavoro di sistema con richieste in rapido cambiamento. I suoi test coprono web serving, retrieval, database, esecuzione di strumenti ed elaborazione delle risposte.
La strategia dell'azienda a 256 core punta al lavoro parallelo tra tali servizi. Più core possono supportare richieste aggiuntive, ambienti di runtime isolati, transazioni di database o chiamate simultanee agli strumenti.
Il design ad alta frequenza da 96 core affronta una preoccupazione diversa. Cerca di preservare la velocità per core per attività che non possono distribuirsi efficientemente su centinaia di core.
Il portafoglio AMD sfida quindi Nvidia su due fronti. EPYC 9996 enfatizza il throughput, mentre il modello ad alta frequenza affronta l'esecuzione sensibile alla latenza.
Le specifiche della piattaforma rafforzano questa proposta. EPYC 9006 supporta fino a 256 core e 512 thread per socket, secondo i dettagli della piattaforma Zen 6 di AMD.
Supporta inoltre 16 canali di memoria DDR5, MRDIMM valutati per 12.800 megatransfer al secondo e connettività PCIe 6. AMD dichiara fino a 1,6 terabyte al secondo di larghezza di banda della memoria per socket.
Vera utilizza otto canali di memoria LPDDR5X attraverso moduli SOCAMM2. Nvidia indica una larghezza di banda di circa 1,2 terabyte al secondo.
Capacità della memoria, latenza, potenza e larghezza di banda non si riducono a una sola specifica. Tuttavia, la dichiarazione di AMD sulla larghezza di banda indebolisce l'argomento secondo cui una CPU per server convenzionale debba cedere questa categoria a Nvidia.
AMD dispone anche di un vantaggio di adozione fondato sulla familiarità. EPYC utilizza l'ambiente software x86 già diffuso nell'infrastruttura enterprise e cloud.
Vera introduce una piattaforma Arm in ambienti dove validazione del software, monitoraggio, virtualizzazione e processi di approvvigionamento possono essere incentrati su x86. L'adozione di Arm è significativa, ma i costi di migrazione variano in base al carico di lavoro.
Nvidia può compensare questo attrito attraverso sistemi rack strettamente integrati. I clienti che acquistano una piattaforma AI Nvidia completa possono attribuire più valore a hardware e software unificati che all'intercambiabilità della CPU.
AMD scommette che molti acquirenti resisteranno a questo consolidamento. La narrazione delle prestazioni di EPYC Venice offre loro una ragione tecnica per mantenere aperto il livello CPU.
La densità di core incontra l'argomento del percorso critico di Nvidia
Il disaccordo principale non è semplicemente AMD contro Nvidia; riguarda quale comportamento della CPU determini prestazioni utili nell'infrastruttura AI.
AMD presenta la concorrenza come un requisito distintivo per i sistemi agentici. Una richiesta utente può generare operazioni di retrieval, ricerche in database, controlli delle policy, esecuzione di codice e sub-agenti indipendenti.
Queste operazioni creano picchi di lavoro parallelo. Una CPU con un alto numero di core può assorbire una quota maggiore di tale lavoro senza costringere ogni servizio su una macchina separata.
Nvidia si concentra sulle dipendenze sequenziali tra questi picchi. Un agente non può compiere il passo successivo finché le chiamate agli strumenti o i sotto-compiti richiesti non restituiscono un risultato.
Questa catena di attesa è il percorso critico, ossia la sequenza che controlla il tempo di completamento totale. Thread individuali più rapidi possono abbreviarlo anche quando il sistema dispone di capacità parallela inutilizzata.
L'argomentazione di Nvidia sulle prestazioni di Vera sostiene che il processore offra prestazioni per core pari a 1,5 volte quelle di Venice in quattro test selezionati orientati agli agenti.
Tali test includono carichi di lavoro sensibili a compilatore, analisi statica, Python e memoria. Nvidia confronta Vera con il denso EPYC 9996 a 256 core di AMD, anziché con il modello Venice ad alta frequenza da 96 core.
AMD sceglie un confronto diverso. La sua più forte dichiarazione per core mette la configurazione Venice ad alta frequenza da 96 core contro Vera nell'intera suite SPECrate Integer.
Entrambi i fornitori scelgono un carico di lavoro e un processore concorrente che sostengono il loro messaggio architetturale. Nvidia punta all'ammiraglia densa di AMD, mentre AMD risponde con un modello ottimizzato per la frequenza.
Questo non invalida automaticamente nessuna delle due analisi. I processori per server sono progettati per diversi punti operativi e i clienti confrontano spesso più modelli all'interno della stessa famiglia di prodotti.
Tuttavia, queste selezioni impediscono di dichiarare semplicemente che una CPU abbia prestazioni per core universalmente superiori. La risposta cambia in base al modello Venice e al set di carichi di lavoro.
Il throughput totale presenta una complicazione simile. EPYC 9996 prevale nella stima di AMD in parte perché colloca 256 core in ciascun socket.
Questa densità ha un valore reale quando il software riesce a mantenere occupati i core. Conta meno quando un'applicazione dipende da un numero ridotto di thread rapidi.
Una flotta di database, un cluster di web serving o un servizio sandbox possono spesso sfruttare un ampio parallelismo. Una fase di orchestrazione seriale può rispondere più fortemente alla latenza per thread.
Molti sistemi di produzione contengono entrambi i modelli. Le richieste arrivano contemporaneamente, ma ciascuna richiesta include anche passaggi che devono essere eseguiti in ordine.
Questo comportamento misto rende l'economia della flotta più importante di un singolo punteggio di picco. Gli acquirenti devono considerare i lavori completati, la tail latency, l'uso della memoria, le licenze software, la potenza del rack e l'utilizzo.
Il caso prestazionale di AMD EPYC Venice è più forte quando un carico di lavoro scala su molti core. Il caso di Nvidia si rafforza quando la latenza sequenziale domina l'esperienza utente.
Nessuno dei due fornitori ha ancora fornito un test neutrale end-to-end che copra sessioni agentiche rappresentative su sistemi commercializzati comparabili. Finché non arriverà, i benchmark specifici per architettura indicano una direzione anziché una superiorità universale.
La competizione si estende anche oltre i singoli nodi. AMD stima che Venice possa offrire maggiori prestazioni a livello di rack con un budget di potenza fisso.
La sua precedente metodologia modellava un rack da 100 kilowatt e riduceva il numero di nodi Venice per tenere conto della maggiore potenza per nodo. L'azienda calcolava comunque un throughput aggregato superiore.
Questa analisi dipende da proiezioni delle prestazioni e dalla potenza di sistema modellata. I rack reali includono raffreddamento, networking, storage, acceleratori, conversione di potenza ed effetti di utilizzo.
La domanda più utile non è quindi quale fornitore vinca un grafico a barre normalizzato. È quale sistema completi il lavoro richiesto entro i vincoli di latenza, potenza e software dell'acquirente.
Cosa cambiano le note a piè di pagina dei benchmark
Il confronto tra AMD e Nvidia Vera resta provvisorio perché diversi risultati combinano stime, test dei fornitori e configurazioni non identiche.
SPEC CPU offre una suite di carichi di lavoro controllata, ma una valida interpretazione richiede comunque dettagli di configurazione. Il numero di processori, il compilatore, la memoria, il threading, il firmware e i flag di ottimizzazione possono tutti influenzare il punteggio.
Le regole di reporting SPEC consentono risultati prestazionali stimati. Richiedono che ogni stima rechi un'etichetta chiara, anziché nascondere tale stato in una clausola di esclusione generale.
AMD segue questo principio nelle sue note dettagliate. I valori di 2.070, 1.210 e 925 sono tutti stime.
L'assenza di un risultato presentato significa che i lettori non possono ancora esaminare una pagina standard dei risultati SPEC per ogni configurazione. Ciò limita la riproducibilità indipendente.
Il white paper di AMD include anche confronti che utilizzano diverse versioni dei compilatori. Alcuni sistemi Venice usano il compilatore AOCC 5.1 di AMD, mentre alcuni sistemi concorrenti usano GCC 13 o Intel OneAPI.
La scelta del compilatore è parte delle reali prestazioni della piattaforma. I fornitori ottimizzano spesso il software per i propri processori e i clienti possono adottare queste toolchain ottimizzate.
Tuttavia, compilatori diversi rendono meno immediate le conclusioni architetturali. Un punteggio può riflettere il processore, la maturità del compilatore, i flag, le librerie o l'interazione fra tutti e quattro.
Anche le configurazioni di memoria differiscono. I sistemi AMD più recenti possono usare 16 canali di MRDIMM veloci, mentre il sistema Vera confrontato utilizza otto canali SOCAMM2.
Si tratta di scelte di piattaforma, non di deviazioni accidentali. Significa però che il benchmark valuta configurazioni di sistema complete anziché core CPU isolati.
Nelle prove Redis divulgate da AMD, EPYC 9996 opera inoltre con una specifica di potenza CPU predefinita di 600 watt. Tale valore supera i livelli di potenza associati a molti precedenti processori per server.
Una potenza più elevata non rende irrilevante un risultato prestazionale. Gli operatori di data center accettano abitualmente una maggiore potenza per socket quando il consolidamento migliora il throughput per rack.
Richiede però una valutazione più ampia. Densità di raffreddamento, predisposizione elettrica, comportamento in idle e potenza degli acceleratori possono determinare se i vantaggi del consolidamento persistano nell'implementazione.
I test di AMD sui carichi di lavoro agentici introducono un'altra limitazione. L'azienda utilizza componenti riconoscibili quali NGINX, FAISS, carichi di lavoro di database e un agente multi-persona riprodotto.
Alcuni test derivano i carichi di lavoro da TPC-H o TPC-C. AMD osserva che questi risultati derivati non sono comparabili con i punteggi pubblicati ufficialmente da tali famiglie di benchmark.
Questa metodologia può comunque rivelare comportamenti utili fra i sistemi AMD controllati dall'azienda. Non dovrebbe essere presentata come una classifica standardizzata del settore.
Il confronto con AWS Graviton5 aggiunge variabili cloud. AMD ha testato Graviton5 tramite un'istanza bare-metal pubblicamente disponibile, anziché attraverso un sistema di riferimento locale equivalente.
Firmware cloud, storage, rete e servizi di piattaforma possono influenzare i risultati. AMD dichiara che tali fattori potrebbero incidere sul confronto.
La copertura indipendente ha evidenziato queste avvertenze. L'analisi originale dei benchmark rileva che AMD combina fonti di dati e talvolta utilizza diverse generazioni di GCC.
L'interpretazione più prudente è circoscritta. AMD stima che specifiche configurazioni Venice superino i sistemi confrontati nei carichi di lavoro e nelle ipotesi dichiarate.
Questo è più significativo di uno slogan di marketing privo di riscontri. È meno conclusivo di test riprodotti in modo indipendente su hardware generalmente disponibile.
Perché i data center AI guardano oltre i grafici della CPU
Il valore strategico di Venice dipende dalla sua capacità di migliorare l'economia reale dell'infrastruttura grazie alla densità, non dalla vittoria in ogni benchmark isolato.
I cluster AI dedicano la maggior parte dell'attenzione e del capitale agli acceleratori. Le CPU continuano però a coordinare il lavoro circostante che mantiene produttivi tali acceleratori.
Un'applicazione con retrieval-augmented generation deve trovare documenti, filtrare le autorizzazioni, trasformare dati e assemblare il contesto prima che inizi l'inferenza. Queste fasi mettono sotto pressione memoria, storage, rete e calcolo general purpose.
Un agente può anche creare ambienti di codice temporanei o sessioni del browser. Ogni attività isolata consuma tempo CPU e memoria mentre il modello attende un risultato.
Un'elevata densità di core può consolidare questi servizi di supporto. Un numero inferiore di server può offrire la stessa capacità aggregata quando i carichi di lavoro scalano in modo efficiente.
Il consolidamento può ridurre lo spazio nei rack, le porte di rete, le istanze del sistema operativo e il sovraccarico di gestione. Può anche concentrare i guasti e aumentare i requisiti di raffreddamento.
Il livello software determina quanta densità hardware diventi capacità utile. Gli scheduler devono distribuire il lavoro efficacemente, mentre le applicazioni devono evitare lock, colli di bottiglia della memoria e servizi condivisi sovraccarichi.
La larghezza di banda della memoria diventa importante quando più core richiedono dati contemporaneamente. Il design a 16 canali di AMD tenta di alimentare una popolazione di core molto più ampia senza aumentare proporzionalmente gli stalli.
Anche la capacità della cache sostiene l'argomento della densità. EPYC 9996 include un gigabyte di cache L3, distribuito nella sua architettura a chiplet.
Un'ampia cache aggregata può ridurre il traffico verso la memoria per carichi di lavoro adatti. Non garantisce una bassa latenza di accesso per ogni core e posizione dei dati.
Il design monolitico di Nvidia punta su accesso uniforme e robuste prestazioni per core sotto carico. L'azienda sostiene che questo equilibrio riduca la variabilità nei flussi di lavoro degli agenti.
Queste filosofie concorrenti creano scelte di acquisto pratiche. Un provider cloud può privilegiare la massima densità di tenant, mentre un'azienda può valorizzare una latenza applicativa prevedibile.
Le licenze software possono modificare nuovamente il calcolo. I prodotti concessi in licenza per core possono penalizzare un'implementazione a 256 core, anche quando il throughput totale è superiore.
Altre applicazioni prevedono licenze per server, utente o consumo. Questi modelli possono premiare il consolidamento.
Anche la compatibilità conta. Venice estende l'ambiente x86 utilizzato dai precedenti sistemi EPYC, ma il nuovo socket, il design della memoria e il profilo di potenza richiedono comunque piattaforme qualificate.
Nvidia può semplificare l'implementazione per i clienti che acquistano sistemi Rubin completi. CPU, acceleratori, rete e software arrivano come parti di un'unica roadmap integrata.
Questo vantaggio comporta un rischio di concentrazione. Gli acquirenti diventano più dipendenti da un solo fornitore per prezzi, disponibilità, calendario dei rilasci e direzione del software.
AMD offre un'alternativa incentrata sulla scelta della CPU e su infrastrutture basate su standard. I suoi progressi produttivi sostengono questa strategia.
L'azienda ha dichiarato che Venice è entrato nella fase di incremento produttivo sul processo a 2 nanometri di TSMC nel maggio 2026. AMD lo ha definito il primo prodotto di calcolo ad alte prestazioni a raggiungere questa fase su tale processo.
L'incremento produttivo non equivale a una disponibilità diffusa. La qualifica OEM, la maturità del firmware, la validazione della memoria e le spedizioni in volume determinano quando le aziende possono implementare i sistemi.
AMD afferma che le principali piattaforme OEM sono in linea per il lancio, con i principali cloud provider che inizieranno le implementazioni più tardi nel 2026. Tali implementazioni forniranno prove più significative delle proiezioni ingegneristiche.
Tre segnali decideranno la corsa fra AMD e Nvidia Vera
Risultati indipendenti, disponibilità produttiva e throughput reale degli agenti determineranno se il vantaggio di AMD nei benchmark resisterà al di fuori del suo white paper.
Il primo segnale è un insieme completo di risultati SPEC CPU 2026 pubblicati. Le presentazioni comparabili dovrebbero rendere noti compilatori, flag, memoria, firmware, impostazioni di potenza e topologia del sistema.
Un vantaggio di throughput verificato pari a 2,2 volte rafforzerebbe l'argomento di AMD sulla densità. Un risultato più ristretto mostrerebbe che le stime preliminari hanno sopravvalutato il vantaggio di Venice.
Le presentazioni per core sono altrettanto importanti. Il confronto più informativo includerebbe EPYC 9996, il modello ad alta frequenza da 96 core e Vera in condizioni software allineate.
Il secondo segnale è la disponibilità dei sistemi su scala significativa. AMD ha avviato la produzione, ma i clienti necessitano di server qualificati, firmware stabile, memoria supportata e forniture costanti.
Le istanze cloud renderanno Venice più facile da testare senza un grande acquisto hardware. I tempi di lancio e le configurazioni disponibili riveleranno quali modelli raggiungeranno per primi i clienti.
Nvidia affronta lo stesso test con Vera. Le dichiarazioni sui prodotti hanno un peso operativo limitato finché i clienti non possono ottenere i sistemi e misurarne il comportamento sostenuto.
Una disponibilità diffusa rafforzerebbe il fornitore che per primo trasforma le specifiche in capacità affidabile. I ritardi darebbero ai rivali più tempo per migliorare hardware, compilatori e prezzi.
Il terzo segnale è il lavoro degli agenti completato sotto vincoli fissi. I test dovrebbero misurare insieme sessioni utente riuscite, latenza di coda, throughput, potenza e utilizzo degli acceleratori.
Tali risultati devono includere sia percorsi critici ristretti sia ampi picchi di strumenti paralleli. Altrimenti, il test ripete semplicemente la storia architetturale preferita da un fornitore.
Osservate come i sistemi si comportano quando retrieval, database, API, sandbox di codice e inferenza del modello operano contemporaneamente. Questa combinazione rappresenta meglio i servizi di agenti in produzione rispetto a una singola suite CPU.
Per i team infrastrutturali, il prossimo passo corretto non è accettare il grafico normalizzato di nessuna delle due aziende. Definite prima il carico di lavoro, l'obiettivo di latenza, lo stack software, il limite del rack e il modello di licenza.
Quindi confrontate sistemi già disponibili con dati e obiettivi di livello di servizio identici. I benchmark AMD EPYC Venice danno agli acquirenti una seria ragione per includere AMD in questa valutazione.
Offrono inoltre a Nvidia un obiettivo chiaro. Se Vera riuscirà a superare Venice nelle sessioni AI completate pur avendo meno core, l'argomento di Nvidia sul percorso critico acquisterà credibilità.
Se Venice trasformerà il throughput previsto in minori costi infrastrutturali e una forte latenza, AMD avrà sfidato più di una CPU. Avrà sfidato il piano di Nvidia di possedere l'intera piattaforma server per l'AI.



