Nvidia DGX Spark vs AMD Strix Halo: la sfida dell'IA locale da 128GB
- Aisha Washington

- 29 lug
- Tempo di lettura: 7 min

Entro la fine del 2025, la soglia di accesso per eseguire localmente modelli con un numero enorme di parametri è cambiata. Non stiamo più osservando solo la capacità VRAM delle schede da gaming; stiamo guardando architetture di memoria unificata che portano specifiche da data center sulla scrivania. Il mercato ci ha finalmente offerto due percorsi distinti verso 128GB di memoria ad alta velocità senza il prezzo a cinque cifre dei cluster industriali: il Nvidia DGX Spark e l'AMD Strix Halo.
La scelta tra i due non riguarda la fedeltà al marchio. Si tratta di comprendere due filosofie fondamentalmente diverse. Uno è un'appliance specializzata progettata per portare l'architettura Grace Blackwell in un box da 1 litro. L'altro è un'APU a forza bruta che sfuma il confine tra un desktop di fascia alta e una workstation AI.
Questa analisi esamina l'utilità reale di entrambi, iniziando dai punti di attrito immediati che i primi utilizzatori stanno affrontando.
Esperienza utente critica: risolvere le particolarità di Nvidia DGX Spark e AMD Strix Halo

Prima di esaminare il throughput puro, devi sapere com'è davvero convivere con queste macchine. Entrambi i dispositivi hanno comportamenti peculiari che possono rovinare l'esperienza se non sai come gestirli.
Risolvere i tempi di caricamento lenti di Nvidia DGX Spark (la correzione mmap)
Se apri la confezione di un Nvidia DGX Spark, installi il tuo ambiente, e provi a caricare un modello come gpt-oss-120b tramite llama.cpp, potresti pensare che l'unità sia difettosa. I tempi di caricamento iniziali possono superare un minuto e mezzo (circa 100 secondi). Per un dispositivo alimentato dal superchip GB10 Grace Blackwell, sembra lento.
La community ha identificato il colpevole: la mappatura della memoria (mmap). Il comportamento predefinito di molti motori di inferenza entra in conflitto con il modo in cui Spark gestisce il suo pool di memoria unificata.
La soluzione: Devi disabilitare mmap negli argomenti di avvio di llama.cpp.
Disattivando questo flag, gli utenti segnalano tempi di caricamento che scendono da 100 secondi a circa 22 secondi. Questa semplice modifica porta Spark alla pari con, o persino più veloce di, i suoi concorrenti. Inoltre, disabilitare mmap sembra migliorare la velocità di elaborazione dei prompt e la stabilità della generazione dei token. Se possiedi questo box, non è facoltativo; è un passaggio obbligatorio di configurazione.
Ottimizzazione e vincoli hardware di AMD Strix Halo
L'AMD Strix Halo (in particolare le varianti Ryzen AI Max+ 395) offre un onboarding software più fluido per chi è abituato a Windows o alle distribuzioni Linux standard, ma presenta le proprie limitazioni fisiche e software.
Sul fronte software, sebbene ROCm sia maturato, i backend standard per l'inferenza possono lasciare prestazioni inutilizzate. Per le attività di inferenza pura in llama.cpp, passare al backend Vulkan ha mostrato miglioramenti misurabili rispetto alle configurazioni predefinite sull'architettura Strix Halo.
La manutenzione hardware è il punto in cui l'AMD Strix Halo eccelle rispetto al rivale del team verde. Unità come HP Z2 Mini G1a presentano meccanismi di accesso senza attrezzi. Puoi far scorrere l'apertura del case e sostituire le unità NVMe 2280 standard in pochi secondi.
Confrontalo con il Nvidia DGX Spark. Il design industriale di Spark è minimalista in modo frustrante. Manca un LED di alimentazione o persino una spia di attività per la porta di rete. Spesso devi eseguire un ping del dispositivo solo per vedere se è acceso. Peggio ancora, lo slot di archiviazione interno utilizza il formato M.2 2242—uno standard più corto e più raro dell'onnipresente 2280. Trovare un SSD ad alte prestazioni da 4TB o 8TB nel formato 2242 è difficile e costoso. Se prevedi di archiviare enormi dataset su Spark, preparati a fare affidamento su storage di rete esterno o a cercare unità rare.
Analisi approfondita delle prestazioni: capacità di Nvidia DGX Spark

Il Nvidia DGX Spark è essenzialmente un "laboratorio di IA in un box". Il suo prezzo è più alto, circa $3,999, ma tale costo include capacità specifiche che non puoi trovare altrove.
Generazione di immagini e potenza INT4 di Nvidia DGX Spark
Sebbene entrambe le macchine gestiscano con competenza i Large Language Models (LLM), il Nvidia DGX Spark distrugge la concorrenza nella generazione di immagini. Nei test con FLUX.1 Dev (BF16), Spark raggiunge circa 120 TFLOPS.
Per contestualizzare, Spark genera immagini circa 2.5 volte più velocemente dell'AMD Strix Halo, che raggiunge circa 46 TFLOPS in carichi di lavoro simili. Se il tuo flusso di lavoro prevede un uso intenso di modelli di diffusione, Spark giustifica immediatamente il suo sovrapprezzo.
L'architettura supporta anche NVFP4 nativo (virgola mobile a 4 bit). Il throughput teorico per INT4 su Spark è enorme—112 TOPS—superando Halo di un fattore di quasi 9x. Tuttavia, al momento si tratta di un "potenziale" piuttosto che di una "realtà". L'ecosistema software al di fuori degli strumenti Nvidia di livello enterprise non ha ancora pienamente recuperato nell'utilizzo efficace di questa precisione nei loader accessibili ai consumatori. Acquisti Spark per ciò che fa oggi con CUDA 13, ma scommetti anche sul fatto che il software futuro sbloccherà quel margine INT4.
Un'altra caratteristica distintiva è il networking. Spark include una scheda ConnectX-7 200GbE. Per un singolo utente, è eccessiva. Ma per un piccolo laboratorio che desidera raggruppare tre o quattro unità per eseguire un modello da 400B parametri, questa interconnessione è inestimabile.
Il re tuttofare: analisi di AMD Strix Halo
L'AMD Strix Halo costa significativamente meno, attestandosi tra $2,300 e $2,500. Non cerca di essere un nodo server; cerca di essere la workstation definitiva.
Prestazioni della CPU e usabilità quotidiana di AMD Strix Halo
L'AMD Strix Halo sfrutta 16 core CPU Zen 5. Nelle attività di calcolo generale, compilazione e preelaborazione dei dati, supera significativamente i core ARM presenti in Spark.
Nei benchmark di calcolo ad alte prestazioni come Linpack, Strix Halo offre 1.6 TFLOPS di prestazioni in doppia precisione, più del doppio dei 708 GFLOPS di Spark. Se il tuo flusso di lavoro IA implica una pesante preelaborazione lato CPU o se hai semplicemente bisogno che la macchina funga anche da potente desktop di sviluppo Linux, Strix Halo è la scelta logica.
Quando si tratta di generazione di token LLM, la battaglia è sorprendentemente equilibrata. Poiché l'inferenza LLM è spesso limitata dalla larghezza di banda della memoria piuttosto che dalla pura potenza di calcolo, i 128GB LPDDR5X-8000 su Halo (circa 256 GB/s) tengono il passo con Spark (circa 273 GB/s). In molti scenari di generazione di testo, la differenza è trascurabile.
Strix Halo rappresenta un percorso di migrazione senza soluzione di continuità. Poiché utilizza lo stesso stack ROCm e HIP presente nei data center, il codice sviluppato qui si adatta facilmente alla scalabilità, ma la macchina stessa sembra un PC standard ad alta potenza.
Perché RTX 5090 non rientra in questa discussione

Inevitabilmente sorge la domanda: "Perché non comprare semplicemente una RTX 5090?"
La RTX 5090 standard è una bestia in termini di potenza di calcolo pura, superando di gran lunga entrambe Nvidia DGX Spark e AMD Strix Halo in termini di FLOPS per dollaro. Tuttavia, incontra un limite invalicabile: 32GB di VRAM.
Nel mondo degli LLM locali, la memoria è ossigeno. Semplicemente non è possibile caricare un modello da 70B parametri ad alta precisione, o un modello da 120B a una quantizzazione ragionevole, in 32GB di memoria video. La 5090 è più veloce per i modelli piccoli, ma fallisce completamente con quelli grandi.
Ci sono voci e prototipi di schede "RTX 5090 da 128GB" in circolazione nei laboratori di ingegneria, alcune con prezzi esorbitanti superiori a $13,000. Non sono prodotti consumer. Per l'utente che oggi necessita di 128GB di memoria, la strada della GPU richiede più schede e una complessa gestione delle linee PCIe. Spark e Halo offrono tale capacità in un unico blocco di memoria coerente.
Verdetto finale: scegliere la tua workstation da 128GB

La decisione tra Nvidia DGX Spark e AMD Strix Halo dipende dalla pipeline specifica del tuo flusso di lavoro.
Scegli Nvidia DGX Spark se:
Hai bisogno di un'appliance dedicata per la ricerca su NVFP4 o la verifica CUDA aziendale.
Il tuo flusso di lavoro è incentrato sulla generazione di immagini (Flux, Stable Diffusion).
Hai intenzione di creare un cluster di più unità utilizzando la connessione 200GbE.
Ti trovi a tuo agio con un'esperienza da "server headless" e con l'amministrazione Linux.
Scegli AMD Strix Halo se:
Desideri il miglior rapporto qualità-prezzo (quasi la metà del prezzo dello Spark).
Hai bisogno di una macchina versatile per l'uso quotidiano che compili codice oltre a generare testo.
Dai priorità a semplici aggiornamenti hardware (SSD standard).
Il tuo obiettivo principale è l'inferenza testuale degli LLM, ambito in cui eguaglia l'utilità dello Spark.
Entrambe le macchine dimostrano che il 2025 è l'anno in cui l'IA locale da 128GB è diventata accessibile. Che tu scelga l'appliance raffinata del team verde o la potente APU del team rosso, i giorni in cui la memoria era insufficiente sono finiti.
FAQ
D: Posso giocare ai videogiochi su Nvidia DGX Spark?
R: No, lo Spark è strettamente un'appliance per l'IA. Non dispone di uscite video come DisplayPort (solo HDMI) e l'architettura basata su ARM, combinata con driver GPU per data center, lo rende inadatto al gaming standard su PC.
D: L'SSD di Nvidia DGX Spark è aggiornabile?
R: Sì, ma è difficile. Devi smontare l'unità dal fondo e trovare un SSD con fattore di forma M.2 2242, più raro e spesso più costoso delle unità standard 2280 utilizzate nella maggior parte dei PC.
D: AMD Strix Halo supporta Windows?
R: Sì, Strix Halo è basato su x86 e supporta Windows 11 nativamente. Tuttavia, per le massime prestazioni IA e l'accesso all'intero stack ROCm, è generalmente consigliato un ambiente Linux.
D: Quanto è rumoroso Nvidia DGX Spark sotto carico?
R: Il rumore della ventola è udibile e il telaio in metallo può diventare piuttosto caldo a causa delle dimensioni compatte di 1 litro. Sebbene sia più silenzioso di alcuni mini-PC ad alto numero di giri, non è silenzioso ed è meglio collocarlo lontano dalla postazione di lavoro immediata se si è sensibili al rumore.
D: Qual è il principale collo di bottiglia per gli LLM su questi dispositivi?
R: La larghezza di banda della memoria è il principale collo di bottiglia. Nonostante la capacità di 128GB, la velocità con cui i dati si spostano dalla memoria ai core di calcolo (larghezza di banda) limita i token al secondo, facendo sì che Spark e Halo offrano prestazioni simili nella generazione di testo nonostante il vantaggio computazionale dello Spark.


