Nvidia DGX Spark vs. AMD Strix Halo: Das lokale KI-Duell mit 128 GB
- Aisha Washington

- 29. Juli
- 6 Min. Lesezeit

Bis Ende 2025 hat sich die Einstiegshürde für die lokale Ausführung von Modellen mit enormen Parameterzahlen verschoben. Wir betrachten nicht mehr nur die VRAM-Kapazität von Gaming-Karten; wir betrachten Architekturen mit gemeinsamem Speicher, die Rechenzentrums-Spezifikationen auf den Schreibtisch bringen. Der Markt hat uns endlich zwei unterschiedliche Wege zu 128 GB Hochgeschwindigkeitsspeicher ohne den fünfstelligen Preis industrieller Cluster eröffnet: den Nvidia DGX Spark und den AMD Strix Halo.
Die Wahl zwischen ihnen hat nichts mit Markentreue zu tun. Es geht darum, zwei grundlegend unterschiedliche Philosophien zu verstehen. Das eine ist ein spezialisiertes Gerät, das die Grace-Blackwell-Architektur in ein 1-Liter-Gehäuse bringt. Das andere ist eine kompromisslose APU, die die Grenze zwischen einem High-End-Desktop und einer KI-Workstation.
Diese Analyse schlüsselt den praktischen Nutzen beider Systeme auf und beginnt mit den unmittelbaren Reibungspunkten, mit denen frühe Anwender konfrontiert sind.
Entscheidende Nutzererfahrung: Eigenheiten von Nvidia DGX Spark und AMD Strix Halo beheben

Bevor Sie sich den reinen Durchsatz ansehen, müssen Sie wissen, wie es tatsächlich ist, mit diesen Maschinen zu leben. Beide Geräte zeigen eigenwillige Verhaltensweisen, die die Erfahrung ruinieren können, wenn Sie nicht wissen, wie Sie damit umgehen.
Die langsamen Ladezeiten des Nvidia DGX Spark lösen (der mmap-Fix)
Wenn Sie einen Nvidia DGX Spark auspacken, Ihre Umgebung installieren und versuchen, ein Modell wie gpt-oss-120b über llama.cpp zu laden, könnten Sie denken, das Gerät sei defekt. Die anfänglichen Ladezeiten können sich über mehr als eineinhalb Minuten hinziehen (ca. 100 Sekunden). Für ein Gerät mit dem GB10 Grace Blackwell Superchip wirkt das träge.
Die Community hat den Schuldigen identifiziert: Memory Mapping (mmap). Das Standardverhalten vieler Inferenz-Engines kollidiert mit der Art und Weise, wie der Spark seinen gemeinsamen Speicherpool handhabt.
Die Lösung: Sie müssen mmap in Ihren llama.cpp-Startargumenten deaktivieren.
Durch das Deaktivieren dieses Flags berichten Nutzer von Ladezeiten, die von 100 Sekunden auf ungefähr 22 Sekunden sinken. Diese einfache Anpassung bringt den Spark auf Augenhöhe mit oder sogar vor seine Konkurrenten. Darüber hinaus scheint das Deaktivieren von mmap die Geschwindigkeit der Prompt-Verarbeitung und die Stabilität der Token-Generierung zu verbessern. Wenn Sie dieses Gerät besitzen, ist das nicht optional; es ist ein zwingender Konfigurationsschritt.
AMD-Strix-Halo-Optimierung und Hardware-Einschränkungen
Der AMD Strix Halo (insbesondere die Varianten Ryzen AI Max+ 395) bietet ein reibungsloseres Software-Onboarding für diejenigen, die an Windows oder Standard-Linux-Distributionen gewöhnt sind, hat jedoch eigene physische und softwareseitige Vorbehalte.
Auf der Softwareseite kann zwar ROCm inzwischen viel, doch die Standard-Backends für Inferenz lassen Leistung ungenutzt. Für reine Inferenzaufgaben in llama.cpp hat der Wechsel zum Vulkan-Backend auf der Strix-Halo-Architektur messbare Gewinne gegenüber Standardkonfigurationen gezeigt.
Bei der Hardware-Wartung glänzt der AMD Strix Halo im Vergleich zu seinem Rivalen vom grünen Team. Geräte wie der HP Z2 Mini G1a verfügen über werkzeuglose Zugangsmechanismen. Sie können das Gehäuse aufschieben und Standard-2280-NVMe-Laufwerke in Sekunden austauschen.
Stellen Sie dies dem Nvidia DGX Spark gegenüber. Das Industriedesign des Spark ist frustrierend minimalistisch. Es fehlt eine Power-LED oder sogar eine Aktivitätsanzeige für den Netzwerkanschluss. Oft müssen Sie das Gerät anpingen, nur um zu sehen, ob es eingeschaltet ist. Schlimmer noch: Der interne Speichersteckplatz verwendet den M.2-2242-Formfaktor – einen kürzeren, selteneren Standard als den allgegenwärtigen 2280. Eine leistungsstarke 4-TB- oder 8-TB-SSD in der Größe 2242 zu finden, ist schwierig und teuer. Wenn Sie große Datensätze auf dem Spark speichern möchten, sollten Sie sich darauf einstellen, externen Netzwerkspeicher zu nutzen oder nach seltenen Laufwerken zu suchen.
Leistungsanalyse im Detail: Fähigkeiten des Nvidia DGX Spark

Der Nvidia DGX Spark ist im Wesentlichen ein „KI-Labor in einer Box“. Er ist mit etwa 3.999 $ höher bepreist, doch diese Kosten umfassen spezifische Fähigkeiten, die Sie sonst nirgends finden.
Nvidia-DGX-Spark-Bildgenerierung und INT4-Leistung
Während beide Maschinen Large Language Models (LLMs) kompetent verarbeiten, vernichtet der Nvidia DGX Spark die Konkurrenz bei der Bildgenerierung. In Tests mit FLUX.1 Dev (BF16) erreicht der Spark etwa 120 TFLOPS.
Um das einzuordnen: Der Spark generiert Bilder ungefähr 2,5-mal schneller als der AMD Strix Halo, der in ähnlichen Workloads etwa 46 TFLOPS erreicht. Wenn Ihr Workflow eine intensive Nutzung von Diffusionsmodellen umfasst, rechtfertigt der Spark seinen Preisaufschlag sofort.
Die Architektur unterstützt außerdem natives NVFP4 (4-Bit-Gleitkomma). Der theoretische Durchsatz für INT4 auf dem Spark ist enorm – 112 TOPS – und übertrifft den Halo um einen Faktor von fast 9x. Derzeit ist dies jedoch eher ein „Potenzial“ als „Realität“. Das Software-Ökosystem außerhalb von Nvidia-Tools für den Enterprise-Bereich hat bei der effektiven Nutzung dieser Präzision in für Verbraucher zugänglichen Loadern noch nicht vollständig aufgeholt. Sie kaufen den Spark für das, was er heute mit CUDA 13 leistet, setzen aber auch darauf, dass zukünftige Software diesen INT4-Spielraum erschließt.
Ein weiteres herausragendes Merkmal ist die Vernetzung. Der Spark enthält eine ConnectX-7-200GbE-Karte. Für einen einzelnen Nutzer ist das übertrieben. Doch für ein kleines Labor, das drei oder vier Geräte zusammenclustern möchte, um ein Modell mit 400 Milliarden Parametern auszuführen, ist diese Verbindung unschätzbar.
Der König der Allrounder: AMD-Strix-Halo-Analyse
Der AMD Strix Halo ist deutlich günstiger und liegt zwischen 2.300 und 2.500 $. Er versucht nicht, ein Serverknoten zu sein; er versucht, die ultimative Workstation zu sein.
AMD-Strix-Halo-CPU-Leistung und Alltagstauglichkeit
Der AMD Strix Halo nutzt 16 Zen-5-CPU-Kerne. Bei allgemeinen Rechenaufgaben, Kompilierung und Datenvorverarbeitung übertrifft er die im Spark verbauten ARM-Kerne deutlich.
In Hochleistungsrechen-Benchmarks wie Linpack liefert der Strix Halo 1,6 TFLOPS an Double-Precision-Leistung und verdoppelt damit die 708 GFLOPS des Spark mehr als. Wenn Ihr KI-Workflow eine umfangreiche Vorverarbeitung auf der CPU-Seite umfasst oder Sie die Maschine einfach als leistungsstarken Linux-Entwicklungsdesktop nutzen möchten, ist der Strix Halo die logische Wahl.
Bei der LLM-Token-Generierung ist der Wettbewerb überraschend eng. Da LLM-Inferenz oft durch Speicherbandbreite und nicht durch reine Rechenleistung begrenzt wird, hält der 128 GB LPDDR5X-8000 des Halo (ca. 256 GB/s) mit dem Spark (ca. 273 GB/s) Schritt. In vielen Szenarien der Textgenerierung ist der Unterschied vernachlässigbar.
Der Strix Halo stellt einen nahtlosen Migrationspfad dar. Da er denselben ROCm- und HIP-Stack verwendet, der in Rechenzentren zu finden ist, lässt sich hier entwickelter Code leicht hochskalieren, doch die Maschine selbst fühlt sich wie ein normaler, leistungsstarker PC an.
Warum die RTX 5090 nicht in dieses Gespräch passt

Unweigerlich stellt sich die Frage: „Warum nicht einfach eine RTX 5090 kaufen?“
Die Standard-RTX 5090 ist ein Monster bei der reinen Rechenleistung und übertrifft bei Weitem sowohl den Nvidia DGX Spark und AMD Strix Halo in Bezug auf FLOPS pro Dollar. Allerdings stößt sie an eine harte Grenze: 32 GB VRAM.
In der Welt lokaler LLMs ist Speicher Sauerstoff. Ein Modell mit 70 Milliarden Parametern bei hoher Präzision oder ein 120B-Modell bei angemessener Quantisierung lässt sich schlicht nicht in 32 GB Videospeicher laden. Die 5090 ist bei kleinen Modellen schneller, versagt bei großen jedoch vollständig.
Es kursieren Gerüchte und Prototypen von „128GB RTX 5090“-Karten in Entwicklungslaboren, von denen einige exorbitante Preise von über 13.000 $ haben. Dabei handelt es sich nicht um Verbraucherprodukte. Für Nutzer, die heute 128 GB Speicher benötigen, erfordert der GPU-Weg mehrere Karten und ein komplexes Management der PCIe-Lanes. Der Spark und der Halo bieten diese Kapazität in einem einzigen, zusammenhängenden Speicherblock.
Fazit: Die Wahl Ihrer 128GB-Workstation

Die Entscheidung zwischen dem Nvidia DGX Spark und dem AMD Strix Halo hängt von Ihrer spezifischen Workflow-Pipeline ab.
Wählen Sie den Nvidia DGX Spark wenn:
Sie ein dediziertes Gerät für NVFP4-Forschung oder CUDA-Validierung im Unternehmen benötigen.
Ihr Workflow stark auf Bildgenerierung (Flux, Stable Diffusion) ausgerichtet ist.
Sie planen, mehrere Einheiten über die 200GbE-Verbindung zu clustern.
Sie mit einer „Headless-Server“-Erfahrung und Linux-Administration vertraut sind.
Wählen Sie den AMD Strix Halo, wenn:
Sie das beste Preis-Leistungs-Verhältnis wünschen (nahezu halb so teuer wie der Spark).
Sie einen vielseitigen täglichen Rechner benötigen, der sowohl Code kompiliert als auch Text generiert.
Sie einfache Hardware-Upgrades (Standard-SSDs) priorisieren.
Ihr Hauptfokus auf LLM-Textinferenz liegt, bei der er dem Spark in seiner Nutzbarkeit entspricht.
Beide Maschinen beweisen, dass 2025 das Jahr ist, in dem lokale KI mit 128 GB zugänglich wurde. Ob Sie sich für das ausgereifte Gerät des grünen Teams oder die leistungsstarke APU des roten Teams entscheiden: Die Zeiten von Speichermangel sind vorbei.
FAQ
F: Kann ich auf dem Nvidia DGX Spark Spiele spielen?
A: Nein, der Spark ist ausschließlich ein KI-Gerät. Ihm fehlen Display-Ausgänge wie DisplayPort (nur HDMI), und die ARM-basierte Architektur in Kombination mit GPU-Treibern für Rechenzentren macht ihn für Standard-PC-Gaming ungeeignet.
F: Ist die SSD im Nvidia DGX Spark aufrüstbar?
A: Ja, aber es ist schwierig. Sie müssen das Gerät von unten zerlegen und eine SSD im Formfaktor M.2 2242 finden, die seltener und oft teurer ist als die Standard-2280-Laufwerke, die in den meisten PCs verwendet werden.
F: Unterstützt der AMD Strix Halo Windows?
A: Ja, der Strix Halo ist x86-basiert und unterstützt Windows 11 nativ. Für maximale KI-Leistung und Zugriff auf den vollständigen ROCm-Stack wird jedoch im Allgemeinen eine Linux-Umgebung empfohlen.
F: Wie laut ist der Nvidia DGX Spark unter Last?
A: Die Lüftergeräusche sind hörbar, und das Metallgehäuse kann aufgrund seiner kompakten Größe von 1 Liter ziemlich heiß werden. Obwohl er leiser ist als einige Mini-PCs mit hoher Drehzahl, ist er nicht geräuschlos und sollte bei Lärmempfindlichkeit am besten abseits Ihres unmittelbaren Arbeitsplatzes aufgestellt werden.
F: Was ist der Hauptengpass für LLMs auf diesen Geräten?
A: Die Speicherbandbreite ist der primäre Engpass. Trotz einer Kapazität von 128 GB begrenzt die Geschwindigkeit, mit der Daten vom Speicher zu den Rechenkernen gelangen (Bandbreite), die Tokens pro Sekunde, sodass Spark und Halo bei der Textgenerierung trotz des Rechenvorteils des Spark ähnlich abschneiden.


