Nvidia DGX Spark vs AMD Strix Halo: 128GB 本地 AI 大对决
- Aisha Washington

- 6月6日
- 讀畢需時 6 分鐘

到2025年底,在本地运行大规模参数模型的入门门槛已经发生了变化。我们不再仅仅关注游戏显卡上的VRAM容量;我们关注的是将数据中心规格带到桌面的统一内存架构。市场终于为我们提供了两条不同的途径,以获得128GB高速内存,而无需工业集群的五位数价格标签:the Nvidia DGX Spark and the AMD Strix Halo.
在两者之间做出选择并非关乎品牌忠诚度。而是要理解两种根本不同的理念。一种是专门设计的设备,旨在将Grace Blackwell架构装入1升的盒子中。另一种则是将高端台式机与AI workstation
之间的界限模糊化的暴力APU。本分析将从早期采用者面临的即时摩擦点开始,剖析两者的实际效用。
Critical User Experience: Fixing Nvidia DGX Spark and AMD Strix Halo Quirks

在查看原始吞吐量之前,您需要了解使用这些机器的实际感受。两款设备都有特殊的行为,如果不知道如何处理,可能会毁掉使用体验。
Solving the Nvidia DGX Spark Slow Load Times (The mmap Fix)
如果您拆开Nvidia DGX Spark的包装,安装好环境,然后尝试通过llama.cpp加载gpt-oss-120b这样的模型,您可能会认为该设备有缺陷。初始加载时间可能拖延超过一分半钟(约100秒)。对于由GB10 Grace Blackwell超级芯片驱动的设备来说,这感觉很迟缓。
社区已经找出了罪魁祸首:内存映射(mmap)。许多推理引擎中的默认行为与Spark处理其统一内存池的方式相冲突。
The Solution: 您必须在llama.cpp启动参数中禁用mmap。
通过关闭此标志,用户报告加载时间从100秒降至约22秒。这一简单调整使Spark与竞争对手持平,甚至更快。此外,禁用mmap似乎还能改善提示处理速度和token生成稳定性。如果您拥有此设备,这不是可选操作;而是强制配置步骤。
AMD Strix Halo Optimization and Hardware Constraints
The AMD Strix Halo(特别是Ryzen AI Max+ 395变体)为习惯Windows或标准Linux发行版的用户提供了更顺畅的软件入门体验,但它也有自己的物理和软件限制。
在软件方面,尽管ROCm已经成熟,但用于推理的标准后端可能会让Strix Halo架构的性能大打折扣。对于llama.cpp中的纯推理任务,切换到Vulkan backend已在Strix Halo架构上显示出比默认配置更显著的提升。
硬件维护是AMD Strix Halo相比其绿色阵营对手的亮点所在。像HP Z2 Mini G1a这样的设备具有免工具进入机制。您可以滑动打开机箱,并在几秒钟内更换标准的2280 NVMe驱动器。
与Nvidia DGX Spark形成对比。 Spark的工业设计简约得令人沮丧。它缺少电源LED,甚至缺少网络端口的活动指示灯。您通常必须ping该设备才能知道它是否已开启。更糟糕的是,内部存储插槽使用M.2 2242外形尺寸——这是一种比无处不在的2280更短、更罕见的标准。找到高性能的4TB或8TB 2242尺寸SSD既困难又昂贵。如果您计划在Spark上存储海量数据集,请准备好依赖外部网络存储或寻找稀有驱动器。
Performance Deep Dive: Nvidia DGX Spark Capabilities

The Nvidia DGX Spark本质上是一个“盒装AI实验室”。它的定价更高,约为3999美元,但该成本包含了您在其他地方找不到的特定功能。
Nvidia DGX Spark Image Generation and INT4 Power
虽然两台机器都能胜任大型语言模型(LLM)的处理,但the Nvidia DGX Spark在图像生成方面完胜竞争对手。在运行FLUX.1 Dev (BF16)的测试中,Spark的性能约为120 TFLOPS。
为了说明这一点,Spark生成图像的速度大约是AMD Strix Halo的2.5倍,后者在类似工作负载中约为46 TFLOPS。如果您的工作流程涉及大量扩散模型的使用,Spark立即证明了其溢价的合理性。
该架构还支持原生NVFP4(4位浮点)。Spark上INT4的理论吞吐量巨大——112 TOPS——以近9倍的优势超过Halo。然而,这目前是“潜力”而非“现实”。企业级Nvidia工具之外的软件生态尚未完全跟上,在消费者可访问的加载器中有效利用这种精度。您购买Spark是为了它在CUDA 13下今天的表现,同时也在押注未来软件将释放该INT4的潜力。
另一个突出特点是网络连接。Spark包含ConnectX-7 200GbE卡。对于单个用户来说,这有些过剩。但对于希望将三到四个单元集群以运行400B参数模型的小型实验室来说,这种互连是无价的。
The Generalist King: AMD Strix Halo Analysis
The AMD Strix Halo的价格明显更低,徘徊在2300至2500美元之间。它并不试图成为服务器节点;它试图成为终极工作站。
AMD Strix Halo CPU Performance and Daily Usability
The AMD Strix Halo利用16个Zen 5 CPU核心。在一般计算任务、编译和数据预处理方面,它明显优于Spark中的ARM核心。
在Linpack等高性能计算基准测试中,Strix Halo在双精度性能方面提供1.6 TFLOPS,是Spark的708 GFLOPS的两倍多。如果您的AI工作流程涉及繁重的CPU端预处理,或者您只是需要该机器兼作强大的Linux开发桌面,那么Strix Halo是合乎逻辑的选择。
在LLM token生成方面,战斗出奇地接近。因为LLM推理通常受内存带宽而非纯计算限制,Halo上的128GB LPDDR5X-8000(约256 GB/s)与Spark(约273 GB/s)保持同步。在许多文本生成场景中,差异可以忽略不计。
Strix Halo代表了一条无缝迁移路径。因为它使用数据中心中相同的ROCm和HIP堆栈,在这里开发的代码可以轻松扩展,但机器本身感觉就像一台标准的高功率PC。
Why the RTX 5090 Doesn’t Fit This Conversation

不可避免地会出现这样的问题:“为什么不直接买RTX 5090?”
标准RTX 5090是原始计算的猛兽,在每美元FLOPS方面远远超过both the Nvidia DGX Spark and AMD Strix Halo。然而,它遇到了硬墙:32GB VRAM。
在本地LLM的世界中,内存就是氧气。您根本无法将高精度的70B参数模型或合理量化的120B模型加载到32GB视频内存中。5090对于小型模型更快,但对于大型模型完全失败。
工程实验室中流传着“128GB RTX 5090”卡的传闻和原型,有些价格高得离谱,超过13000美元。这些不是消费级产品。对于今天需要128GB内存的用户,GPU路线需要多张卡和复杂的PCIe通道管理。Spark和Halo在单个连贯的内存块中提供了这种容量。
Final Verdict: Choosing Your 128GB Workstation

Choose the Nvidia DGX Spark if:
您需要用于NVFP4研究或企业CUDA验证的专用设备。
您的工作流程侧重于图像生成(Flux、Stable Diffusion)。
您计划使用200GbE连接集群多个单元。
您适应“无头服务器”体验和Linux管理。
Choose the AMD Strix Halo if:
您想要最佳的性价比(几乎是Spark价格的一半)。
您需要一台既能编译代码又能生成文本的多功能日常驱动器。
您优先考虑易于硬件升级(标准SSD)。
您的主要重点是LLM文本推理,在这方面它与Spark的效用相当。
这两台机器都证明了2025年是128GB本地AI变得普及的一年。无论您选择绿色阵营的精致设备还是红色阵营的强大APU,内存匮乏的日子已经结束。
FAQ
Q: Can I play games on the Nvidia DGX Spark?
A: No, the Spark is strictly an AI appliance. 它缺少DisplayPort等显示输出(仅HDMI),并且基于ARM的架构结合数据中心GPU驱动程序使其不适合标准PC游戏。
Q: Is the SSD in the Nvidia DGX Spark upgradeable?
A: Yes, but it is difficult. You must disassemble the unit from the bottom and find an M.2 2242 form factor SSD, which is rarer and often more expensive than the standard 2280 drives used in most PCs.
Q: Does the AMD Strix Halo support Windows?
A: Yes, the Strix Halo is x86-based and supports Windows 11 natively. 但是,为了获得最大AI性能和访问完整的ROCm堆栈,通常建议使用Linux环境。
Q: How loud is the Nvidia DGX Spark under load?
A: The fan noise is audible and the metal chassis can get quite hot due to its compact 1-liter size. While it is quieter than some high-RPM mini-PCs, 它并不安静,如果对噪音敏感,最好将其放置在远离您工作区域的地方。
Q: What is the main bottleneck for LLMs on these devices?
A: Memory bandwidth is the primary bottleneck. Despite having 128GB of capacity, the speed at which data moves from memory to the compute cores (bandwidth) limits the tokens per second, making the Spark and Halo perform similarly in text generation despite the Spark's compute advantage.


