Nvidia DGX Spark 与 AMD Strix Halo:128GB 本地 AI 对决

到 2025 年底,本地运行海量参数模型的准入门槛已经发生变化。我们不再只是关注游戏显卡上的 VRAM 容量;我们关注的是将数据中心规格带到桌面的统一内存架构。市场终于为我们提供了两条不同的路径,无需工业集群的五位数价格标签即可获得 128GB 高速内存:这款 Nvidia DGX Spark 和这款 AMD Strix Halo。
在它们之间做选择并非出于品牌忠诚度,而是要理解两种根本不同的理念。其中一种是专门设计的设备,旨在将 Grace Blackwell 架构装入一个 1 升的盒子。另一种则是一款蛮力型 APU,模糊了高端桌面设备与一台 AI 工作站之间的界限。
本分析将剖析两者的实际实用性,首先从早期采用者正在面临的直接摩擦点开始。
关键用户体验:解决 Nvidia DGX Spark 和 AMD Strix Halo 的怪癖

在考察原始吞吐量之前,你需要知道实际使用这些机器是什么体验。两台设备都有特异行为,如果不知道如何处理,可能会毁掉使用体验。
解决 Nvidia DGX Spark 加载缓慢的问题(mmap 修复)
如果你拆开一台 Nvidia DGX Spark,安装好环境,然后尝试通过 llama.cpp 加载 gpt-oss-120b 这样的模型,你可能会认为这台设备有缺陷。初始加载时间可能拖到超过一分钟半(约 100 秒)。对于一台由 GB10 Grace Blackwell 超级芯片驱动的设备而言,这感觉很迟缓。
社区已经找到了罪魁祸首:内存映射(mmap)。许多推理引擎的默认行为与 Spark 处理其统一内存池的方式发生冲突。
解决方案: 你必须在 llama.cpp 的启动参数中禁用 mmap。
关闭这个标志后,用户报告加载时间从 100 秒降至约 22 秒。这项简单调整使 Spark 与竞争对手持平,甚至更快。此外,禁用 mmap 似乎还能改善提示词处理速度和令牌生成稳定性。如果你拥有这台设备,这不是可选项;而是一个强制性的配置步骤。
AMD Strix Halo 优化与硬件限制
这款 AMD Strix Halo(具体为 Ryzen AI Max+ 395 变体)为习惯 Windows 或标准 Linux 发行版的用户提供了更顺畅的软件上手体验,但它也有自身的物理和软件注意事项。
在软件方面,尽管 ROCm 已经成熟,推理的标准后端仍可能无法充分发挥性能。对于 llama.cpp 中的纯推理任务,切换到 Vulkan 后端 相比 Strix Halo 架构上的默认配置,已显示出可衡量的增益。
硬件维护方面,AMD Strix Halo 相较于其绿队对手表现出色。像 HP Z2 Mini G1a 这样的设备具有免工具进入机制。你可以滑开机箱,并在数秒内更换标准 2280 NVMe 硬盘。
与之形成对比的是 Nvidia DGX Spark。 Spark 的工业设计简约得令人沮丧。它没有电源 LED,甚至没有网络端口活动指示灯。你往往得 ping 一下设备才能知道它是否已开机。更糟的是,内部存储插槽使用 M.2 2242 规格——比无处不在的 2280 更短、更罕见的标准。要找到 2242 尺寸的高性能 4TB 或 8TB SSD 很困难且昂贵。如果你计划在 Spark 上存储海量数据集,请准备依赖外部网络存储,或寻找罕见硬盘。
性能深度解析:Nvidia DGX Spark 的能力

这款 Nvidia DGX Spark 本质上是一个“盒中 AI 实验室”。它的价格更高,约为 3,999 美元,但这笔成本包含了你在其他地方找不到的特定能力。
Nvidia DGX Spark 图像生成与 INT4 性能
虽然两台机器都能胜任处理大语言模型(LLM),但 Nvidia DGX Spark 在图像生成方面碾压竞争对手。 在运行 FLUX.1 Dev(BF16)的测试中,Spark 达到约 120 TFLOPS。
换个角度看,Spark 生成图像的速度约为 AMD Strix Halo 的 2.5 倍,后者在类似工作负载中约为 46 TFLOPS。如果你的工作流涉及大量使用扩散模型,Spark 立刻就能证明其溢价的合理性。
该架构还支持原生 NVFP4(4 位浮点)。Spark 的 INT4 理论吞吐量非常巨大——112 TOPS——几乎是 Halo 的 9 倍。然而,目前这仍是一种“潜力”,而不是“现实”。企业级 Nvidia 工具之外的软件生态系统尚未完全跟上,无法在面向消费者的加载器中有效利用这种精度。你购买 Spark,是为了它今天借助 CUDA 13 能做到的事,同时也在押注未来的软件将释放那部分 INT4 余量。
另一个突出的特点是网络功能。Spark 配备了一张 ConnectX-7 200GbE 网卡。对于单个用户而言,这有些过剩。但对于希望将三到四台设备集群起来运行 400B 参数模型的小型实验室而言,这种互连极其宝贵。
全能王:AMD Strix Halo 分析
这款 AMD Strix Halo 的价格明显更低,在 2,300 至 2,500 美元之间。它并不试图成为一个服务器节点;它试图成为终极工作站。
AMD Strix Halo CPU 性能与日常可用性
这款 AMD Strix Halo 配备了 16 个 Zen 5 CPU 核心。在通用计算任务、编译和数据预处理方面,它显著优于 Spark 中的 ARM 核心。
在 Linpack 等高性能计算基准测试中,Strix Halo 的双精度性能达到 1.6 TFLOPS,是 Spark 708 GFLOPS 的两倍多。如果你的 AI 工作流涉及繁重的 CPU 端预处理,或者你只是需要让这台机器兼作强大的 Linux 开发桌面设备,Strix Halo 是合乎逻辑的选择。
谈到 LLM 令牌生成时,这场较量出人意料地接近。由于 LLM 推理通常受内存带宽而非纯计算能力限制,Halo 上的 128GB LPDDR5X-8000(约 256 GB/s)能够与 Spark(约 273 GB/s)并驾齐驱。在许多文本生成场景中,差异微乎其微。
Strix Halo 代表了一条无缝迁移路径。由于它使用与数据中心相同的 ROCm 和 HIP 软件栈,在这里开发的代码很容易扩展,但机器本身感觉就像一台标准的高功率 PC。
为什么 RTX 5090 不适合这场讨论

不可避免地会出现这样的问题:“为什么不直接买 RTX 5090?”
标准 RTX 5090 是原始计算能力的猛兽,远远超过 两者中的 Nvidia DGX Spark 和 AMD Strix Halo,按每美元 FLOPS 计算。 不过,它遇到了一道硬性限制:32GB 显存。
在本地 LLM 的世界里,内存就是氧气。你根本无法将一个高精度的 700 亿参数模型,或一个以合理量化运行的 1200 亿参数模型,加载到 32GB 显存中。5090 对小型模型更快,但面对大型模型则完全无能为力。
有传言称,工程实验室中存在“128GB RTX 5090”显卡的原型,一些价格高得离谱,超过 13,000 美元。这些并不是消费级产品。对于如今需要 128GB 内存的用户而言,GPU 路线需要多张显卡以及复杂的 PCIe 通道管理。Spark 和 Halo 则在单个连贯的内存块中提供了这一容量。
最终结论:选择你的 128GB 工作站

选择 Nvidia DGX Spark,如果:
你需要一台用于 NVFP4 研究或企业 CUDA 验证的专用设备。
你的工作流高度依赖图像生成(Flux、Stable Diffusion)。
你计划通过 200GbE 连接将多个设备组成集群。
你适应“无头服务器”体验和 Linux 管理。
选择 AMD Strix Halo,如果:
你希望获得最佳性价比(价格接近 Spark 的一半)。
你需要一台多功能的日常主力机,既能编译代码,也能生成文本。
你优先考虑便捷的硬件升级(标准 SSD)。
你的主要重点是 LLM 文本推理,而在这方面它的实用性与 Spark 相当。
两台机器都证明,2025 年是 128GB 本地 AI 变得触手可及的一年。无论你选择绿队的精致设备,还是红队的强大 APU,内存捉襟见肘的日子已经结束。
常见问题
问:我可以在 Nvidia DGX Spark 上玩游戏吗?
答:不可以,Spark 是一台严格意义上的 AI 专用设备。 它缺少 DisplayPort 等显示输出接口(仅有 HDMI),而基于 ARM 的架构加上数据中心 GPU 驱动程序,使其不适合标准 PC 游戏。
问:Nvidia DGX Spark 中的 SSD 可以升级吗?
答:可以,但很困难。你必须从底部拆解设备,并找到一块 M.2 2242 规格的 SSD;这种规格较为罕见,且通常比大多数 PC 使用的标准 2280 硬盘更贵。
问:AMD Strix Halo 支持 Windows 吗?
答:支持,Strix Halo 基于 x86,并原生支持 Windows 11。 但是,为了获得最高的 AI 性能并访问完整的 ROCm 堆栈,通常建议使用 Linux 环境。
问:Nvidia DGX Spark 在负载下有多吵?
答:风扇噪声听得见,并且由于其紧凑的 1 升体积,金属机箱可能会变得相当烫。尽管它比一些高 RPM 迷你 PC 更安静,但它并不静音;如果你对噪声敏感,最好将其放在远离直接工作区的位置。
问:这些设备运行 LLM 的主要瓶颈是什么?
答:内存带宽是主要瓶颈。尽管拥有 128GB 容量,但数据从内存移动到计算核心的速度(带宽)限制了每秒生成的 token 数量,因此尽管 Spark 具有计算优势,Spark 和 Halo 在文本生成方面的表现仍然相似。



