NVIDIA DGX Spark 64GB 发布,而 128GB 型号迎来大幅涨价
NVIDIA 宣布推出 NVIDIA DGX Spark 64GB,而原有的 128GB 系统价格将上调近 50%。
新配置保留了 GB10 Grace Blackwell 处理器、NVIDIA 软件栈和高速网络连接。不过,其统一内存减半,本地存储容量据报也有所降低。
这一取舍改变了 NVIDIA 桌面 AI 系统的意义。DGX Spark 最初承诺在紧凑机身中提供不同寻常的大容量统一内存。新的入门型号让这一核心资源变得更为稀缺,同时定价高于原始 128GB 型号的上市价格。
NVIDIA 表示,64GB 系统将于 10 月 23 日通过 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 上市。该公司不会销售 NVIDIA 品牌的 64GB Founders Edition。
64GB 发布详情强调私有推理、持久运行的 AI Agent,以及更便捷地构建双节点集群。这些用途确实合理,但容量限制将决定哪些模型和工作流仍具实际可行性。
NVIDIA DGX Spark 的价格上涨构成了核心矛盾。买家要么接受更少的内存,要么为 128GB 支付显著更高的价格,或者根据 AMD 和 Apple 芯片评估竞争系统。
NVIDIA DGX Spark 64GB 保留 GB10,但内存减半
新系统保留了 NVIDIA 的计算平台,但削减了使 DGX Spark 尤其有价值的核心资源。
DGX Spark 在 GB10 Grace Blackwell Superchip 中结合了 Blackwell 代 GPU 和 20 核 Arm CPU。MediaTek 与 NVIDIA 合作参与了该处理器的设计。
CPU 和 GPU 共享同一个一致的内存池。一致性统一内存让两个处理器能够访问相同的数据,无需维持独立的系统内存和图形内存分配。
这种安排对本地人工智能至关重要。大型模型的权重、运行时状态、提示词和生成数据都必须容纳在可用内存中。
传统桌面 GPU 的专用内存通常远小于 DGX Spark。开发者可以增加系统 RAM,但独立 GPU 无法像使用本地显存那样高效地利用它。
原始 128GB 机器提供了不同的平衡。NVIDIA 表示,它可对最多包含 2000 亿参数的模型进行推理,并可微调最多 700 亿参数的模型。
这些是厂商给出的上限,并不保证适用于每个模型。精度、量化、上下文长度、缓存需求和框架开销都会改变实际内存消耗。
NVIDIA DGX Spark 64GB 将 NVIDIA 所述的单系统模型上限降至 1000 亿参数。这仍相当可观,特别是在模型使用压缩权重时。
不过,能装下模型不等于能舒适地运行它。工作负载还需要为键值缓存留出空间,该缓存用于存储推理期间生成的注意力数据。
更长的提示词会消耗更多缓存。多个用户或 Agent 会进一步增加需求。勉强能够加载的模型,可能会留下过少的余量,难以开展有效工作。
NVIDIA 并未随着容量一同削减内存带宽。报道称,64GB 系统仍保留每秒 273GB 的带宽。
这表明制造商可能采用了更低密度的 LPDDR5X 封装,同时没有缩减内存接口。因此,当工作负载能够装入内存时,该设计应可避免明显的带宽损失。
新机器还保留了 DGX OS、CUDA 库、PyTorch 支持、NVIDIA 的 Agent 工具以及流行的推理运行时。支持的选项包括 Ollama、llama.cpp、vLLM 和 LM Studio。
ConnectX-7 网络仍是该平台的一部分。其 200Gbps 连接可让两套系统以远高于普通消费级以太网的速度交换数据。
因此,64GB 版本并非以相同名称销售的低速处理器。它是现有平台的容量受限版本。
这一差异更适合反复运行紧凑模型的开发者。对于特意选择 DGX Spark 以规避内存限制的买家而言,它的吸引力则较低。
据报,存储容量也会随系统内存一同下降。NVIDIA 的公开公告重点聚焦内存和集群,而非提供完整的、按合作伙伴区分的存储规格。
买家应在订购前核实各制造商的具体配置。仅通过合作伙伴发布意味着存储、端口、支持和保修条款可能因系统而异。
NVIDIA 首次发布 DGX Spark时,将这台机器定位为个人 AI 超级计算机。64GB 版本将这一承诺收窄至更具针对性的本地工作负载。
这仍然有用。只是它与在一张办公桌上部署超大规模模型开发环境,是截然不同的价值主张。
NVIDIA DGX Spark 的价格上涨重写了价值逻辑
低容量型号之所以存在,是因为原始系统已经远离其最初的市场定位。
DGX Spark 最初名为 Project Digits,是一套在 CES 2025 上公布的紧凑型桌面系统。早期定位显示,其入门门槛可能低于该机器最终的定价。
128GB Founders Edition 后来以更高价格上市。NVIDIA 在 2026 年再次上调该价格,理由是 LPDDR5X 内存和 NAND 闪存供应受限。
据报道,最新调整使 128GB 型号相较此前标价上涨近半。与最初上市水平相比,其价格已高出近四分之三。
实际成交价格可能会因卖家和供货情况而异。不过,NVIDIA 产品线和多套合作伙伴系统的整体走向已十分明确。
根据最初的价格报道,新的 64GB 配置如今充当进入 GB10 平台成本更低的入口。
这里所谓“成本更低”是相对而言。报道称,缩减版的价格比 128GB Founders Edition 上市时高出四分之一。
这一比较揭示了逆转。买家并非是在稳定产品价格体系下获得常规的低内存折扣。
相反,他们以高于去年满容量型号的入门成本,获得了一半的内存。128GB 选项已进入另一档支出类别。
NVIDIA 将 64GB 版本定位为更容易入手的起点。这一说法仅在当前 GB10 市场中成立,而不适用于该产品的完整历史。
该公司对供应端给出了合理解释。LPDDR5X 封装被焊接在这些紧凑系统中,高容量配置需要大量高密度组件。
NAND 存储同样会影响成本。与传统工作站不同,DGX Spark 不允许买家在购买后安装更便宜的内存模块。
组件价格并不能完全解释每一次零售价格波动。制造商利润率、库存时点、需求和渠道供应情况也会影响标价。
NVIDIA 尚未公开提供任一容量版本的物料清单明细。因此,买家无法分辨涨价中有多少直接来自内存成本。
不过,内存供应商确实描述了一个紧张的市场。Micron 曾警告,需求将在 2027 年和 2028 年持续超过供应。
这一前景很重要,因为 AI 基础设施正在多个内存类别中争夺制造产能。供应商自然会优先服务回报更高的产品和客户。
紧凑型 AI 系统处于一个不太舒适的位置。它们需要足够多的内存来区别于普通 PC,却没有数据中心级别的采购规模。
因此,NVIDIA DGX Spark 的价格上涨不只是一次临时促销的结束。它反映了对定义该产品的关键组件所施加的压力。
这种压力也改变了采购计算方式。考虑购买多台 Spark 的团队,如今必须将其与工作站、租用加速器和集中式推理服务器进行比较。
对于持续性工作负载而言,云计算依然昂贵。但它避免了在模型或需求即将增长前购买固定容量系统的风险。
本地硬件提供隐私、可预测的可用性和直接控制。其财务优势取决于利用率、模型适配度、能源成本、支持服务以及买家的开发计划。
闲置的工作站经济性很差。一台全天候运行内部编程或研究 Agent 的 Spark,则更具说服力。
新的价格结构使工作负载定义变得不可或缺。买家不能再主要因为该系统以激进的上市价格提供异常庞大的内存池而为其辩护。
DGX Spark 64GB 与 128GB,本质上是工作负载的选择
正确的容量取决于上下文长度、并发性、微调需求和模型选择,而非仅仅取决于参数数量。
NVIDIA 认为,较小的开放模型已经足够强大,能够完成有价值的本地工作。该公司指出了参数规模在 260 亿至 350 亿之间的模型。
这些模型可以支持编程、文档分析、研究辅助和其他 Agent 任务。量化可通过以更低精度存储权重,进一步降低其内存占用。
该公司表示,一台 64GB Spark 可支持最多 1000 亿参数的模型。该数字描述的是在特定条件下的上限。
较小的模型通常能带来更好的实际使用体验。它可以为长提示词、并发请求、工具、嵌入和操作系统进程留出内存。
设想一名持续运行编程 Agent 的开发者。系统必须在索引代码库、处理文档并保留不断扩展的对话时,持续容纳模型。
配合合适的模型,64GB 内存池能够处理这类工作流。但当开发者增加上下文长度或启动多个 Agent 时,它便会变得受限。
文档分析也会带来类似压力。研究 Agent 可能需要处理报告、笔记和源文件中的数千个 token。
模型权重只是内存分配的一部分。推理引擎、缓存、文档处理工具和应用服务都在争夺内存。
图像生成和多模态工作负载又增加了一层复杂性。模型可能结合文本编码器、图像解码器、视觉组件和临时张量。
微调的需求更高。训练或适配模型需要为参数、梯度、优化器状态和中间激活值提供内存。
低秩适配等技术可以减轻这一负担。尤其当团队需要更大模型、更长序列或更大批次时,它们并不能完全消除这一负担。
这就是为什么 DGX Spark 64GB 与 128GB 的选择不能依赖 NVIDIA 的最大模型标签。买家需要从其计划使用的软件中取得测量结果。
128GB 配置为试验提供了更多空间。它可容纳更大的模型、更宽的上下文窗口和并发工作负载,而无需立即构建集群。
更大容量也能减少运维摩擦。开发者可减少调整量化级别、卸载服务或在多台机器之间拆分工作的时间。
64GB 系统更适合受控环境。它适合采用已知模型、且理解该模型运行时内存占用的团队。
仅推理部署尤其适合。团队一旦选定并测试模型,便可围绕可预测的流量优化服务栈。
微调团队面临更艰难的选择。他们应将 64GB 视为需要验证的限制,而非原始 Spark 的通用替代品。
NVIDIA 的应用示例包括编程智能体、研究智能体、图像生成和远程模型服务。这些属于类别,而非标准化工作负载。
读取小型代码库的编程智能体,与分析数百万行代码的智能体并不相同。面向单个用户的研究助手,也不同于供整个部门共享的服务。
真正有意义的问题并不是 64GB 能否运行本地 AI。它显然可以。
问题在于,完整的目标工作负载能否在保留足够增长余量的情况下运行。这需要用实际模型和数据进行测试才能回答。
团队应记录峰值内存使用量、提示词处理速度、生成速度,以及在并发请求下的表现。还应测试最长的真实使用上下文。
软件兼容性强化了 NVIDIA 的优势。CUDA 仍是许多 AI 库的首选平台,开发者也经常优先为 NVIDIA 优化新工具。
这一优势可以弥补较小的内存或较高的采购成本。当竞争系统需要不受支持的内核或手动修复时,它尤为重要。
不过,CUDA 兼容性无法凭空创造缺失的容量。一旦工作负载超过物理内存,买家就必须使用更小的模型、分配工作负载,或选择其他系统。
NVIDIA 将两台较小系统变为其升级路径
集群可提供更多算力和汇聚内存,但无法以更低成本复现一台 128GB 机器。
每台 DGX Spark 都配备 ConnectX-7 网络接口。两台系统可通过 QSFP 线缆直接连接,组成高速集群。
NVIDIA Sync Cluster Assistant 可检测设备、验证其配置,并准备 ConnectX-7 连接。这减少了多项手动网络配置步骤。
即将推出的 Model Launcher 将简化在一或两个节点上部署受支持模型的流程。NVIDIA 表示,Qwen3.8 27B 将是首批选项之一。
这项软件工作解决了一个真实弱点。此前,分布式本地推理需要通过命令行配置,并修改 vLLM 或 TensorRT-LLM 的启动设置。
NVIDIA 表示,两台 64GB 系统可汇聚内存,以支持最高包含 2,000 亿参数的模型。它们还可提供两倍的聚合内存带宽。
在 NVIDIA 对 Qwen3.8 27B 的测试中,双节点集群的性能最高可达单台 64GB 系统的 1.7 倍。
这一结果由厂商生成,尚未获得广泛的独立验证。不应将其解读为普遍适用的扩展比例。
分布式性能取决于工作负载需要在节点间传输数据的频率。即使互连速度很快,网络传输也会增加延迟。
有些模型可以顺畅地分布到两颗处理器上。其他模型则会因同步、通信或软件开销损失更多性能。
集群还会使算力、存储、网络硬件和实体系统数量翻倍。它并不只是把两组内存合并的方法。
这使该设计对吞吐量很有价值。团队可以处理更多请求、运行多个智能体,或将不同任务分配给各个设备。
不过,购买两台 64GB 系统的成本远高于购买一台采用新定价的 128GB 系统。集群提供了额外算力,但并非以更低成本获得相同容量的途径。
当需求逐步增长时,这一升级方案最具吸引力。开发者可以先从一个节点开始,确认需求后再增加一个,而无需替换原有机器。
如果工作负载已经需要超过 64GB 的内存,其吸引力就较弱。此类买家必须接受即时的复杂性和更高总支出,才能避免购买满容量型号。
功耗和管理负担也会随节点数量增长。团队必须监控两个操作系统、两个存储设备、网络健康状况,以及分布式软件行为。
NVIDIA Sync 可减少部署工作,但无法消除单台计算机与集群之间的运维差异。
该公司表示,应用可通过普通笔记本电脑和台式机访问集群中的模型。这为团队创造了一台小型共享推理设备。
一个节点可托管私有编程模型,员工则可通过浏览器或熟悉的开发工具使用它。敏感数据可以保留在组织网络内部。
这一场景表明,DGX Spark 并不只是高端迷你 PC。NVIDIA 正在将数据中心软件、网络和部署模式打包,为较小型环境提供服务。
这种做法也保护了 NVIDIA 的平台战略。客户增加第二台 Spark 后,将更加依赖 DGX OS、CUDA、ConnectX 和 NVIDIA 的管理工具。
因此,NVIDIA DGX Spark 64GB 既是一款产品,也是一个扩展单元。其长期价值取决于集群在精心策划的演示之外表现如何。
独立测试应衡量两台机器上的首个 token 延迟、持续生成性能、并发用户数、功耗和故障恢复能力。
在这些测试结果出现之前,NVIDIA 的 1.7 倍结果更适合作为上限,而非每种模型都能达到的预期结果。
AMD 和 Apple 对 NVIDIA 的内存取舍施加压力
NVIDIA 凭借 CUDA 集成和 AI 网络领先,而竞争对手可以提供更多内存或更广泛的桌面灵活性。
AMD 通过 Ryzen AI Halo 系统扩大了对紧凑型本地 AI 的应对。这些机器采用统一内存和集成 Radeon 图形。
AMD 在 2026 年发布的一款开发者系统配备了 128GB LPDDR5X 内存,并支持 Linux 或 Windows。其初始定位以低于 NVIDIA 前代 Spark 价格的方式切入市场。
AMD 系统对比说明了这种选择。AMD 提供熟悉的 PC 灵活性,而 NVIDIA 提供更成熟的 AI 软件环境。
多家厂商推出的 Ryzen AI Max 系统也面向本地模型用户。其中一些提供 128GB 配置、标准 PC 功能和可更换存储。
容量更高的 AMD 平台进一步扩大了这种竞争。它们可优先提供大容量内存池,面向愿意在一定程度上牺牲 AI 性能或软件便利性的用户。
仅靠内存容量并不能决定比较结果。评测通常发现,GB10 在基于 GPU 的 AI 工作中比同期集成 Radeon 方案更快。
CUDA 仍是另一项优势。许多框架、模型包和优化项目都会在等效 AMD 路径成熟之前先发布 NVIDIA 支持。
需要某个依赖 CUDA 的特定库的开发者,可能没有实际可行的替代方案。如果所需软件无法正确运行,节省硬件成本的价值就很有限。
对另一类用户而言,AMD 的 Windows 支持可能同样重要。创意工作者和开发者可能希望使用本地 AI,但不想维护专用 Linux 设备。
Apple 提供了第三条路径。Mac Studio 系统结合了高内存容量、高效处理器和成熟的桌面操作系统。
Apple 的统一内存使大型模型能够加载,而无需受独立 GPU 常见显存上限的限制。MLX 等工具直接面向 Apple silicon。
不过,软件可用性和模型性能存在差异。以 CUDA 为中心的工作流不会自动迁移到 Apple 的 Metal 或 MLX 环境。
Mac 系统也没有 DGX Spark 内置的 ConnectX-7 网络架构。它们并非围绕 NVIDIA 的直接双节点本地推理路径设计。
因此,竞争决策涉及多个维度。
内存容量
NVIDIA 64GB 系统:更适合明确的模型和可控的推理工作负载。
NVIDIA 128GB 系统:余量更大,但最新的价格调整削弱了其原有价值。
AMD 和 Apple 系统:部分配置可提供更大的内存池,但性能和软件取舍不同。
软件兼容性
NVIDIA:广泛的 CUDA 支持和预配置的 AI 软件栈。
AMD:不断改进的 ROCm 支持,以及传统的 Windows 和 Linux 选项。
Apple:强大的原生应用和 MLX 工具链,但 CUDA 兼容性有限。
扩展策略
NVIDIA:通过辅助配置实现直接 ConnectX-7 集群。
AMD:更传统的工作站和网络部署选择。
Apple:具备较高的单机容量,但没有等效的 Spark 集群设计。
通用计算
NVIDIA:DGX OS 将系统聚焦于 AI 开发和推理。
AMD:功能上更接近标准高端 PC。
Apple:将本地 AI 与成熟的创意和生产力平台相结合。
因此,DGX Spark 64GB 与 128GB 的决策必须纳入替代方案。买家不应将 GB10 视为运行私有本地模型的唯一途径。
NVIDIA 最强的防御在于集成。它在一个受支持的设计中结合了芯片、CUDA、优化运行时、网络和系统管理。
其弱点在于内存的价值。如果买家主要需要容量,竞争对手无需匹配每一项 GB10 性能结果,也能向 NVIDIA 发起挑战。
最新定价扩大了这一机会。若替代方案能在一台机器上容纳所需模型,买家可能愿意接受更慢的推理速度。
反过来,通过 CUDA 更快运行的较小模型,在日常使用中可能优于较大但运行较慢的部署。应由真实工作负载决定胜负。
买家应关注 64GB 发布后的哪些信号
三项信号将表明较小的 Spark 会成为实用平台,还是对内存稀缺作出的昂贵回应。
第一个信号是 10 月 23 日及之后的合作伙伴供货情况。NVIDIA 已点名六家制造商,但它们的具体配置和出货量将十分重要。
如果名义上的起始配置始终无法获得,其价值就很有限。买家应追踪实际交付的系统,而不是公告页面或积压订单列表。
合作伙伴规格也需要仔细比较。存储容量、端口选择、区域可用性、保修服务和捆绑软件都会改变实际价值。
如果多家制造商能维持可靠库存,64GB 的发布将强化 NVIDIA 关于其打造了可用入门点的主张。
如果库存仍然稀缺,该产品看起来将更像定价参考,而不是广泛可获得的开发机器。
第二个信号是独立工作负载测试。评测应比较一台 64GB Spark、一台 128GB Spark,以及一个双节点 64GB 集群。
仅测试模型加载并不够。测试需要涵盖长上下文、同时用户、智能体工具调用、微调工作负载和持续运行。
最重要的测量指标包括可用内存、首个 token 的时间、输出速度、能耗和集群扩展效率。
NVIDIA 的最大参数量声明应受到特别审视。一个从技术上可容纳的模型,仍可能带来不切实际的使用体验。
独立测试也能揭示,未变的带宽是否保留了大部分单节点性能。受容量限制的工作负载应与受带宽限制的工作负载呈现不同表现。
如果较小机器能以可预测的方式运行热门的 270 亿至 350 亿参数模型,NVIDIA 的定位将得到支持。
如果普通上下文或并发智能体就会耗尽内存,64GB 版本的受众将远比其营销所暗示的更狭窄。
第三个信号是竞争反应。AMD 系统制造商和 Apple 可通过内存容量、软件支持或更低的总拥有成本向 NVIDIA 施压。
AMD 有空间改进 ROCm 兼容性,并推广基于 Windows 的本地 AI。模型运行器提供更好的支持,将削弱 CUDA 的实际锁定效应。
Apple 可以强调大容量统一内存配置和高效本地推理。其机会在已使用 macOS 的开发者群体中最为突出。
NVIDIA 可以通过更好的软件而非再次调整硬件来回应。Sync Cluster Assistant 和 Model Launcher 就是这一战略的早期例子。
持续关注有多少型号会获得一键部署配置。同时也要观察开发者能否在无需回到复杂手动配置的前提下,自定义这些配置。
内存市场仍是外部变量。若供应短缺持续,高价将逐渐常态化,并促使制造商倾向于推出更小的配置。
供应改善将检验近期涨价是否只是暂时现象,也可能重新迫使 NVIDIA 在入门级产品中提供更多内存。
对企业买家而言,眼下的行动很明确:先界定工作负载,再选择机器。
测试计划使用的模型、上下文长度、用户数量和微调方式。比较时还应纳入框架兼容性与运营成本。
NVIDIA DGX Spark 64GB 采用相同的 GB10 基础平台,但内存上限更低。它可适用于目标明确的推理和智能体部署。
不应将其视为原版 128GB 系统的通用替代品。128GB 型号仍更灵活,但其更高的价格需要以更充分的利用率来支撑。
你的工作负载会更受益于 CUDA 性能和 NVIDIA 的托管技术栈,还是单台系统所能提供的最大内存池?在决定购买任一 Spark 配置之前,先完成这项测试。



