top of page

退役 Nvidia Tesla V100 将游戏 PC 变成高速本地 AI 主机

一块来自 2017 年的 Nvidia 硬件刚刚交出令人意外的成绩:运行一个 270 亿参数的本地语言模型时,每秒可生成 32 个 token。Nvidia Tom 的报道介绍了一台游戏 PC:一块 Tesla V100 服务器加速卡与 RTX 4080 并排安装其中。

这项实验提供了合计 32GB 的显存,足以让一个量化 27B 模型和较长的上下文窗口都留在 GPU 上。这一结果挑战了本地 AI 硬件的一项核心假设:最实用的加速器不一定总是最新的。

不过,这套方案并非面向消费者的便捷捷径。它结合了两种不同的 GPU 架构、一个非官方适配器、Linux 配置、自定义散热改造,以及日益收窄的软件支持窗口。其原装风扇的噪声还曾达到 82 分贝,堪比嘈杂的户外设备。

因此,真正的较量并不是旧 Nvidia 硬件与某一款新 GPU 之间的对比,而是廉价且充裕的内存容量,与现代消费级硬件的兼容性和便利性之间的取舍。

Tesla V100 方案实际实现了什么

这一结果之所以重要,是因为它将退役的数据中心硬件变成了真正可用的本地推理系统。

开发者 Oscar Molnar 最初使用的是一张配备 16GB VRAM 的 RTX 4080。这样的容量足以应对许多游戏和较小的语言模型,但会限制哪些更大的模型能够完全驻留在 GPU 上。

将模型的一部分移入系统内存是可行的,但 CPU 卸载通常会降低生成速度。更大的上下文窗口也会通过键值缓存占用内存,该缓存会保存先前 token 的注意力数据。

Molnar 加装了一块另有 16GB HBM2 内存的 Tesla V100 SXM2。SXM2 是一种面向服务器的模块形态,它安装在专用主板上,而不是插入普通桌面 PC 的 PCIe 插槽。

一个非官方 SXM2 转 PCIe 适配器提供了物理和电气连接。完成后的机器在 RTX 4080 和 V100 之间提供了总计 32GB VRAM,尽管这些内存并未构成一个统一的内存池。

根据 Molnar 详细的 V100 构建日志,llama.cpp 将模型分配到两块加速器之间。软件把部分工作负载放在每块 GPU 上,并在推理期间通过 PCIe 传输数据。

这台机器运行的是采用 Q5_K_M 量化的 Qwen3.6-27B-MTP。量化会将模型权重压缩为较低精度的表示,在尽量保留有用输出质量的同时降低内存需求。

生成的模型文件约占用 19GB。Molnar 配置了 128,000-token 的上下文窗口,将全部 99 个模型层卸载到 GPU,并在两块 GPU 之间平均分配工作负载。

他报告的生成速度约为每秒 32 个 token。提示词处理速度约为每秒 133 至 160 个 token。

这些测量数据来自一位爱好者的单台系统,并非独立实验室基准测试。性能取决于模型、量化方式、提示词、软件版本、上下文长度和 GPU 分配方法。

即使考虑到这些限定条件,每秒 32 个 token 也足以满足交互式写作和编程会话的响应需求。许多用户阅读生成文本的速度远低于机器的输出速度。

这一结果尤其值得注意,因为两块 GPU 原本都不是为彼此协同工作而设计的。一块使用 Nvidia 2022 年的 Ada Lovelace 架构,另一块则使用 2017 年的 Volta 架构。

这并不等同于拥有一张配备 32GB VRAM 的单卡。跨 GPU 通信会引入延迟,而且每块加速器只能访问本地分配的数据,除非通过系统互连传输信息。

尽管如此,这项实验跨过了许多本地 AI 用户最看重的门槛:一款能力足够强的 27B 模型能够完全装入汇总后的 GPU 内存中,并且无需在每个 token 后经历不切实际的停顿。

这使 Nvidia Tom 的报道不只是一则关于特殊硬件的奇闻。它展示了软件如何从已被数据中心淘汰的加速器中提取实用的推理能力。

为什么旧 Nvidia 显存对本地 LLM 仍然重要

本地语言模型推理通常更看重内存容量和带宽,而非最新的游戏功能。

每个语言模型在生成文本时都必须将其权重存放在某处。如果权重能装入 VRAM,GPU 就能反复读取它们,而无需严重依赖速度较慢的系统内存。

一个 270 亿参数的模型若采用完整 16 位精度,需要的内存远超任一张显卡所能提供。量化通过以更少位数存储每个权重来降低这一需求。

这一过程带来取舍。更激进的量化可以节省内存,但可能影响输出质量或兼容性。较不激进的格式会保留更多模型信息,但需要额外的 VRAM。

V100 仍具相关性,是因为 Nvidia 为其配备了 HBM2,即第二代高带宽内存。Nvidia 官方的 V100 规格列出了每秒 900GB 的内存带宽。

对于一块退役加速器而言,这一数字仍相当可观。每生成一个 token,通常都需要频繁通过内存读取模型权重,因此带宽是单用户推理的重要限制因素。

V100 还拥有 5,120 个 CUDA 核心和 640 个第一代 Tensor Core。Tensor Core 可加速神经网络常用的矩阵运算,不过 Volta 支持的现代数值格式少于更新的架构。

它的原始用途同时解释了其优势与问题。Nvidia 将这款加速器用于 AI 训练、科学计算和高密度服务器部署,而不是游戏桌面 PC。

SXM2 型号支持最高 300 瓦的功耗范围,设计上依赖强劲的机箱风道。它没有显示输出、熟悉的桌面散热器,也没有标准 PCIe 金手指连接器。

但这些缺失的消费级特性,也解释了为什么退役设备会吸引实验者。如果主机处理器或另一块 GPU 负责桌面显示,本地推理服务器并不需要显示输出。

即使周边平台逐渐过时,其内存依然有用。数据中心更换加速器是出于效率、密度、支持和运维一致性的考虑,而不是因为每一颗旧芯片突然失去计算能力。

本地用户会以不同方式评估同样的硬件。只要机器能够私密运行目标模型,爱好者就可以接受手动配置、更低密度和较旧的软件环境。

这创造了一个二级市场:企业级淘汰并不等于技术上毫无用处。服务器所有者看到的是维护负担,而实验者看到的是内存带宽和 CUDA 兼容性。

这种分歧对消费级 GPU 的产品定位形成压力。许多新游戏显卡提供出色的图形性能,但其内存容量低于本地 AI 用户运行更大模型所希望拥有的水平。

现代显卡依然具备多项优势。它提供最新驱动、更高效率、更新的精度格式、视频引擎、显示输出、更安静的散热方案以及受支持的物理设计。

然而,这些特性无法加载超过显卡可用内存的模型。对于某些本地推理工作负载,容量是一道硬性门槛,而非性能偏好。

V100 实验揭示了这种错位。对 AI 感兴趣的消费者可能会以不同于游戏玩家的方式看待 VRAM,但两类用户通常都在同一产品系列中选购。

Apple 的统一内存系统和较新的工作站加速器为更大的内存池提供了替代路径。AMD 显卡也能提供有竞争力的容量,不过软件兼容性会因型号和推理引擎而异。

二手 V100 并不会在所有指标上胜过这些方案。它只是表明,本地 AI 为主流桌面产品未能持续满足的配置创造了市场。

Nvidia Tom 的结果与其说取决于芯片,不如说取决于软件

该硬件之所以能够运行,是因为 llama.cpp 可以将量化模型分配到不匹配的 GPU 上,而无需传统服务器平台。

llama.cpp 是一个开源推理引擎,旨在让语言模型能够在 CPU 和多种 GPU 后端上高效运行。它支持 GGUF,这是一种为可移植本地推理构建的模型文件格式。

该项目的 多 GPU 文档区分了层拆分和张量拆分。这两种方法以不同方式将工作分配到多个设备上。

层拆分会将连续的模型层分配给各个 GPU。每个 token 依次穿过这些层,与更细粒度的张量并行相比,可减少跨设备通信量。

张量拆分则会在层内部划分运算。当互连速度足够快时,它可以改善生成延迟,但需要参与的 GPU 之间进行更多通信。

Molnar 使用了张量拆分设置,以均匀分配模型。他的两张显卡通过桌面平台通信,而不是采用 V100 原生的服务器级 NVLink 连接方案。

这一差异很重要,因为汇总 VRAM 并不会自动变得可用。软件必须知道如何放置模型权重、缓存和中间值,同时不超出任一设备的容量。

两块 GPU 的性能特征也不同。RTX 4080 更新得多,而 V100 则提供较旧的计算单元和高带宽内存。

不均衡的组合可能使更快的显卡等待较慢的显卡。因此,所选拆分比例可能需要根据模型架构、内存使用情况和实测吞吐量进行调优。

Molnar 的配置将整个量化模型保留在 GPU 内存中。这避免了将若干层发送到 CPU 所带来的更大幅度降速。

他还使用了一个支持该模型多 token 预测架构的软件版本。多 token 预测允许模型先提出多个未来 token,再验证哪些提议可以接受。

当预测成功时,这项技术可以提升吞吐量,尤其适用于结构化或可预测的输出。不过,支持情况取决于模型和推理引擎,实际收益也会因提示词而异。

这一细节避免得出过于简单的结论:每块 V100 都能以报告中的速度运行每个 27B 模型。不同的量化方式、上下文大小、后端或模型架构,都可能产生截然不同的结果。

即使加载同一个模型,也无法保证获得相同的性能。长提示词会增加键值缓存用量,而并发请求则会改变内存压力和调度行为。

Nvidia Tom 的实验还使用了 NixOS 和自定义 llama.cpp 构建版本。NixOS 以声明式方式定义系统配置,帮助操作者通过版本化文件复现软件包和服务。

这可以让不同寻常的配置在改动后更容易恢复,但并不意味着该硬件组合获得了官方支持。

据报道,Windows 在原始构建中遇到了更多困难。V100 有时还会在热重启后消失,需要让机器完全关机后才能再次检测到它。

对于亲手搭建系统的实验者而言,这些不便可以接受。但对于一台每天早晨都应可预测启动的工作站而言,它们将是严重的可靠性问题。

不过,这套构建展示了本地 AI 的一个更大变化。开放模型格式和可适配的推理引擎能够延长硬件的实用寿命,使其超出原本的部署周期。

最重要的组成部分不再只是加速器本身。实际系统还包括模型格式、量化、运行时、驱动程序、操作系统、散热和互连。

评估二手企业级硬件的买家必须考量这整套技术栈。VRAM 容量只是打开大门,软件决定模型能否真正走进去。

割草机般的噪声揭示了真正的取舍

退役服务器 GPU 以精致的使用体验换取容量,而散热系统让这笔交易的代价无法忽视。

该适配器原装风扇在 Apple Watch 上的读数为 82 分贝。这一测量并非经过校准的声学测试,但它清楚地说明了问题。

服务器硬件假定运行环境可控,在那里噪声的重要性低于排热。紧凑型机架可以使用高速风扇,因为没人会整天坐在它旁边。

游戏 PC 会让同样的气流变得清晰可闻。据报道,该适配器的风扇始终全速运转,因为其原始连接器未提供常规的桌面风扇控制。

Molnar 研究了接线方式,并通过定制线缆将风扇接到主板插针上。随后,脉宽调制让主板能够降低风扇转速。

据称,在 10% 的风扇设定下,V100 在测试负载下保持在 50 摄氏度以下。Molnar 表示,它变得几乎难以听见。

这一方案很巧妙,但读者不应将其视为通用的散热保证。机箱风道、室温、风扇结构、GPU 负载和传感器位置都会影响散热。

接线错误的风扇可能损坏插针,或意外停止运转。在未监控温度的情况下减少气流,可能导致加速器、适配器、内存或供电组件过热。

电气要求带来了另一项风险。SXM2 模块依赖一块非官方适配器,必须通过 Nvidia 并未为消费级部署设计的硬件提供大量电力。

这张卡不具备普通桌面产品默认的安全性和便利性。买家必须核实电源连接、适配器质量、物理间隙、固件行为和电源容量。

接下来是能耗问题。二手加速器在购置时可能颇具吸引力,但在长期每日运行后可能不再划算。

Molnar 观察到,他的工作负载下 V100 的最高功耗约为 150 瓦。Nvidia 将 SXM2 设计的最高功耗额定为 300 瓦,因此工作负载和配置会造成显著差异。

现代 GPU 可以用更少的电力和更低的热量完成某些任务。它也可能更快完成任务,即使峰值功耗看起来相近,总耗电量仍会更低。

因此,比较取决于利用率。一台偶尔用于私有编程会话的机器,与一台持续响应请求的服务器,成本结构并不相同。

支持寿命带来了更尖锐的担忧。Volta 的计算能力为 7.0,而新的 AI 内核正越来越多地面向 Ampere 及后续架构。

Nvidia 的 CUDA 13 notes 指出,CUDA 13 工具包已移除对 Volta 的离线编译和库支持。CUDA 12.x 仍是面向这些架构的受支持构建路径。

这不会让现有 V100 系统失效。它意味着,随着新库逐步向前演进,运营者必须保留兼容的工具链。

未来的推理引擎版本可能需要 Volta 无法使用的较新 CUDA 库或内核。用户可以固定在旧版本,但这会增加维护和安全工作。

现代模型也可能假定支持 BF16,这是一种数值范围比 FP16 更宽的 16 位浮点格式。Volta 的 Tensor Cores 不提供原生 BF16 加速。

某些运行时会转换不受支持的操作、采用较慢路径,或拒绝不兼容的配置。具体行为取决于模型和框架。

新的注意力机制内核也会造成类似缺口。针对 Ampere、Hopper 或 Blackwell 优化的软件,可能不会提供实用的 Volta 实现。

这些限制使 V100 成为一项固定平台投资。即使如今固定版本的技术栈仍可工作,所有者也应预期兼容性会逐步收缩。

这项实验的 32-token 结果尚未在这台确切机器上得到独立复现。它应被理解为有记录的个人基准测试,而非有保证的产品规格。

它还结合使用了 RTX 4080 和 V100。旧加速器本身并未提供 32GB VRAM,也没有单独实现所报告的完整结果。

这一差异很重要,因为标题可能会让 V100 看起来像是现代大显存显卡的完整替代品。更准确地说,它是经过精心配置的系统中的扩展设备。

对于合适的运营者而言,这笔交易仍然颇具吸引力。对于需要安静运行、官方支持、可预测更新或尽量少排障的人来说,它就不具性价比。

老旧数据中心 GPU 正在给消费级 AI 市场施压

这项实验凸显了桌面 GPU 厂商仍未均衡满足的一项需求:面向本地模型推理的经济型内存容量。

游戏基准通常优先考虑帧率、光线追踪、超分辨率和能效。本地 AI 引入了不同的购买优先级。

模型要么能装入可用内存,要么不能。当所选模型和上下文超出 VRAM 容量时,更快的算力无法弥补这一问题。

用户可以选择更强的量化、更短的上下文窗口、更小的模型或 CPU 卸载。每一种选择都会改变质量、能力或响应速度。

这推动了对旧企业级显卡、多 GPU 组合和统一内存计算机的需求。它们都无法提供配备充足 VRAM 的当代消费级 GPU 所具备的完整便利性。

Nvidia 仍处于核心地位,因为 CUDA 在 AI 框架中获得广泛支持。即便其官方工具链不再推进,V100 仍受益于这一生态系统。

AMD 提供具备较大内存配置的显卡,但用户必须确认其首选模型和运行时能否通过 ROCm 或其他后端良好运行。兼容性已经改善,但在不同应用之间并不一致。

Apple 的统一内存让 CPU 和 GPU 可以访问同一个大型内存池。这能够容纳更大的模型,但带宽、持续吞吐量、软件支持和不可升级内存仍是重要考量。

更新的 Nvidia 工作站和数据中心产品以当前功能提供高容量。它们面向的买家,其预算和运营要求与家庭爱好者不同。

Tesla P40 是另一种二手服务器选择。它提供 24GB 内存,但属于更早的 Pascal 世代,且缺少 Tensor Cores。

P40 可以加载超过 16GB 的模型,但其较低的内存带宽和更旧的计算路径可能降低生成性能。容量本身并不能决定结果。

二手 V100 显卡处于一个独特的中间地带。它们结合了 HBM2 带宽、第一代 Tensor Cores 和成熟的 CUDA 12 支持,但也带有明确的淘汰风险。

因此,Nvidia Tom 的报道所施压的是产品分层,而非某一个竞争对手。它显示,一些用户愿意接受严重的不便,以摆脱低 VRAM 上限。

这一信号应当引起 GPU 制造商重视。AI 工作负载正在让内存成为显眼的消费级规格,而不再只是专业买家的小众关注点。

这同样关系到模型开发者。高效量化和本地运行时能够扩大可运行模型的已安装硬件基础。

需要最新精度格式的模型,会排除其他本可胜任的加速器。可移植的 GGUF 发布版本则能够覆盖使用较旧 Nvidia、AMD、Apple 或仅 CPU 系统的用户。

这并不意味着开发者应围绕过时芯片冻结软件发展。它意味着,兼容性选择会影响谁能私下运行模型,以及谁必须使用托管服务。

本地运行带来多项好处。提示词可以留在用户机器上,生成不依赖网络可用性,运营者也能控制模型更新。

运营者也会承担所有基础设施责任。其中包括驱动程序、模型文件、身份验证、远程访问、散热、监控和备份。

云服务则采取相反的取舍。它们免除了大部分硬件维护,但要求用户在可用性、政策和数据处理方面信任外部服务。

V100 构建并未终结这场争论。它让本地方案对那些重视控制权胜过便利性、且具备技术信心的用户更具可信度。

本地 AI 构建者接下来应关注什么

三个信号将决定 V100 的复兴会成为持久的小众市场,还是通往新硬件路上的短暂停留。

第一个信号是 llama.cpp 对 Volta 的支持。随着新的模型架构、量化格式和 GPU 内核出现,该项目变化很快。

V100 所有者应关注重要模型是否保留可用的 CUDA 12 构建路径。持续兼容将加强保留这些系统的理由。

转向需要更高计算能力的内核则会削弱这一理由。固定版本可以延缓这种结果,但无法无限期提供对新模型的支持。

第二个信号是不同 27B 模型之间可复现的性能。Molnar 的结果使用了特定模型、量化、上下文配置和混合 GPU 方案。

独立测试应报告生成速度、提示词处理速度、上下文长度、功耗、温度和确切的软件版本。单一的每秒 token 数掩盖了太多变量。

密集模型的结果也不应与混合专家模型随意比较。混合专家设计会在每个 token 上仅激活其总参数中的一部分。

如果多名测试者能够复现经济型 V100 组合上响应迅速的 27B 推理,核心主张就会更有力。若结果差异很大,则表明原始结果严重依赖专家级配置。

第三个信号是即将推出的消费级 GPU 和工作站的内存容量。更多定位合理的大内存产品将降低对临时改装服务器方案的需求。

如果消费级显卡仍将强大算力与受限 VRAM 搭配,二级市场的加速器仍会具有吸引力。用户会继续以效率和支持换取模型容量。

软件供应商也可能作出回应。更好的异构多 GPU 调度可以让不匹配的加速器更容易组合,而更严格的内核要求则可能关闭这扇门。

潜在构建者应从计划使用的模型开始,而不是先购买 GPU。检查模型大小、量化选项、上下文要求、运行时支持和预期并发量。

他们还应区分实验用途与可靠的生产用途。一台偶尔需要冷重启的设备在家中可能很有趣,但在业务工作流中却不可接受。

记录每个驱动程序、适配器、风扇设置、固件选择和模型修订版本至关重要。可搜索的工程知识库可以将排障发现转化为可重复的系统。

这则 Nvidia Tom 硬件报道最终既不是普适建议,也不是毫无意义的噱头。它表明,当软件、散热和运营者的耐心相契合时,退役芯片仍能提供有用的本地推理能力。

你是否愿意接受较旧的 CUDA 软件栈、定制布线和手动故障恢复,只为在本地运行更大的模型?相比任何基准测试,这个答案更能决定 Tesla V100 是否适合成为你下一台 AI 机器的一部分。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page