top of page

MI355X 在每美元性能上击败 B300 后,Kimi K3 登上 Hacker News

Wafer 报告称,八张 AMD MI355X GPU 以约每秒 952 个输出 token 的速度为 Kimi K3 提供服务,随后 Kimi K3 登上了 Hacker News。该系统的总吞吐量落后于一台配备八张 GPU 的 Nvidia B300 节点。不过,按照 Wafer 的租赁成本假设,AMD 在每美元性能方面表现更优。

这一区别至关重要,因为 Kimi K3 的需求异常苛刻。Moonshot AI 的这款开放权重模型包含约 2.8 万亿个参数,每个 token 会激活其中约 1040 亿个参数。在服务系统为运行时状态和长提示词预留内存之前,其检查点就已占用超过 1.5 TB。

按该配置,标准的八 GPU B200 节点无法从容承载这一部署。因此,Wafer 将一个 MI355X 节点与一个 B300 节点及双节点 B200 配置进行了比较。结果通过一个范围有限但在商业上很重要的问题,对 Nvidia 的优势提出了挑战:哪个平台能以最低的基础设施成本提供可接受的 Kimi K3 推理能力?

Hacker News 上的说法关乎经济性,而非绝对速度胜出

Wafer 并未报告 MI355X 比 B300 更快。它报告的是,MI355X 在每单位每小时基础设施支出下提供了更高的吞吐量。

这一差异很容易在标题中被忽略。根据 Wafer 的基准测试文章,其八 GPU MI355X 节点实现了每秒 952 个输出 token 的总吞吐量。同一测试中,八 GPU B300 配置达到了每秒 1,568 个 token。

这让 Nvidia 在原始吞吐量方面拥有显著优势。B300 节点在单路请求中也达到了每秒 172 个 token,而 MI355X 为 118 个。若采购方只追求单个节点的最大输出,按照这些结果,B300 仍然更具优势。

Wafer 在采用每小时租赁成本估算后得出了不同结论。其计算显示,MI355X 在单位支出对应的总吞吐量方面领先。该公司将 AMD 加速器描述为每美元性能的赢家,而非整体性能的赢家。

该基准测试使用包含 1,024 个输入 token、要求生成 400 个输出 token 的提示词。这种工作负载很有参考价值,因为它捕捉了常规文本生成行为,同时又不会成为长上下文压力测试。它并不代表所有生产环境工作负载。

B200 的比较又增加了一层复杂性。在 Wafer 的配置中,Kimi K3 需要跨两个节点使用 16 张 B200 GPU。该部署的总吞吐量为每秒 498 个 token,即每节点约 249 个。

由于 GPU 必须通过网络协调模型执行,跨节点通信带来了性能损失。Wafer 表示,该连接采用 RoCE v2——一种基于以太网、可在较少 CPU 参与下实现系统间直接数据传输的协议。

因此,B200 的不利结果既反映了拓扑结构,也反映了芯片本身。按照 Wafer 所需的内存分配,模型无法装入单个八 GPU B200 节点。将其拆分到两个节点后,通信被引入了解码路径。

这一限制正是故事的核心。Kimi K3 甚至在软件调优开始前,就将内存容量转化为架构优势。MI355X 与 B300 每张 GPU 均提供 288 GB 高带宽内存,使单个八 GPU 节点成为可行方案。

Hacker News 上的讨论集中于这一结果是否削弱了 Nvidia 的软件护城河。单一厂商的基准测试无法回答这一更广泛的问题。但它确实表明,对于特定模型,内存容量和租赁经济性可以推翻传统的 GPU 排名。

它也改变了采购方解读加速器对比的方式。峰值算力很重要,但只是诸多输入因素之一。模型规模、量化、内存布局、框架支持、并发、延迟、网络和利用率,都可能决定实际账单。

对于 Kimi K3,首要胜利属于无需进行别扭的多节点拆分、就能容纳该模型的平台。AMD 用一个 MI355X 节点跨过了这一门槛。Nvidia 可通过 B300 达到这一点,而 B200 在这一特定配置下则吸引力较低。

因此,这一结果比“AMD 已赶上 Nvidia”这种笼统论断更具边界,也更有用。它指出了一个 AMD 的设计选择开始产生财务意义的工作负载。

Kimi K3 将内存容量变成决定性约束

Kimi K3 使加速器内存成为部署要求,而非采购方可以视为次要因素的规格参数。

Moonshot AI 将 Kimi K3 描述为一款拥有 2.8 万亿参数的混合专家模型。混合专家模型会让每个 token 仅经过网络的一部分,从而在保留更大规模学习参数池的同时,降低活跃计算量。

K3 技术论文称,该模型每个 token 会激活约 1040 亿个参数。它从 896 个专家池中选择 16 个路由专家。这种稀疏性限制了计算量,但并未消除存储完整专家权重的需求。

每次请求都可能将 token 路由至不同专家。因此,服务系统必须让整个 GPU 组都能访问更广泛的检查点。该检查点由此形成了塑造 Wafer 对比的内存需求。

AMD 自己的部署指南估算,考虑加载器后的检查点大小约为 1.56 TB。在八路张量并行下,每张 MI355X 承载约 191 GiB 的模型权重。

张量并行会将大型模型运算拆分到多张 GPU 上。每个加速器计算其中一部分,然后与同伴交换中间结果。将全部八张 GPU 放在一台服务器中,通常比跨多台机器部署更能降低通信损失。

AMD 估算,在模型最大上下文下,单个序列的已知运行时状态会为每张 GPU 增加约 14.4 GiB。已知分配合计约为 205.4 GiB,在其他开销之前,每张 MI355X 还剩约 82.6 GiB。

剩余内存必须容纳通信缓冲区、临时工作区、分配器碎片、框架状态及其他生产成本。它还可支持批处理,即将请求分组,让 GPU 一起完成更多有效工作。

Moonshot 为 Kimi K3 提供了一百万 token 的上下文窗口。上下文窗口是模型在单次交互中可考虑的文本及其他 token 化输入的最大规模。支持这一理论最大值所需的内存,多于服务短提示词时的需求。

Kimi Delta Attention 有助于控制这种增长。它在许多层中使用固定大小的循环状态,而非在所有位置维护传统键值缓存。键值缓存会保存先前的注意力数据,使模型无需为每个生成的 token 重新计算整个序列。

Kimi K3 仍包含维护依赖 token 的缓存状态的层。因此,长提示词仍会消耗大量内存。这一架构减轻了负担,但并未让长上下文变得没有成本。

AMD 的 MI355X 和 Nvidia 的 B300 在标准八 GPU 平台中都提供每张 GPU 288 GB HBM。Nvidia 的B300 架构列出了全节点 2.3 TB 内存,与 AMD 平台属于相同的大致容量级别。

B200 每张 GPU 的内存更少。八张设备足以满足许多模型,但 Wafer 表示,该配置无法容纳 Kimi K3 及其计划使用的长上下文内存池。增加到 16 张 GPU 可以解决容量问题,但会增加网络成本和运维复杂性。

这正是 Hacker News 兴趣背后更深层的逆转。Nvidia 的 B200 仍是一款高端加速器,但 Kimi K3 可以让周边系统拓扑的重要性超过该芯片熟悉的市场地位。

同一原则也适用于该模型之外的场景。开放权重模型让运营方可以自行选择硬件、服务框架、量化方式和请求调度器。更大的检查点使这些选择越来越依赖内存容量。

计划部署内部编程代理、文档分析或研究自动化的公司,可能会预期出现长提示词和持续生成。这类团队应在比较加速器吞吐量之前对内存需求建模。

维护一个可检索的工程知识库也能让这些评估更易复现。否则,配置记录、性能分析结果、部署变更和故障报告会分散在本地文档与聊天线程中。

Kimi K3 并未证明内存是唯一的护城河。它表明,内存可以决定哪些平台有资格进入竞争。

推测解码缩小了 AMD 的部分软件差距

MI355X 的结果依赖于软件修复和服务优化,尽管 Wafer 不需要为其主要解码改进编写新的 GPU 内核。

Wafer 以 AMD 首日提供的 Kimi K3 支持为起点。该基础版本已能在八张 MI355X GPU 上加载模型,并通过兼容的推理服务器对外提供服务。但从可用部署达到有竞争力的吞吐量,仍需要工程投入。

最大的解码改进来自推测解码。这项技术使用较小的草稿模型预测若干未来 token。主模型随后一起验证这些候选项,从而减少昂贵的顺序解码步骤数量。

Kimi K3 并未随模型提供常见于前沿模型集成的推测方法所需的专用草稿张量。Wafer 转而使用由 RadixArk 发布的外部块扩散草稿模型 Kimi-K3-DSpark。

据称,CUDA 版本未出现同样的中断问题。在 AMD 用于 GPU 计算的软件平台 ROCm 上,首个生产请求便在 SGLang 的 token 验证路径中触发了缺失函数错误。

SGLang 是一个开源服务框架,负责调度模型请求、管理内存并运行优化内核。其 CUDA 构建版本导入了一个 top-k 概率重归一化函数。ROCm 分支则未为所测试的路径提供等效定义。

Top-k 采样会在选择下一个输出前,仅保留最可能的 token 候选项。重归一化会重新缩放它们剩余的概率,使其总和为一。这个缺失操作在数学上很简单,但其缺失会导致请求调度器崩溃。

Wafer 使用标准 PyTorch 原语实现了这一操作。该函数对概率排序,保留排名最高的候选项,掩蔽其余候选项,并重新缩放剩余值。

据称,这一修复将单路性能提升了约 2.2 倍。在中等负载下,单路性能提高约 1.7 倍。峰值总吞吐量提升了 18%。

这些收益说明,硬件规格并不能直接预测生产推理性能。加速器执行运算,但服务栈决定请求是否能够进入高效代码路径。

Nvidia 的 CUDA 平台受益于多年的框架集成和开发者关注。新的推理技术往往首先出现在该平台上。漏洞获得更广泛的暴露,而库通常会先假定 CUDA 行为,再添加其他后端。

AMD 已在 ROCm 及其配套库上投入了大量资源。Kimi K3 的部署显示出进展,因为所缺失的功能只需一次紧凑的软件修正,而不必进行数月的底层内核开发。

但这个 bug 仍然很重要。在真实流量下会崩溃的请求路径并非无关紧要的瑕疵。它意味着测试、维护和运营风险,基础设施团队必须将这些风险计入部署决策。

Wafer 的结果还依赖于实现高并发。并发衡量服务器同时处理多少条序列。更多并发请求可以通过让加速器持续处理有效工作来提高总吞吐量。

投机解码将系统的峰值吞吐量推向了更高并发设置。这种结果适合接收大量请求的共享服务。对于需要立即得到单个响应的应用而言,其意义可能较小。

这一差异区分了聚合吞吐量与交互性。聚合吞吐量衡量所有用户合计生成的 token 总数。交互性则衡量每条独立流推进的速度。

MI355X 节点 952 token 的聚合结果对繁忙服务很有价值。其单流 118 token 的表现则讲述了不同的故事。无论是单流还是整体节点,B300 都仍然更快。

因此,这一机制支持的是一个务实结论,而非普遍结论。在 Wafer 修复框架缺口,并围绕外部草稿模型配置投机解码后,AMD 硬件展现出有利的经济性。

其他团队必须确定自己能否复现这套技术栈。他们需要兼容的框架版本、相同的模型表示、稳定的采样行为,以及足够大的请求量。

他们还需要能够诊断特定后端故障的工程师。发现缺失函数后,修复可能很容易。但要在生产负载下定位精确故障,可能需要更长时间。

这就是为什么 Hacker News 上的说法不应被简化为硬件评分。它证明 AMD 的软件劣势有时可以被界定并修复,但并不表明这种劣势已经消失。

在延迟和密度最关键的场景,B300 仍然领先

当目标从基础设施效率转向最大吞吐量或最短等待时间时,Nvidia 的 B300 仍是更强的选择。

Wafer 测得 B300 节点的聚合输出吞吐量为每秒 1,568 个 token。在测试配置下,这比 MI355X 节点 952 token 的结果高出约 65%。

B300 在单流场景下也达到每秒 172 个 token,MI355X 为 118 个。对于交互式编程、实时 agent 或面向客户的聊天,这一差异会影响产品的响应感受。

在预填充阶段,比较变得更具挑战性。预填充是模型在生成第一个输出 token 前处理用户已有提示词的阶段。长文档和大型代码仓库使这一阶段尤为重要。

Wafer 测试了包含约 172,000 个 token 的相同冷提示词。MI355X 配置最初处理它约需 51 秒,而 B300 约需 23 秒。

这一差距超过了普通解码阶段的差异。文本开始生成后,用户可能可以接受流速略慢;但在第一个 token 出现前等待更久,可能会让应用显得停滞。

Wafer 将 AMD 在预填充上的大部分差距归因于注意力内核回退。在八路张量并行下,Kimi K3 为每块 GPU 分配了 12 个注意力头。AMD 更快的 AITER 内核支持其他注意力头数量形状,因此框架选择了较慢的通用 Triton 代码。

AITER 是 AMD 的优化 AI 算子库。Triton 是用于编写可移植 GPU 内核的语言和编译器。通用 Triton 路径可以简化兼容性,但性能可能无法媲美针对硬件的汇编实现。

Wafer 将 12 头输入填充至 16 头,运行优化内核后再移除人为添加的输出。据报道,这种形状调整将稳态预填充吞吐量提升至约每秒 13,000 个 token。

此前的回退路径约为每秒 4,000 至 7,000 个 token。Wafer 将这一修复描述为预填充性能提升两到三倍。

重要的是,这项优化并未提高解码的头条结果。它针对的是首 token 时间,即 TTFT,衡量用户在生成开始前需要等待多久。

这一事件展现了 AMD 所处位置的两面性。硬件拥有能够实现更好性能的高效内核,但由于 Kimi K3 产生了不受支持的形状,框架未能选择该内核。

当这些不匹配问题已在 CUDA 库中被预先考虑时,Nvidia 将从中受益。当开发者能够适配现有内核而无需设计新内核时,AMD 将从中受益。采购方必须决定自己能够容忍多少集成工作。

在 Wafer 的测试中,B300 的单 GPU 聚合性能也更高。这种密度在机架空间、供电能力、网络端口或数据中心可用性限制部署时可能很重要。

低成本 GPU 并不必然意味着服务层面更便宜。运营方还必须计入服务器利用率、电力、网络、工程时间、冗余容量、故障恢复和软件维护。

如果一个 B300 节点能够承载原本需要更多 AMD 节点的流量,周边基础设施成本可能会缩小最初每美元性能优势。反过来,延迟要求适中的应用也可能通过接受 AMD 较低的峰值性能来节省更多成本。

正确的比较对象是服务级目标,而不是芯片级口号。服务级目标定义了系统必须稳定交付的延迟、可用性和吞吐量。

团队应在相同目标交互性下比较两个平台。他们还应测量相同的提示词长度、输出长度、缓存行为、并发度、量化方式和正常运行时间预期。

分别针对每个平台独立优化的基准测试,能够回答专家调优后哪个系统性能最佳。使用相同软件的基准测试,则能回答技术栈的可移植性如何。这是不同的问题。

Wafer 的测试更接近前者。它调优了 MI355X 路径,并将所得服务与其 Nvidia 部署进行比较。这反映了运营方可能如何追求最佳可得经济性,但也使严格的架构归因更加复杂。

在已公布的数据中,B300 仍是更快的平台。MI355X 值得关注,是因为在 Wafer 选定的工作负载下,较低的租赁成本假设足以弥补这一性能差异。

这是一个有意义的竞争结果,但并不意味着 Nvidia 的性能王冠易主。

该基准测试并未证明什么

已发布的结果仍然是企业自行运行的快照,方法细节有限,也没有独立复现来支撑其核心主张。

Wafer 开发 GPU 优化和推理产品,也提供托管模型访问服务。该公司显然具备专业能力,但它在商业上也有动机表明软件工作能够解锁 Nvidia 之外的替代方案。

这并不使该基准测试失效。这意味着读者应将这些测量视为运营方报告的结果,而非中立的行业认证。

基准测试文章说明了提示词长度、要求的输出、硬件配置、吞吐量和选定的优化工作。但文章并未提供完整的可复现性材料包。

一些重要细节仍不清楚。文章没有完整说明每个软件版本、预热流程、请求分布、测量时长、输出验证步骤或功耗测量。

根据 Wafer 的比较标签,B300 配置还使用了上下文处理解耦。解耦将提示词处理与 token 生成分开,使每个阶段能够使用合适的资源。这会同时影响性能和系统设计。

MI355X 条目使用了八路张量并行。B200 部署使用了跨两个节点的 16 块 GPU。B300 条目则结合了八路张量并行和解耦处理。

这些都是实际部署,但并非完全对称的配置。每个平台都遇到了不同的内存和拓扑限制。这种不对称性在一定程度上正是重点所在,但它限制了仅针对芯片架构的结论。

每美元性能结果还取决于租赁假设。GPU 市场会因云服务商、合同期限、地区、可用性和预留模式而变化。拥有折扣 Nvidia 容量的买方可能得出不同结论。

共同写作规则不允许在此列出具体商业价格。重要事实是,Wafer 假设 MI355X 容量的每 GPU 小时成本显著低于 B300。其经济性判断直接源于这一前提。

可用性同样重要。如果团队无法在所需地区预留足够节点,理论上有吸引力的加速器也无法带来节省。Nvidia 更广泛的云端覆盖可以减少采购摩擦。

模型行为带来了另一项不确定性。只有当草稿模型预测的 token 被主模型接受时,投机解码才能加速生成。接受率可能随编程、散文、数学、语言和采样设置而变化。

因此,Wafer 的短输入基准测试相较于处理大型代码库的 agent,可能产生不同的收益。长上下文研究、客户支持和批量提取,都可能改变预填充与解码之间的权衡。

模型本身也很新。Moonshot 于 2026 年 7 月 27 日发布 Kimi K3 权重,仅在 Wafer 于 7 月 31 日公布测量结果的数日前。框架、量化和优化内核仍处于早期阶段。

AMD 的初始指南刻意保持谨慎。它验证了在八块 MI355X GPU 上加载和基本正确性,但并未宣称峰值吞吐量、token 延迟或内核效率。

Wafer 提供了下一层的性能工作。独立团队现在应使用开放脚本和清晰定义的服务目标来复现结果。

比较还应扩展至 B300 之外。Nvidia 的更新系统、未来的 AMD 加速器以及专用推理硬件,都将改变可选方案。软件发布无需更换任何芯片,就可能改变今天的排名。

还存在质量问题。低精度格式和投机方法应在既定容差内保持输出行为。速度结果需要正确性检查,尤其是采样变化可能掩盖细微差异时。

Moonshot 的模型使用混合低精度表示来降低内存和计算需求。这些选择是其预期架构的一部分。实现仍必须确认每个后端在具有代表性的任务上都能产生可接受的结果。

最站得住脚的解读是有条件的:在 Wafer 的工作负载、软件栈和租赁假设下,MI355X 实现了更强的每美元性能结果。

最站不住脚的解读则是 AMD 已在 AI 推理领域全面击败 Nvidia。已发布的证据并不支持这一结论。

三个信号将决定 AMD 能否重现这场胜利

只有当 AMD 的 Kimi K3 结果经受住独立测试、更广泛工作负载和常规框架发布的考验时,它才会具有战略重要性。

第一个信号是可复现性。独立运营方应使用已发布配置、相同提示词、经验证的输出和匹配的延迟目标,在 MI355X 和 B300 上运行 Kimi K3。

若每美元性能优势能够被反复验证,将强化 Wafer 的主张。若不同团队之间存在巨大差异,则表明该结果高度依赖专门调优或有利的基础设施条款。

复现不应只覆盖峰值聚合吞吐量。测试还需要衡量首个 token 延迟、单用户解码速度、持续并发能力、错误率、内存利用率、功耗以及长时间运行稳定性。

测试还应披露完整的成本模型,而非假设某个公开租赁价格快照适用于所有买家。签约容量和自建基础设施都会改变计算结果。

第二个信号是,ROCm 的改进是否会进入主流推理框架。Wafer 的 top-k 修复和填充式预填充路径解决了具体问题,但私有补丁也会带来维护负担。

如果 SGLang、AITER、vLLM 及相关项目吸收了类似修复,更多团队就能在无需维护自定义分支的情况下复现这一结果。这将把单一运营商的专业能力转化为更广泛生态系统的收益。

快速获得上游支持,也会降低框架更新破坏优化路径的风险。基础设施采购方重视可复现性,因为生产系统的生命周期远长于基准测试。

如果修复仍然零散分布,即使 AMD 硬件看起来颇具吸引力,Nvidia 的软件优势依然稳固。CUDA 的护城河包括文档、调试工具、库覆盖度、经验丰富的开发者,以及可预测的框架行为。

第三个信号是其在贴近生产环境的工作负载上的表现。Kimi K3 的百万 token 上下文支持,意味着它适用于大型代码库、文档集合、研究历史以及长时间运行的 agent 会话等任务。

这些工作负载会提升预填充、缓存管理、请求调度和内存碎片控制的重要性。Wafer 已展示,在启用优化内核路径之前,AMD 的初始冷预填充结果落后于 B300。

要取得更广泛的胜利,MI355X 需要在短聊天提示、长文档、代码 agent、多模态输入和混合流量中都保持竞争力。同时,在节点服务大量用户时,它还必须维持可接受的延迟。

如果 AMD 能在这些条件下表现良好,硬件采购方将获得实质性的议价能力。他们可以基于一个可信的第二平台进行谈判,并部署大型开放权重模型,而无需接受自动附加的 Nvidia 溢价。

如果这一优势在短输入吞吐量测试之外消失,MI355X 仍将是一种面向特定工作负载的选择。它依然可能带来有价值的部署,但不会从根本上削弱 Nvidia 的地位。

Hacker News 带来的更广泛启示是,开放权重模型正将推理变成一场系统层面的竞争。模型开发者定义架构,芯片制造商提供内存与算力,而框架团队决定其中多少容量能够真正被利用。

Kimi K3 加剧了这场竞争,因为它的 checkpoint 迫使买家立即直面内存限制。它也会奖励那些能够支持低精度计算、高效专家路由和大规模上下文状态的平台。

开发者应关注基准测试仓库和框架发布说明。基础设施团队应运行自己的流量追踪,而不是依赖单一的每秒 token 数指标。

企业买家应要求在其应用所需延迟条件下进行比较。除加速器租赁假设外,他们还应将工程人力和运营风险纳入考量。

现有证据为 AMD 提供了一个可信的结果,也向 Nvidia 发出了明确警告。B300 仍然更快,而据报道,MI355X 在 Wafer 的 Kimi K3 部署中提供了更优的经济性。

下一个问题是,这种优势能否成为常态。在将一则 Hacker News 结果视为持久转变之前,应持续关注独立基准测试、上游软件支持以及长上下文生产测试。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page