top of page

AMD 与韩国计划采用国产 NPU 构建开放式 AI 基础设施

9月1日
讀畢需時 13 分鐘

AMD 于 7 月 23 日与韩国签署协议,挑战了 AI 热潮背后的一个核心假设:所有工作都应由单一 GPU 架构承担。随着韩国科技界领袖提出,数据中心必须结合 CPU、GPU 和国产神经处理单元,这一消息经由 Google News 浮出水面。他们的目标不只是训练模型,而是应对大规模提供 AI 智能体服务时日益攀升的成本与功耗需求。

该协议为异构计算提供了一次检验机会,即将不同工作负载分配给专为不同任务设计的处理器。AMD 将贡献 CPU、GPU、软件和技术专长。韩国企业则将提供主要面向 AI 推理设计的神经处理单元,即 NPU。韩国政府希望这些系统接受商业工作负载的检验,而不是只用于受保护的演示。

这给 Nvidia 的单一供应商平台带来了压力,尽管 Nvidia 仍是 AI 基础设施的主导性参照对象。这场竞争并不只是 AMD 对阵 Nvidia,而是高度集成的 GPU 平台与由专用组件构建的开放系统之间更广泛的较量。

韩国的计划之所以颇具说服力,是因为推理与模型训练有着不同的经济逻辑。训练需要庞大的集群,以尽快完成计算密集型任务。推理则必须持续响应用户请求,同时满足延迟、电力、散热和运营成本方面的限制。

尚未解决的问题是,混合系统能否作为一个可靠的平台协同运行。芯片本身无法造就可用的数据中心。驱动程序、编排软件、网络、模型支持、监控和故障恢复,必须在真实流量下协同运作。

Google News 揭示的 AMD 协议内容

韩国正推动国产 NPU 从政府支持的实验项目,进入拟议中的全球计算架构。

韩国科学和信息通信技术部在旧金山举行的 AMD Advancing AI 2026 期间,与 AMD 董事长兼 CEO Lisa Su 签署了该备忘录。该部将签署时间标注为 2026 年 7 月 23 日下午 3 点,太平洋时间。

韩国政府将该项目描述为建设开放式 AI 计算基础设施生态系统的努力。其首个技术目标,是连接 AMD CPU、GPU 与韩国开发、专为推理优化的 NPU。

这一措辞至关重要。韩国 AI 芯片过去常作为替代方案,出现在国内扶持项目的评估中。而这项协议则将其视为更大架构中的潜在组件,该架构还包括一家成熟的全球处理器企业。

该部的计算协议还涵盖软件开发、联合研究、人才项目和物理 AI。物理 AI 将模型应用于机器人、工厂、车辆和工业设备等系统。

AMD 另行表示,合作伙伴将探索国家级基础设施、开源模型和先进研究。其主权 AI 计划强调技术选择权,以及减少对单一供应商的依赖。

该备忘录并未证明 AMD 与韩国 NPU 已可作为可投入生产的系统协同运行。它建立的是合作框架,并将异构基础设施确立为预期方向。

这一差别使该公告区别于围绕它流传的、更具雄心的解读。原始讨论汇集了政府官员、AMD Korea、研究人员和韩国芯片企业高管,共同讨论成功部署需要具备哪些条件。

与会者反复回到三个条件:系统必须处理真实流量,公布客观的性能和成本结果,并将成功的软件工作转化为可复用的基础设施。

根据讨论,计划中的验证分为三个阶段。团队首先将验证 AMD 处理器与韩国 NPU 之间的软件连接,随后把该系统用于服务类工作负载,最后公布客观结果,并向开放生态系统贡献软件资产。

这些步骤使这次事件的重要性超越了又一场半导体合作仪式。它们也表明,在买家能够将韩国 NPU 视为常规数据中心选项之前,仍有大量工作要做。

MOU 表达的是意向,而非具有约束力的采购承诺。它并不保证部署规模、客户采用情况,或与每一种韩国加速器的集成。AMD 和该部尚未公布最终系统设计或生产时间表。

因此,近期的变化主要在于地位转变。韩国 NPU 正被纳入跨国架构的考量范围,但尚未在其中赢得永久位置。

推理经济性正推动不同的架构

混合处理器最有力的理由来自推理:在这一场景中,功耗、延迟和并发用户数比单项头条基准测试更重要。

生成式 AI 基础设施最初是以训练集群的规模来讨论的。更大的模型需要更多处理器、内存和网络带宽。这带来了一种直接的采购逻辑:在电力和融资允许的范围内,购入尽可能多的高性能 GPU。

AI 智能体让这一模式变得更复杂。智能体在规划、检索信息、使用工具和检查工作时,可能会进行多次模型调用。因此,一个可见的请求可能会在界面背后触发一连串推理操作。

这一工作负载改变了性能的关键衡量单位。每秒峰值计算量仍然有用,但运营商还需要衡量每瓦 token 数、每机架用户数、响应延迟和每项已完成任务的成本。

服务级目标,即 SLO,定义了服务必须维持的最低性能。对于交互式模型,这可能包括首个 token 的生成时间,以及每位用户持续的每秒 token 数。

专用 NPU 通过优化这些运营目标参与竞争。它们牺牲了 GPU 所具备的一部分通用性,以提升对受支持神经网络工作负载的效率。

FuriosaAI 的 RNGD 加速器说明了这一思路。这家韩国公司将 RNGD 设计用于大语言模型和多模态推理,而非通用图形处理或 AI 开发的每一个阶段。

Furiosa 表示,一张 RNGD 卡的热设计功耗为 180 瓦,并配备 48GB HBM3 内存。其架构以张量收缩为核心操作,公司认为这更直接契合多维 AI 计算。

该公司在 2026 年 4 月发布的推理基准测试中,对比了四张 RNGD 卡与四张 Nvidia RTX Pro 6000 卡。测试使用 FP8 精度的 Qwen3-32B,并采用相同的输入和输出长度。

Furiosa 报告称,在三个服务目标下,RNGD 每千瓦可支持的用户数分别为 1.8 倍、1.9 倍和 2 倍。这些目标分别是每位用户每秒 20、30 和 40 个 token。

该公司还模拟了在 15 千瓦机架内的部署。其表示,在这一功耗限制内可部署五台各配备八张 RNGD 卡的服务器,而相较之下只能部署两台同等配置的 RTX Pro 6000 服务器。

在每位用户每秒 30 个 token 的目标下,Furiosa 估计 RNGD 配置可服务 474 名并发用户。该公司将这一结果描述为对比系统机架级容量的 2.5 倍。

这些是厂商自行发布的结果,并非对任一加速器作出的独立裁定。它们适用于特定模型、软件版本、精度格式和服务目标。不同模型或运行条件可能改变结果。

不过,这项基准测试仍说明了运营商为何正在审视专用硬件。数据中心往往会在理论上的 AI 服务需求耗尽之前,就先触及电力、散热或机架密度的限制。

增加一张高功耗 GPU 可能需要升级电力设施、采用液冷,或建设新建筑。功耗更低的加速器有时能在现有设施内增加服务容量。

推理也会奖励工作负载专业化。GPU 集群可能仍是训练和快速变化研究的首选环境。NPU 则可承担稳定、高容量的服务任务,在这类任务中,效率决定利润空间。

这构成了韩国提案背后的核心机制。AMD 处理器并不会消失,而是与韩国 NPU 协同,让后者承接选定的推理工作负载。

数据中心将成为处理器组合,而非塞满单一类别加速器的房间。软件必须决定每个模型、请求或阶段应在哪里运行。

这种架构类似现有计算系统,它们已在 CPU、GPU、存储处理器和网络设备之间分配工作。AI 推理让这种分工更加重要,因为其资源需求持续存在且直接面向用户。

Nvidia 的优势在于系统,而不只是 GPU

异构硬件能够降低对单一芯片供应商的依赖,但它必须与 Nvidia 集成的软件和网络平台竞争。

Nvidia 在 AI 基础设施中的地位不只依赖加速器性能。CUDA 为开发者提供了成熟的编程环境,而 Nvidia 围绕其 GPU 提供库、网络、服务器和部署工具。

这种集成降低了买家的不确定性。团队可以招聘具备相关经验的工程师,使用熟悉的框架,并为常见模型找到大量文档。

开放式混合系统则颠倒了这种便利。它提供更多供应商选择,但每增加一种处理器,就会引入另一套编译器、运行时、驱动程序和支持关系。

模型兼容性构成一项即时考验。AI 架构变化迅速,运营商无法等待数月才让加速器供应商支持一款新近变得重要的模型。

量化又增加了一层复杂性。量化通过降低数值精度来节省内存和计算工作。它可以提升吞吐量,但实施方式必须维持可接受的模型质量。

运营商还需要张量并行,即当模型无法在单一设备上高效运行时,将其拆分到多个处理器上。这一能力必须在负载下和软件更新期间保持稳定。

监控不能止步于硬件利用率。团队需要针对不同处理器系列,获得队列时间、token 生成、内存压力、失败请求和能源使用情况的一致遥测数据。

故障恢复同样重要。若一台 NPU 服务器离线,编排软件必须在不违反客户延迟目标的情况下重新路由工作负载。系统还必须能够处理升级,而不破坏应用行为。

这就是韩国讨论如此重视架构所有权的原因。负责绘制完整设计的组织,决定了独立组件能否像一项服务那样运行。

AMD 为这项工作带来了可信的基础。其 CPU 已广泛部署于数据中心,其 GPU 则使用 ROCm 软件平台服务于 AI 和高性能计算。

该协议为韩国 NPU 厂商提供了一条可能的路径,使其进入 AMD 已供应主要组件的系统。它也让 AMD 得以将开放性作为一种架构优势来呈现。

然而,开放性并不会自动带来互操作性。软件仓库可以公开,但安装、调试和运维仍可能十分困难。

因此,AMD 和韩国政府必须定义处理器之间稳定的接口。这些接口需要涵盖模型部署、数据移动、调度、可观测性和安全性。

数据移动尤其值得关注。设备之间传输张量会消耗时间和电力。如果处理器不断传输大量数据,专用计算带来的理论收益可能会消失。

高带宽内存和高速互连能够降低这一代价,但无法消除软件复杂性。工程师必须让相关操作尽可能靠近其所使用的数据,并尽量减少不必要的传输。

该合作还提到了物理 AI,其延迟和可靠性要求可能更加严格。工厂机器人或安全系统无法容忍与后台文档处理任务相同的延迟。

韩国在制造业、机器人、移动出行、造船和工业自动化领域拥有相关部署环境。这些行业可以为混合计算系统带来严苛的测试。

但它们也提高了失败的代价。一个在基准测试中表现出色的原型,仍可能无法满足认证、安全、维护或正常运行时间要求。

因此,对 Nvidia 的压力是战略性的,而非即时的。韩国正试图在下一波推理基础设施围绕单一平台固化之前,打造一条替代采购路径。

AMD 同样面临压力。它必须证明,其开放平台主张能够造就客户可实际运营的系统,而不只是更庞大的兼容组件目录。

韩国 NPU 公司面临最严峻的考验。它们必须在满足成熟 GPU 平台所塑造的软件预期的同时,交付可量化的效率提升。

基准测试差距才是真正的风险

只有独立、生产规模的测试确认成本更低,且没有将复杂性转嫁给开发者和运维人员,韩国的计划才能成功。

厂商基准测试是在受控条件下回答狭窄的问题。商业部署则要在数月内不断变化的流量、模型和软件环境中,回答更广泛的问题。

Furiosa 的结果具有参考价值,因为它衡量的是机架功耗限制内的并发用户数。与孤立的峰值吞吐量相比,这一指标更接近运营者的真实约束。

然而,该比较并不能证明其对 Nvidia GPU 具有普遍优势。它评估的是特定硬件、单一模型、既定精度、选定批次大小,以及 Furiosa 自身优化的软件。

软件改进同样推动了报告结果的重要部分。Furiosa 表示,在特定配置下,一个月的 SDK 优化将服务容量从 5.8 名用户提升至 47.5 名用户。

这 8.2 倍的提升展示了软件工作的价值,也揭示了加速器性能对运行时成熟度和基准测试设置的敏感程度。

买方需要了解,是否每个重要模型都能获得类似优化。良好支持单一基准测试,与在整个应用组合中维持广泛的模型覆盖,是两回事。

第三方测试应复现吞吐量、延迟、功耗和质量结果,并公布系统配置、软件版本、提示词长度、批处理行为和测量方法。

测试还应涵盖不规则流量。生产请求具有不同的输入长度、输出长度、优先级和工具调用模式,极少能形成完全高效的批次。

Agent 工作负载使这种波动更加严重。有些请求在一次响应后结束,另一些则会发起多次模型调用、检索文档、运行代码或等待外部服务。

有价值的评估必须衡量尾延迟,即请求中最慢部分的表现。平均性能看起来可能可以接受,但仍可能有相当一部分用户收到延迟响应。

能耗测量也需要同样谨慎。芯片级功耗并未涵盖服务器的所有组件。买方需要覆盖内存、网络、主机处理器、冷却和电力转换损耗的设施级数据。

总拥有成本必须计入工程时间。如果团队需要花数月时间适配模型或维护定制化部署路径,较便宜的加速器也可能变得昂贵。

供应仍是另一个未解决的问题。企业客户需要可预测的产能、替换设备、固件支持和多年产品路线图。

韩国芯片厂商还必须让客户相信,软件投资能够延续到未来的硬件世代。每当新加速器出现时,应用不应从头重建。

安全性带来了更多要求。混合系统增加了运营者必须信任的驱动程序、固件包、管理服务和更新渠道数量。

这些担忧并不否定异构模式。它们界定了验证该模式所需的证据。

该部委提出从软件集成到真实服务和公开指标的推进路径,抓住了正确的问题。如果项目止步于短期试点,就会失去可信度。

生产测试应为韩国 NPU 分配核心工作负载,而非象征性的辅助任务。它应接收真实流量,并让硬件经受故障、恢复事件和模型更新的考验。

结果应展示每瓦性能、每请求成本、服务可用性和开发者投入,并在等效服务目标下,将混合系统与现代 GPU 配置进行比较。

中立评估机构将增强研究结果的说服力。大学可以协助设计方法论,客户则可以验证工作负载是否反映商业条件。

最终报告应公布令人失望的结果,也应公布成功案例。模型支持或编排方面的弱点,将指出进一步投资最重要的方向。

韩国政府必须避免将采购作为衡量采用情况的唯一标准。政府采购可以暂时创造需求,但私人运营者决定一个平台是否具有持久价值。

原始论坛清楚地体现了这种张力。政府支持可以为本土厂商争取时间,并建立评估基础;但它无法让客户偏好成本更高或故障更频繁的系统。

三个信号将显示该计划是否奏效

接下来的关键证据将是可用的软件栈、商业部署,以及可由独立方验证的运营数据。

第一个信号是 AMD CPU 和 GPU 与至少一家韩国 NPU 之间成功实现集成。这必须超越识别设备或运行预先准备的演示。

有价值的集成应能通过文档化工具完成安装,并在无需大量人工干预的情况下执行受支持的模型。开发者应能检查故障,并以一致方式衡量设备行为。

调度将提供成熟度的早期迹象。平台必须根据能力、可用内存、延迟目标和功耗限制来部署工作负载。

该集成还应说明应用如何在处理器之间迁移。如果开发者必须重写推理服务的大部分内容,该平台将难以吸引用户。

如果软件以维护中的开放仓库形式提供,并附有可复现的安装说明,这一信号将强化异构计算的论点。封闭式演示则会削弱这一论点。

第二个信号是在商业工作负载下的部署。韩国计划中的大规模演示应涉及一家服务真实客户,或运营重要内部服务的机构。

除非其流量和服务目标接近生产需求,否则单纯的聊天机器人无法解决这一问题。更好的候选方案应结合模型服务、检索、Agent 操作和不断变化的请求模式。

部署应运行足够长时间,以经历升级和故障。运营者需要关于可靠性、恢复、人员配置要求和支持响应的证据。

商业延续性比启动仪式更重要。如果客户在试点后扩大部署规模,表明该系统提供了可量化的价值。

即使初始基准测试看起来有利,若决定将工作负载迁回 GPU,也会削弱这一论点。这种结果将表明,运营复杂性超过了效率收益。

第三个信号是公布可比较的性能和成本数据。韩国参与方已经主张采用可由第三方验证的数据,因此,信息披露是评判进展的合理标准。

报告应包括每瓦 token 数、每机架用户数、尾延迟、正常运行时间和系统总功耗,也应披露模型版本、精度、提示词长度和软件构建版本。

成本报告应将硬件、能源、冷却、网络和工程工作分开列示。否则,较低的加速器功耗数据可能掩盖系统其他环节的支出。

比较应采用相同的质量和服务目标。如果量化显著降低回答质量,或造成不可接受的模型行为,那么更快的输出价值有限。

透明的结果比毫无保留的胜利宣称更有帮助。买方需要了解哪些工作负载更适合 NPU,哪些仍更适合 GPU,以及 CPU 在何处仍发挥核心作用。

这三个信号应按顺序出现。软件集成促成商业部署,而部署会生成可信的运营数据。

时间表也将揭示这份谅解备忘录是否具有制度性分量。韩国政府表示,正将大型演示作为下一年度的新预算项目进行准备。

仅凭预算获批无法证明采用。它只能显示政府是否已将 7 月协议转化为获得资金支持的实施计划。

私营部门的参与将是更有力的指标。云服务商、企业和工业公司必须看到足够的价值,才会贡献工作负载,并在政府支持减少后继续采购。

Google News 为原始说法提供了一个吸引眼球的框架:用单一 GPU 类型填满数据中心的时代正在结束。现有证据如今支持的是一个更为狭窄的结论。

推理经济性正在为混合处理器类型创造可信的理由。韩国还拥有本土 NPU 公司、强大的存储器专长、工业工作负载,以及愿意探索集成的全球合作伙伴。

但这些都不能证明已经形成了 Nvidia 平台的成熟替代方案。开放系统仍需要软件成熟度、商业可靠性,以及可由独立方复现的经济性。

关注实际部署的内容,而不是签署的内容。如果 AMD 处理器和韩国 NPU 能以公开的成本与功耗收益承载真实流量,异构基础设施就会成为一种采购选择。

如果该项目仍只是带有选择性基准测试的试点,那么单一厂商数据中心将保留其最强优势:它已经作为一个系统运转起来。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page