top of page

AMD Google 战略借助 Taalas 转向硬连线

8月11日
讀畢需時 14 分鐘

AMD 于 8 月 6 日同意收购 Taalas,为其不断扩大的 Nvidia 和 Google 挑战增添了一项极端专业化的押注。这家多伦多创业公司围绕单个 AI 模型打造芯片,牺牲广泛的可编程性,以追求更快得多的推理速度。

这使其不只是 AMD 的又一次收购。该公司正在买入一条绕开内存数据搬运、软件开销和散热需求的路径,而这些因素共同塑造了现代 GPU 系统。Taalas 将模型权重和计算直接置入其芯片设计之中。

这一战略带来了一个不同寻常的 AMD 与 Google 对比。Google 多年来一直在为机器学习工作负载定制其 Tensor Processing Units。AMD 现在希望针对选定模型走得更远,同时将这类专用硬件与其 Instinct GPUs 和 Helios 机架级系统连接起来。

这笔交易并不意味着 GPU 会过时。Taalas 无法训练任意前沿模型,也无法在无需新芯片的情况下承载每一种新模型。它的价值取决于高容量推理工作负载能否保持足够长时间的稳定,从而证明专用芯片的投入是合理的。

这种权衡让 AMD 面对的是 Nvidia 的通用平台,而不只是其最新加速器。结果将表明,AI 基础设施的下一阶段究竟会奖励无处不在的灵活性,还是在最繁忙环节的专业化。

AMD 正在购入一条新的推理路径

AMD 收购 Taalas,是因为通用加速器并不总是反复服务成熟模型的最高效方式。

AMD 已就收购 Taalas 达成最终协议,但仍须获得监管批准并满足惯常交割条件。该公司未披露交易财务条款,也未提供交割日期。

收购协议显示,AMD 计划将 Taalas 技术整合进其加速器路线图。该公司还打算开发将该技术与 AMD Instinct GPUs 相结合的系统级产品。

这一细节界定了该战略。AMD 并未将 Taalas 定位为 Instinct、EPYC 处理器或 ROCm 软件的替代品。它将专用推理芯片视为更广泛平台中的另一种计算引擎。

Taalas 成立于 2023 年,总部位于多伦多。其创始人包括曾任职于 AMD、Nvidia 和 Tenstorrent 的工程师。联合创始人 Ljubisa Bajic 此前参与 AMD 芯片设计,之后协助创立 Tenstorrent。

这家创业公司通过 HC1 首次公开亮相,这是一款针对 Meta 的 Llama 3.1 8B 模型优化的技术演示产品。8B 模型包含约 80 亿个已学习参数,这些参数决定了它如何处理和生成语言。

HC1 不像传统 GPU 卡那样可以从内存加载许多不同模型。它将特定模型的权重和数据流以物理方式编码进芯片的部分结构中。

Taalas 将其称为模型专用或模型最优芯片。该方法采用掩模 ROM 调用架构,其中固定信息通过芯片的制造层形成。可编程 SRAM 则保留给可变数据,包括文本生成期间使用的键值缓存。

AMD 的公告没有承诺具体产品或性能水平。公告称,Taalas 可减少与通用架构相关的计算和内存瓶颈,并将这项技术描述为对 Helios、Instinct、EPYC 和 ROCm 的补充。

这种谨慎的措辞很重要。AMD 收购的是一个技术方向和一支工程团队,而非其现有路线图的成熟替代方案。

因此,眼下的变化体现在架构层面。AMD 现在可以探索这样的系统:GPU 处理灵活工作负载,而固化芯片服务于稳定、重复性的推理任务。

这种分工类似于数据中心已经将网络、存储和安全功能交给专用处理器的做法。Taalas 将同样的逻辑应用到了模型本身。

如果整合成功,AMD 系统可使用灵活的 Instinct GPUs 应对模型变化、提示处理或较难预测的工作。专用芯片则可为选定的生产模型处理重复的 token 生成。

这种可能性使此次收购成为对 Nvidia 平台经济性的直接挑战。当灵活和重复性工作都依附于其 GPUs 时,Nvidia 将从中获益。AMD 押注的是,部分最有价值的推理周期可以转移到其他地方。

为什么 AMD 与 Google 的竞争如今纳入了定制芯片

AMD 与 Google 的竞争正从加速器性能扩展至:谁能掌控客户如何在专用硬件之间划分 AI 工作负载。

Google 的 TPUs 说明了专业化为何重要。TPU 是围绕机器学习运算设计的定制处理器,而非源自 GPU 更广泛的图形处理传统。

Google 仍在其各代 TPU 上支持许多模型。Taalas 则做出了更狭窄的取舍,即针对一种模型配置优化芯片。这种差异是一个连续光谱,而非定制芯片与 GPU 之间的简单二分。

超大规模云服务商有充分理由沿着这一光谱前进。推理将训练好的模型转化为答案、图像、预测或行动。一旦服务达到高规模,微小的效率提升都会在每次请求中累积放大。

训练在技术上依然要求很高,但它是周期性发生的。只要客户使用生成的模型,推理就会持续进行。语音系统、编程助手、搜索功能、翻译服务和自主智能体都可能产生持续需求。

AMD 最近的业绩体现了这类需求所处的规模。该公司报告称,2026 年第二季度营收为 115 亿美元,其中数据中心部门贡献 67 亿美元。数据中心营收较上年增长 107%。

这些季度业绩也说明了 AMD 为何能够同时推进多种架构。Instinct 部署正在扩张,Helios 则开始进入量产爬坡阶段。

AMD 还宣布了涉及 Anthropic 和 Microsoft 的大规模部署。其 Helios 设计将 GPUs、EPYC CPUs、网络和软件整合为机架级平台。这是 AMD 对 Nvidia 日益一体化系统的回应。

Taalas 提出了一个不同的问题:最佳机架是否不应完全由单一类型的加速器构成?

AMD 已通过与 Cerebras 的合作迈向异构推理。该安排将 Helios 系统与 Cerebras 晶圆级处理器结合,为不同推理阶段分配适合各阶段的硬件。

Taalas 将这一原则从系统分工延伸至模型专用芯片。对于足以证明极端优化合理性的工作负载,该公司可为 AMD 提供另一种引擎。

Google 面临着同样的根本选择。它可以持续改进能力广泛的 TPU 平台、委托开发更狭窄的设计,或同时采用两者。大型云运营商拥有足够需求,可以支持围绕重复性工作负载构建的硬件。

不过,Taalas 也为 AMD 提供了一种向单一云服务商以外销售专业化能力的方式。Google 的定制芯片主要强化 Google Cloud 及其内部服务。AMD 则有可能向多个模型开发商和基础设施提供商提供相关能力。

这将使 AMD 成为定制推理系统的外部供应商。没有 Google 芯片设计组织的客户,可以通过 AMD 获得模型专用硬件。

这一战略也契合 AMD 的历史。其收购 Xilinx 后获得了现场可编程门阵列,即 FPGAs,客户可在制造后对其重新配置。Taalas 则处于灵活性光谱的另一端附近。

FPGA 可接受频繁变化,但可编程性也带来开销。Taalas 芯片牺牲了大部分灵活性,以提高密度并减少数据搬运。AMD 现在可以评估这两个极端之间的多个选择。

这种广度并不保证会被采用。客户仍须决定哪些模型值得使用专用硬件、这些模型能维持多久的实用性,以及专用系统如何融入现有运营。

重要的变化是,AMD 不再必须用另一块通用 GPU 来回答每一个推理问题。这对 Nvidia 的加速器平台和 Google 的定制芯片优势都形成了压力。

将模型硬连线会改变性能方程

Taalas 通过减少反复的数据搬运来提升速度,但这种效率的代价是芯片绑定于单一模型。

传统加速器将模型权重存储在高带宽内存中,通常称为 HBM。计算单元在处理请求时会反复读取这些权重。

现代 GPUs 使用宽内存接口、大型缓存和先进封装来保持数据流动。这些系统仍具有灵活性,但数据搬运会消耗功耗并增加架构复杂性。

Taalas 将模型权重嵌入其掩模 ROM 架构中。计算在靠近存储数值的位置进行,缩短了内存与算术单元之间的距离。

这家创业公司称,它可以用一个晶体管存储一个四位参数并完成相关乘法。该说法尚未在商业规模上得到独立验证,但它解释了该架构预期的密度优势。

据 Taalas 称,HC1 采用 TSMC 的 N6 工艺制造,面积为 815 平方毫米。该芯片容纳完整的 Llama 3.1 8B 模型,功耗约为 250 瓦。

独立演示测试中,HC1 面向一名用户时每秒生成超过 15,000 个 token。Taalas 报告称,在某些条件下结果接近每秒 17,000 个 token。

token 是语言模型处理的一个小型文本单位。token 速度会影响模型在接收请求后生成长篇回复的速度。

这一结果引人注目,但需要结合背景理解。HC1 运行的是经过激进量化的 Llama 3.1 8B 版本。量化以更少的位数表示模型数值,从而减少内存和计算需求,但可能影响输出质量。

该芯片无法通过软件下载切换到另一模型。从 Llama 3.1 转向另一种架构,需要制造修改后的版本。

Taalas 认为,这种更新是可控的,因为它只会改动两层金属掩模。底层基础设计基本保持不变,而改变后的连接则编码新的权重和数据流。

该公司称,其自动化流程可在约一周的工程工作量内,将模型转换为接近寄存器传输级硬件规格的设计。其目标是用两个月完成定制芯片的周转。

这些时间表仍属于公司说法。制造产能、验证、封装、客户认证和生产良率都可能延长实际部署周期。

随着模型规模增长,这一架构会变得更加困难。HC1 可在单芯片上容纳一个 8B 模型,但大得多的模型将需要大量芯片和额外通信。

Taalas 已为拥有 6710 亿参数的 DeepSeek-R1 模拟了多芯片配置。该公司估计,即便未来设计的密度提高,仍大约需要 30 次定制流片。

模拟并不是已部署的产品。大型系统会带来网络延迟、可靠性问题、软件编排和制造挑战,而这些都是单芯片演示无法暴露的。

不过,HC1 的结果证明了一件更明确且重要的事:当一个模型足够稳定时,将其权重和计算路径变成处理器的物理特性,可以获得显著的速度提升。

这使 Taalas 对于延迟或请求量比即时模型灵活性更重要的工作负载颇具吸引力。例子包括实时翻译、语音处理、固定的计算机视觉模型,以及高吞吐量的智能体组件。

编码智能体也可以使用一个经过固化的小型模型来完成日常分类或工具选择。更大的、托管在 GPU 上的模型则可继续负责复杂推理。

这种分工允许专业化,而无需冻结整个 AI 服务。开发者可以将硬连线模型视为更大工作流中的一个高速组件。

对于管理大量模型输出的团队而言,在一个可搜索的知识库中保留相关提示词、评估结果和决策,有助于追踪某个特定模型版本为何进入生产环境。

因此,这笔收购为 AMD 提供的是一种机制,而非万能答案。它可以将专用引擎部署在灵活计算资源旁,并为每种工作负载分配合适的硬件。

Nvidia 的平台才是真正目标

AMD 正在挑战这样一种假设:每一种有价值的 AI 工作负载,都应在其整个生命周期内持续运行于可编程 GPU 之上。

Nvidia 的优势不止于芯片的原始性能。CUDA 软件、网络、开发者工具和集成式机架系统,使其硬件更容易部署到不断变化的工作负载中。

这种灵活性在模型开发期间具有巨大价值。研究人员调整架构、精度格式、上下文处理方式和服务技术的频率太高,固定硅片难以适应。

GPU 还让基础设施运营商能够重新分配容量。今天为一个模型提供服务的集群,明天无需更换处理器即可承载另一个模型。

Taalas 只会在工作负载稳定之后挑战这一优势。如果一个模型在足够长时间内产生足够多的请求,灵活性开始显得像一种额外开销。

这正是此次收购中的核心竞争图景:通用 GPU 基础设施对阵模型专用推理硅片。AMD 与 Google 的竞争为此提供了背景,但 Nvidia 的平台仍是首要目标。

Nvidia 无需直接复制 Taalas 便可作出回应。它可以提升内存带宽、降低精度支持、改善能效、优化软件调度和系统利用率。

它也可以将 GPU 与更专用的组件结合。Nvidia 的网络产品组合和系统控制能力,为其提供了许多在不将整个模型硬连线的情况下减少推理瓶颈的方法。

其他加速器公司则处于中间位置。Cerebras 将大量计算和内存资源置于晶圆级处理器上。Groq 通过其语言处理架构强调可预测的执行。

SambaNova 和 D-Matrix 在为推理优化内存与计算的同时保留了更多可编程性。Etched 则致力于为 Transformer 模型专门设计硬件,而不是针对一组固定权重。

在这些路径中,Taalas 代表了最极致的专用化。其优势应会在请求量高且目标模型保持不变时增强。

而当客户需要频繁更新时,其弱点就会显现。每隔几个月就采用新模型的服务,可能累积生命周期短暂的芯片库存和运营复杂性。

分析师 Karl Freund 在其HC1 评估中指出了这种管理负担。多个模型版本可能会形成许多需要数据中心团队支持的硬件配置。

这个问题不止关乎机架空间。运营商需要为每种配置提供备件、监控、调度、安全更新、兼容性测试和可预测的支持生命周期。

AMD 可以通过将 Taalas 技术整合进标准系统架构来减轻这一负担。通用的网络、管理和部署工具,能够使专用芯片表现得像受管理的组件,而不是孤立的设备。

ROCm 整合同样重要。如果使用一款高速处理器需要单独的开发和运维环境,客户会产生抵触。

这笔收购让 AMD 掌握了这些整合选择的主导权。它可以将 Taalas 硬件与 Instinct GPU 连接起来,而不必等待两家独立供应商协调路线图。

AMD 还必须决定这项技术在商业上应如何落地。独立的模型专用卡、另一封装内的芯粒,或 Helios 内的专用引擎,都会形成不同的采用路径。

该公司尚未宣布将采取哪一种设计。它只表示,Taalas 技术将纳入其加速器路线图,并支持系统级解决方案。

这种克制是恰当的。HC1 的性能并不能证明 AMD 能够面向众多客户,以经济的方式制造模型专用芯片。

它也无法表明需求是否会集中在稳定模型上。开放模型可以迅速走红,但生产环境用户往往会对其进行微调,或随着能力提升而替换它们。

在不确定性之下,Nvidia 的灵活性依然是更稳妥的默认选择。当客户能够识别出足够可预测、足以证明另一类硅片合理性的工作负载时,AMD 的收购才会真正构成威胁。

硬连线押注面临模型过时问题

只有当模型的有效寿命超过将其转化为可靠量产硬件所需的时间和投入时,Taalas 才能发挥作用。

AI 模型的发展速度仍快于传统半导体开发。在芯片项目启动时选定的模型,可能会在大规模部署到来之前失去相关性。

Taalas 通过修改两层金属层来应对这一风险,而不是重新设计每一层。这种方式比打造一颗完整的专用集成电路,即 ASIC,更快。

但两个月并非即时完成。客户必须冻结权重、选择量化格式、验证输出质量,并在作出承诺前预测需求。

更新后的安全政策或经微调的行为也可能改变权重。Taalas 为部分适配保留了可编程 SRAM,但它并不提供无限的制造后灵活性。

质量是另一个关注点。HC1 的速度比较依赖于高度量化的 Llama 模型。公平的评估必须在每秒 token 数之外,同时比较输出质量、上下文长度、批量大小、延迟和可靠性。

吞吐量也可能产生误导。一颗生成文本速度快于用户阅读速度的芯片,对普通聊天机器人或许价值有限。当机器消费输出,或大量任务并发运行时,其优势才更重要。

智能体系统提供了一个合理的市场。软件智能体可以生成代码、调用工具、分析文档,并以快于人类阅读每个中间 token 的速度协调子任务。

不过,智能体同样受益于更新的推理模型。将较旧模型固化,或许能降低服务成本,却会降低任务完成率,从而抵消基础设施节省。

安全更新带来另一项不确定性。固定模型可能会在制造后暴露不安全行为或漏洞。客户需要一种可信的方法来缓解这些问题,而不必废弃已部署的硬件。

AMD 的整合选择可以缓解这些弱点。GPU 可以处理更新后的政策、路由或回退请求,而专用硅片处理工作负载中稳定的部分。

这种混合设计会保留部分灵活性,但也会削弱 Taalas 效率论点的纯粹性。引擎之间的数据传输和协调可能重新带来开销。

规模是最难解决的问题。HC1 为一个 8B 模型提供了有说服力的证据。前沿规模系统会将计算和内存分布到众多处理器上,从而产生不同的工程约束。

Taalas 已发布针对更大配置的模拟结果,而非量产基准测试。AMD 不应将模拟性能视为该设计能够顺利扩展的证明。

制造经济性同样需要规模。即使采用减少掩模的工艺,仍需要晶圆产能、封装、测试和库存规划。小规模部署可能不足以证明这些固定成本合理。

收购价格仍未披露,因此投资者无法判断 AMD 当前的直接财务风险。更重要的成本将通过整合和未来产品开发到来。

根据其融资披露,Taalas 在交易前已筹集约 2.19 亿美元。这些资金支持了 HC1 演示,以及延伸至更大模型的路线图。

AMD 现在必须将这项研究转化为可重复交付的产品。成功不仅需要留住这家初创公司的团队,还需要客户承诺、制造执行力,以及能够隐藏运营复杂性的软件。

这也是 AMD 的公告强调产品组合的原因。该公司并非选择固定硅片来取代 GPU,而是购买了判断何时每种方式在经济上合理的能力。

持怀疑态度的结论很直接:Taalas 展示了不同寻常的速度,但尚未证明存在一个围绕单个模型绑定芯片的持久市场。

AMD 与 Google 的竞争接下来必须证明什么

下一步证据必须来自一款具名的 AMD 产品、一项经过独立测试的更大模型,以及一位愿意承诺生产流量的客户。

第一个信号是 AMD 的整合路线图。投资者和基础设施买家应关注一款在 Instinct GPU 旁使用 Taalas 技术的具体产品。

如果 AMD 解释工作负载路由、软件支持和部署时间表,一款具名产品将强化这笔收购的逻辑。对未来加速器的模糊提及,则会让这一战略仍未经验证。

这项技术所处的位置同样重要。独立卡可支持更快的实验,而芯粒则可带来更紧密的整合和更好的数据流动。

Helios 组件将表明 AMD 希望在大型 AI 工厂内部实现模型专用推理。嵌入式产品则意味着稳定的边缘工作负载提供了更早的商业机会。

第二个信号是在 Llama 3.1 8B 之外的独立性能测试。评测人员需要在匹配条件下比较输出质量、延迟、功耗、吞吐量和系统利用率。

更大的推理模型将提供更有力的技术测试。它将揭示 Taalas 是否能够在协调多颗芯片、支持更高要求的内存行为时保持其效率。

接近这家初创公司模拟结果的表现,将强化 AMD 对抗 Nvidia 的论点。模拟与量产之间的大幅差距,则会将这项技术限制在更小、稳定的工作负载中。

第三个信号是一位已作出承诺的客户。最理想的证据,是模型开发商或云服务提供商为具有持续流量的生产服务订购硬件。

客户承诺将验证最重要的假设:一个模型能够在足够长的时间内保持价值,从而证明专用硅片的合理性。有限的演示无法回答这个问题。

AMD 与 Google 的竞争使这一客户决策具有更广泛的意义。Google 已控制定制硬件、云基础设施和重要模型。Nvidia 则控制着领先的外部加速器平台。

AMD 正试图占据一个不同的位置。它希望向寻求替代方案的客户提供 CPU、GPU、网络、机架系统、软件,以及如今面向特定模型的推理技术。

只有当 Taalas 的专用化能力能够通过熟悉的 AMD 系统落地时,它才能增强这一产品组合。客户不应为了从中受益而变成半导体制造商。

对开发者而言,实际问题在于:延迟和调用量在何种程度上足以证明应将模型固化下来。稳定的翻译、语音、视觉、检索和智能体子程序,比持续变化的前沿助手更适合作为可信的起点。

对企业采购方而言,决策应基于经过测量的工作负载行为。团队需要证据证明,请求量、模型稳定性和质量要求在整个硬件生命周期内仍可预测。

AMD 已经获得了一个针对该问题的答案,而 Nvidia 的通用平台则通过灵活性来应对这一问题。AMD 现在必须证明,专用化所创造的价值足以抵消模型锁定带来的代价。

请关注首个集成产品、首个经过独立测试的更大模型,以及首个生产环境客户。这些信号将共同表明,AMD 对 Google 的挑战是否获得了一种真正的新架构,还是仅仅得到了一项令人印象深刻的实验室成果。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page