top of page

Positron AI 融资支持对 Nvidia 发起以内存为先的挑战

6天前
讀畢需時 15 分鐘

9 月 10 日,Positron AI 融资额达到 8.75 亿美元,为这家初创公司带来新资金,以挑战以 Nvidia 为核心的系统处理 AI 推理的方式。根据其融资公告,本轮融资令 Positron 的估值达到 50 亿美元。然而,支撑这一估值、名为 Asimov 的处理器尚未进入量产。

这一差距定义了这则故事。Positron 并非只是推出另一款计算核心组合不同的加速器。它认为,生成式 AI 推理已成为一个内存数据搬运问题,而不只是追求更多算力的竞赛。

该公司围绕 LPDDR5X 设计 Asimov。LPDDR5X 是一种通常与移动设备相关的低功耗内存技术。Nvidia 的领先数据中心加速器则使用高带宽内存,即 HBM;这种内存被部署在处理器附近,以实现快速数据访问。

Positron 表示,这种以内存为先的架构将为大型模型提供更多可用容量和更好的能耗经济性。该公司还称,该设计能够规避部分 HBM 供应与封装限制。

这些承诺尚未在量产芯片上得到验证。Asimov 预计将在 2026 年末附近完成流片,即将完成的设计送往制造环节。量产目标定在 2027 年下半年。

因此,真正的竞争在于以内存为先的 AI 芯片与围绕 HBM 构建的成熟 GPU 系统之间。Positron 已获得进入这场竞争所需的资金,但尚未拿出解决这一问题所需的量产证据。

Positron AI 融资将架构论点转化为制造押注

本轮融资支持一项明确的转变:将 Asimov 从技术设计推进为制造芯片和商业化系统。

本轮融资分两部分进行。Positron 表示,其以 35 亿美元投前估值完成了 3.75 亿美元的 C 轮融资。随后进行的 C-1 轮融资最高可达 5 亿美元,使宣布的融资总额达到 8.75 亿美元。

NEA、Atreides Management、Valor Equity Partners、Andra Capital、SemiAnalysis Capital 和 Jim Clark 均是本轮融资的领投方。其他参与者包括 Qatar Investment Authority、Cisco Investments、Naver Ventures 和 Hudson River Trading。

公司董事会也新增了数位投资者代表。这些新增席位将融资直接连接到下一阶段的制造与商业化进程。

Positron 表示,这笔资金将支持 Asimov 流片,以及其计划推出的推理服务器 Titan 的量产爬坡。资金还将用于扩展公司硬件产品组合周边的制造能力。

该公司此前于 2026 年 2 月融资 2.3 亿美元,估值超过 10 亿美元。Reuters 报道称,PitchBook 对该轮融资的估值约为 10.6 亿美元。因此,最新一轮融资使 Positron 的估值在七个月内增长了数倍。

这一变化显示,投资者正以多高的价格评估推理基础设施的潜在价值。但它并不能证明 Asimov 的实际表现符合宣传。

Positron 已拥有名为 Atlas 的第一代系统。该公司称,超过 50 个 Atlas 机架正在 Oracle Cloud Infrastructure 部署。Parasail 将使用该容量提供推理服务,Jump Trading 和 i3d.net 也被列为生产环境客户。

Atlas 的意义在于,它让 Positron 在 Asimov 面世前获得运营经验。不过,Atlas 并不能消除新定制处理器、内存子系统、互连、编译器和服务器平台所附带的执行风险。

Asimov 代表着规模更大的技术投入。Positron 计划采用先进制程制造这款芯片,并将其集成到四芯片或八芯片 Titan 服务器中。

成功流片仅意味着完成一个阶段。随后产出的芯片还必须在真实工作负载下达到频率、功耗、良率、内存、网络和软件方面的目标。

Positron 还必须确保足够的组件和制造产能,以商业规模交付系统。即使架构理念看起来可靠,先进芯片仍可能遭遇延误。

因此,投资者正在为两个相互关联的命题提供资金。第一,推理需求将证明一个新的硬件类别存在合理性。第二,Positron 能在既有平台再次推进之前,将其内存论点转化为可靠设备。

第二个命题更为困难。在 Positron 从设计走向制造期间,Nvidia 将继续推进其 GPU 路线图。

本轮融资的规模让 Positron 有更大空间承受工程挫折。但它无法让半导体开发变得可预测。

为何内存已成为推理瓶颈

Positron 的核心论点是,许多生成式 AI 工作负载花费过多时间搬运模型数据,而用于实际计算的可用算力过少。

AI 推理是运行已训练模型以生成答案、图像、预测或行动的过程。它不同于训练;训练会利用大规模数据集和重复计算来调整模型。

大型语言模型推理通常分为两个阶段。第一阶段处理用户输入,第二阶段则逐个生成输出 token。

这一 token 生成阶段往往高度依赖内存带宽。加速器会反复提取模型权重,也就是编码模型所学内容的数值。

即使芯片拥有可观的算术能力,当这些数值无法足够快地到达时,部分算力仍可能闲置。更高的理论算力并不会自动解决数据搬运问题。

更长的提示词带来了另一处压力点。推理系统会维护键值缓存,通常称为 KV cache,用于存储来自先前 token 的中间注意力数据。

随着对话、文档和智能体历史变长,该缓存也会增长。在大量并发用户场景下,它可能消耗大量内存。

Positron 围绕容量和可实际利用的带宽设计了其 Asimov architecture。该公司列出的配置范围为每颗芯片 288 GB 至 2.3 TB 的 LPDDR5X 内存。

该公司称,可实现的内存带宽为 2.76 TB/s,热设计功耗约为 400 瓦。热设计功耗描述了冷却系统必须准备处理的发热水平。

Positron 还称,在 transformer 工作负载上,Asimov 可利用超过 90% 的可用内存带宽。它将这一数字与运行相同模型的 GPU 不足 30% 作比较。

这些百分比来自 Positron,而非独立的量产基准测试。在外部测试者能够评估制造出的芯片之前,应将其视为设计主张。

LPDDR5X 的选择是这一思路的核心。LPDDR 指低功耗双倍数据速率内存,这是一种旨在降低能耗、同时高效传输数据的技术。

HBM 通过部署在加速器附近的垂直堆叠内存,提供极高的峰值带宽。它已成为领先 AI GPU 的关键组成部分,但需要专门制造和先进封装。

单个传统内存封装的 LPDDR5X 无法提供相同的峰值带宽。Positron 的方案是使用大量内存通道,并围绕其预计可实现的带宽平衡周边计算能力。

这并不只是以更便宜的内存进行替代。处理器、内存控制器、物理布局、互连和软件必须作为一个整体架构协同工作。

Asimov 包含两个被 Positron 称为 hemispheres 的运行半区。每个半区拥有自己的内存子系统,可以处理独立工作,或参与更大的工作负载。

该芯片还包含可配置的脉动阵列,即通过规则流水线传递计算的处理单元网格。Positron 表示,该阵列可针对不同 transformer 操作改变方向。

专用硬件处理包括归一化、softmax 和位置编码在内的功能。这些操作贯穿 transformer 推理;若反复经由通用执行路径处理,可能产生额外开销。

基于 Arm 的处理器核心为较难预测的操作提供了一条路径。这种组合旨在将常见任务保留在专用硬件上,同时不让处理器变得完全缺乏灵活性。

这一机制具备足够可信度,值得关注。数据搬运消耗时间和能量,而模型规模与上下文要求仍在持续增长。

不过,架构效率取决于工作负载行为。针对受内存限制的 token 生成进行优化的系统,在计算密集型输入处理或其他模型类别上可能具有较小优势。

Positron 承认,不同加速器可以专注于不同的推理阶段。其论点并不要求 GPU 全面过时。

它要求以内存为先的 AI 芯片在足够多的高价值工作负载中胜出,从而使买家愿意接受另一套硬件和软件平台。

Asimov 和 Titan 瞄准考验 GPU 内存的模型

Positron 的目标是大型模型、扩展上下文和高用户并发,而非所有推理工作负载。

计划中的 Titan 服务器将结合四颗或八颗 Asimov 处理器。Positron 的 Titan specifications 列出,其最高可配备 18.4 TB 加速器内存和 6 TB 主机内存。

该公司称,一台服务器可支持多达 32 万亿参数的模型,也宣传其上下文窗口可超过 1000 万 token。

这些是容量主张,并非证明处于这些上限的每个模型都能提供可接受的速度或准确性。参数量本身无法描述系统的实际性能。

模型架构、数值精度、批处理、缓存需求、网络流量和软件优化都会影响结果。稀疏的混合专家模型,其行为方式也不同于参数总量相同的稠密模型。

不过,目标使用场景已很清楚。长文档处理、持续运行的 AI 智能体、多模态系统和视频生成,都可能对加速器内存提出沉重要求。

一个 AI 编程智能体可能需要访问代码仓库文件、工具结果、先前决策和延展的交互历史。企业研究助手则可能在维持长时间会话证据的同时处理数千份文档。

视频模型必须处理时间序列,而非孤立的文本 token。这可能增加推理系统必须保留和搬运的中间数据量。

高容量内存可减少将模型拆分到许多设备上的需求。更少的分区可以简化通信,并避免部分网络开销。

Positron 表示,每颗 Asimov 处理器将提供 16 Tb/s 的直接芯片间带宽。其拟议的集群可通过多种网络布局连接多达 16,384 颗芯片。

在服务器层面,该公司列出了对 PCI Express 6 和 Compute Express Link 的支持。Compute Express Link,即 CXL,可让处理器和加速器通过共享协议访问连接的内存。

这些接口很重要,因为推理并非完全在加速器内部进行。主机负责 tokenization、调度、采样、请求和缓存管理等任务。

更大的内存池除了容纳单个超大模型外,也具有运营价值。供应商可以加载多个模型、服务更多用户,或保留更大的缓存,而无需频繁从存储中迁移数据。

然而,容量只有在软件能够高效分配时才有价值。编译器、模型运行时、调度系统、可观测性工具和故障恢复机制,决定了运营商能否可靠地使用这些硬件。

Nvidia 的优势不止体现在芯片规格上。CUDA、优化库、成熟的部署工具和庞大的开发者社区,降低了运行新模型所需的工作量。

Positron 必须提供兼容的框架和可靠的工具链。买家比较的不只是每瓦 token 数,也会比较部署和维护工作负载所需的时间。

这家初创公司称,其软件将支持广泛使用的模型接口。真正有意义的考验将在外部工程师无需 Positron 团队直接协助,即可迁移具有代表性的应用时到来。

Titan 面向风冷和液冷部署而设计。这种灵活性解决了数据中心运营商在获取新冷却基础设施方面受限的实际约束。

不过,标称 400 瓦的芯片并不代表整台服务器或整个机架的总耗电。内存、主机处理器、网络设备、电源转换装置、风扇和冷却设备都会影响设施的能耗。

因此,最具参考价值的比较将涉及完整系统。买家需要在相同工作负载和服务目标下,衡量吞吐量、延迟、利用率、能耗和运营成本。

狭义的加速器基准测试无法回答这些问题。理论内存带宽数字同样无法回答。

真正的对手是 Nvidia 以 HBM 为核心的平台

Positron 必须超越完整的 GPU 平台,而不只是暴露某项基准测试中效率不高的局部表现。

Nvidia 的数据中心 GPU 将强大的计算能力与 HBM 和高速互连相结合。该公司还销售机架级系统,将处理器、网络、软件和冷却整合在一起。

这种集成让客户获得一个责任主体明确的平台,也让基础设施团队能够在多种工作负载中复用熟悉的编程工具。

Positron 针对目标细分市场采取了相反的架构立场。它从生成式推理的内存需求出发,再增加足够的计算能力,以充分发挥这些内存的效能。

这种差异带来了比简单的初创公司对阵现有巨头更尖锐的比较。它提出的问题是:专为推理打造的硬件,能否克服 GPU 在灵活性和软件成熟度方面的优势。

Nvidia 系统可以运行训练、输入处理、token 生成、科学计算工作负载及其他加速应用。这种灵活性有助于运营商在需求变化时,让昂贵的基础设施保持高利用率。

Asimov 的专用化程度更高。专用化可以提升效率,但当客户优先级变化时,也可能缩小可承载的工作负载范围。

HBM 问题又增加了一个维度。HBM 提供高带宽,但其供应依赖于数量有限的内存生产商和复杂的封装产能。

Positron 认为,LPDDR5X 能让其获得更广泛的内存供应链,同时降低功耗要求。Qatar Investment Authority 在其投资声明中提到了对受限 HBM 和先进封装的依赖降低。

这一供应链主张具有战略重要性。即便无法赢得所有性能类别,能够避免使用稀缺组件的加速器也可能更易制造和扩产。

不过,在大规模部署之后,任何替代内存的需求都可能发生变化。Positron 必须确保获得足够数量的合适 LPDDR5X,维持多通道下的信号完整性,并验证完整设计。

HBM 技术也不会停滞不前。内存供应商持续提升容量、带宽和能效,而 Nvidia 可以调整其架构和系统配置。

Nvidia 还通过规模获得了杠杆优势。其供应商关系、生产承诺和客户覆盖范围,可以降低小型公司必须直接管理的风险。

其他推理专业厂商从另一方向施加压力。Groq 强调确定性执行和低延迟 token 生成。Cerebras 使用晶圆级处理器,配备大容量片上内存和广泛的内部带宽。

SambaNova 提供围绕自身数据流架构构建的集成系统。云服务商也部署了自研加速器,包括 Google 的 tensor processing units 和 Amazon 的 Inferentia 芯片。

这些替代方案表明,对通用 GPU 经济性的不满并非 Positron 独有。但它们也让市场更加艰难,因为客户拥有多种专用选择。

Positron 的创始人拥有相关运营经验。CEO Mitesh Agrawal 曾担任 Lambda 的首席运营官,而联合创始人 Thomas Sohmers 曾在 Groq 和 Lambda 工作。

这一背景将芯片设计与基础设施部署的现实联系起来。但这并不保证客户会采用又一个专有平台。

Positron AI 本轮融资让该公司获得了更接近先进半导体项目所需规模的资源。其 50 亿美元估值也在决定性产品尚未问世前提高了市场预期。

投资者实际上已将成功制造、有竞争力的性能、客户需求和量产扩张计入估值。若其中任何一个里程碑未能实现,支撑该估值的逻辑都会被削弱。

Nvidia 无需在每项基准测试中击败 Asimov。它可以通过提供足够高的效率、更低的迁移风险和更广泛的工作负载覆盖来留住客户。

Positron 的任务要求更高。它必须带来足以证明软件改造、采购风险以及依赖较年轻供应商合理性的收益。

Positron 的性能主张尚未证明什么

最大的未知并非内存是否重要,而是 Asimov 的模拟优势能否经受制造和客户部署的考验。

Positron 公布的 Titan 对比指出了一项重要限制。该公司表示,Asimov 的性能基于周期精确模拟,即在实体芯片出现之前对芯片行为进行建模。

这类模拟在半导体开发中很常见。工程师用它来测试架构、估算性能,并在昂贵的流片前发现设计问题。

它们并不等同于从已制造芯片上获得的测量结果。真实设备会面临时钟波动、散热、供电、内存行为、制造缺陷以及意外的软件瓶颈。

Positron 将模拟的 Asimov 结果与来自 SemiAnalysis InferenceX 的 Nvidia GPU 数据进行比较。该框架可以提供细致的工作负载建模,但这一比较应谨慎解读。

SemiAnalysis Capital 共同领投了 Positron 的融资,创始人 Dylan Patel 也加入了该公司的董事会。这种关系并不会使数据失效,但读者应认识到其中的关联。

独立评估应使用已记录的模型、精度、提示长度、输出长度、批处理策略和延迟要求,复现这一比较。

当系统服务大批量请求时,每秒 token 数可能显得令人印象深刻。交互式应用则可能更重视首个 token 出现前的延迟,以及每位用户延迟的一致性。

每瓦 token 数也可能掩盖系统边界。仅限于加速器的比较可能忽略主机、内存、网络和冷却设备。

每美元 token 数需要对采购、利用率、电力、融资、维护和系统寿命作出假设。即使硬件相同,不同假设也会产生不同结果。

模型质量引入了另一项变量。较低的数值精度可以提高速度并降低内存需求,但应用必须确认输出质量仍然可接受。

软件成熟度是另一项风险。新加速器可能在选定模型上表现出色,却难以应对不常见的操作、快速的架构变化或定制企业代码。

Positron 将通用 Arm 核心作为不受支持操作的后备路径。这可以改善兼容性,但频繁回退可能削弱预测中的性能优势。

可靠性也必须在大规模集群中得到验证。Positron 提出的配置可扩展至数千颗芯片,在这一规模下,组件故障和网络行为都会成为日常运营问题。

客户将期待检查点机制、健康监控、工作负载隔离、安全控制和可预测的恢复能力。这些功能很少出现在头条基准测试结果中。

部署时间表带来了时机风险。Asimov 预计将在 2026 年末流片,随后于 2027 年下半年进入生产。

首次流片并不总能产出可量产的芯片。发现严重问题可能需要修改设计并再经历一个制造周期。

与此同时,竞争对手将发布新硬件和软件。相较于某一代 GPU 看起来有利的性能目标,可能在产品上市时变得不再那么有说服力。

当前的 Atlas 部署为 Positron 提供了真实的客户反馈。不过,Asimov 改变了足够多的技术栈,以至于 Atlas 的采用情况无法验证其最终性能。

该公司称,Atlas 已通过 Oracle Cloud Infrastructure 的 50 多个机架以超大规模云服务商级别运行。有关利用率、工作负载组合、服务水平和经济效益的外部细节仍然有限。

这些信息将帮助买家区分实体部署与持续的生产需求。仅凭机架数量无法显示系统承载了多少流量。

这些不确定性均未推翻内存优先的论点。它们界定了仍然缺失的证据。

Positron 已解释其架构应如何工作。下一阶段必须展示它在公司模型和选定部署之外的实际表现。

三个信号将决定内存优先的押注是否奏效

流片质量、独立基准测试和重复客户部署,将决定本轮融资是否造就了可持续的 Nvidia 替代方案。

第一个信号是 Asimov 的流片和初始硅片。Positron 的目标是在 2026 年末流片,随后于 2027 年下半年进入生产。

重要的更新不会只是象征性的设计完成。买家应关注首批芯片是否能启动、运行目标模型,并接近公布的频率和功耗范围。

成功的首批硅片结果将增强 Positron 的执行力论据。重新设计或进度延误将缩短其在竞争平台进步前可用的时间。

第二个信号是可由独立方复现的基准测试。它应在相同模型、上下文长度、批处理规则和延迟目标下,对完整的 Asimov 与 GPU 系统进行比较。

结果应包括首个 token 时间、生成速度、内存利用率、系统总功耗和持续吞吐量,还应披露数值精度和软件版本。

若在多种工作负载类型中均取得有利结果,将支持 Asimov 推理芯片的论点。若仅在一个经过精心挑选的场景中表现强劲,则意味着市场可能更为狭窄。

第三个信号是重复的生产需求。最有价值的证据将是更多客户在真实服务条件下运行 Positron 硬件后,超越试点阶段继续扩展部署。

买家应关注工作负载细节、利用率、服务可靠性和部署增长。具名客户在其使用持续超过最初公告之后,才更具意义。

Oracle 的 Atlas 安装项目为 Positron 提供了一个可信的起点。这项 50 机架部署 也让该公司能够积累有关调度、散热、维护和软件集成的经验。

最有力的验证,将是这些经验能否转化为 Titan 的市场采用。现有客户若选择 Asimov 系统,将表明 Positron 已将运营层面的信任转化为对其新架构的需求。

竞争对手的反应也将提供更多背景。Nvidia 可以通过新一代 GPU、软件更新、更低精度的格式以及专用系统配置来提升推理效率。

云服务商同样可以引导客户采用其内部加速器。其他初创公司则可能以不同的技术取舍,瞄准相同的内存和延迟瓶颈。

这意味着 Positron 并不存在毫无竞争的成长空间。它的时间窗口取决于能否在其所发现的差距缩小之前完成交付。

对开发者而言,实际问题在于可移植性。框架支持、模型覆盖范围、调试工具和部署工作量,将决定 Asimov 是否能在专业团队之外被广泛使用。

对基础设施采购方而言,决定性指标是完整的服务经济性。硬件效率只有在以可接受的运营成本提供可靠容量时才有意义。

对 AI 产品团队而言,更大的内存容量或许能够支持更长的智能体历史记录、更大的检索上下文,以及要求更高的多模态应用。不过,这些优势仍需要模型能够有效利用这部分容量。

Positron AI 的 8.75 亿美元融资,已将一场技术论证转变为资金充足的制造计划。但它尚未将模拟变成芯片,也未将预测变成客户成果。

关注首批芯片、首批独立测量结果,以及首批重复订单。如果三者都能如期到来,以内存为先的推理将成为严肃的采购选项。若其中任一环节失利,Nvidia 的一体化 GPU 平台仍将难以被取代。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page