top of page

Qualcomm 新一代 Snapdragon 将 AI 竞争从速度转向内存

9月12日
讀畢需時 13 分鐘

Qualcomm 披露了其下一代高端移动平台中的三大计算引擎,其中包括该公司称首款可达到 5GHz 的移动 CPU。但 Qualcomm 新一代 Snapdragon 的核心并不只是更高的主频。其 Oryon CPU、Adreno GPU 和 Hexagon NPU 都瞄准同一项限制:数据移动会消耗时间、内存带宽和电池电量。

因此,该公司正将更多存储资源和专用加速能力部署到每个计算引擎附近。FlexCache 为 CPU 提供数据支持,专用高性能内存服务于 GPU,而更大的共享内存则支撑 NPU。这些改变面向的工作负载,会在规划、图形、推理和系统操作之间频繁切换。

这一思路让 Qualcomm 直接面对智能手机的内存限制。与此同时,Apple 也在其 A20 Pro 芯片中推广更高的内存带宽和神经加速能力。Qualcomm 已披露足够的架构细节来说明其策略,但尚未提供足够的独立测试结果来判定胜负。

Qualcomm 在芯片命名之前先披露了平台

Qualcomm 预览的是一套整合式计算策略,而非三项彼此无关的组件升级。

相关披露始于 2026 年 8 月 25 日发布的下一代 Oryon CPU。Qualcomm 随后于 9 月 2 日公布重新设计的 Adreno 图形架构,并于 9 月 10 日详述 Hexagon NPU,在 Snapdragon Summit 2026 前补全了核心计算版图。

Qualcomm 尚未在这些披露中公开命名这一高端移动平台。不过,该公司表示,这款芯片将搭载于下一代旗舰设备中。Snapdragon Summit 定于 9 月 22 日至 9 月 24 日在夏威夷毛伊岛举行。

初步架构报告介绍了一款八核 Oryon CPU,包括两颗 Prime 核心和六颗 Performance 核心。Qualcomm 表示,Prime 核心频率可达 5GHz。GPU 采用三组切片设计,运行频率为 1.45GHz,并配备 18MB 本地高性能内存。

Hexagon NPU 增加了用于 Transformer 运算的 Element Accelerator。Transformer 是大多数现代语言模型背后的神经网络架构。Qualcomm 还表示,该 NPU 支持最高 32K 的上下文长度,即在一次模型会话中可处理多达 32,000 个 token。

这些规格带来了醒目的性能标题。5GHz 移动 CPU 之所以备受关注,是因为智能手机必须在严格的散热和续航限制下运行。然而,Qualcomm 在解释新架构为何重要时,反复强调数据局部性。

数据局部性指的是,将指令、模型状态和中间结果保留在使用它们的处理器附近。相比反复访问系统内存,邻近缓存通常需要更少的时间和能耗。这一原则贯穿 CPU、GPU 和 NPU 的设计。

CPU 获得动态分配的缓存池。GPU 配备专用于图块、帧缓冲区和计算数据的本地内存。NPU 则拥有更大的共享内存和旨在减少外部数据传输的模型加载技术。

这很重要,因为智能体 AI 并非一项连续不断的单一计算。一个 AI 智能体可能需要理解请求、制定计划、调用应用、分析响应,再调整下一步操作。不同阶段可能会在不同处理引擎之间流转,从而提高每次数据交接的成本。

Qualcomm 押注于:当周边内存系统能持续供应数据时,专用处理器将带来更大的价值。这一命题比单一峰值频率纪录更具影响力,但也更难仅凭规格表验证。

5GHz Oryon CPU 只是 CPU 故事的一半

在 5GHz Prime 核心能够改善实际应用表现之前,Oryon CPU 需要持续访问有用的数据。

Qualcomm 将 Oryon 称为一套定制的 Arm 架构 CPU 微架构。微架构是决定处理器如何执行指令、预测分支、管理缓存和移动数据的内部设计。Qualcomm 掌控这些选择,而不是直接照搬标准 Arm Cortex CPU 设计。

下一代移动端实现包含两颗用于高负载任务的 Prime 核心,以及六颗负责其他任务的 Performance 核心。Qualcomm 表示,Prime 核心使 Oryon 成为首款达到 5GHz 的移动 CPU。在量产设备经过独立测试前,这一说法仍属于公司声明。

频率本身无法完整描述处理器性能。核心还必须在每个时钟周期内完成有用指令,同时避免因缺少数据而停顿。散热和功耗限制还决定了手机能够维持最高速度多久。

因此,Qualcomm 的5GHz Oryon 设计将频率主张与 FlexCache 相结合。这一架构让异构核心能够访问同一个动态分配的缓存池。异构核心是指性能和能效特征不同的核心。

固定缓存分配可能导致一个核心空间不足,而另一个核心仍有闲置容量。FlexCache 则允许负载较高的 Prime 核心在其工作集扩大时,从更大的共享池中获取资源。工作集是活跃任务在特定时期内所需的数据和指令。

将工作集保留在缓存中,可减少访问系统内存的次数。这既能降低延迟,也能减少芯片内部的数据流量。当任务在 Prime 和 Performance 核心间切换时,这也可能带来帮助。

智能体工作负载体现了这一设计目标。一个核心可能处理应用逻辑,另一个则为 NPU 准备数据。共享缓存能够在这些转换期间保留相关信息,而不必强迫每个核心重新获取数据。

游戏则提供了另一种例子。其处理器会不断更新模拟状态、角色行为和场景数据。更大的可访问缓存可减少停顿,不过实际效果仍取决于各游戏引擎和手机的散热系统。

视频编辑同样涉及连续操作。解码、特效、预览生成和导出,都可能在多个计算单元之间传递帧数据。Qualcomm 认为,将更多这些信息保留在附近将改善响应速度。

不确定性在于持续性能。处理器可以短暂达到高频,却未必能在长时间工作负载中维持。Qualcomm 尚未公布这一移动平台完整的功耗范围、缓存容量、制造工艺或持续散热测试结果。

这并不意味着该架构无效。它意味着 5GHz 这一数字应被视为系统的一部分,而非最终结论。量产手机的散热、电池容量、软件调度和厂商调校都会有所不同。

Qualcomm 面临的比较环境也很复杂。Apple 的 A20 Pro 在 iPhone 18 Pro 中采用六核 CPU 和重新设计的散热封装。Apple 宣称其新芯片带来了 iPhone 迄今最高的持续性能,而 Qualcomm 则主张移动端频率里程碑。

这些说法采用了不同的衡量方式。一方强调峰值频率,另一方强调产品的持续性能。独立测试需要在相同的工作负载、温度和功耗条件下比较完整手机。

对消费者而言,真正有价值的问题不是规格页上是否出现 5GHz,而是 Oryon CPU 能否更快完成日常和高强度任务,同时不缩短续航,也不会在数分钟后降频。

Qualcomm 新一代 Snapdragon 将内存局部性作为核心机制

Qualcomm 新一代 Snapdragon 架构将 AI 加速分布到每个主要计算引擎,同时让内存更接近实际工作负载。

Adreno GPU 让这一策略尤其直观。Qualcomm 表示,新设计拥有三组图形切片,每组都包含专用 Matrix Cores。矩阵核心可加速神经网络和现代图形技术所使用的数学运算。

据该公司称,这是首代搭载这类专用 AI 核心的 Adreno。游戏无需将每一项 AI 辅助图形操作都交给 NPU,而可在图形管线内处理特定模型。这减少了不同处理模块之间的往返传输。

GPU 还包含 18MB 的 Adreno High Performance Memory,即 HPM。这类本地存储可容纳帧缓冲区、渲染图块和中间计算结果等内容。Qualcomm 表示,将这些资源保留在 GPU 上可以减少对系统内存的访问流量。

该公司称,相较于 Snapdragon 8 Elite Gen 5 基准,功耗表现提升了 12%。这一数据尚未得到独立复现。Qualcomm 也没有提供足够的测试细节,来比较所有工作负载或持续运行条件。

Adreno Neural Fusion 是围绕这些 Matrix Cores 构建的软件与硬件系统。它应用 AI 辅助超分辨率技术,即先以较低分辨率渲染场景,再重建出更清晰的输出。若实现得当,这项技术可以减少图形计算量。

传统超分辨率可能带来闪烁、重影或画面细节偏软等问题。Qualcomm 表示,其新方法在保留精细细节的同时改善了运动稳定性。其AI 渲染架构已整合至 Unity 和 Unreal Engine 工作流程。

这些整合很重要,因为硬件功能需要开发者采用。若引擎和应用无法轻松调用,专用加速器的价值便有限。对 Unity 和 Unreal 的支持可减少集成工作量,但各工作室仍须测试并推出兼容实现。

Hexagon NPU 将相同的局部性原则应用于语言模型和智能体。NPU 是专为高效执行机器学习运算而设计的神经处理单元。Qualcomm 在向量和标量扩展单元之外,新增了专注于 Transformer 计算的 Element Accelerator。

向量扩展可并行处理多个相关数值。标量扩展处理单独操作,包括路由和决策逻辑。Qualcomm 将这些单元描述为一套用于推理、编排和模型控制的整体架构。

该公司表示,大容量共享内存增加了 50%。将模型状态、上下文、激活值和键值缓存数据保留在 NPU 附近,可减少外部内存请求。键值缓存会保存此前的 Transformer 计算结果,使模型不必为每个新 token 重复全部早期计算。

Qualcomm 还宣称,相较于 Snapdragon 8 Elite Gen 5,INT4 模型的预填充性能最高提升 50%。INT4 使用四位整数存储模型数值,可降低内存占用,但可能牺牲精度。预填充是模型生成响应前处理初始提示词的阶段。

该 NPU 支持 INT2、INT4、INT8、FP8 和 FP16 数值格式。开发者可根据模型质量、速度、内存和能耗需求,在更小或更大的表示形式之间选择。较低精度通常能减少资源消耗,但结果取决于模型对量化的适应程度。

最具雄心的主张涉及混合专家模型。MoE 模型包含专门的参数组,但会针对每个输入仅激活选定的组。这可以让模型获得更大的总参数规模,同时无需在每个 token 生成时调动全部参数。

根据 Qualcomm 的 Hexagon NPU 详情,该平台可支持总参数量最高达 300 亿的 MoE 模型。每个 token 生成步骤中,约有 30 亿个路由参数保持活跃。

Qualcomm 提议将未激活的专家存储在闪存中,并在需要时迁移和缓存所选专家。这种方法可减少某一时刻所需的工作内存。但它并不能让完整模型摆脱存储、加载延迟或带宽限制。

因此,这三类引擎分别应对不同阶段。Oryon 协调系统活动和通用代码。Hexagon 运行密集的神经网络推理。Adreno 则处理图形任务,同时加速适用于渲染管线的 AI 模型。

这一策略属于异构计算,即将每项工作负载分配给最适合它的处理器。Qualcomm 多年来一直采用异构处理。重要变化在于,专用 AI 运算和本地内存如今更深入地延伸至整个平台。

Apple 与 MediaTek 正在应对同一项限制

Qualcomm 的竞争对手同样在整合 CPU、GPU、神经加速、内存与软件,而非将 NPU 视为孤立功能。

Apple 于 9 月 9 日发布 A20 Pro,比 Qualcomm 披露 Hexagon 信息早一天。尽管 Qualcomm 尚未推出完整的设备平台,这一时间点已让两种不同的旗舰策略进入公众视野。

A20 Pro 采用 2 纳米制程,配备六核 CPU、七核 GPU 以及双 16 核 Neural Engine。Apple 表示,该芯片的内存带宽比 A19 Pro 高出 50%。它还在 CPU 与 GPU 内部部署了神经加速器。

这种相似性意义重大。两家公司都在将机器学习能力分布到通用处理、图形处理和专用神经硬件之中。两者也都将内存数据移动和持续运行视为核心设计问题。

Apple 的 A20 Pro 平台将芯片与新的封装设计及 iPhone 18 Pro 内部更大的均热板相结合。Apple 表示,这一散热设计可带来最高 40% 的持续性能提升,相较前代更为出色。

Qualcomm 尚未公布可比的完整手机产品,也未披露散热实现方案。Snapdragon 客户会打造采用不同散热系统的设备,这为厂商提供了灵活性,但也会带来差异化结果。一款 Snapdragon 手机的表现可能与另一款采用相近芯片的产品不同。

Apple 控制芯片、操作系统、框架和最终设备。这种整合可简化应用对其 Neural Engine 和其他加速器的调用。Qualcomm 则必须协调 Android、手机厂商、模型开发者、游戏引擎及其自身的软件栈。

Qualcomm 在覆盖范围上拥有不同的优势。其高端平台出现在多家制造商的设备中,使一套架构能够支持多样化设计。不过,成功仍取决于合作伙伴能否一致地开放这些新能力。

MediaTek 则提供了 Android 阵营内的另一项对比。其 Dimensity 9500 将八核 CPU 与 Arm Mali-G1 Ultra GPU 及 MediaTek NPU 990 相结合。MediaTek 将该平台定位于生成式和智能体 AI、游戏、影像以及持续本地推理。

该公司表示,其 NPU 990 的 token 生成速度是上一代的两倍以上。它还声称,针对某些 AI 处理,峰值功耗最高可降低 56%。与 Qualcomm 的数据一样,这些结果取决于公司选定的测试条件。

MediaTek 的 Dimensity 9500 规格显示,Qualcomm 并非唯一追求专用、低功耗神经处理的厂商。竞争的焦点是完整平台、开发者工具和实际交付体验,而非单一 TOPS 数字。

TOPS 指每秒万亿次运算。它可以描述 NPU 的理论吞吐量,但无法反映模型兼容性、内存容量、token 生成速度、软件开销或能耗。值得注意的是,Qualcomm 在最新披露中转而强调架构和工作负载行为。

竞争压力不止来自跑分领先。手机厂商需要有说服力的 AI 功能,且这些功能不能持续依赖云端访问。开发者需要可靠的加速器调用路径。用户则需要这些功能在运行时不会带来无法接受的发热、延迟或电池消耗。

本地处理可以提升隐私,因为部分数据会留在设备上。它还可降低网络延迟,并在连接较弱时提供功能。不过,本地执行仍要求应用妥善处理权限、模型更新和敏感数据。

云端模型仍将在规模、快速更新和获取大量计算资源方面保有优势。因此,更现实的竞争并非将本地与云端视为绝对的二选一,而是手机能在多大程度上避免依赖云端,同时保持质量与响应速度。

Qualcomm 希望借助其架构推动这一边界。Apple 和 MediaTek 也希望通过各自的硬件和软件系统实现同样的结果。因此,相比孤立的营销纪录,内存效率、开发者可及性和持续性能是更有价值的比较维度。

这些架构主张仍需量产产品验证

Qualcomm 已说明该设计应如何运作,但尚未展示完整平台在零售手机中的实际表现。

最大的证据缺口涉及功耗与散热。5GHz 的峰值频率几乎无法说明两颗 Prime 核心能够以该频率运行多久。它也无法揭示所需能耗、对机身表面温度的影响,或散热限制介入后的性能表现。

GPU 功耗改善 12% 的说法同样需要更多背景。Qualcomm 已将 Snapdragon 8 Elite Gen 5 作为基准,但实际提升会因游戏、分辨率、帧率、驱动和手机设计而异。Neural Fusion 的图像质量也需要在高动态场景中接受评估。

AI 性能还带来额外复杂性。所声称的 INT4 预填充提升 50% 仅涵盖一个阶段和一种数值格式。它并不必然意味着端到端智能体性能提高 50%。

智能体在模型推理之外也会耗费时间。它可能等待存储、网络响应、应用权限或操作系统服务。即使 NPU 能够快速处理 token,工具失败和软件重试也可能主导用户感知到的延迟。

对 300 亿参数 MoE 的支持同样需要谨慎解读。每个 token 仅有约 30 亿参数处于活跃状态,而未激活的专家仍必须保存在可访问的存储中。从闪存加载不同专家可能引入延迟并消耗能量。

模型规模并非质量保证。训练数据、架构、量化、路由和应用设计都会影响结果。针对特定任务调优的较小模型,可能优于未经适当优化的更大模型。

上下文支持也需要同样谨慎。32K 上下文窗口描述的是该架构能够寻址的 token 化信息量。它并不保证模型能够准确记住每一个细节,或在整个窗口范围内正确推理。

软件支持可能成为最难解决的实际问题。开发者需要稳定的 API、有文档说明的模型转换流程、性能分析工具,以及跨设备的一致行为。需要大量厂商专属调优的功能,可能难以超越演示阶段。

Qualcomm 通过将 Neural Fusion 与主要游戏引擎整合,降低了一项采用门槛。但 NPU 的前景仍取决于框架、模型可用性、Android 服务和手机软件。消费者无法体验到应用未能使用的加速器。

独立测试还必须区分峰值跑分结果与持续工作负载。短时间 CPU 测试可能有利于加速频率。简短的 AI 测试也可能无法揭示在更长时间使用中出现的内存压力或温度变化。

一项平台分析认为,内存局部性是 Qualcomm 各项披露信息中的共同主题。这一解读符合该架构,但对于量产产品性能而言,它仍只是一项假设。

Qualcomm 值得肯定的一点是,它披露了这些主张背后的机制。FlexCache、Matrix Cores、HPM、Element Accelerator 和由闪存管理的专家机制,比泛泛的 AI 性能标签更具信息价值。它们的综合价值仍需测量验证。

最有力的结果不会是单项跑分的胜利,而是在多款零售手机中实现一致性能,并提供在电池和散热限制下仍保持响应迅速的实用应用。

在这些设备到来之前,Qualcomm 下一代 Snapdragon 平台应被理解为一项详细的架构提案,而非已经完成的产品结论。

三项信号将决定 Qualcomm 的押注能否奏效

Snapdragon Summit、零售产品跑分和开发者采用情况,将决定 Qualcomm 是解决了真正的瓶颈,还是仅仅重新安排了营销重点。

第一个信号是 Snapdragon Summit 2026 上的完整平台发布。Qualcomm 必须披露芯片名称、制程技术、完整缓存布局、内存支持、连接能力和性能目标。这些细节将揭示三类计算引擎周围的整体配置。

此次发布还应确认首批设备合作伙伴及预计上市时间。广泛的厂商承诺将增强 Qualcomm 的平台论据。狭窄或延迟的发布节奏,则会限制开发者将这些新能力视为重要目标的速度。

第二个信号是持续性的独立测试。评测者应测量短时和长时工作负载下的 CPU 性能,然后追踪功耗和温度。最有价值的比较将包括 Apple 的 A20 Pro 及当前 MediaTek 旗舰芯片。

GPU 测试应分别评估原生渲染和 Neural Fusion。评测者需要检查图像质量、帧时间稳定性、功耗和伪影。当重建图像出现闪烁,或延迟变得不稳定时,更高帧率的重要性就会下降。

NPU 测试应涵盖提示词处理、token 生成、内存消耗和完整任务耗时。它们还应将本地执行与 CPU、GPU 和云端辅助方案进行对比。单一峰值吞吐量数字无法捕捉这些差异。

第三个信号是应用采用情况。Qualcomm 需要开发者在人们熟悉的软件中使用 Matrix Cores、Element Accelerator 和共享 AI 栈。游戏、助手、创作应用和生产力工具应展现可衡量的收益。

一款实用的端侧智能体应能以可预测的权限控制完成多步骤操作。它应保留上下文,在网络连接较弱时正常工作,并避免过度消耗电池。这些结果将支持 Qualcomm 关于本地化计算改变体验的论点。

有限的演示将削弱这一论点。功能若仅限于一款手机,或一个经过精心挑选的模型,同样如此。当开发者能够在无需大量定制工作的情况下,将能力部署到多款设备时,平台价值才会提升。

因此,未来几个月的关注重点将从架构模块转向产品表现。Qualcomm 已清晰论证:限制移动 AI 的不只是原始算力,更是内存数据的移动效率。它也已按照这一判断,将缓存和加速器部署在相应的位置。

如今,Qualcomm 的下一代 Snapdragon 平台必须证明,这些选择能够经受真实手机、真实软件与长时间使用的考验。关注峰会公布的规格参数,对比零售设备的持续性能表现,并观察哪些应用真正启用了新硬件。这三个信号将揭示,Qualcomm 究竟是推动了端侧 AI 的进步,还是仅仅给芯片贴上了更多 AI 标签。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page