top of page

Qualcomm Snapdragon 8 Elite Gen 6 将 300 亿 AI 主张带入手机

2小时前
讀畢需時 15 分鐘

Qualcomm 发布了两款 Snapdragon 8 Elite Gen 6 智能手机芯片,其中包括一款 Extreme 型号,旨在本地运行 300 亿参数 AI 模型。这一醒目的数字让 Android 手机厂商在应对 Apple 日益强大的端侧模型时有了新的回应。但它也带来了一个更棘手的问题:这些模型究竟能为手机用户带来什么?

随着 Qualcomm 推动 AI 智能体突破基于云端聊天的局限,Snapdragon 8 Elite Extreme Gen 6 和 Snapdragon 8 Elite Gen 6 应运而生。该公司希望手机能够学习个人上下文、理解持续进行的活动,并在无需将每个请求发送至远程服务器的情况下完成任务。

300 亿参数的说法听起来像是对智能水平的直接衡量,但事实并非如此。Qualcomm 采用混合专家设计,在每个 token 生成步骤中仅激活约 30 亿个参数。该架构可降低实际参与计算的规模,但完整模型仍会带来存储、内存、软件和续航方面的挑战。

Apple 提供了最清晰的参照点。其第三代基础模型集合包含一个拥有 200 亿参数的混合专家模型。因此,Qualcomm 竞争的不只是处理器速度。更大的较量在于,谁能让私密、持续且实用的移动智能体在已上市设备上可靠运行。

Qualcomm Snapdragon 8 Elite Gen 6 划分旗舰产品层级

Qualcomm 最重要的决定,是推出两款旗舰芯片,而非将其最新架构只留给一款高端处理器。

该公司于 2026 年 9 月 22 日在毛伊岛举办的 Snapdragon Summit 上推出这两个平台。其移动芯片公告将 Extreme 版本定位为性能最高的选择。标准版 Snapdragon 8 Elite Gen 6 则将大部分相同架构带给更广泛的高端手机。

两款处理器均采用 2 纳米制程和 Qualcomm 定制的 Oryon CPU 架构。它们还配备重新设计的 Adreno GPU,以及更新后的 Hexagon 神经处理单元,即 NPU。NPU 是一种专用硬件,相较于通用 CPU,能够更高效地执行机器学习工作负载。

这一共同基础至关重要,因为移动 AI 需要的是普及,而非一款展示性手机。若一项功能仅在最昂贵的设备上可用,应用开发者便缺乏支持它的动力。更广泛的处理器产品线则能为本地智能体软件提供更大的潜在市场。

Qualcomm 表示,采用这两款处理器的设备将来自 Honor、iQOO、Motorola、OnePlus、Oppo、Redmi、RedMagic、Vivo 和 Xiaomi。该名单涵盖多家主要 Android 厂商,但 Samsung 并未出现在已点名的阵容中。

Motorola 还发布了采用 Extreme 处理器的 Signature 27。据初步报道,该机预计将在 2026 年内全面上市。它的发布将成为一项早期检验,观察 Qualcomm 对智能体的主张能否转化为面向消费者的功能。

双芯片策略为厂商在旗舰品类中提供了另一种选择。供应商可以将 Extreme 平台保留给注重性能的型号,同时在定位较不专业的高端设备上使用标准芯片。

这种差异也可能影响 AI 能力。Qualcomm 明确将其 300 亿参数混合专家模型的主张与 Extreme 型号绑定。消费者不应假定每项功能或性能数据都同样适用于两款处理器。

此次发布还包括生成式 AI 之外的多项改进。Extreme 型号支持以每秒 60 帧录制 8K 视频,也支持以每秒 240 帧录制 4K 视频,用于慢动作画面。

Qualcomm 新增了 Advanced Professional Video 编解码器支持和像素级相机控制。这些功能面向希望在一台设备上完成视频拍摄、剪辑、调色和导出的创作者。

Extreme 平台还引入了一款配备两颗超大核、最高频率达 5 GHz 的 CPU。Qualcomm 称其为首款达到该时钟频率的移动 CPU。时钟频率本身并不能决定应用性能,但它确立了鲜明的营销差异。

根据 Qualcomm 的 Extreme 平台规格,该 CPU 的性能较上一代提升 13%。该公司还宣称 GPU 性能提高 44%,GPU 能效提升 40%。

这些对比数据来自 Qualcomm,仍需独立测试验证。设备散热、内存、软件以及厂商设定的功耗限制,都可能显著改变结果。纤薄手机维持峰值性能的时间可能短于更大的游戏机型。

因此,这次发布同时改变了两件事。Qualcomm 现在拥有一个分层的旗舰产品家族,而 AI 容量已成为其顶级处理器之间的主要差异。

第二项变化带来了真正的压力。Android 厂商必须决定,本地智能体是否值得投入更多内存、存储、工程工作以及更高的元器件要求。

端侧 AI 给 Android 手机厂商带来压力

这些芯片为厂商提供了更高的本地 AI 容量,但手机厂商仍必须围绕这种容量打造实用体验。

Qualcomm 销售的是架构基础,而非成品个人智能体。处理器可以加速模型、保留上下文并调度工作负载。厂商和应用开发者则必须决定智能体知道什么、可以执行哪些操作,以及何时请求许可。

新的感知中枢说明了这种责任分工。Qualcomm 表示,它可运行最多包含 2 亿参数的小型模型。这些模型能够处理持续存在的上下文信号,无需为每个事件唤醒更大的计算模块。

这种方式可以支持能够区分不同说话者的个人记录助手。它还可以从设备活动中建立本地记忆,再利用这些上下文建议自动化任务。

据称,该平台可运行完整的语音输入、语音输出智能体。这类智能体会接收语音输入、理解上下文、完成任务,并生成语音回应。

这些能力在芯片层面听起来逻辑完整。但其实际价值仍取决于能否访问消息、日历、文档、应用、麦克风及其他个人数据。

Android 手机厂商必须在不让智能体变得侵扰或低效的前提下,制定这些访问规则。过于严格的权限可能破坏多步骤自动化;过度的访问则可能带来隐私和安全风险。

因此,Snapdragon 8 Elite Gen 6 的发布起初给厂商带来的压力大于消费者。手机品牌不能只宣传 NPU 速度,就宣称其 AI 战略已经完成。

它需要能够持续使用本地模型的应用,也需要针对记忆保留、数据删除、权限和云端升级提供清晰控制。

开发者面临着相关挑战。他们需要稳定的接口来调用模型,并在不同应用间传递结构化操作。碎片化的厂商框架可能迫使开发者为同一工作流支持多个不兼容版本。

如果其硬件成为这些体验之下的通用层,Qualcomm 将从中受益。然而,该公司并不控制 Android 的每个部分、每个厂商接口或每个应用权限。

Google 仍处于核心地位,因为 Android 管理着大部分软件环境。手机厂商也可能更倾向于自家的助手、云服务和账户系统。这些竞争层级可能催生权限重叠的重复智能体。

Apple 则拥有不同的结构性优势。它控制处理器、操作系统、核心应用,以及其基础模型的分发。其第三代模型包含一个用于设备端和云端的 200 亿参数混合专家系统。

Qualcomm 可以在其顶级芯片上为 Android 厂商提供更高的总参数规模。Apple 则能在更加统一的软硬件栈中协调模型行为。

这种对比界定了主要竞争。Qualcomm 押注于共享芯片能够支持多样化、由厂商主导的智能体;Apple 则可通过直接的平台控制,优化较为集中的设备阵容。

当厂商快速实验时,Android 的多样性可以成为优势;但它也可能延缓通用标准的形成,并导致功能可用性不均。

双芯片产品线通过将新 AI 硬件扩展到更多高端设备,解决了其中一部分问题。但它无法解决软件协同问题。

Qualcomm 的客户名单应能让开发者有理由关注。然而,决定性的数字不会是有多少品牌宣布与芯片合作,而是有多少手机提供一致的本地 AI 功能。

对于企业买家而言,本地执行提供了一个颇具吸引力的前提。在部分工作流中,敏感对话、文档和行为上下文可以留在设备上。

本地处理并不会自动使应用具备隐私性。数据仍可能在同步、备份、分析或云端回退过程中离开手机。买家需要具体文档,而不是笼统的端侧主张。

知识工作者面临类似的取舍。能够记住会议并建议任务的手机,可以减少日常工作。与此同时,这样的记忆系统也需要透明的边界和可靠的纠错工具。

因此,处理器发布将责任向外推移。Qualcomm 提供更高的本地容量,而厂商、开发者和买家必须决定如何让这种容量成为值得信赖的软件。

300 亿参数模型通过激活其中较少部分来运行

300 亿参数的主张依赖于选择性激活、更大的本地内存,以及对模型数据从存储中调度的谨慎处理。

参数是 AI 模型内部学习得到的数值。更多参数可以支持更大的模型容量,但参数数量并不能直接预测准确性、速度或实用性。

稠密模型会在每个推理步骤中使用大量参数。混合专家模型则将网络的一部分划分为专业化组别,再将每项输入路由至选定的专家。

Qualcomm 表示,其 300 亿参数模型会在每个 token 生成步骤中激活约 30 亿个经路由的参数。完整参数集合仍然可用,但处理器不会同时对全部 300 亿参数进行计算。

这一区别至关重要。Snapdragon 8 Elite Gen 6 Extreme 并非在每一步都处理一个稠密的 300 亿参数网络,而是在当前输入下选择更适合的较小参数子集。

选择性激活降低了生成过程所需的即时计算量和内存带宽。但它也带来了路由和数据管理工作,因为设备必须迅速提供正确的专家参数。

Qualcomm 围绕这一问题设计了新的 Hexagon NPU。其 NPU 架构新增了 Element Accelerator,用于执行当代语言模型所使用的 Transformer 运算。

NPU 还保留了标量、向量和矩阵处理组件。这些单元负责推理的不同环节,包括数值运算、路由逻辑和编排。

Qualcomm 表示,新一代 NPU 内存子系统比前代大 50%。因此,更多模型状态、激活值和中间数据可以保留在靠近处理器的位置。

将经常需要的数据保留在芯片上,可减少访问手机主内存的次数。这些数据传输会增加延迟并消耗能量,尤其是在持续生成 token 的过程中。

该架构还采用了从闪存到内存的专家管理与缓存机制。该方法将模型的一部分存储在闪存中,再将所需专家加载至工作内存。

这种设计使得总规模较大的模型成为可能,无需将所有参数都放在活跃内存中。不过,访问闪存仍然比读取已保留在处理器附近的数据更慢。

反复切换专家可能会带来延迟,具体取决于模型、提示词和缓存行为。Qualcomm 尚未公布足够的独立测量数据,以说明这些影响在真实工作负载中的表现。

该 NPU 支持从 INT2 到 FP16 的数值格式。低精度格式以更少比特表示模型数值,可降低内存和计算需求,但可能牺牲模型质量。

Qualcomm 称,对于采用 INT4 精度的模型,提示词预填充速度最高可提升 50%。预填充是指模型在生成回复前处理用户初始提示词和上下文的阶段。

更快的预填充应能缩短智能体开始回答前的等待时间。当模型需要处理长消息、转录文本、文件或累积的个人上下文时,这一点尤为重要。

低精度和选择性激活使这一主打模型规模成为可能。但这两项技术都不能保证本地模型能达到更大云端服务的输出质量。

模型设计、训练数据、微调、路由质量和可用上下文都会影响性能。较小的活跃网络可能响应很快,却仍会作出较差的判断。

Qualcomm 还表示,Extreme NPU 的速度提升了 35%,每瓦性能最高提升 33%。这些数据是与上一代相比,且仍属于公司自身说法。

对于持续运行的智能体而言,每瓦性能会比短暂的跑分更重要。一个全天监测上下文的服务无法持续以处理器峰值功耗运行。

更新后的传感中枢会单独处理较低强度的任务。其双微型 NPU 和始终感知组件可以处理信号,无需将每个事件都分配给主 Hexagon NPU。

这一层级设计在系统层面类似于混合专家理念。小型处理器处理小任务,而较大型组件则在工作负载需要时才启用。

会议助手就是一个实际例子。传感中枢可以识别发言人并检测会议上下文。更大的模型则可总结讨论内容、将其与文档关联,并提出后续行动建议。

手机不必为每段捕获的声音调用最大的模型。它可以只升级处理相关信息,从而节省能量并限制不必要的处理。

同样的结构可支持通话转录、通知分流、旅行协助或个性化建议。每种场景对上下文、权限和延迟容忍度的要求都不同。

因此,Qualcomm 的机制比“30B”这一标签更具意义。它结合了专家路由、本地加速、多种精度等级、扩展内存和分阶段模型加载。

如果这些部分能够协同工作,手机便可支持更大类别的模型,而无需将每次请求都视为云服务器工作负载。如果其中任一层出现阻塞,体验仍可能显得缓慢或不可靠。

此次发布为开发者提供了一个能力更强的本地目标平台。尚未解答的问题是,量产手机能否在正常的发热、电池和存储限制下持续支撑这一目标。

30B 这一数字并不能决定真实世界的考验

Qualcomm 已详细介绍该架构,但尚未证明最大的本地模型在上市手机中的实际表现。

参数数量是最容易营销、也最难解读的指标之一。一个拥有 300 亿参数的混合专家模型,每个 token 可能只激活 30 亿参数。其表现将高度依赖这些专家的训练方式和路由方式。

该公司尚未公开说明支撑这一主打说法的确切 30B 模型。它也没有提供关于 token 速度、首 token 延迟、能耗、模型大小或持续运行的全面测量数据。

这些缺失并不能否定该架构。它们只是使读者无法将这一说法直接与 Apple 的模型、云服务或较小型的本地替代方案进行比较。

一项有价值的独立测试应分别测量多个阶段。它应记录模型加载时间、提示词预填充、生成速度、电池消耗、设备温度,以及重复任务下的质量表现。

测试还应检查缓存未命中情况。反复使用相似提示词的演示,可能会将所需专家保留在内存中。更丰富多变的使用方式则可能迫使更多数据在闪存和工作内存之间移动。

存储是另一个问题。量化通过用更少比特表示权重来缩小模型占用空间。即便如此,数百亿总参数仍可能占据相当大的空间。

制造商必须决定,是默认安装这类模型、稍后下载,还是流式传输选定组件。每种选择都会影响设置时间、存储压力、离线访问和软件更新。

一位手机空间几乎用满的用户,可能会认为存储空间比更大的本地模型更重要。设备制造商需要解释哪些内容可以移除,以及哪些内容仍是核心 AI 功能所必需的。

内存容量也可能使采用相同处理器的设备产生差异。拥有更多 RAM 的旗舰机型,可能比更轻薄或价格更低的机型保留更多模型状态和缓存专家。

Qualcomm 的架构可减少外部内存流量,但无法消除系统限制。应用程序、相机处理、图形处理和操作系统仍在争夺内存和电力。

散热限制在持续任务中至关重要。短暂的 AI 演示可以在手机发热前以峰值频率运行。更长时间的对话、媒体生成或持续运行的智能体,则构成更严格的考验。

对电池的说法也需要同样谨慎。设备端推理避免了网络通信和远程处理带来的延迟,但仍会消耗本地能量,尤其是在智能体监测上下文或生成较长回复时。

当任务需要更大模型、最新在线信息或大量外部计算时,云端处理仍然有用。未来更可能是混合模式,而非完全本地化。

混合智能体可以使用手机处理私密上下文、快速路由和常规操作。随后,它可以在将高要求工作升级交给云端模型前请求许可。

这一设计提出了新的透明度要求。用户应当知道信息何时保留在本地、何时离开手机,以及由哪项服务接收。

当工作流只有一部分在本地运行时,“设备端 AI”这一说法可能掩盖这些边界。本地语音识别器仍可能将其转录文本发送给云端模型。

因此,制造商应记录具体工作流,而不是为整个助手贴上单一的隐私标签。企业管理员也将需要对云端回退和保留上下文进行控制。

安全性带来了另一个悬而未决的问题。能力更强的智能体可能读取通知、识别联系人、检索文档,并跨应用执行操作。这类访问会增加遭受操纵或误判意图的后果。

提示词注入就是一个例子。消息或网页中的恶意文本可以试图改变智能体的行为。本地处理并不能消除这一风险。

智能体还需要针对敏感操作制定确认规则。转账、共享文档、删除数据或更改账户,应比建议创建日历条目需要更强的批准。

Qualcomm 将智能体描述为在用户许可下行动。设备制造商必须将这一原则转化为可见且一致的交互模式。

模型更新将与最初的芯片同样重要。新的训练、安全修正和专业专家模型可以在不更换硬件的情况下改善本地智能体。

更新也可能占用存储空间并改变行为。用户和组织可能需要版本控制、发布说明和可预测的支持期限。

独立应用支持仍存在不确定性。Qualcomm 可以提供开发者工具和模型优化,但开发者会追随能够覆盖足够用户的设备和 API。

最初的发布报道确认 Motorola 是早期设备合作伙伴。更广泛的验证将需要多家制造商和不同的手机设计。

成功的部署应带来不止跑分胜利。它应提供可重复执行的任务,能够离线运行、尊重权限,并避免快速耗尽电池。

因此,30B 这一数字是一项开场主张,而非最终结论。它说明 Qualcomm 称其顶级平台在特定模型架构下能够容纳什么。

上市设备必须证明,这种容量能否带来更好的决策、更快的响应或更私密的工作流。缺少这些结果,这个数字仍只是一项没有令人信服使用场景的规格。

三个信号将显示 Qualcomm 的 AI 赌注是否奏效

接下来的证据应来自上市手机、开发者支持,以及与 Apple 移动模型的直接比较。

第一个信号是 Motorola Signature 27。它的发布应揭示 Qualcomm 的哪些功能能够触达消费者,哪些仍只是等待软件支持的平台能力。

评测者应在普通条件下测试个人记录助手、说话人识别、语音交互和持久记忆。他们还应测量较长会话中的发热和电池消耗。

广泛的离线任务将增强 Qualcomm 的论点。可靠的转录、总结、图像理解和跨应用操作,将表明本地推理提供了实际价值。

一组狭窄的脚本化演示则会削弱这一论点。如果主要功能尽管被宣传为本地体验却依赖互联网连接,结果也是如此。

第二个信号是 Qualcomm 已宣布的制造合作伙伴对该平台的采用情况。Honor、OnePlus、Oppo、Xiaomi、Vivo 及其他品牌需要推出利用新 NPU 架构的功能。

仅有硬件分发还不够。关键考验在于,应用程序能否在不同制造商的设备上使用一致的接口。

通用框架将让开发者只需优化一次本地模型,便可覆盖广泛的 Android 市场。制造商专属实现则会增加成本并拖慢采用速度。

还应关注模型的可用性。Qualcomm 的架构支持混合专家工作负载,但用户需要针对其内存、精度和路由系统优化的模型。

开发者也需要用于分析性能、电池消耗和回退行为的工具。良好的工具链可以将理论容量转化为可靠的应用程序。

第三个信号是与 Apple 的 200 亿参数混合专家模型进行公平比较。总参数数量本身不会决定这场竞争。

测试应采用可比的任务、上下文长度、精度设置和设备条件。除速度、电池使用和隐私边界外,还应衡量输出质量。

Apple 的一体化平台或许能在较小的设备范围内提供更一致的体验。Qualcomm 的合作伙伴网络则可带来更多样化的选择,并可能支持更快的实验迭代。

胜出者未必会拥有标称规模最大的模型,而会在实用软件、广泛可用性、可预期的权限机制和可接受的能耗之间形成最清晰的组合。

其他移动芯片竞争者也将作出回应。MediaTek 以及采用定制芯片的设备制造商,无法忽视围绕持久化本地智能体展开的旗舰叙事。

竞争应促使厂商发布更具参考价值的指标。相比仅看参数总量,Token 生成速度、每项任务能耗、模型体积以及持续运行时的热表现更有意义。

消费者也应关注制造商对个人记忆数据提供了多大程度的控制权。实用的智能体需要上下文,但用户也需要能够查看、更正、暂停和删除这些上下文。

当用户无法理解个人智能体为何提出某项建议时,其价值就会下降。清晰的来源追溯和权限记录将成为建立信任的关键。

评估这些手机的企业应要求获得明确答案。他们需要了解哪些数据始终留在本地、哪些模型会接收更新,以及哪些管理控制机制决定何时升级至云端处理。

开发者应聚焦实际部署路径。Qualcomm AI 设计提供了多种运行本地模型的机制,但真正决定可访问性的将是最终发布的 API。

Snapdragon 8 Elite Gen 6 系列已将移动 AI 的竞争重点,从孤立的 NPU 基准测试转向完整的智能体系统。这一转变使软件整合成为衡量成功的核心标准。

Qualcomm 已经提出了一条在手机中容纳更大模型类别、且在技术上可信的路径。选择性激活和分层处理机制,使这一主张比其标题数字所暗示的更具可信度。

该公司尚未证明,300 亿参数的混合专家模型能够带来最佳移动体验。实际设备必须将这套架构转化为有用的任务能力,同时避免不可接受的代价。

应关注首款 Motorola 手机、合作伙伴实现方案的一致性,以及与 Apple 的直接对比。这些信号共同将表明,Qualcomm 的本地 AI 战略是否超越了一项旗舰规格。

对购买者而言,关键问题不是一部手机能否宣称搭载 300 亿参数模型,而是哪些功能可离线使用、哪些数据会离开设备,以及电池能续航多久。开发者则应关注,同一应用是否能在参与的各个 Android 品牌上保持一致的行为。企业应要求提供关于权限、记忆、更新及云端回退的书面控制说明。若 Snapdragon 8 Elite Gen 6 能在量产产品中回答这些问题,Qualcomm 将建立起有意义的平台优势;若不能,300 亿这一数字仍将只是对其能力的亮眼描述,而非更优个人智能体的证明。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page