Arm CSS for Mobile 2 加码 Android 游戏与端侧 AI
Arm 推出了 Arm CSS for Mobile 2,配备两款全新计算引擎,并对未来 Android 手机作出了不同寻常的大胆承诺。该平台将 C2 CPU 核心与 Mali G2-Ultra NX GPU 相结合,旨在带来更丰富的游戏体验和响应更迅速的本地 AI。
关键变化并非又一次年度性能提升。Arm 将专用矩阵硬件置入 CPU 集群,并把神经加速器直接集成到其旗舰移动 GPU 内部。这种设计将 AI 视为日常计算和图形处理的一部分,而非局限于独立神经处理单元的工作负载。
Arm 于 2026 年 9 月 8 日发布该平台,但消费者目前尚无法购买。芯片设计公司必须先将这些知识产权整合到处理器中,手机制造商才能推出成品设备。Qualcomm、MediaTek、Samsung 及其他芯片供应商,将决定 Arm 的设计有多少能真正落地到 Android 产品中。
这一落差构成了核心矛盾。Arm 的内部结果显示,CPU 性能更快、AI 能力大幅提升,图形效果则在手机功耗限制内接近桌面级技术。量产硬件必须在不过热、不显著消耗电池,也不依赖始终未采用所需软件的游戏的前提下,实现这些优势。
Arm CSS for Mobile 2 实际改变了什么
Arm CSS for Mobile 2 是一套协调的 CPU、GPU、系统与软件设计,并非一款完整的智能手机处理器。
Arm 的 CSS for Mobile 2 整合了 C2-Ultra 和 C2-Pro CPU 核心、两个 SME2 单元、Mali G2-Ultra NX 图形系统、系统互连技术以及开发工具。CSS 指的是 Compute Subsystem,即一组经过验证、可由芯片制造商调整并整合到片上系统中的组件。
这种方式给授权方提供的不只是独立的 CPU 或 GPU 蓝图。Arm 还提供物理实现方案与系统级指导,涵盖性能、功耗、芯片面积和数据传输。合作伙伴既可采用完整配置,也可将选定组件与自研及第三方技术组合使用。
一个示例旗舰集群包含两颗注重性能的 C2-Ultra 核心和六颗注重效率的 C2-Pro 核心,同时搭载两个 Scalable Matrix Extension 2 单元。SME2 是 Arm 的一种指令扩展,可加速语音、视觉和语言模型所需的矩阵运算。
这一 CPU 配置意义重大,因为上一代产品的核心仅搭配一个 SME2 单元。Arm 在将 CPU 定位为移动 AI 编排层的同时,把这一能力提升了一倍。该公司预计,未来的智能体将同时检索信息、准备提示词、运行模型并控制应用程序。
图形部分带来了更直观的架构变化。Mali G2-Ultra NX 是 Arm 首款在图形管线内部配备专用神经加速能力的 Mali 设计。其着色器核心可调用这部分硬件,同时共享 GPU 的内存、缓存和控制结构。
这一安排瞄准神经图形处理,即由模型重建或生成图像的一部分,而不是以传统方式渲染显示的每一个像素。该 GPU 还获得了全新的执行引擎,以及 Arm 第三代硬件光线追踪单元。
这些组件仍是可授权的构建模块。采用 C2 CPU 核心的手机并不一定需要最大的 Mali 配置。芯片制造商可以选择较小的 GPU 版本、加入自有加速器,或在成本和性能之间寻求不同平衡。
因此,这项发布确立了技术方向,却没有定义单一的 Android 体验。Arm 构建了共同基础,而授权方将决定其核心数量、频率、内存系统、散热假设和软件支持。
在阅读基准测试数据时,这一区别尤为重要。Arm 在内部选定的条件下比较了参考配置。最终表现将取决于每个合作伙伴的实现方式,以及各手机制造商的散热限制。
Arm C2 CPU 集群将 AI 带入日常计算
C2 CPU 集群将本地 AI 视为持续性的系统工作负载,而非完全交由 NPU 执行的短暂任务。
Arm 表示,其新一代 C2 CPU cluster 的单线程性能较上一代最高提升 15%。该公司还称,应用启动速度提高 12%,集群级多线程性能提高 12%。
这些数据涵盖的不只是生成式 AI。单线程性能会影响界面响应、浏览器任务、应用逻辑,以及自动化工作流中的单个步骤。当多个应用和模型同时运行时,多线程能力就变得重要。
C2-Ultra 是该集群的旗舰核心。Arm 表示,它采用了更大的执行引擎、改进的分支预测以及更好的指令获取机制,让更多操作持续流经处理器。它负责前台任务,因为细微延迟仍会被用户察觉。
C2-Pro 面向长时间运行的任务,更强调能效。Arm 表示,它保留了 C1-Pro 所采用的低功耗微架构,同时转向更新的制造技术。这一组合旨在维持后台活动,而不必将每项任务都分配给大核心。
两个 SME2 单元负责 CPU 侧的矩阵密集型计算。Arm 声称,在选定 AI 任务中,扩展后的配置较其 C1 集群最高可提升 70%。该公司还称,在选定 AI 模型中,性能可达上一代的 1.7 倍。
这些是公司基准测试数据,并非零售设备的实际结果。Arm 表示,测试于 2026 年 3 月至 8 月期间进行,并警告实际结果可能有所不同。公布的百分比同样代表最大增幅,而非所有应用中的保证平均提升。
不过,这一主张背后的机制值得关注。移动智能体不能始终在单一加速器上运行一个大型模型。它必须收集上下文、安排任务、调用应用、处理较小模型,并决定任务应在本地还是云端执行。
CPU 在整条链路中始终参与其中。SME2 容量翻倍,可让更多推理在应用控制本已发生的位置完成,从而减少处理模块之间的数据传输。当工作负载足够适合 CPU 的专用单元时,这种方式可改善延迟。
这项设计并不意味着专用 NPU 变得无关紧要。它扩大了 CPU 在异构系统中的角色,不同引擎负责不同阶段。实际优势将取决于软件能否在不引入新延迟的情况下选择正确的引擎。
潜在应用场景包括语音识别、检索、个人记忆、规划和轻量级推理。这些任务通常需要一系列短操作,而不是一次不间断的推理任务。Arm 希望 C2 协调这一系列操作,同时由更大的加速器处理适合的部分。
Mali G2-Ultra NX 押注于像素重建
Arm 的桌面级图形卖点依赖于减少渲染数据量,再通过神经处理重建缺失细节。
新的 Mali G2-Ultra NX 支持三种神经图形技术。每种技术都可减少一部分传统渲染工作负载,但也都需要游戏开发者进行集成。
Neural Super Sampling 先以较低分辨率渲染,再利用模型重建更清晰的最终图像。此前帧的时间信息有助于恢复细节并平滑边缘。这种方法类似于桌面图形厂商已经采用的超分辨率策略。
Neural Frame Rate Upscaling 会在正常渲染的帧之间生成中间图像。游戏可以渲染更少的完整帧,同时由神经硬件为显示屏创建额外帧。Arm 表示,在合适的工作负载中,最终输出可达到每秒 120 帧。
Neural Super Sampling and Denoising 将重建与光线追踪场景中的降噪结合起来。光线追踪模拟光线与表面的交互,可产生更逼真的反射、阴影和间接照明,但计算成本也很高。
Arm 的架构将神经加速器置于着色器核心内部,紧邻传统图形和计算资源。共享缓存和内存结构减少了将图像数据移交给外部加速器的需求。更少的数据传输可节省能耗并缩短处理时间。
据 Arm 称,GPU 的全新执行引擎可为每个 warp 提供最高两倍数量的寄存器。warp 是一组协同执行的图形线程。更多寄存器可帮助复杂着色器保留数据,避免反复访问速度较慢的内存。
Arm 将其称为 Mali 指令集架构七代以来最大的一次更新。该公司报告称,基准测试性能最高提升 24%,而在未采用神经图形技术的现有游戏中,性能最高提升 14%。
这两类结果之间的区别至关重要。对于未获得特殊集成的游戏,14% 的数据更具参考价值。更大的提升依赖神经渲染技术、优化软件,或是突出新架构能力的选定测试。
光线追踪也获得了专门改进。Arm 表示,在领先的光线追踪基准测试中,第三代单元可将 DRAM 流量最高减少 13%。降低外部内存流量可同时减少功耗和带宽压力。
Opacity Micromaps 提供了另一项优化。该功能可表示树叶、织物等复杂透明几何体,无须让每个微小表面都经历完整的光线追踪过程。Arm 在一项演示中报告了 30% 的帧率提升。
据该公司称,这项演示还将光线追踪工作负载最多减少了 70%。这些结果描述的是特定场景和技术,不应被理解为适用于所有游戏的普遍提升。
Arm 的 Neural Dawn 演示结合了神经帧生成、降噪和 Unreal Engine 光照。该公司称,与原生渲染相比,其性能效率最高可提升四倍,外部内存流量最高可降低 70%。
软件层面的进展不止于实验室演示。NetEase 计划在 Where Winds Meet 中加入 Neural Super Sampling,Infold Games 则正将其整合到 Infinity Nikki。Tencent Games 和 Unity China 也在与 Arm 合作开发神经图形技术。
这些项目为开发者提供了具体目标,但尚未展示该技术在不同芯片配置、游戏引擎或长时间游戏场景下的表现。只有在商用硬件上市后,相关证据才会出现。
Qualcomm 和自研芯片仍将决定真正的门槛
Arm 正在与完整芯片实现方案竞争,但其销售的是合作伙伴可修改、缩减或替换的组件。
Qualcomm 的 Snapdragon 平台为高端 Android 游戏提供了最清晰的竞争参照。Qualcomm 开发自研 CPU 技术,并搭配自家的 Adreno 图形方案。这种垂直整合能力可在同一商用处理器内协调驱动、硬件与性能目标。
MediaTek 传统上更依赖 Arm CPU 与 Mali GPU 设计。因此,它很可能会采用最完整的 CSS for Mobile 2 配置。Samsung 同样可以授权使用 Arm 核心,同时为其 Exynos 处理器在 Mali 及其他图形方案之间进行选择。
Google 则代表另一种路径。Tensor 芯片采用兼容 Arm 的 CPU 技术,但 Google 会围绕其 AI 模型、影像处理管线与 Pixel 软件作出产品决策。采用通用的 Arm 平台,并不会消除这些厂商特有的优先级。
Apple 虽不生产 Android 设备,却仍是重要的架构参照。其自研的兼容 Arm CPU、GPU、神经引擎、操作系统及开发者框架,均属于同一个受控平台。这种整合使 Apple 能够同时影响硬件采用与软件行为。
Arm 的优势在于规模。该公司表示,Mali GPU 的出货量已超过 140 亿颗。广泛授权的神经图形架构,可以为游戏工作室提供一个覆盖多家厂商产品的统一目标。
但规模本身并不能保证体验一致。被授权方可选择不同的核心数量、内存接口、频率和制程技术。手机厂商还会将这些芯片装入散热系统与电池策略各不相同的设备中。
因此,Android 芯片路线图在设计上仍然是碎片化的。一家厂商可能优先追求游戏峰值性能,另一家则可能选择更小的 GPU,把更多芯片面积投入摄像头或自定义 NPU。
软件支持又增加了一层复杂性。游戏需要引擎集成、稳定驱动和可预测的性能表现,开发者才会投入资源构建专门的渲染路径。即使某项功能已存在于硬件中,若部署它会带来测试或兼容性负担,也可能长期得不到使用。
Arm 尝试通过开放接口、神经图形开发套件、Vulkan 支持以及与游戏引擎合作伙伴的协作来降低这一门槛。Vulkan 是一种跨平台图形 API,可让开发者更底层地控制 GPU 资源。
该公司也在硬件发布前为开发者做了准备。它在 2025 年预览了 Arm Neural Technology,并分发用于内容创作和性能测试的工具。这段提前准备期应有助于首批游戏更接近首批设备的上市时间。
不过,Qualcomm 可以通过针对 Adreno 定制的改进作出回应,而 Apple 和桌面 GPU 厂商已支持成熟的重建技术。Arm 是在进入一场既有的软件竞争,而不是从零发明神经渲染。
它的机会在于让这些理念能在庞大的 Android 硬件基础上移植。其风险也来自同一基础上的采用不一致。只有足够多的被授权方推出具备实质配置的产品,共享架构才会具备价值。
这正是为何主要竞争并非 Arm 对抗某一家芯片公司,而是 Arm 对可复用平台的承诺,对抗 Android 芯片实现的现实。规格确立潜力,而合作伙伴决定用户体验。
“桌面级游戏”仍是一项主张,而非产品
Arm 描述了一种可信的能效机制,但其最强的游戏和 AI 主张仍主要来自内部测试和演示。
“桌面级”指的是图形技术,而非手机与独立桌面显卡拥有完全相同的性能。Arm 强调,在移动设备的功耗范围内实现光线追踪光照、神经超分、帧生成和降噪。
根据一项独立平台分析,Arm 表示神经图形可在 1 瓦功耗预算内运行。该公司还展示了以每秒 30 帧持续运行的丰富光追内容。
这在技术上很有意思,但它并未定义零售手机上的分辨率、图像质量、设备温度,或完整系统功耗。神经重建还可能在运动、精细几何、界面元素和快速变化的场景中引入伪影。
帧生成也存在相关的取舍。生成帧可以提升观感上的流畅度,但未必能降低输入延迟。除非其他系统予以补偿,游戏仍会按照基础渲染帧率处理玩家输入。
图像质量还取决于训练、模型设计、运动数据和引擎集成。一款游戏可能生成令人信服的重建细节,另一款则可能暴露重影或不稳定边缘,而这些问题在小尺寸高分辨率屏幕上依然明显。
持续性能构成最大的硬件考验。手机的散热能力远低于桌面电脑或游戏主机。其处理器还需要与显示屏、调制解调器、内存、存储和后台应用共享功耗。
Arm 的低功耗主张正是直接针对这一限制。但最终表现取决于制程技术、芯片布局、电压目标和厂商调校。被授权方可以将架构能效转化为更长的游戏时间,也可以将其用于提高峰值性能。
同样的谨慎也适用于智能体 AI。更快的小型模型并不会自动带来实用的手机智能体。应用必须开放安全的控制权限,操作系统必须协调权限管理,模型还必须能可靠地规划动作,而不是将每一步都发送至云端。
内存容量将与原始算力同样重要。模型、检索索引、应用状态和图形资产会争夺有限的带宽。更快的 CPU 单元无法消除系统其他环节的瓶颈。
Arm 的基准测试比较也以其上一代设计为基准。它们并不能证明其领先于当代 Snapdragon、Apple 或其他自研处理器。独立测试需要在匹配的工作负载下比较完整产品。
对于 Mali 游戏而言,驱动质量也是另一项不确定因素。先进硬件依赖稳定的 Vulkan 实现,以及芯片和手机厂商及时提供的更新。不一致的驱动交付可能使应用无法在不同设备上可靠地使用相关功能。
开发者采用情况同样尚不确定。Neural Super Sampling 可降低渲染成本,但工作室仍必须对其进行集成和测试。发行商会优先考虑拥有足够用户、可靠工具以及可量化收益的平台,以证明这项工作值得投入。
Arm 已拥有一些有价值的早期合作伙伴,包括 Sumo Digital、NetEase、Tencent Games、Infold Games 和 Unity China。这些关系让此次发布比纸面规格更具实质性,但它们仍只占全球移动游戏目录中的一小部分。
首批商用设备将揭示,该软件栈能否从 Arm 的参考环境顺利迁移到厂商芯片中。在此之前,“桌面级”最好被理解为一种视觉技术目标,而非经过验证的性能类别。
三项信号将显示 Arm 的押注是否奏效
商用芯片、独立持续测试和实际游戏采用情况,将决定 Arm CSS for Mobile 2 是否会改变 Android 手机。
第一个信号,是采用该平台重要组成部分的具名处理器。应关注公开的 C2 核心数量、所选 Mali 配置、SME2 能力、内存设计和制造工艺。大幅精简的实现会削弱与 Arm 参考结果的比较价值。
时机也很重要。Arm 在设备厂商能够销售基于其技术的手机之前,就向其提供知识产权。首款芯片的发布将说明合作伙伴是将该平台视为近期旗舰基础,还是更长期的设计选项。
第二个信号,是零售设备中的独立测试。评测者需要测量持续 CPU 速度、游戏帧率、电池消耗、表面温度和图像质量。短时合成基准测试无法裁定 Arm 的主张。
匹配测试应将传统图形性能提升与神经渲染带来的提升区分开来。这一区分将揭示,有多少性能来自新的执行引擎,又有多少依赖于游戏特定的 AI 功能。
本地 AI 测试也需要同样严谨。实用的衡量指标包括首次响应延迟、模型持续运行速度、能耗,以及其他应用保持活跃时的表现。手机智能体是一项系统级工作负载,而非孤立的推理基准测试。
第三个信号,是生产环境软件的采用情况。Where Winds Meet、Infinity Nikki、Tencent 技术演示和未来的引擎集成,都会提供早期观察点。实际发布的支持比又一次受控演示更重要。
开发者还应关注,神经图形功能能否在多家芯片厂商的平台上运行,而无需单独开展优化项目。广泛的可移植性将强化 Arm 的可复用平台论点;厂商特定的行为则会削弱它。
对于消费者而言,第一代产品应作为完整设备评估,而非一组 Arm 百分比指标的集合。散热、内存、驱动、电池管理和软件支持将决定该架构是否真正带来不同体验。
对于开发者而言,眼前的问题是 Arm 的开放工具是否足以减少集成工作,从而值得构建一条新的渲染路径。现在测试开发套件,可以在兼容手机抵达用户手中前暴露图像质量和兼容性问题。
Arm CSS for Mobile 2 提出了一项连贯的押注:未来手机需要让 AI 融入其 CPU 和图形处理管线。该架构为这一转变提供了可信的工具,但规格本身无法独自交付体验。
关注首批具名芯片,随后是首批设备的持续测试,最后是首批大规模搭载神经功能的游戏。这三个检查点将表明,Arm 的设计会成为 Android 标准,还是又一项等待软件支持的能力。



