Arm 边缘 AI 推进将数据中心与设备连接起来,但软件必须跟上
- Ethan Carter

- 4小时前
- 讀畢需時 13 分鐘
Arm 于 9 月 8 日在三大计算市场扩展其 AI 战略,通过同一套架构连接云服务器、边缘设备和实体机器。Arm 的边缘 AI 推进涵盖新的数据中心设计、移动计算平台、开发者软件以及机器人合作计划。
这一宣布之所以重要,是因为 Arm 不再将服务器、智能手机和嵌入式系统视为彼此独立的故事。它希望开发者将它们视为同一计算连续体的组成部分。一个 AI 智能体可以在云端训练或检索信息,在手机上作出私密决策,并通过机器人执行行动。
这一愿景挑战了定义首轮生成式 AI 热潮的云端中心化模式。Nvidia 仍是加速计算领域的核心,而 AMD 和 Intel 则在服务器与个人电脑市场展开竞争。Qualcomm、Apple、MediaTek 及其他 Arm 被授权方已在推进端侧 AI。Arm 现在希望借助其架构和软件层连接这些市场,同时不取代负责打造最终芯片的合作伙伴。
Arm 边缘 AI 成为全平台战略
Arm 的宣布将边缘 AI 从单一设备功能转变为协调一致的云端到设备平台的一部分。
公司在中国举行的 Arm Everywhere 活动上推出了多项产品和计划。它们共同覆盖云基础设施、移动计算、开发者工具和实体 AI 系统。
面向数据中心,Arm 发布了 Neoverse Compute Subsystems N4,即 CSS N4。计算子系统将处理器核心、内存接口及其他经验证组件整合在一起,供芯片设计商为其产品进行配置。
CSS N4 支持每颗芯片最多 128 个核心、LPDDR6 内存和 PCIe Gen 7 连接。Arm 表示,其性能最高可达 CSS N3 的两倍。公司还宣称,其每瓦性能最高提升至 1.25 倍,内存带宽提升至 1.75 倍。
这些数字来自 Arm 的测量,并非独立的量产基准测试。它们的重要性在于产品定位。CSS N4 为云服务公司和半导体厂商提供了另一条打造定制 Arm 架构基础设施的路径,无需自行设计每一个组件。
该子系统与 Arm AGI CPU 并列,后者是 Arm 于 2026 年 3 月推出的成品数据中心处理器。Arm 将 AGI CPU 设计用于围绕 AI 加速器的编排任务,包括调度工作、移动数据、运行数据库,以及协调软件智能体群组。
Arm 表示,OpenAI、Meta、Cloudflare、Oracle、SAP、Lenovo、Supermicro 和 Verda 正围绕 AGI CPU 开发解决方案。ByteDance 的 Volcano Engine 计划利用该处理器提供智能体沙盒。智能体沙盒是隔离环境,软件智能体可在受控访问权限下执行工具和代码。
边缘部分则通过 CSS for Mobile 2 实现。该平台整合了 Arm 的 C2 CPU 集群、Mali G2-Ultra NX 图形处理器、系统组件、物理设计和配套软件。
Mali 设计新增了用于 AI 辅助图形的专用神经加速器。C2 Ultra CPU 配备 Scalable Matrix Extension 2,即 SME2,可加速众多 AI 模型使用的矩阵运算。
Arm 还发布了 AI Portal,汇集经过优化的模型、性能信息、代码示例和部署工作流。该门户上线时支持的模型包括 Alibaba 的 Qwen、Google 的 Gemma 和 Ultralytics YOLO。
由此形成的 Arm 边缘 AI 主张不止于一款新处理器。Arm 希望在云端选定的模型,能够拥有通往手机、电脑、摄像头、车辆和机器人的实际优化路径。
这种连续性也带来了核心矛盾。通用架构可以减少重复工程工作,但仅靠架构本身并不能保证在差异巨大的设备上实现一致性能。
为什么智能体 AI 正在走出云端
智能体 AI 提升了本地计算的价值,因为持续将每一次观察和决策发送至数据中心,会带来延迟、隐私和成本问题。
生成式 AI 最初将需求集中在云数据中心。训练大型模型需要由加速器组成的集群,而大多数消费级应用则将提示词发送至远程推理服务。
智能体系统改变了这一模式。智能体做的不只是生成文本或图像;它还可以检索记录、调用软件工具、监控输入、更新计划,并与其他智能体协作。
每项行动都会带来额外的计算工作。云端 CPU 必须管理存储、网络、数据库、安全控制和加速器。边缘处理器则必须判断哪些任务需要云端,哪些可以留在本地。
Arm 的云基础设施宣布认为,没有任何一种单一处理器配置能够适配所有工作负载。CSS N4 面向构建定制芯片的客户,而 AGI CPU 则提供可直接投入生产的硬件。
这种区别反映了碎片化的数据中心市场。大型云服务运营商会围绕自身基础设施设计定制处理器。其他买家则更偏好采用标准化组件组装的服务器,因为他们缺乏自主打造芯片的工程能力。
边缘侧带来了更多差异。高端智能手机、安防摄像头和工业机器人面临不同限制。电池容量、发热、内存、响应时间和物理安全性,都会决定推理发生在何处。
端侧处理可以在没有网络连接的情况下提供即时响应。它还可以让敏感音频、图像或商业数据不必传送至远程服务。然而,本地模型通常受限于较少的内存和计算能力。
因此,实用的智能体将分配其工作。一部手机可能在本地识别语音,从云服务检索复杂信息,并在设备上总结响应。机器人则可能在本地处理运动控制,同时利用远程基础设施进行全机群学习。
Arm 的机会源于其在受能耗限制设备中的既有布局。随着这些设备承担更多 AI 工作,公司可以提供架构连续性。其数据中心扩张则为这一叙事提供了第二个端点。
这一战略对仅依赖云端的软件栈施加的压力,比对任何一家芯片制造商的压力更为直接。开发者将期待应用能在远程和本地执行之间切换,而无需完全重写。
它也要求处理器厂商支持的不只是峰值基准分数。他们还需要编译器、运行时、模型库、调试工具和可跨多种设备类别工作的部署系统。
Nvidia 已通过高度整合的软硬件平台应对这一问题。Qualcomm 为手机和电脑打造完整的 Snapdragon 系统。Apple 则在自身产品线内控制芯片、操作系统和设备。
Arm 走的是不同的路径。它向许多相互竞争的公司提供技术。其规模带来了广泛覆盖,但其授权模式限制了对最终用户体验的直接控制。
真正的关键在于共享软件
Arm 最强的优势不在于某一项处理器规格,而在于能够在异常广泛的硬件基础上复用软件的可能性。
Arm 表示,其生态系统拥有超过 2200 万名开发者。这一数字代表潜在覆盖范围,但并未说明有多少开发者正积极为每个新的 Arm 平台优化 AI 工作负载。
新的AI 模型门户旨在让这一生态系统更易于使用。开发者可以搜索面向特定任务的模型,比较延迟和内存需求,并获取部署示例。
该门户支持语言、语音、计算机视觉和神经图形工作负载,并包含 ExecuTorch、LiteRT 和 ONNX Runtime 等运行时。运行时提供在特定硬件上执行已训练模型所需的软件。
Arm 表示,开发者可以通过 Hugging Face 获取优化模型。编程智能体还可通过 Model Context Protocol 访问门户资源;这是一项将 AI 系统与外部工具和信息连接起来的标准。
这种机器可读的方法契合 Arm 的智能体计算理念。软件智能体可以识别合适模型、检查设备需求并获取优化工作流,而不必完全依赖人工研究。
Arm 报告了两项早期优化结果。据称,在采用混合量化和 SME2 加速后,Qwen3-TTS 在 Vivo X300 智能手机上的运行速度提升超过四倍。量化通过降低模型计算的数值精度,减少内存使用和计算需求。
Arm 还表示,Ultralytics YOLO26n 的性能提升超过 40%。公司在 Vivo X300 和 Raspberry Pi 5 上使用低精度格式测试了这一计算机视觉模型。
这些结果展示了针对性优化能够在选定硬件上实现的效果。它们并不能证明在每个模型、操作系统或基于 Arm 的芯片上都能获得同等提升。
这一限制解释了为什么软件是关键机制。两款处理器可以实现相同的指令集,却提供不同的内存容量、图形硬件、神经加速器和散热限制。
开发者仍需选择由哪种处理器处理各项任务。他们必须在量化后测试准确性、衡量持续性能,并考虑后台工作负载。一个在短暂演示中运行的模型,在持续使用时可能表现不同。
移动计算平台试图通过将更多设计要素打包在一起来减少这种差异。CSS for Mobile 2 将 CPU、GPU、系统组件、实现方案和软件作为协调一致的平台提供。
Arm 的 C2 CPU 系列包含多种配置,以适应不同的性能和能效需求。旗舰级 C2 Ultra 增加了 SME2,而 Mali G2-Ultra NX 则在 GPU 内部集成了专用神经加速能力。
这种设计让 AI 工作可以在多种计算引擎之间迁移。CPU 可以处理控制密集型代码。GPU 可以处理高度并行的图形和模型运算。专用加速器则可高效执行受支持的神经网络工作负载。
这种分配对持续运行的边缘 AI 至关重要。让每项任务都经过同一处理器会浪费能耗并形成瓶颈。
不过,该平台的成功取决于应用支持。开发者需要能够暴露硬件能力的工具,同时无需为每家厂商的芯片维护单独实现。
因此,Arm AI Portal 的战略重要性远超其朴素的界面所暗示的程度。它将 Arm 的硬件宣布与部署模型所需的日常工作连接起来。
Arm 的广泛覆盖也带来了最严峻的限制
Arm 必须协调一个自己无法完全控制的生态系统,而多家合作伙伴正通过专有硬件和软件展开竞争。
Arm 向半导体公司授权处理器设计和指令集技术。这些公司将 Arm 组件与自己的图形处理器、神经引擎、调制解调器、内存系统和软件结合。
这种模式帮助 Arm 在智能手机和嵌入式设备中广泛普及,也让合作伙伴能够实现差异化。同样的灵活性则可能造成能力、更新节奏和开发者体验的不一致。
针对一款高端手机优化的模型,未必能在低成本设备上高效运行。某家供应商神经处理器支持的功能,可能需要在其他平台上走另一套代码路径。操作系统支持还会进一步增加差异。
当应用横跨云端与边缘端时,问题会变得更加复杂。数据格式、安全策略、模型版本和推理结果都必须在多个系统之间保持兼容。
Arm 的共享架构减轻了部分负担,但无法免除在每个部署目标上进行测试的必要。
竞争又带来另一层复杂性。Qualcomm 打造基于 Arm 的 Snapdragon 处理器,但通过 Oryon CPU 核心、Adreno 图形、Hexagon 神经处理和软件实现差异化。Apple 则在封闭的产品栈中打造自研的 Arm 兼容处理器。
Nvidia 将 Arm CPU 与图形处理器及 CUDA 软件结合使用。它能够借助内部控制更紧密的平台,连接数据中心、工作站、机器人和汽车产品。
Intel 和 AMD 在服务器与个人电脑领域保有庞大的 x86 软件基础。两家公司也都将图形和 AI 加速能力集成到客户端处理器中。开发者无需放弃这些平台即可运行本地 AI。
RISC-V 为寻求更开放指令集基础的企业提供了另一种选择。其 AI 软件环境在消费级设备上仍不够成熟,但定制加速器供应商可无需依赖 Arm 授权便采用它。
因此,Arm 必须证明,其通用基础设施节省的工程工作量大于生态碎片化带来的额外成本。这一证据需要来自已上市设备和可重复验证的测量结果。
数据中心的叙事同样值得谨慎看待。Arm 援引 IDC 表示,在加速计算领域,基于 Arm 的机架级服务器已超过 x86。该类别包括昂贵的 AI 系统,其中 Arm CPU 与 GPU 及其他加速器协同工作。
这并不意味着 Arm 已在全部服务器出货量上超过 x86。一项独立服务器分析指出,按处理器出货量计算,Intel Xeon 和 AMD EPYC 系统仍占据主导地位。
营收比较也可能因完整加速系统的高价值而产生偏差。一台配备大量高端 GPU 的机架,其营收远高于传统服务器,即便每套系统都只包含一颗主机 CPU。
工作负载差异同样重要。针对云处理器的学术测试发现,在某些情况下,Arm 实例的表现落后于 x86 替代方案。一项云性能研究报告称,Arm 系统在一项专门的密码学工作负载中表现较弱。
该研究并未终结更广泛的架构之争。它说明了为什么买家必须评估自身代码,而非根据平台层面的效率主张进行外推。
Arm 针对 CSS N4 和移动 AI 发布的性能数据,在合作伙伴推出产品、独立测试者能够复现之前,仍属于公司自身的主张。最终芯片在时钟频率、内存配置、散热和供应商软件方面都可能有所不同。
核心的不确定性在于执行,而非架构可行性。Arm 在云端和边缘计算领域拥有可信的发展路径,但必须在不削弱支撑其广泛覆盖的合作伙伴多样性的前提下,将这一路径转化为稳定一致的产品。
物理 AI 将这一押注延伸至机器领域
机器人和车辆让 Arm 的云到边缘战略变得具体可感,因为它们需要本地决策,同时仍依赖远程数据与开发系统。
Arm 将这一类别称为物理 AI。该术语涵盖能够感知周围环境、推理事件,并通过电机或其他物理组件执行动作的机器。
该公司宣布推出 Arm Total Design for Physical AI,参与机构超过 80 家。已公布成员包括 AWS、Hugging Face、Liquid AI、NXP、QNX、Siemens、Unitree Robotics,以及多家汽车技术公司。
Arm Total Design 此前曾帮助合作伙伴围绕经过验证的子系统开发定制芯片。物理 AI 的扩展则增加了模型、软件、传感器、处理器和完整机器之间的协作。
该计划的首批项目包括 Robotics Capability Framework。Arm 将其描述为一套用于比较自主机器能力的通用语言。
这样的框架有望解决一个真实的行业问题。机器人演示通常强调在受控条件下成功完成的单项任务。买家需要更清晰的方法,来比较感知、移动、操作、自主性和安全性。
然而,共享词汇并不等于建立认证标准。它也无法证明两台报告相近能力的机器人,会在非受控环境中表现得同样出色。
Arm 的物理 AI 计划汇集了市场多个层级的公司。这种广度有助于统一接口,但成员拥有不同商业利益时,也可能拖慢共识达成的速度。
机器人说明了为什么边缘计算不能简单复制云端模式。仓库机器在靠近人员时,不能等待远端服务再决定停止。车辆也不能依赖持续连接来作出即时转向决策。
本地处理器负责处理对时间敏感的感知和控制。云系统则可用于训练模型、分发更新、协调车队,以及分析长期运行数据。
这两种环境的故障代价也不同。聊天机器人的延迟回复只是带来不便;机器人的延迟动作则可能损坏设备或伤及人员。
这一现实提高了 Arm 边缘 AI 战略的要求。移动助手可以容忍偶发的模型错误,而物理系统需要可预测的时序、安全更新、冗余控制和广泛验证。
Arm 在能效方面的积累适用于电池供电机器人和嵌入式控制器。其架构也已广泛应用于受严格散热限制的汽车和工业产品。
不过,物理 AI 所依赖的不仅是处理器。传感器必须提供可靠信息,模型必须应对陌生条件,机械系统必须准确执行命令,安全软件则必须在智能体行为变得不安全时接管控制。
Arm 明智地将自身定位为通用基础,而非完整的机器人解决方案。该公司能够减少集成工作,但制造商仍需对系统级性能负责。
其战略收益在于覆盖范围。如果基于 Arm 的云服务器、开发计算机、移动设备和机器人共享兼容工具,开发者就能复用更多代码和运营知识。
风险在于,“兼容”可能变得过于宽泛,以至于不再意味着可预测性。成功的生态系统需要为每类硬件提供有文档说明的配置文件、经过测试的模型包和清晰的支持边界。
三项信号将检验 Arm 的 AI 雄心
下一阶段将通过已上市产品、持续的应用性能,以及开发者能否跨硬件类别复用软件的证据来衡量。
第一项信号是基于 CSS for Mobile 2 的商用芯片。Arm 已发布该平台,但设备制造商将决定其最终形态。
读者应关注采用新 CPU 和 GPU 设计的具名处理器、智能手机、计算机及其他产品。上市时间、内存配置和持续散热性能的重要性将高于峰值规格。
独立基准测试应在多个运行时环境中测试真实模型。有价值的指标包括响应延迟、能耗、内存需求、模型准确率,以及长时间会话期间的性能。
如果多款设备都取得强劲结果,将支持 Arm 关于其平台让本地智能体更具实用性的主张。供应商之间存在显著差异,则表明碎片化仍主导着实际体验。
第二项信号是 AGI CPU 和 CSS N4 的生产部署。Arm 已列出一批重要的软件、云和服务器合作伙伴。市场现在需要看到部署细节。
Volcano Engine 的智能体沙盒提供了一项早期检验。买家应关注其他云服务商是否推出 AGI CPU 实例、托管服务或公开性能数据。
服务器供应商也需要以有用的规模交付系统。客户案例研究应说明实际工作负载,而不是重复关于智能体 AI 的笼统主张。
如果企业将 Arm 处理器用于数据库、工具执行、检索和加速器协调,Arm 在数据中心的地位将显得更强。有限的试点则会削弱更广泛的平台论点。
第三项信号是围绕 Arm AI Portal 的开发者行为。只有当目录中的模型保持最新、可复现且易于部署时,它才会创造价值。
Arm 应公布更多跨不同供应商和设备类别的结果。开发者还需要量化后的透明准确率数据、清晰的版本管理,以及与常见构建系统集成的工作流程。
最有说服力的证据,将是一款应用只需有限的平台特定工作,便能在云端、移动端和物理硬件之间迁移。这将验证该公司的计算连续体论点。
开发者还应关注门户资源是否扩展至展示模型之外。对专有模型的支持预计将在后续阶段推出,这对企业采用尤为重要。
企业也应关注 Robotics Capability Framework。具体的测量方法和广泛的合作伙伴参与将使其更具实用性。没有可比较测试结果的词汇体系,对采购决策的价值将有限。
Arm 的公告确立了一个连贯的方向。该公司正将其数据中心扩张与令其架构无处不在的边缘市场连接起来。
它尚未证明,单一开发层能够驯服云服务器、手机和机器人之间的每一种差异。这正是 Arm 边缘 AI 面临的核心检验。
对开发者而言,眼下的任务是进行严谨评估。记录模型版本、目标硬件、运行时环境、准确率变化、延迟和能耗。对比众多公告的团队,可以将这些发现保存在一个可搜索的知识库中。
问题已不再是 AI 计算是否会扩展到数据中心之外。它已经发生。问题在于,Arm 能否在保留合作伙伴所期待选择空间的同时,让这个分布式世界呈现出统一平台的体验。


