top of page

阿里巴巴与 Google 正面交锋:Gemma 4、Phi-4 Mini 和 Qwen3.5 推动 AI 走向端侧

9月1日
讀畢需時 14 分鐘

阿里巴巴与 Google 在相隔数周内发布了新的小型模型,使端侧 AI 成为围绕能力、内存和控制权的直接竞争。Gemma 4 和 Qwen3.5 现已在笔记本电脑、手机、工作站及紧凑型边缘系统上挑战 Microsoft 较早推出的 Phi-4 Mini。

阿里巴巴与 Google 的较量并非一场简单的基准测试竞赛。Google 围绕本地硬件上的多模态、类智能体任务设计了 Gemma 4。阿里巴巴则为 Qwen3.5 提供了广泛的尺寸选择、原生多模态支持,以及旨在降低推理成本的架构。

Microsoft 的 Phi-4 Mini 仍是重要参照,因为它展示了一个 38 亿参数模型能够提供何种程度的推理能力。然而,它于 2025 年 3 月推出,早于最小的 Qwen3.5 版本和 Gemma 4 近一年。在开发者比较架构、部署工具和支持的输入类型时,这一时间差具有重要意义。

更大的转变在于 AI 工作发生的位置。本地运行的模型能够处理敏感笔记、源代码、录音、图像和文档,而无需将每一项输入发送至远程服务。在连接受限或云端延迟变得不可接受时,它也能继续工作。

不过,“端侧”涵盖的硬件差异很大。Raspberry Pi、Android 手机、Apple Silicon 笔记本电脑和工作站 GPU 面临的限制各不相同。仅凭模型尺寸无法告诉开发者哪种系统效果最佳。

Google 和阿里巴巴重塑本地模型竞赛

决定性的变化在于,本地模型正为完整工作流而设计,而不再只服务于简短的文本对话。

Google 于 2026 年 4 月初发布 Gemma 4,将其定位为适用于本地、多模态和类智能体应用的开放模型家族。该公司表示,这一模型家族支持规划、自主操作、离线代码生成、视觉处理,以及 140 多种语言。

Google 还将此次发布与其设备软件关联起来。开发者可通过 Google AI Edge 使用 Gemma 4,而 AICore 开发者预览版则将该模型引入 Android 的托管 AI 运行时。这使部署基础设施成为 Google 竞争论点的一部分。

首批模型覆盖多个硬件类别。最小配置面向资源受限设备,更高密度及混合专家版本则面向笔记本电脑和专用 GPU。混合专家模型会针对每项输入仅激活其整体网络的一部分,从而减少实际计算量。

Google 在 6 月通过 Gemma 4 12B 扩展了产品线。根据其开发者指南,这一稠密模型可通过单一的无编码器架构接收文本、图像和音频。

编码器通常会在语言模型处理前,将媒体转换为表征。Google 则将多模态信息直接输入模型的主干网络。该公司表示,这种设计减少了独立视觉和音频编码器带来的开销。

Gemma 4 12B 也体现了端侧 AI 模糊的边界。Google 表示,它可在拥有 16GB 显存或统一内存的笔记本电脑上运行。这属于本地计算,但与中端手机所处的环境并不相同。

阿里巴巴于 2026 年 2 月开始发布 Qwen3.5,随后在 3 月推出更小的 9B、4B、2B 和 0.8B 模型。这些较小的检查点让该模型家族更适用于消费级硬件和嵌入式部署。

Qwen3.5 将传统注意力机制与线性注意力组件结合。线性注意力是一种替代性的序列处理方法,旨在避免部分会随上下文长度急剧增长的成本。该模型家族还包含原生视觉语言模型,可将图像与文本一并处理。

较小的 Qwen 版本让阿里巴巴覆盖了广泛的硬件范围。0.8B 模型可面向高度受限的系统,而 4B 和 9B 版本则适用于性能更强的设备。更大的稠密和混合专家版本将同一模型家族延伸至工作站和服务器领域。

Microsoft 的 Phi-4 Mini 采取了更窄的路线。其技术报告描述了一款 38 亿参数的文本模型,该模型使用了大量合成数学和代码数据进行训练。

这种训练重点帮助 Phi-4 Mini 成为紧凑型推理模型的参照。Microsoft 还将其词汇表扩展至 20 万个 token,并采用分组查询注意力机制,通过共享键和值表征来降低内存使用。

最终形成了一场三方比较,但没有完全匹配的参赛者。Gemma 4 是一个 2026 年推出的多模态模型家族。Qwen3.5 覆盖多种尺寸和架构。Phi-4 Mini 则是较早的文本优先模型,其最突出的优势集中在紧凑型推理。

阿里巴巴与 Google 的竞争为何给 Microsoft 带来压力

阿里巴巴和 Google 如今将多模态输入与广泛部署能力视为核心要求,这给以文本为重点的 Microsoft Phi-4 Mini 带来了压力。

Phi-4 Mini 并没有突然失去能力。其紧凑尺寸仍使其适用于文本提取、分类、结构化生成、代码辅助和数学推理。成熟模型在推理框架中的支持范围也可能比新发布模型更广。

压力来自不断变化的预期。开发者越来越希望一个本地模型能够读取截图、解读文档、听取简短录音、调用工具,并生成结构化输出。文本质量依然重要,但已不再是唯一的决定因素。

Google 通过将模型整合至其边缘技术栈来应对这一趋势。LiteRT-LM 提供了一个运行时层,用于在受支持硬件上部署生成式模型。AICore 则增加了一项 Android 系统服务,可管理模型访问和设备资源。

这种整合能够减少 Android 开发者的工作量。应用无需独立打包每一个组件,而可在可用情况下依赖平台托管的能力。Google 仍需证明这些路径能够稳定覆盖生产设备。

阿里巴巴则通过模型广度施压。Qwen3.5 为拥有不同内存上限的系统提供了紧密关联的检查点。团队可以在较大模型上进行原型开发,随后在部署成本受限时考察更小的成员。

这一尺寸阶梯很重要,因为本地 AI 项目往往在优化阶段失败。原型可能在开发者工作站上运行良好,却在客户硬件上停滞。同一模型家族中拥有多个尺寸,可以缩小测试与部署之间的概念距离。

Microsoft 也拥有自己的资产。Windows、Azure、Foundry、ONNX Runtime 以及不断扩展的 Copilot 生态系统,为其进入企业设备提供了多条路径。Phi 模型同样受益于 Microsoft 与 PC 制造商及芯片供应商的关系。

然而,这一具体比较暴露出一个令人不安的时间线。Phi-4 Mini 代表的是 2025 年初的紧凑型模型,而 Gemma 4 和 Qwen3.5 则反映了为 2026 年做出的设计选择。新模型进入的市场,对多模态和自主任务执行有着更强需求。

Microsoft 的 Phi-4 Multimodal 在一定程度上缩小了这一差距。它通过特定模态的低秩适配器结合文本、视觉和语音;这些适配器是附加在共享模型上的小型可训练组件。不过,Phi-4 Multimodal 与纯文本 Phi-4 Mini 属于不同的比较对象。

因此,开发者不应将“Phi-4 Mini”和“Phi-4 Multimodal”视为可互换的名称。它们支持不同的输入,可能需要不同的部署决策。忽略这一差异的比较将得出误导性的结论。

对 Microsoft 的压力是战略性的,而不只是技术性的。Google 可以将本地模型连接至 Android。阿里巴巴可以通过全球开发者社区及其云平台分发庞大的开放模型家族。Microsoft 必须让紧凑型 Phi 版本保持更新,同时使其与 Windows 硬件保持一致。

这场竞争通过扩大选择范围而使买家受益,但也增加了评估工作。团队现在需要在每种目标设备上测试模型质量、内存消耗、启动时间、持续速度、工具可靠性和隐私行为。

阿里巴巴与 Google 的模型让架构成为真正的竞赛

阿里巴巴与 Google 的竞争归根结底是部署机制之间的较量,而不是对模型智能水平进行普遍排名。

Gemma 4 强调无编码器的多模态路径。这一设计旨在避免为文本、视觉和音频配置独立的处理栈。当多种媒体类型必须参与同一任务时,它可简化本地应用。

设想一名在缺乏可靠网络连接的情况下工作的现场技术人员。应用可能需要检查设备照片、接收口头描述、检索本地手册,并起草维修记录。原生多模态处理能够减少必须保持加载状态的模型数量。

代价是内存。即便是高效的统一模型,也必须存储权重、维护上下文缓存并处理媒体表征。一个在技术上能够加载的模型,仍可能产生不可接受的延迟,或在持续使用时耗尽电池。

Qwen3.5 采用混合架构路线。其标准注意力与线性注意力机制的组合,旨在处理长序列时避免让每一层都承担最高的计算成本。这对于本地文档分析很重要,因为上下文可能变得昂贵。

阿里巴巴的较小模型同样具备视觉能力。因此,紧凑型 Qwen3.5 检查点可以处理截图理解、界面自动化、文档检查和视觉问答。实际表现将取决于分辨率、量化方式和设备运行时。

量化会降低用于存储模型权重的数值精度。四位版本通常比全精度检查点需要少得多的内存。这种缩减可使本地部署变得可行,但也可能影响输出质量。

Phi-4 Mini 的机制则更为聚焦。Microsoft 专注于训练数据质量,尤其是数学和代码的合成材料。该公司称,这使该模型能在特定推理任务上与更大的系统竞争。

这一说法不应被泛化到所有工作负载。针对数学和代码模式调优的模型,可能会在结构化推理上优于同类模型,却在视觉理解、多语言对话或创意生成方面落后。

上下文长度带来了另一种混淆来源。模型可以宣称支持很长的输入,但接近该限制时可能变得缓慢或占用大量内存。存储中间注意力数据的键值缓存,可能在长对话期间消耗大量内存。

不同应用实际需要的上下文量也不同。语音命令路由器可能只需要简短提示词。私有文档助手可能需要数千个 token。代码智能体则可能结合代码库文件、工具输出和不断增长的操作历史。

对于知识工作,模型选择应遵循工作负载。组织本地研究资料的系统可将紧凑模型与检索结合,在生成前找出相关段落。这种方法避免要求模型在单个提示词中容纳整个档案。

这一差异同样适用于个人知识库。本地存储与检索策略的重要性,可能不亚于生成最终回答的模型。

工具使用带来了另一项架构考验。模型或许能生成流畅文本,却可能无法选择正确的函数、正确格式化参数,或在出错后恢复。因此,类似智能体的部署需要的不只是出色的基准测试成绩。

Google 明确将 Gemma 4 定位于多步骤任务。Qwen 近期的模型系列也强调智能体与工具使用。Phi-4 Mini 可以支持结构化调用,但其表现必须在应用实际使用的确切 schema 和运行时环境中进行测试。

最终胜出的机制会因产品而异。原生音频能力对会议工具可能很重要;强大的紧凑型推理能力对离线辅导可能很重要;高效的图像处理能力则可能对移动端支持系统至关重要。

Gemma 4、Phi-4 Mini 与 Qwen3.5 并不存在唯一赢家

可信的比较应区分内存级别、输入支持和工作负载质量,而不是宣称某个模型最佳。

在最小规模端,Qwen3.5 提供了 0.8B 和 2B checkpoint。这些模型面向内存和能耗比最大推理质量更重要的环境,可用于分类、信息提取、路由和受限助手任务。

Gemma 4 的紧凑型变体也处于相近领域,但 Google 将其定位为具备更广泛的类智能体与多模态能力。评估两者的开发者应在同一设备上,以相同的量化级别和完全一致的提示词进行测试。

从参数量看,Phi-4 Mini 与 Qwen3.5 4B 相近。这使二者颇具可比性,但参数量无法统一架构、数据、上下文行为或模态。它只是存储和计算需求的粗略指标。

在文本推理方面,Phi-4 Mini 依然具有竞争力。其训练方案专门面向数学和编程,而 3.8B 的规模在量化后可适配许多笔记本级环境。Microsoft 的报告还提到,相比 Phi-3.5 Mini,它的多语言覆盖能力有所提升。

Qwen3.5 4B 采用更新的架构并支持原生视觉输入。这让它在涉及截图或图像的应用中拥有更广的功能范围,但并不保证它在所有文本任务上都能给出更好的答案。

Gemma 4 对应的紧凑型模型则提出了不同的价值主张。Google 将广泛的语言支持、视觉处理和边缘端集成结合起来。Gemma 4 发布公告还强调了离线代码生成和多步骤规划。

更大规模的比较会带来更多复杂因素。Gemma 4 包含稠密模型和混合专家配置,而 Qwen3.5 延伸至更大的模型。其中一些 checkpoint 只有在高端工作站上才算得上本地运行。

在单张专用 GPU 上运行的模型是本地模型,但并不代表普通消费者硬件。文章常常将工作站、笔记本电脑、手机和嵌入式开发板归入同一标签,从而模糊了这一界线。

开发者在比较输出之前,应先定义硬件上限。该上限应包括可用内存、存储空间、散热限制和可接受的响应时间。移动设备还需要考虑电池预算。

接下来,团队应选择可重复的任务。一个有用的测试集可包括客户邮件、截图、代码片段、本地文档,以及来自目标产品的工具调用。整个测试过程中都应保护私有数据。

每个模型都应接收相同的系统指令和输出格式。测试人员应记录失败案例,而不只是收集看起来出色的示例。单个精心打磨的回答几乎无法说明模型在多次运行中的可靠性。

应分阶段衡量延迟。首 token 时间反映回答开始生成的速度;生成速度衡量输出吞吐量;端到端时间则包括图像处理、检索、工具执行和应用开销。

还应在真实的上下文增长过程中测量内存占用。一个模型在启动时能轻松加载,可能在长时间会话后超出设备限制。对于需要保留多份文档或延长对话的助手,这种行为非常重要。

质量还必须包括事实严谨性。当提示要求综合分析时,较小模型可能会编造缺失细节。检索和引用可以降低这种风险,但无法彻底消除它。

隐私需要直接审查。“本地”应意味着输入、中间数据和输出都留在预定设备上。应用仍可能将遥测数据、崩溃报告、搜索请求或工具调用发送给外部服务。

这些因素都不会产生永久赢家。某个 Qwen3.5 checkpoint 可能在多语言图像任务中领先;Phi-4 Mini 可能仍更适合受限的推理工作流;Gemma 4 则可能为 Android 应用提供最顺畅的路径。

已发布的基准测试仍无法证明什么

厂商基准测试描述的是模型在特定条件下的能力,但无法证明它在真实应用中的可靠表现。

Google、Alibaba 和 Microsoft 发布的评估在提示词、评分方式、模型规模、精度和运行时设置上各不相同。比较不同模型卡中的数字,可能会造成虚假的精确感。

即使是共享基准测试,也可能偏向某一种训练方案。编程评估会奖励接触过编程任务的模型;数学测试会奖励拥有结构化推理数据的模型;视觉测试则取决于图像预处理和分辨率。

这些公司也控制着发布材料中呈现哪些结果。这并不意味着结果是虚假的,而是说,在独立测试以可比条件复现前,读者应将其视为厂商声明。

社区测试提供了有价值的证据,但也会带来自身问题。用户可能采用不同的量化方式、采样设置、提示词模板或上下文长度。细微的配置变化都可能改变质量和速度。

围绕 Gemma 4 和 Qwen3.5 的早期报告,在编程、设计生成、多语言写作和商业任务上呈现出不一的结果。这种差异支持一个谨慎结论:工作负载设计比单一排行榜名次更重要。

模型的新旧程度也会扭曲比较。Qwen3.5 在 Phi-4 Mini 之后发布,而 Alibaba 仍在持续更新其模型系列。Google 则在最初公布该系列后新增了 Gemma 4 12B。

因此,静态的三方对比标题可能很快过时。Microsoft 可能发布新的紧凑型 Phi 模型;Alibaba 可能替换更小的 Qwen3.5 checkpoint;Google 也可能扩大 Android 可用范围或调整其运行时。

许可证需要单独审查。“开放模型”和“开源”并不总是同义词。开发者应检查每个 checkpoint 附带的实际许可证、可接受使用条款、再分发权利和义务。

适用于实验的许可证,可能会给嵌入式商业分发带来疑问。移动应用还可能面临与模型质量无关的应用商店规则、出口管制和地区要求。

安全性是另一个尚未解决的问题。能够访问文件、麦克风、摄像头或操作系统功能的本地智能体,可能带来严重风险。离线运行降低了一些网络暴露风险,但并不意味着工具执行就是安全的。

当模型读取不受信任的文档或网页时,提示注入仍有可能发生。恶意文本可能试图改变智能体的行为。应用需要在模型之外设置权限边界和确认步骤。

开发者还应检查软件成熟度。新架构有时会在各个推理引擎完全支持之前就进入模型仓库。转换工具、量化器、移动运行时和 GPU 后端的行为可能各不相同。

Qwen3.5 的部署历程说明了这一普遍风险。对新型混合式、多模态架构的框架支持,需要协调更新。模型已发布权重,并不自动保证它能在每个运行时中稳定执行。

Gemma 4 也面临类似的验证要求。Google 的 Android 集成具有战略意义,但开发者预览版并不等同于广泛的生产环境可用性。设备覆盖范围和操作系统支持将决定它的实际影响力。

Phi-4 Mini 受益于较长的市场时间、文档和累积的集成。时间可能成为能力上的劣势,但成熟度仍可能是部署上的优势。

因此,怀疑论立场很直接:这三个系列都尚未在手机、笔记本电脑、边缘开发板和工作站上确立普遍领先地位。现有证据支持差异化优势,而非绝对排名。

三个信号将决定端侧 AI 的竞争

下一阶段取决于生产级硬件支持、独立的工作负载测试,以及各家公司后续发布的速度。

第一个信号是真实设备分发。只有当 Gemma 4 通过稳定 API 覆盖具有实际规模的已出货 Android 设备时,Google 的 AICore 预览才有意义。开发者应关注支持的芯片组、内存要求和操作系统版本。

如果 Google 扩大这项支持,其边缘端战略将更具可信度。Android 集成的价值可能超过狭窄的基准测试领先优势。有限的可用性则会削弱 Google 关于 Gemma 4 改变主流端侧开发的主张。

同样的考验也适用于 Microsoft。Windows PC 正越来越多地配备神经处理单元,即专为 AI 工作负载优化的处理器。Microsoft 的回应将揭示紧凑型 Phi 模型是否会成为 Windows 开发者技术栈中稳定的一部分。

Alibaba 对占主导地位的北美消费者操作系统控制较少。它的信号将是广泛的运行时采用。若能在 Transformers、llama.cpp、MLX、Ollama、移动框架和芯片专用引擎中获得稳定支持,将抵消这一平台劣势。

第二个信号是在固定硬件限制下进行的独立测试。有价值的比较应将规模和量化程度相近的模型部署在同一设备上,并报告内存、延迟、能耗及重复任务质量。

使用真实文档、图像、代码和工具使用工作负载的公开评估,将加深市场理解。它也可能挑战依赖精心挑选基准测试的厂商叙事。

最有参考价值的测试将衡量失败恢复能力。智能体必须识别失败的工具调用、修正计划,并避免重复不安全操作。一次性问答无法捕捉这种行为。

第三个信号是各家公司下一次发布的小模型。Phi-4 Mini 现在面临来自更新一代的竞争对手。Microsoft 的下一款紧凑型 Phi 模型将表明,它是否优先考虑原生多模态、更长且高效的上下文,或更深度的 Windows 集成。

Alibaba 更小规模的 Qwen 更新将揭示其混合架构改进的速度。该公司已经形成快速发布的模式。开发者必须在这些收益与频繁更换模型带来的迁移成本之间取得平衡。

Google 的后续动作将表明 Gemma 4 是会成为一个持久系列,还是短暂的 checkpoint 周期。更好的设备覆盖、优化的量化方案和稳定的智能体工具将强化其本地优先定位。

对于买家而言,眼下的行动不是根据一个标题选出赢家。应从产品必须完成的工作中构建测试集,然后在用户实际面临的确切内存和隐私限制下运行测试。

密切关注哪些数据会离开设备。本地模型可以支持私密工作流,但检索服务和连接的工具仍可能传输敏感信息。处理个人资料的团队应绘制每一条数据路径。

阿里巴巴与 Google 的竞逐让本地 AI 更具可信度,而 Microsoft 的 Phi-4 Mini 仍提供了一个实用的紧凑型推理基准。如今决定胜负的问题已非常实际:哪款模型能在不超出设备限制的前提下,可靠地完成你的真实工作负载?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page