随着 DeepSeek 推动 AI 成本下降,Alibaba 与 Google 的竞争趋于白热化
- Aisha Washington

- 18小时前
- 讀畢需時 15 分鐘
Alibaba 和 DeepSeek 再次压低了模型成本,使这场竞争进一步波及 Google 以及所有主要的专有 AI 提供商。因此,最新的 Alibaba 与 Google 对比已不只是基准测试排名之争。它关系到:随着性能足够的替代方案变得更便宜、更易于修改,昂贵且受严格控制的模型能否守住利润空间。
眼下的压力来自两家采取相容策略的中国企业。DeepSeek 将注意力集中在高效的推理和编程模型上。Alibaba 则将 Qwen 扩展为覆盖推理、软件开发、翻译、视觉、音频和企业工作负载的庞大模型家族。
它们共同带来的挑战很直接。如果开发者能够以低成本部署模型、查看其权重并在本地进行适配,模型就不必在每项基准测试中领先。这一主张让 Google、OpenAI 和 Anthropic 面临一个比“谁拥有最聪明的聊天机器人”更棘手的问题。
老牌美国实验室仍拥有重要优势。它们运营着成熟的云平台,支撑大型企业合同,并掌控被广泛使用的消费级产品。Google 还将 Gemini 与 Search、Workspace、Android 和 Google Cloud 结合起来。
但这些分发优势并不能决定模型经济性。开放权重系统让开发者可以下载模型参数,并通过其他提供商或自有基础设施运行它们。这削弱了模型创建者与最终计算账单之间的联系。
这场竞争正演变为两种运营模式之间的较量。一种强调前沿能力、专有访问和纵向整合服务。另一种则借助高效架构和开放权重,将能力强大的 AI 扩散至相互竞争的基础设施之上。
Alibaba 与 Google 的比较如今从成本开始
最新一轮模型竞赛正在将采购问题从“哪个系统最好?”转变为“这项工作负载实际需要多少能力?”
DeepSeek 通过发布在推理和编程方面具备可信竞争力、同时强调计算效率的模型,推动了这一变化。其较新的发布延续了这一模式,尤其适用于消耗大量 token 的软件任务。
Alibaba 也正通过 Qwen 施加类似压力,但所处位置不同。它并非一家试图凭单一头条模型取胜的独立研究实验室,而是一家为众多工作负载、部署区域和客户类型构建产品组合的云服务运营商。
这种差异很重要。企业很少会将所有请求都发送给一个前沿系统。它们可能会为复杂决策保留高级推理模型,同时将分类、提取、翻译和常规生成路由至其他系统。
Alibaba 不断扩展的目录支持这种路由策略。其官方模型目录按任务、部署区域、上下文大小和推理模式区分模型。其中既包括 Qwen 模型,也包括来自 DeepSeek、Moonshot AI、MiniMax 和 Zhipu AI 的托管系统。
包含竞争对手模型的云市场改变了竞争方式。即使客户选择 DeepSeek 而非 Qwen,Alibaba 也能从对高效中国 AI 的需求中受益。它在部署、编排和基础设施中获得了一席之地。
Google 通过 Vertex AI 遵循了类似的云逻辑,客户可在其中访问 Gemini 和外部模型。不过,Alibaba 和 DeepSeek 正在模型层面施加更强的下行压力。它们的开放权重选项也为买家提供了更可信的退出路径。
这使 Alibaba 与 Google 的竞争变得更为严峻。Google 必须在证明其更广泛平台足以支撑更深层整合的同时,捍卫 Gemini 作为模型本身的价值。Alibaba 则可通过 Qwen、云托管以及接入更广泛的国内模型市场展开竞争。
这种比较并非完全对称。Google 服务于受到不同隐私、安全和监管要求影响的全球客户群。Alibaba 立足中国,同时提供国际云区域和可全球访问的模型服务。
不过,当类似任务能够通过成本更低的系统运行时,模型买家会注意到这一点。编程助手、文档提取流水线、支持代理和翻译服务会产生重复请求。随着采用规模扩大,每次请求中的微小差异都会累积。
价格压力也改变了产品设计。团队可以负担更多模型调用,测试多个候选方案,并为规划和执行使用不同模型。他们可以重试失败输出,而不必将每次尝试都视为高成本事件。
这种灵活性有利于围绕模型路由构建的应用。路由层会评估请求,并根据质量、延迟、上下文或治理需求,将其发送给合适的模型。没有任何一家提供商会自动获得全部工作负载。
对 Google 而言,风险并非 Qwen 会在所有场景取代 Gemini,而是工作负载的碎片化。每项转移至高效替代方案的任务,都会减少支撑高端专有经济模式的业务量。
对 Alibaba 而言,机会不止于赢得某项基准测试。它可以让 Qwen 成为混合环境中的默认选项。这种位置会带来开发者熟悉度、部署经验,以及围绕其模型设计的不断扩大的应用基础。
DeepSeek 增添了紧迫性,因为它已经展示了开发者注意力能够多快转移。其发布使低成本推理成为战略类别,而非次要功能。Alibaba 如今正将这一挑战扩展至更多模态和企业任务。
效率已成为产品功能
Alibaba 和 DeepSeek 并非仅通过折扣降低成本;其架构旨在减少每次有效响应所需的计算量。
一种重要方法是专家混合,即 MoE。这种架构包含许多专门的参数组,但每个 token 仅激活其中一部分。模型因此获得了广泛容量,却不必在每次请求中使用全部参数。
DeepSeek 多年来一直在完善这一方法。其 DeepSeek-V2 论文介绍了稀疏专家激活,以及在生成过程中压缩所存储信息的 Multi-Head Latent Attention。研究人员报告称,相较于早期基线,该方案具备更低的训练成本、更小的内存缓存,以及显著更高的生成吞吐量。
这些结果来自 DeepSeek 自身的评估,因此不应被视为普遍适用的生产保证。硬件、批量大小、软件配置和提示词长度都可能改变实际部署性能。不过,底层机制仍解释了为何效率始终是 DeepSeek 模型设计的核心。
Alibaba 也在 Qwen 中采用了专家混合设计。一些 Qwen 变体在推理时只激活其总容量的一部分。其他变体则采用稠密架构,适用于更看重简化部署或可预测内存需求的环境。
混合推理提供了另一种成本控制方式。模型可以在不生成冗长内部推理轨迹的情况下回答普通提示。随后,它可以针对数学、规划、编程或复杂分析切换到计算密集度更高的模式。
这一选择很重要,因为推理 token 会消耗时间和计算资源。一个对每句问候、摘要或格式请求都进行深度推理的系统是在浪费容量。选择性推理让应用能够将更重的处理留给真正能从中受益的任务。
长上下文效率同样重要。上下文是随请求提供的文本、代码、图像或其他信息。处理大量上下文甚至会在模型生成答案前,就增加延迟和内存使用量。
DeepSeek 的注意力机制旨在减轻这一内存负担。Qwen 的产品组合提供不同的上下文限制和任务专用模型。这两种策略都鼓励开发者将模型设计与工作负载相匹配,而不是默认使用可用的最大系统。
开放权重放大了这些架构收益。它们让独立托管方能够优化服务软件、量化模型,并选择硬件配置。量化会降低用于存储模型权重的数值精度,从而降低内存需求,但可能需要以质量为代价。
托管方之间的竞争随后可进一步压低部署成本。专有 API 通常只有一个主要运营方和一种商业结构。开放权重模型则可出现在云平台、专业推理服务和私有集群之中。
这并不意味着推理不再需要成本。数据中心仍然需要加速器、电力、网络、冷却和工程投入。高效模型只是改变了这些资源能够产出多少有效工作。
它们也改变了优化发生的位置。模型开发者可以改进架构,基础设施提供商可以调优内核和调度。应用团队则可以缩减上下文、缓存重复输入,或根据难度路由请求。
这种分层优化才是成本下降背后的真正机制。没有单一技术能够解释这一变化。稀疏计算、压缩缓存、选择性推理、量化、模型路由和提供商竞争会彼此强化。
这一机制也解释了为何单凭基准测试胜利无法呈现完整图景。更大的专有模型或许能在困难测试中取得更高分数。对于有边界、重复性的任务而言,较小的开放模型仍可能是更好的生产选择。
以内部知识助手为例。大多数请求涉及查找相关文档、提取段落并生成简短综合内容。应用可以先使用搜索缩小证据范围,再要求模型作答。
这种设计降低了每次请求都使用最强模型的必要性。团队也可以将有用的源材料保存在个人知识库中,然后针对相同证据测试多个模型。
当买家开始以这种方式思考时,Alibaba 和 DeepSeek 将从中受益。它们的模型成为系统内部的组件,而非整个软件栈的替代品。组件竞争奖励的是可接受的质量、运营灵活性和可预测的资源使用。
开放权重令专有 AI 承压
核心对手并非 Alibaba 对阵 DeepSeek;而是高效的开放权重分发模式对阵昂贵的专有控制模式。
Alibaba 和 DeepSeek 直接争夺开发者、企业工作负载和技术声望。但它们的发布也强化了同一种更广泛的替代方案,用以对抗由 Google、OpenAI 和 Anthropic 主导的封闭系统。
开放权重模型会公开参数,供其他人下载并运行。这一术语并不自动等同于完全开源。训练数据、准备方法、安全流程或完整开发代码仍可能无法获得。
这种区别对于透明度主张很重要。获取权重有助于检查和定制,但并不能揭示塑造模型的一切。不同版本的许可条款也可能有所不同。
即使存在这些限制,开放权重访问仍会改变买方的议价能力。企业可以测试私有部署、使用区域托管服务,或保留备用供应商。开发者则可以针对某种语言、行业或定义明确的工作流程修改模型。
斯坦福大学研究人员认为,中国的生态系统远不止 DeepSeek 一个故事。他们的开放权重分析涵盖了 Qwen、DeepSeek、Kimi 和 GLM 等模型家族,它们拥有不同的组织背景和技术重点。
这种多样性很重要,因为没有任何一家实验室必须满足所有使用场景。Alibaba 可以服务已经在使用其云服务的开发者。DeepSeek 可以专注于模型研究。Moonshot AI 可以面向长上下文和智能体工作负载,而其他实验室则瞄准多模态系统。
其结果更像是一场生态系统竞争,而非单一模型的竞赛。每次新发布都会带来其他团队可以借鉴的技术、权重、评测和部署经验。改进不必等待某一家供应商的产品路线图,也能扩散开来。
Google 面临多条战线的压力。Gemini 在 API 工作负载上直接与 Qwen 和 DeepSeek 竞争。Google Cloud 与 Alibaba Cloud 及独立推理服务商竞争。Google 的开放模型家族 Gemma 也必须赢得开发者的关注。
Google 仍拥有强大的防御优势。其定制 Tensor Processing Units 支持大规模训练和推理。Android 和 Workspace 提供分发渠道。Search 提供了庞大的消费者触点,而 Google Cloud 则为大型组织提供治理和采购支持。
这些优势使得被完全取代的情景不太可能发生。更直接的挑战在于定价权。如果开放模型能够承担越来越多的编码、翻译、信息提取和智能体执行工作,溢价 API 就必须证明其差异化价值。
质量仍然是一项理由。专有服务商可以在困难任务上提供更强的可靠性、更好的多模态集成,或更一致的工具使用能力。它们还可以为受监管客户打包提供安全控制、服务承诺和支持。
集成则提供了另一道防线。与电子邮件、文档、会议、搜索和企业身份系统相连的模型,可能比更强但孤立的 API 创造更高价值。Google 可以利用 Workspace 和 Cloud,将 Gemini 打造成更广泛运营环境的一部分。
Alibaba 也可以在自己的服务体系中提出同样的论点。这正是为什么 Alibaba 与 Google 的竞争不能被简化为单项基准测试。两家公司都围绕模型销售基础设施和应用。
DeepSeek 扮演着不同的角色。它的重要性部分来自于证明:一家独立实验室也能重塑市场预期。它无需复制大型平台的每一部分分发能力,也能对其施压。
这种关系在中国市场内部形成了富有成效的张力。DeepSeek 迫使 Alibaba 提升效率和可信度。Alibaba 则为高效模型提供了大规模进入企业基础设施的路径。
这种综合效应波及美国服务商。Brookings 研究人员指出,中国开发者一直强调开放权重分发、效率,以及降低对受限计算资源的依赖。他们的AI 竞赛评估也警告称,简单的国家间竞争叙事掩盖了各个市场内部不同参与者的目标。
这种谨慎态度很有价值。Alibaba、DeepSeek 和 Google 都是具有不同激励机制的商业和技术参与者。国家政策会塑造它们面临的约束,但不会让它们的战略变得完全相同。
最清晰的竞争分界线仍然是分发经济学。专有服务商寻求在模型和服务层保持控制权。开放权重开发者则通过可移植性、可修改性和更广泛的托管选择来争取采用。
随着这些模型不断改进,举证责任也在转移。买方不再需要解释为什么考虑开放替代方案。专有供应商必须解释,为什么某项特定工作负载应继续留在成本更高、控制更严格的系统中。
更低成本并不能消除部署风险
低成本模型访问可以改善应用的经济性,但无法解决安全、治理、可靠性或地缘政治方面的担忧。
基准测试结果是首要的不确定性来源。模型创建者会选择测试、提示方法、推理设置和对比系统。方法上的细微变化就可能产生不同的排名。
编码基准测试尤其值得谨慎看待。一个模型可能能够解决自包含的代码库任务,却难以应对缺乏文档的系统、内部依赖关系或不断变化的需求。生成的代码也可能通过测试,却引入安全弱点。
智能体评测带来了更多模糊性。智能体是指利用模型选择工具并朝目标执行多个步骤的系统。其成功与否取决于周边软件、工具描述、权限和恢复逻辑。
强大的模型可能在糟糕的智能体设计中失败。一般的模型在任务约束严格时也可能表现出色。因此,买方应测试完整工作流程,而不是假设公开评分能够预测生产环境结果。
可靠性同样会影响实际成本。如果一次更便宜的请求需要反复重试、大量验证或人工修正,就无法节省资金。当模型嵌入面向客户的软件时,延迟和正常运行时间同样重要。
开放权重带来了运营责任。私有运行模型提供了控制权,但买方必须管理基础设施、更新、监控和访问权限。专业技能可能成为比模型许可证更大的约束。
对于跨国组织而言,治理尤为重要。数据驻留规则可能决定提示词和输出可以流转到哪里。行业要求可能限制哪些服务商可以处理金融、医疗、法律或政府信息。
模型的原产国并不能回答所有治理问题。买方需要审查服务提供商、部署区域、日志政策、分包商、模型许可证和安全控制措施。私有托管的 Qwen 模型与通过远程服务访问同一模型,面临的风险不同。
政治审查仍可能影响采用。中国 AI 系统面临审查制度、数据处理、供应链和潜在政府影响力方面的担忧。美国服务商也面临自身关于监控、版权、集中化和不透明安全决策的问题。
开放权重的可用性带来了另一项权衡。广泛访问支持研究、定制和本地控制,但也可能让强大系统更容易被改造成有害自动化、网络行动或欺骗性内容工具。
因此,政策辩论介于能力扩散与风险遏制之间。限制性规则可以保护敏感应用,但也可能将控制权集中在少数资金雄厚的服务商手中。广泛发布政策会扩大获取渠道,同时也让滥用更难治理。
硬件的不确定性使有关效率的说法更加复杂。实验室可以报告一次最终训练所用的资源,却不包含早期实验、数据准备或人员时间。比较还取决于芯片类型、利用率和核算边界。
DeepSeek 早期的效率主张改变了市场预期,但外部观察者无法独立重建其开发流程的每一个环节。同样的怀疑态度也应适用于 Alibaba、Google、OpenAI、Anthropic 和其他模型创建者。
模型访问成本也只是整个系统的一部分。检索数据库、可观测性、评测、安全审查、人工监督和产品工程仍然必不可少。即使 token 变得更便宜,这些支出也不会消失。
推理成本下降甚至可能增加总体消耗。当每次请求变得更可负担时,开发者会加入更多调用、更长上下文、额外验证和更多智能体。因此,单位成本下降反而可能带来更大的整体计算足迹。
这种反弹并不否定经济层面的转变,只是改变了其解读方式。低成本智能会鼓励软件使用更多智能,就像更便宜的存储曾鼓励应用保留更多数据一样。
企业买方应关注每项已完成任务的成本。该指标包括重试、工具调用、人工审查、延迟和故障处理。相比宣传中的模型输入或输出成本,它提供了更有用的比较。
对 Alibaba 和 Google 的公平评估还需要针对工作负载进行测试。团队应使用具有代表性的提示词、私有文档、预期工具调用和已知失败案例,并评估事实准确性、完成率、延迟和审查人员投入。
不同任务的赢家可能不同。Gemini 可能在与 Google 服务相连的多模态工作流程中领先。Qwen 可能适合可定制的多语言部署。DeepSeek 则可能在编码或推理任务上提供有吸引力的经济性。
这种差异性削弱了“一个模型将取代另一个模型”的简单论断。它强化了一个更大的结论:服务商将持续面临比较。买方现在拥有足够多可信的选择来谈判、路由工作负载和切换供应商。
三个信号将决定接下来的走向
下一阶段将由独立工作负载结果、企业采用情况,以及专有服务商的回应决定。
第一个信号是最新 Qwen 和 DeepSeek 系统的生产环境证据。公开基准测试会吸引关注,但持续部署才能揭示可靠性、延迟、工具使用和运营成本。
开发者应关注那些公开提示词、设置和失败类别的评测。代码库级编码、多语言客户支持、文档分析和长时间运行的智能体,将提供比单一汇总评分更有用的证据。
如果 Qwen 和 DeepSeek 能在这些工作负载中保持较高完成率,低成本模型的论点就会更有说服力。即使头条基准测试结果仍然亮眼,频繁重试或不稳定的工具使用也会削弱这一论点。
第二个信号是中国以外的企业采用情况。下载量和开发者实验很重要,但并不能证明受监管组织会将开放的中国模型部署到重要系统中。
证据将来自云服务使用量、持续的 API 需求、区域部署和具名生产案例。通过第三方托管服务实现的采用也应计入,因为开放权重分发将模型与其原始开发者分离开来。
国际增长将表明,成本和灵活性能够克服采购方面的担忧。若采用仅限于实验或对价格敏感的应用,则说明机会更为有限。
Alibaba 在这方面具有优势,因为它可以将模型与部署工具和云服务打包。DeepSeek 则受益于可通过多个平台获得。两者仍需要为跨司法辖区运营的组织提供可靠的支持路径。
第三个信号是 Google 和其他专有实验室的回应。它们可以降低模型成本、发布更小的系统、改进开放模型家族,或将 AI 更深入地捆绑进现有订阅和云服务合同中。
广泛的专有服务商回应将证实,中国的效率压力已经改变了市场预期。它也会让最初挑战者的优势更难维持。
Google 的回应尤其值得关注。它可以在自有芯片上优化 Gemini,利用 Gemma 争夺开放模型开发者,并通过人们已经在使用的产品分发 AI。能够同时结合这三种方式的竞争对手寥寥无几。
OpenAI 和 Anthropic 在缺少 Google 消费者业务与硬件生态支撑的情况下,面临着类似的选择。它们可以通过能力、可靠性和智能体平台来捍卫高端定位,也可以为日常工作负载推出更小型的模型。
核心问题在于,前沿技术进步是否会持续创造持久的高端价值。如果昂贵的系统能够完成更便宜模型无法处理的任务,分层市场就会延续。如果能力差距迅速缩小,模型访问将更像一种大宗商品。
大宗商品并非毫无价值。它指的是供应商难以在基础层面维持差异化的产品。价值随后会转向分发、集成、专有数据、工作流设计和可信赖的运营能力。
这种转变将有利于掌控云基础设施或拥有广泛使用软件的公司。即使单次模型调用的利润率受到挤压,它仍可能同时惠及 Alibaba 和 Google。DeepSeek 则会通过设定技术预期而继续保持影响力。
知识工作者将通过应用程序而非模型卡感受到这一变化。更低的成本能够支持更多后台研究、代码审查、翻译、会议分析和文档处理。用户可能会获得多个模型的输出,却无需自行选择供应商。
开发者将需要更完善的评估和路由实践。仅凭模型名称无法决定应用质量。周边数据、工具、权限和验证步骤同样重要。
企业采购方应避免基于单一发布周期作出永久性承诺。他们可以保持提示词的可移植性,将业务逻辑与供应商特定接口分离,并保留具有代表性的评估集。
这种做法并不要求频繁切换。它能够在 Qwen、DeepSeek、Gemini 或其他模型改变成本与质量边界时保留议价能力。可移植性将成为应对模型快速迭代的保险。
因此,Alibaba 与 Google 的竞争将不止体现在研究排名上,还将涉及云采用、模型路由、应用集成和信任。DeepSeek 的角色则是持续推动效率基准向前发展。
对读者而言,实际行动很明确:找出一个昂贵或高吞吐量的 AI 工作流,并在多种模型类别之间进行测试。衡量完成的工作,而不是营销宣传。
请思考:更便宜的开放权重模型能否处理日常执行任务,而高端系统是否只负责棘手案例?随后,针对完整流程跟踪失败情况、审核时间、延迟和治理要求。
这项实验揭示的会比又一个排行榜更多。它将说明低成本竞赛是否已经改变了你的经济性,还是专有集成仍然值得其溢价。


