Alibaba 和 DeepSeek 以更低成本、更强模型重塑 AI 竞赛
- Martin Chen

- 8月4日
- 讀畢需時 13 分鐘
尽管西方实验室在高难度基准测试中仍保持微弱领先,Alibaba 和 DeepSeek 已凭借更低成本的中国 AI 模型登上 Google News 头条。如今争论的焦点在于:客户究竟需要最高分,还是需要一款能够以可承受成本大规模部署的强大模型。
DeepSeek 通过 V3 及其专注推理的 R1 模型,将这一问题推向公众视野。Alibaba 则以 Qwen2.5-Max 作出回应;该模型于 2025 年春节假期期间发布,直接对标 DeepSeek-V3、GPT-4o 和 Meta 的 Llama 3.1。
这些发布并未确立永久的赢家,却揭示了市场评判 AI 系统方式的变化。OpenAI、Anthropic、Google 和 Meta 如今面对的竞争者,不仅凭基准测试领先优势竞争,更依靠效率、可获取的模型权重及快速发布周期展开角逐。
Alibaba 和 DeepSeek 为何登上 Google News
关键事件并非某一模型击败另一模型,而是中国 AI 行业围绕成本与性能的竞争突然加速。
DeepSeek 于 2024 年 12 月发布 V3,随后于 2025 年 1 月 20 日推出 R1。R1 是一款推理模型,这意味着它会投入额外计算资源,在生成答案前处理多步骤问题。
该公司表示,R1 在多项数学、编程和推理测试中的表现可与 OpenAI 的 o1 相当。DeepSeek 还以 MIT 许可证发布模型权重,允许开发者在相对较少限制下修改并将软件商业化。
这些说法之所以受到关注,是因为 DeepSeek 描述了一套异常高效的开发流程。其 V3 技术报告记录显示,该模型最终训练过程使用了 278.8 万 H800 GPU 小时。
这一数字并不代表 DeepSeek 的完整研发预算。它未包含早期实验、架构研究、数据工作、薪酬和基础设施投入。因此,将其视为开发 R1 的总成本,会误读该公司的披露信息。
这一差别很重要,因为较小的数字成为 Google News 叙事的核心。它促成了一种过度简化的结论:DeepSeek 仅用极小的整体预算,就复现了一家领先美国实验室的全部能力。
现有证据支持更有限的结论。DeepSeek 设计了一次高度高效的最终训练,并以此为基础构建了具有竞争力的推理系统。即使不把一项会计估算转化为完整的企业成本比较,这一点依然意义重大。
DeepSeek 的技术路线结合了多项效率措施。混合专家模型仅为每个 token 激活部分参数,从而降低每次响应所需的计算量。
该公司还采用了多头潜在注意力,这项技术旨在压缩推理期间存储的信息。其训练过程依赖低精度 FP8 计算,以及旨在降低 GPU 间通信开销的工程设计。
Alibaba 于 2025 年 1 月 28 日作出回应,宣布推出 Qwen2.5-Max,并通过 Alibaba Cloud 提供服务。该公司表示,这款混合专家模型在超过 20 万亿 token 上进行了预训练。
Alibaba 将 DeepSeek 置于比较的核心。其 Qwen 基准测试结果显示,Qwen2.5-Max 在 Arena-Hard、LiveBench、LiveCodeBench 和 GPQA-Diamond 上超过了 DeepSeek-V3。
每项基准测试都只衡量性能的有限维度。LiveCodeBench 测试编程能力,而 GPQA-Diamond 使用高难度科学问题。Arena-Hard 则尝试通过对比评估近似反映人类偏好。
Alibaba 的结果还将 Qwen2.5-Max 与 GPT-4o 和 Claude 3.5 Sonnet 并列比较。不过,由模型开发者发布的基准测试图表属于公司主张,而非覆盖所有生产工作负载的独立结论。
发布时间进一步放大了竞争信号。Alibaba 在农历新年第一天宣布该消息,当时中国大部分地区正值假期。
一篇当时的报道将这一时机解读为 DeepSeek 快速崛起带来压力的证据。ByteDance、Baidu、Tencent 及其他中国科技公司也在更新模型或调整商业策略。
Alibaba 并不只是回应一家美国竞争对手。它也在捍卫自身地位,对手是一家规模更小、将效率纳入产品叙事的本土研究实验室。
这一变化构成了文章的核心张力。AI 竞赛此前被描述为最大计算集群与最强基准测试成绩之间的较量。DeepSeek 和 Alibaba 表明,工程效率与分发能力同样可能具有决定性影响。
成本挑战如今波及西方 AI 实验室
OpenAI、Anthropic、Google 和 Meta 面临压力,因为基准测试领先已不再保证客户愿意为每项任务支付溢价。
第一波生成式 AI 浪潮奖励的是原始能力。企业常常选择单一的领先模型,因为有用答案与不可靠答案之间的差距很大。
随着竞争模型逐步趋同,这一计算方式发生了变化。处理支持请求、分类文档、起草常规内容或从表单提取字段的公司,可能并不需要当前最强的推理系统。
它需要的是能稳定达到准确率门槛的模型。一旦多款产品跨过这条线,响应时间、部署控制权和运营效率便会在决策中占据更大权重。
中国模型正是在这一领域建立了可信的地位。DeepSeek 和 Alibaba 无需在每项基准测试上击败所有西方模型,便能影响市场。它们只需在大部分商业工作负载中做到足够好。
模型路由强化了这一效应。路由是一种生产方法,会根据请求的难度、敏感性或所需速度,将每个请求发送至选定的模型。
企业可能为复杂编程或多步骤分析保留领先的闭源模型,同时将分类和摘要任务交给成本更低的开放权重系统。
这种架构削弱了“赢家通吃”的假设。在兼容的模型 API 之间切换,比替换搜索引擎、社交网络或企业数据库更容易。
开放权重模型带来了另一种选择。开放权重是可下载的模型参数,允许组织在自身基础设施上运行 AI 系统,但须遵守相应许可证。
自行托管可降低对单一 API 提供商的依赖。它也能将机密材料保留在组织选定的环境中,尽管组织随后需自行承担安全、监控和容量规划责任。
对开发者而言,实际变化是议价能力提升。团队可以用自己的任务测试 Qwen 或 DeepSeek 与闭源模型的表现,再决定质量差异在哪些场景中真正重要。
对企业采购方而言,这一转变使采购决策更加细化。买方无需为所有 AI 活动选择同一供应商,而是可以分别评估编程、客户服务、搜索、分析和内部知识工作所需的系统。
这对西方实验室形成直接压力。OpenAI 和 Anthropic 必须证明其模型为何值得在特定工作流中获得溢价。Google 可以将 Gemini 与其云服务和生产力工具分发渠道结合,但仍需证明这种整合的价值。
Meta 所处的位置不同,因为它一直在推广可下载的 Llama 模型。Qwen 和 DeepSeek 的崛起为开发者提供了更多开放权重选择,加剧了 Meta 偏好分发模式内部的竞争。
Nvidia 面临的结果更为复杂。高效训练可能削弱这样一种假设:每一项进步都必然需要同等显著增加计算支出。
然而,更广泛的模型采用可能带来新的推理需求。推理是训练完成的模型生成答案时使用的计算,而许多应用中的高使用量可能需要大量硬件。
因此,随之而来的压力并非计算需求的简单崩塌,而是转向审视每个计算单位实际带来了什么产出。
DeepSeek 发布 R1,使这种审视变得异常显眼。该公司的官方模型发布公告描述了与 o1 相当的性能、大规模强化学习,以及可自由获取的蒸馏模型。
蒸馏会将较大模型的行为迁移至较小模型中。较小系统可以更易于部署,同时保留较大模型部分推理能力。
这些蒸馏版本将竞争挑战扩展至单一旗舰模型之外。它们为开发者提供了多种尺寸选择,以适配不同硬件和延迟限制。
这正是该事件为何在最初的 Google News 周期之后仍持续受到关注。DeepSeek 改变了人们对独立实验室能够发布何种成果的预期。Alibaba 的回应则表明,一家大型云服务提供商认为这一挑战十分紧迫。
更低成本的 AI 模型改变部署决策
核心逆转在于:当性能略弱的替代方案能够更高效地扩展时,得分最高的模型也可能失去工作负载。
基准测试仍然有用,但它们无法复现组织完整的运营环境。科学测试中相差几个百分点,对科研辅助可能至关重要,对筛选客户邮件却几乎无关紧要。
质量差异也会在长链路智能体工作流中累积。AI 智能体是使用模型规划并完成多项行动的软件,通常会调用外部工具。
如果每一步都有较小的失败概率,包含数十个步骤的工作流便可能变得不可靠。因此,对编程智能体、金融分析或敏感决策支持而言,最强的推理模型可能足以证明其更高运营负担的合理性。
常规任务遵循不同逻辑。每秒处理数百万个短请求的分类服务,受益于可预测的输出、快速响应和高效的硬件使用。
这形成了一个双层市场。前沿模型处理那些每增加一个单位可靠性都能创造显著价值的任务。更易获得的模型则竞争高容量工作,在这些场景中,可接受的性能比最后一个基准测试分数更重要。
DeepSeek 的架构正是围绕这一效率挑战设计的。其 V3 系统总计包含 6710 亿参数,但每个 token 仅激活 370 亿参数。
与规模相近的稠密模型相比,这种稀疏激活降低了每次预测所需的工作量。它并不会让计算变得免费,运行如此规模的模型仍需要严肃的基础设施。
Alibaba 通过 Qwen2.5-Max 采取了类似的混合专家路线。其公告强调了大规模预训练数据、有监督微调和基于人类反馈的强化学习。
有监督微调使用经过筛选的示例来训练预训练模型。基于人类反馈的强化学习则利用源自人类判断的偏好信号调整行为。
两家公司都将大规模训练与旨在更有选择性地使用计算资源的方法结合起来。它们的策略挑战了这样一种观点:效率只属于规模更小或能力较弱的系统。
部署控制的重要性可能不亚于算力效率。可下载的模型权重让企业能够针对专业术语调整模型、在内部进行评估,并自主选择数据的处理地点。
医院、律所、工程公司或公共机构即使面对在公开排行榜上表现更好的闭源模型,也可能更看重这种控制权。具体选择取决于工作负载、治理规则和内部专业能力。
开放权重并不能消除对供应商的依赖。组织仍依赖硬件、推理服务框架、安全工具,以及能够管理该系统的员工。
它们还需要追踪模型许可证和训练数据来源。可下载模型可能带来法律或合规问题,而这些问题在 API 合同中可能会以不同方式分配责任。
知识工作者也在更小的尺度上面临同样的权衡。人们日益频繁地在多个 AI 系统之间切换,因为每个系统都有不同的优势、限制和数据政策。
这种碎片化提升了将源材料独立于任何模型提供商进行整理的价值。个人 AI 知识库可以在偏好的模型发生变化时,保留笔记和参考资料。
更广泛的机制类似于云计算早期的一次转变。标准接口让基础设施更具可替代性,而高端服务仍通过可靠性和集成能力展开竞争。
AI 模型正更快地朝这一方向发展,因为开发者可以立即比较输出结果。评估工具可以在多个系统上运行同一组提示词,并衡量准确性、延迟和失败模式。
Alibaba 和 DeepSeek 推动了这种比较方法的常态化。如今,一次模型发布会引发的不再只是“谁排名第一”的问题。
系统能否在客户选定的环境中运行?它能否可靠地遵循指令?它在客户文档上的表现如何?需要怎样的监控?
这些问题将影响力转向具备严谨评估能力的买方。它们也会惩罚那些仅依靠宽泛的基准测试主张、却无法在实际应用中证明稳定结果的提供商。
更便宜的 AI 模型并不会自动胜出。只有当其局限性不触及目标工作负载的要求时,它才会胜出。
这种区别正是当前竞赛的核心。Alibaba 和 DeepSeek 正在扩大买方能够做出这种选择的任务范围。
Alibaba 和 DeepSeek 的主张尚未解决的问题
较低的报告成本和亮眼的基准测试成绩,并不能定论总开发支出、现实世界可靠性、安全性或政治立场。
第一个不确定性涉及核算方式。DeepSeek 被广泛引用的 V3 数据,涵盖的是最终正式训练流程的 GPU 时间,并基于假定的小时租赁费率计算。
技术报告明确排除了此前的研究和实验。该数据也不代表建设公司、获取数据、招募研究人员或运营基础设施的完整成本。
一项技术评估同样指出,这一数字是与最终训练运行相关的估算。因此,将其与另一家公司全部资本预算进行比较并不可靠。
第二个不确定性涉及基准测试的选择。模型开发者决定发布哪些测试、纳入哪些竞品版本,以及如何配置评估方式。
这并不意味着其结果毫无意义。它意味着买方应使用自己的提示词、语言、文档格式和失败标准,复现重要测试。
Alibaba 表示,Qwen2.5-Max 在指定基准测试中优于多款知名模型。但这并不能证明 Qwen 在每一个代码仓库、企业搜索系统或智能体工作流中都更胜一筹。
DeepSeek 与 o1 的比较也有同样的局限。R1 展现出显著的推理能力,但性能会因问题、提示词、工具访问和评分方法而异。
第三个不确定性涉及安全。开放权重分发赋予部署方控制权,但也将更多责任转移给它们。
闭源提供商通常负责集中式滥用防控,并可在其服务中统一更新。自托管模型则要求部署组织自行设计过滤、日志记录、访问控制和事件响应机制。
对于经验丰富的工程团队,这种负担可以管理。但对于主要受较低运营成本吸引的小型组织而言,难度更高。
第四项担忧涉及隐私和国家安全。由于担心数据处理和境外访问问题,一些政府和组织已限制在公务设备或网络上使用 DeepSeek。
这些限制并不能证明每一种本地部署都不安全。它们表明部署方式很重要。将机密提示词发送至托管服务,与在受控环境中运行可下载权重并不相同。
买方必须区分模型、应用程序和托管服务提供商。公开讨论经常将三者合并为同一个产品名称。
政治立场则构成另一项风险。模型可以在技术层面保持开放,同时保留受训练数据和后训练规则塑造的响应模式。
研究发现,DeepSeek 在涉及中国政治敏感议题时可能表现出不同的回应方式。这种行为会影响新闻报道、学术研究、地缘政治分析,以及任何需要呈现相互冲突观点的产品。
可下载模型可以被修改,但自托管并不会自动消除已学习到的偏见。测试必须纳入对客户重要的内容领域。
此外还存在知识产权问题。OpenAI 表示,正在调查 DeepSeek 是否通过蒸馏,使用其模型输出训练竞争系统。
这一指控并未形成公开的不当行为认定。它突出了一个尚未解决的争议:模型输出是否可用于复现模型行为,尤其是在服务条款限制此类活动的情况下。
一项相关调查报道称,美国官员和 OpenAI 表达了担忧,同时也指出 DeepSeek 的开发过程仍存在不确定性。
西方实验室也面临自身的透明度问题。与开放权重项目相比,闭源模型通常较少披露训练数据、架构和内部测试信息。
因此,这并不是透明的中国系统与文档齐全的美国系统之间的对比,而是一个所有提供商都因竞争、法律或安全原因而保留重要信息的市场。
理性的回应不是否定 Alibaba 和 DeepSeek。它们的模型已产生足够可信的结果,迫使竞争对手作出反应。
但同样不明智的是,将宣传图表或一次最终运行的算力估算视为完整审计。独立评估、透明的事件报告以及针对具体工作负载的测试仍然必不可少。
这种审慎观点并不会削弱核心论点,反而会强化它。即使最广泛的主张尚未得到证实,更便宜的模型仍可能重塑买方的预期。
当买方认为某个替代方案值得测试时,商业影响便开始显现。Alibaba 和 DeepSeek 已经跨过了这一门槛。
三个信号将决定下一阶段
下一阶段取决于真实采用情况、经过验证的智能体可靠性,以及西方模型提供商的回应。
第一个信号是持续的生产使用。下载量和聊天机器人排名反映兴趣,但无法揭示企业在测试后是否继续使用某个模型。
应关注云资源消耗、重复 API 流量、自托管企业部署,以及涉及高吞吐量工作负载的公开案例研究。持续使用将支持这样一种观点:中国产模型正在获取常规 AI 需求。
如果最初试验后使用量下降,这一结论将被削弱。这可能表明集成难度、治理担忧或输出不稳定性,超过了效率优势。
Alibaba 在这方面拥有分发优势。它可以通过成熟的云平台提供 Qwen,并将模型与存储、数据库和商业服务连接起来。
DeepSeek 则拥有不同的优势。其研究型定位和宽松的发布方式,已在传统企业销售渠道之外引发大量开发者兴趣。
第二个信号是其在长程智能体任务中的独立表现。公开基准测试通常一次只为一个答案评分,而生产环境中的智能体必须在多次操作中保持上下文,并从错误中恢复。
涉及软件仓库、浏览器操作、数据分析和工具调用的测试,将显示小幅基准差距是否会在长流程中演变成显著的可靠性差距。
如果 Qwen 和 DeepSeek 的完成率接近领先闭源模型,它们的效率论点将大幅增强。它们将能够竞争高价值的编程和自动化工作,而不只是常规文本处理。
如果差距在长任务中扩大,西方实验室便能继续通过可靠性捍卫其高端定位。当失败的工作流需要人工修复时,廉价 token 的重要性会降低。
第三个信号是 OpenAI、Anthropic、Google 和 Meta 的回应。最明确的回应将体现在模型效率、开放权重发布、服务打包和产品集成方面。
西方提供商不必模仿 DeepSeek 的确切策略。它们可以借助更小的模型、缓存、任务专用系统或更紧密的软件集成,降低完成工作所需的实际成本。
Google 可以将 Gemini 与搜索、生产力工具、Android 和云基础设施相连。OpenAI 和 Anthropic 可以通过开发者生态系统和智能体性能竞争。Meta 则可通过 Llama 捍卫其开放模型的地位。
如果部署摩擦得到普遍降低,将证明 Alibaba 和 DeepSeek 改变了竞争行为。这将表明效率已成为首要产品要求,而非次要的工程指标。
有限的反应则意味着,领先提供商认为企业买方仍更看重最高能力、治理和集成服务。
读者也应谨慎对待未来有关 Google News 的说法。声称某模型击败另一模型的标题,通常会将狭窄的基准结果压缩为普遍性的判断。
更好的问题是:该模型能否以可接受的准确性、延迟、治理和运营要求,完成某项明确的工作负载。不同组织的答案可能完全不同。
开发者可以通过构建与模型无关的评估集并记录失败案例来做好准备。企业买方可以在比较部署选项前,将敏感任务与常规任务分开。
知识工作者可以将研究资料保存在任何单一聊天机器人之外,建立一个会随模型偏好变化而仍然有用的个人知识系统。
Alibaba 和 DeepSeek 并未终结 AI 竞赛,也没有建立永久领先地位。它们改变了竞赛的评分体系。
最高智能水平对最困难的工作仍然重要。效率、开放性和控制权如今决定着谁能服务其余的一切。
下次 Alibaba、DeepSeek 或某家西方实验室主导 Google News 时,请不要只看排行榜。应当问:独立测试是否证实了结果?客户是否持续采用该模型?竞争对手是否因此改变了产品?
这三个信号将揭示,更便宜的中国模型究竟只是吸引关注,还是正在稳步成为基础设施。


