DeepSeek 计划上调 API 价格,阿里巴巴加码大模型竞争
DeepSeek 计划大幅上调 API 价格,尽管其全球声誉很大程度上建立在以异常低廉的价格提供强大人工智能模型之上。最终费率尚未披露,但这一预警已改变开发者评估 DeepSeek 的方式。
时机颇为引人注目。阿里巴巴已发布 Qwen3.8-Max,这是一款混合专家模型,总参数量达 2.4 万亿,每次请求激活的参数约为 950 亿。混合专家架构会激活选定的模型组件,而非为每个 token 都使用全部参数。
这些事件揭示了中国 AI 市场内部更大的转变。模型开发商不再仅仅竞争如何让智能更便宜,而是在努力提升智能体表现、管理不断增长的推理需求,并构建能够支撑持续基础设施投入的业务。
因此,核心竞争并不只是 DeepSeek 对阵阿里巴巴,而是低成本访问与日益雄心勃勃的 AI 系统对资金和算力需求之间的较量。开发者从第一阶段获得了显著的经济效益,但这些效益从未得到保证会一直维持不变。
DeepSeek 正在为更高的 API 成本做准备
DeepSeek 的预警之所以重要,是因为在客户尚不知道最终条款之前,它已改变了公司的商业方向。
据报道,DeepSeek 于 8 月 6 日通知用户,计划在不久后上调整体 API 定价。公司表示涨幅将相当显著,但将详细时间表留待后续公告发布。
中国科技媒体 36Kr 总结的一份券商研究报告,将该通知与中国模型市场的更广泛变化联系起来。该报告称,这项分析来自中信建投证券,也称 CSC Financial。
API,即应用程序编程接口,可让软件以编程方式向模型发送提示并接收生成结果。API 费用会直接影响将 AI 用于编程、搜索、客户服务、研究、翻译或自动化工作流的产品。
该定价通知并不意味着每位 DeepSeek 用户都会立即面临相同幅度的成本上涨。报道发布时,DeepSeek 尚未公布完整的新价目表。生效日期、不同模型之间的差异,以及缓存请求的处理方式仍不清楚。
这一验证缺口十分重要。关于计划涨价的通知,无法支持对客户账单作出精确预测。开发者应等待公司的正式文档,再调整预算或生产架构。
尽管如此,这一预警本身已具有重要影响。企业团队需要可预测的运营成本,尤其是在 AI 请求嵌入采用固定客户订阅价格的产品中时。即便涨幅尚未明确,也会迫使这些团队评估替代供应商和部署方案。
DeepSeek 此前已为其 API 服务引入按时段计价机制。根据报道的安排,在指定高峰时段发起的调用,费用是常规时段调用的两倍。
高峰与非高峰定价为供应商提供了一种方式,可将可灵活安排的工作负载从拥堵时段转移出去。批量摘要、评估运行和文档处理通常可以等待;交互式助手和编程智能体则通常无法等待。
公司的现行 API 文档仍是开发者核查模型、计费单位和更新后商业条款的权威渠道。截图、社交媒体帖子和经销商页面很快可能过时。
这一新兴模式类似于云计算中的需求管理。供应商可通过定价来限制稀缺加速器的压力,而不必直接拒绝请求。它也可以从需要即时响应的客户那里获得更多收入。
DeepSeek 尚未公开说明,计划涨价主要由何种动机驱动。更高的基础设施成本、容量管理、模型能力提升以及更重视收入,都是合理的解释;但尚无任何一种被独立证实为唯一原因。
因此,眼下最直接的变化在于预期。DeepSeek 不再能被视为高级模型访问服务中价格永久固定的下限。客户必须像评估其他可变动的云服务一样评估它。
这一转变带来张力,因为低价是 DeepSeek 影响力的核心。该公司曾帮助挑战人们对高能力推理模型成本的既有假设。它下一步的动作将检验,用户看重的是模型本身,还是主要看重其折扣。
阿里巴巴的 Qwen3.8-Max 提高了算力竞争门槛
阿里巴巴更大的模型表明,即使架构仍保持计算选择性,中国 AI 竞争的下一阶段也将需要更多推理容量。
根据该研究报告引用的活动记录,阿里巴巴于 8 月 3 日发布 Qwen3.8-Max。该模型总参数量为 2.4 万亿,每个 token 大约激活 950 亿参数。
参数是塑造模型响应的学习得到的数值。更大的总参数规模可以扩展容量,但并不自动保证更好的输出。训练数据、架构、后训练、工具和评估设计同样重要。
Qwen3.8-Max 采用混合专家设计。路由系统会为每个 token 选择网络中的有限部分,与每次都激活全部 2.4 万亿参数相比,可减少计算量。
这种效率并不意味着推理在绝对成本上便宜。该系统仍需要大量内存、网络、调度和加速器容量。长提示和智能体循环会在重复调用中放大这些需求。
阿里巴巴在最终发布前已预览该模型。可通过阿里巴巴服务访问 Qwen3.8 预览版,同时公司表示模型权重将随后发布。
此次发布也反映出阿里巴巴对 AI 智能体的更广泛推进。智能体是让模型能够规划步骤、调用工具、检查结果并持续执行直至完成任务的软件。
传统聊天通常需要针对每一轮用户交互发起一次模型请求。智能体在搜索文件、运行代码、查询数据库、检查错误和修订工作时,可能会生成许多请求。
这一差异改变了基础设施经济性。模型每个 token 的效率可以提升,但周边应用仍可能消耗更多 token 总量。更好的工具可能增加使用量,因为它们让更多任务值得自动化。
这种关系类似于其他计算市场中出现的反弹效应。更低的单位成本会鼓励更多消费,进而可能推高总需求。智能体工作流又增加了一层倍增效应,因为一个可见任务可能包含数十项隐藏操作。
阿里巴巴的规模也给较小开发商带来压力。初创公司可以微调开源模型或构建聚焦型应用,但很难匹敌大型云服务商的基础设施规模。
大型云公司可以将模型与存储、数据库、搜索、安全控制和企业销售渠道连接起来。它们还可以利用模型需求来支持更广泛的云业务。
DeepSeek 走的是不同道路。其品牌通过模型效率、开放发布和激进的 API 经济性而成长。若实施广泛涨价,将表明技术效率本身并不能消除商业限制。
这正是阿里巴巴的发布与 DeepSeek 的通知属于同一故事的原因:前者拓展了模型规模的前沿,后者则表明,以持续规模提供高级模型服务是有成本的。
低价智能正在面对智能体 AI 的成本
核心逆转在于,更便宜的模型访问帮助形成了如今更难维持低价的使用模式。
DeepSeek 因展示一家中国实验室能够在获取先进芯片受限的条件下构建具有竞争力的模型,而在国际上受到广泛关注。其工作促使开发者质疑围绕前沿 AI 的投入假设。
公司早期模型采用了旨在提升效率的技术。DeepSeek 已发表的研究描述了稀疏计算和压缩键值缓存,后者用于存储生成后续 token 时所需的信息。
DeepSeek-V2 论文将这些技术描述为降低训练成本并支持经济型推理的方式。后续发布进一步巩固了公司从可用计算资源中提取更多能力的声誉。
这一声誉帮助加剧了竞争。2025 年 2 月,DeepSeek 为其 V3 和 R1 API 推出非高峰时段折扣。路透社报道称,在指定时段内,一款模型的降价幅度达到 50%,另一款达到 75%。
该非高峰计划对中国及国际竞争对手施加了额外压力。它也促使开发者将调度视为 AI 成本控制的重要组成部分。
计划中的涨价扭转了方向,但未必意味着 DeepSeek 的技术理念发生改变。一个模型相较竞争对手仍然可以更高效,同时其供应商也可以提高访问费用。
价格反映的不只是模型一次前向传递的成本。它还要支撑预留容量、网络、存储、工程、安全、滥用防范和客户运营。
可用性同样具有价值。当应用遇到拥堵、不可预测的延迟或严格限制时,低费率的实用性会下降。生产环境客户通常是在为可靠性付费,而非理论上的最低成本。
智能体 AI 加剧了这种压力。一个编程智能体可能会读取代码仓库、提出修改建议、执行测试、检查失败原因,并修订补丁。每一步都可能生成新的提示和输出。
企业研究智能体也可能以类似方式运作。它可能搜索内部文档、检索外部证据、比较来源,并整理出带有引用的回答。这些操作会将一个用户问题转化为一连串推理事件。
构建这类系统的团队还会保留更多上下文。更长的上下文窗口使模型能够处理更大的代码仓库或文档集合,但每个相关 token 都必须在推理期间处理。
当提示共享共同内容时,缓存可以减少重复处理。不过,动态智能体历史通常会在每次工具调用后发生变化,这限制了可复用完全相同缓存前缀的工作量。
结果是单位效率与总消费之间的冲突。模型供应商持续优化前一项指标,而应用开发者则稳步增加后一项。
这一动态解释了为何推理基础设施已成为重要投资主题。训练创造模型,但推理此后要服务每一次客户交互。成功的产品可以在数百万次请求中持续产生需求。
对企业买家而言,教训很实际:他们应衡量完成任务的成本,而不只是宣传中的每 token 成本。若一个更便宜的模型需要更多重试、更长提示或额外验证,最终也可能变得昂贵。
同样的原则也适用于知识工作。组织正日益将模型连接到会议记录、技术文档、电子邮件和研究资料。可搜索的AI knowledge base可通过仅检索相关材料,减少不必要的上下文。
更好的检索并不会消除推理成本。它可以通过限制每个提示词中包含的内容,使成本更可预测。当服务商调整费率或引入按需求定价时,这一点会变得更加重要。
因此,DeepSeek 的调整并未否定低成本 AI 的逻辑,而是对其进行了细化。高效模型可以降低成本曲线,而更广泛的采用则会推动整体基础设施需求上升。
Alibaba 和 DeepSeek 面临不同的商业压力
Alibaba 可以通过广泛的云平台实现 AI 变现,而 DeepSeek 必须证明模型效率能够支撑一项可持续的服务业务。
Alibaba 在销售模型的同时也销售基础设施。Qwen 可以吸引客户使用计算、存储、数据库、开发工具和企业应用。收入不必只来自单一 API 端点。
DeepSeek 的公开定位则更为集中。其模型和开发者服务承载了更多品牌的商业价值。这使得定价成为其预期商业模式更明确的信号。
在比较战略动机时,这一区别至关重要。Alibaba 可以补贴模型访问,以支持云服务采用。DeepSeek 则有更强的理由确保每一单位 API 需求都能对可持续运营作出贡献。
中国 AI 开发者也面临硬件限制。出口管制限制了部分先进加速器的获取,而国产替代方案仍在持续发展。稀缺性可能同时影响训练进度和推理能力。
更大的模型并不直接意味着计算使用量等比例增加。稀疏激活削弱了这种关联。不过,为大型模型提供服务仍需要复杂的集群和显著的内存带宽。
Alibaba 的规模在采购和基础设施整合方面带来优势。DeepSeek 的效率研究则通过减少不必要的计算提供另一种优势。市场正在检验哪一种优势能够带来更持久的定价能力。
其他中国模型开发者使竞争更加复杂。Moonshot AI、Zhipu AI、MiniMax、ByteDance 和 Baidu 分别结合了不同的模型策略、分发渠道和商业动机。
国际服务商又增加了一层变量。OpenAI、Anthropic、Google 和 Meta 会影响开发者对能力、开放性、延迟、安全性和价格的预期。客户越来越能够将不同任务路由到不同模型。
这种灵活性削弱了任何服务商在不产生后果的情况下提价的能力。开发者可以使用一种模型进行复杂推理,另一种模型进行低成本分类,并使用本地模型处理敏感数据。
迁移仍然会产生成本。提示词在不同模型家族中的表现不同,工具调用格式各异,安全系统也可能拒绝不同的请求。在迁移流量之前,评估必须衡量输出质量。
开放权重模型为客户提供了另一种选择。开放权重让组织能够下载模型参数,并在自有或租用的基础设施上运行软件,但须遵守适用许可证。
自托管消除了直接按 token 计费的 API 费用,但并不意味着计算免费。团队仍必须管理加速器、部署、扩展、监控、安全和模型更新。
对于稳定的工作负载,在托管价格上涨后,这种权衡可能变得具有吸引力。对于需求不可预测的场景,托管 API 仍可能更简单且更经济。
混合架构可能会获得更多关注。一家公司可能会将机密工作负载保留在私有基础设施上,同时将通用请求发送至托管模型。它也可以保留备用服务商,以应对拥塞或故障。
DeepSeek 的最终定价将决定这些变化有多紧迫。温和的重构将保留其价值主张。广泛且大幅的上涨将促使市场更积极地测试 Qwen 和其他替代方案。
Alibaba 也面临自身的商业考验。参数规模能吸引关注,但企业买家需要可靠性、安全性、集成能力和可衡量的任务表现。仅靠模型规模无法证明具备这些品质。
因此,竞争的下一阶段将奖励的不仅是基准测试领先。服务商必须以可预测的成本提供有用输出,同时应对不断增长的智能体流量。
这一投资逻辑并不能证明什么
更高的 API 价格和更大的模型支持推理需求上升的观点,但并不保证每一家模型或芯片供应商都能获利。
中国证券的分析认为,国内 AI 正进入一个由能力提升和商业变现定义的阶段。它还将更大的模型、频繁的智能体调用和 API 需求,与更高的推理消耗联系起来。
这一论点有清晰的机制。更多智能体活动会带来更多模型调用。更大、运行时间更长的请求需要更多加速器、内存、网络和数据中心电力。
不过,若干不确定性可能削弱这一结论。第一项是缺少定价细节。报告流传时,DeepSeek 宣布的是其意图,而不是最终结构。
第二项不确定性涉及需求弹性,即使用量对价格变化的反应程度。开发者可能减少调用、缩短提示词、将工作负载转移到非高峰时段,或更换服务商。
大幅上涨并不会自动创造更多收入。只有当客户维持足够的消耗量时,它才会提高单位收入。竞争性 API 和开放模型为开发者提供了替代选择。
第三项不确定性是技术效率。更好的量化、缓存、推测解码和路由可以减少每次输出所需的计算。软件改进能够抵消一部分由智能体带来的需求。
第四项不确定性是利用率。购买更多加速器并不能保证服务商会高效使用它们。调度不佳和内存瓶颈可能导致昂贵硬件利用不足。
第五项是基准测试的可靠性。Alibaba 的参数数量是明确的,但参数数量并不是衡量智能的通用指标。稀疏模型尤其会使简单比较产生误导。
模型评估也可能偏向特定提示词或工具。对编程、推理、多语言工作、事实准确性和智能体可靠性进行独立测试,仍然至关重要。
还存在更广泛的政策风险。中国开发者处于不断变化的出口规则、数据法规和政府采购要求之中。每一项都可能影响硬件或市场的可及性。
数据治理为北美企业带来了另一项限制。评估 DeepSeek 或 Qwen 的组织必须审查数据流向、提示词保留方式以及适用的法律要求。
这些问题并不能证明任何一款模型在所有使用场景中都不安全。它们说明,采购决策需要的不只是基准图表和宣传中的 API 费率。
投资影响同样需要谨慎对待。不断增长的推理需求可能有利于国内加速器、内存、网络、散热和数据中心企业。然而,需求并不会在供应链中均匀分配。
即使出货量上升,一些供应商仍可能面临利润率压力。另一些则可能受制于良率、软件兼容性或客户集中度。模型服务商也可能围绕硬件限制进行优化。
一项被报道的券商观点属于分析,而非经过验证的预测。投资者应区分合理的需求机制与有关个别公司盈利的证据。
开发者也需要遵循类似的原则。他们不应将 DeepSeek 的通知视为所有 AI API 都将朝同一方向变化的证据。服务商可以基于战略、产能和产品定位选择不同价格。
最有力的结论更为有限。低成本推理已进入一个商业上更复杂的阶段,开发者需要能够承受费率变化的架构。
这意味着要维持任务级评估、监控 token 使用情况、测试多个模型,并将对延迟敏感的请求与灵活工作负载分开。也意味着要在价格之外追踪服务质量。
三个信号将表明这一变化是否真实
接下来的三个信号将揭示,DeepSeek 的通知究竟标志着持久的商业转向,还是对产能压力的暂时回应。
第一个信号是 DeepSeek 的最终价目表。开发者应关注生效日期、受影响模型、缓存处理方式、时间窗口,以及输入和输出计费之间的差异。
统一上涨将强化这样一种观点:DeepSeek 正在重设其整体商业定位。狭窄的高峰时段调整则更有力地指向短期产能管理。
公司的表述也会很重要。若定价通知与重大模型发布相关,将表明 DeepSeek 预计客户会为更高能力付费。临时性安排则会支持拥塞解释。
第二个信号是 Alibaba 的 Qwen3.8-Max 在现实世界中的采用情况。Alibaba 表示该模型拥有 2.4 万亿总参数,但客户将根据任务表现、延迟、可靠性和部署选项作出判断。
独立的智能体评估将尤其有用。能够以更少步骤完成任务的模型,可以抵消更高费率。反复重试工具的模型则可能消耗更多基础设施,却无法带来更好的经济性。
Alibaba 此前发布 Qwen3-Max 时,展示了其如何在云战略中定位超大模型。其模型路线图强调了编程、工具使用和企业部署。
持续的 Qwen3.8-Max 流量证据将强化推理需求的逻辑。采用有限则会表明,仅凭参数规模无法将工作负载从既有替代方案中吸引过来。
第三个信号是竞争对手的反应。中国服务商可以降低费率、匹配高峰定价、发布更高效的模型,或提供捆绑式云容量。
一场新的价格战将削弱 DeepSeek 已获得持久定价能力的说法。若各服务商普遍提价,则表明市场此前的费率可能不足以支撑不断增长的服务需求。
在这一第三个信号中,开放权重发布也值得关注。如果开发者通过自托管更多工作负载作出回应,托管 API 服务商可能会面临压力,即使硬件需求仍在上升。
云平台也可以通过路由服务作出回应。这些系统会根据成本、延迟、隐私或质量要求,自动将每个请求发送至相应模型。
路由减少了对单一服务商的依赖。它也使 API 定价更加透明,因为应用可以比较多个模型的任务结果。
开发者应在 DeepSeek 最终调整到来前建立这种灵活性。等到费率上涨生效后再行动,可能会让一项工程决策变成紧急迁移。
团队不需要立即替换 DeepSeek。他们需要掌握当前工作负载、token 消耗、延迟要求和可接受替代方案的清单。
交互式智能体流量应受到特别审视,因为它并不总能转移到更便宜的时段。后台索引、文档扩充和评估运行则提供了更大的调度灵活性。
组织还应改进上下文管理。专注的第二大脑工作流能够检索相关记录,无需反复将整个信息库发送给模型。
更深层的启示并不局限于某一家供应商。AI 采购方曾将 token 价格视为持续下降的投入成本。如今,Agent 的普及让总用量、容量时点和任务效率同样变得重要。
DeepSeek 的正式公告将决定这一警告是否会演变为一次商业层面的重新定价。Alibaba 的采用数据将显示,更大的模型是否足以证明其基础设施负担的合理性。竞争对手的行动则将揭示,任何一家供应商究竟拥有多大的定价权。
对开发者而言,有用的问题已不再是哪一家 API 宣传的价格最低,而是哪种模型、检索、缓存和部署的组合,能够稳定地产出已完成的工作成果。
现在就审查这一组合。衡量完整任务,准备备用供应商,并将紧急请求与可灵活处理的任务区分开来。无论 DeepSeek 是广泛提价,还是缩小最终方案的范围,这些措施都依然有价值。



