top of page

DeepSeek V4-Flash 宣称成本领先,但其实际价值仍待验证

8月4日
讀畢需時 13 分鐘

在一项独立比较将其评为单项任务成本最低的主流 AI 模型后,DeepSeek V4-Flash 已成为 Google News 报道的焦点。这一结果直接向 OpenAI、Google 和 Anthropic 发起挑战。它们的小型模型已无法仅凭价格优势作为竞争防线。

这一结果的意义不止于又一个低价 API 的发布。DeepSeek 将低运营成本与面向编程、推理、智能体及超长输入构建的模型结合在一起。只有当这些能力在完整的生产工作流中依然实用时,其价格优势才有意义。

这也构成了真正的竞争。DeepSeek 销售的是高效能力,而高端供应商销售的是可靠性、安全性、支持服务和可预测的行为。当低成本模型在常见任务上显得颇具竞争力时,开发者必须决定这些保障究竟值多少钱。

DeepSeek V4-Flash 带来了什么变化

DeepSeek 已将模型效率从一项技术特性,转变为对所有主要 AI 供应商的直接压力。

DeepSeek 于 2026 年 4 月与 V4-Pro 一同推出 V4-Flash。该公司将 Flash 描述为更快、更经济的选项,其推理性能接近更大的模型。其官方 V4 发布说明也将 Flash 定位于较简单的智能体任务,即由软件使用工具并完成多步骤工作。

该模型包含 2840 亿个参数,但每个 token 仅激活其中的 130 亿个。这种设计称为混合专家架构。它会让每段文本经由网络中选定的部分处理,而非调动整个模型。

这一差异之所以重要,是因为总参数量本身并不能决定推理需求。激活参数、内存移动、输出长度、硬件利用率和缓存都会影响一次请求所消耗的资源。

V4-Flash 还支持 100 万 token 的上下文窗口。上下文窗口指模型在单次请求中可纳入考虑的信息量。该容量可容纳大型代码库、文档集合或较长的智能体历史记录,但容量本身并不保证检索准确。

在 Artificial Analysis 以每个完成基准测试任务的成本对该模型进行比较后,独立关注随之而来。该指标比公开的 token 费率更具参考价值,因为它考虑了模型为得出答案实际消耗的工作量。该服务的模型评估显示,V4-Flash 的智能评分高于同类系统的中位数,同时报告了异常低的任务成本。

正是这一主张推动 DeepSeek 登上 Google News。它不仅是供应商页面上最便宜的端点;在完成一套标准化任务后,它展现出很高的经济性。

这一区别至关重要。若模型生成过长回答、重复失败步骤,或需要另一个模型修复其工作,低 token 费率的模型也可能变得昂贵。单任务成本试图捕捉更多这类运营现实。

DeepSeek 还提供 V4 权重,供外部部署。开放权重让组织能够下载模型参数,并通过自行选择的基础设施运行它们。但这并不会自动披露全部训练细节,也不会让部署变得低成本。

自行托管如此规模的模型需要强大的硬件和专业工程能力。多数小团队会发现 API 更容易使用。大型组织则可能看重本地控制、自定义策略,或让敏感提示词远离海外托管服务的能力。

4 月发布后,DeepSeek 在 7 月底推出了更新版 V4-Flash。早期第三方报告表明,该更新提升了编程和智能体性能。然而,来自短期公开测试的证据并不能证明它在大型生产代码库中的可靠性。

因此,重要的变化不止于单一排名。DeepSeek 在同一次发布中结合了低测得任务成本、开放权重、长上下文和面向智能体的能力。竞争实验室必须回应这一整体组合,而非某一个孤立数字。

为什么 Google News 的成本排名很重要

这一排名将买家的注意力从模型声望,转向完成有用工作的成本。

AI 供应商通常根据输入和输出 token 公布费率。这些数字看似精确,却可能掩盖不同工作负载之间的巨大差异。一个模型可能直接回答问题,另一个则可能消耗多个推理步骤和工具调用。

智能体会让比较变得更困难。它可能检查文件、搜索文档、执行代码、识别错误并重试任务。每项操作都会增加 token 和计算时间,而一次错误的工具调用不会创造任何业务价值。

单任务成本结果试图纳入这种行为。它关注模型完成同一评估项目时的消耗。这种方法仍不完美,但更接近开发者在实际软件中体验到的 AI 成本。

以审查 pull request 的编程助手为例。有用的单位不是生成一个 token,而是一份能够识别相关缺陷、且不会以大量误报淹没开发者的正确审查。

同样的逻辑也适用于客户支持。若需要人工重写首个回复,或核查其虚构的政策,那么廉价的首次响应几乎没有价值。组织应衡量已解决案例、升级率、延迟和修正工作量。

文档处理是另一个例子。V4-Flash 可以接收极大的输入,但买家仍需测试它能否在这些输入中找到正确证据。遗漏关键条款的大上下文窗口,可能造成代价高昂的下游错误。

Google News 的关注可能放大标题,但购买决策仍取决于具体工作负载。搜索曝光度告诉开发者哪些模型值得评估,却不会告诉他们哪一个模型应处理每一项请求。

DeepSeek 的技术方法为成本主张提供了可信基础。其 V4 架构将稀疏专家激活与混合注意力系统相结合。注意力是决定哪些先前 token 会影响模型下一步输出的机制。

该架构对邻近文本采用本地处理,并针对较长距离的信息采用专门方法。DeepSeek 表示,这些变化可降低内存和计算需求,尤其是在提示词变得很长时。

这一机制应对了日益突出的行业问题。模型供应商希望支持更大的上下文窗口和更长的智能体会话。这两项功能都会增加系统在推理期间必须存储和处理的信息量。

高端供应商有多种可能的回应方式。它们可以降低费率、发布更小的模型、改进缓存,或让智能体通过更少调用完成任务。它们也可以凭借更高准确性、安全控制和服务保证来证明更高成本的合理性。

OpenAI 和 Google 已经运营着广泛的产品组合,因此可以将简单任务路由至更小的模型。Anthropic 则更专注于高端编程和智能体性能。DeepSeek 的结果会以不同方式给每种战略施压。

对 OpenAI 和 Google 而言,威胁在于外部模型能够以更低价格挑战其经济型端点,同时支持要求较高的工作流。对 Anthropic 而言,挑战是证明更强的可靠性能抵消运营成本上的巨大差异。

市场未必会收敛于一个赢家。应用可以将常规工作路由给 V4-Flash,并为敏感或困难的决策保留高端模型。即便如此,这种结构仍会冲击那些原本期待一个通用模型承接所有请求的供应商。

成本排名也会改变内部实验方式。当边际推理成本较低时,团队可以运行更多评估、测试更多提示词,并处理更大的样本集。即使最终产品使用的是另一种模型,低成本测试也能缩短开发周期。

知识工作者也面临类似机会。较低的运营成本支持更频繁地分析会议纪要、技术文档和研究档案。当重复查询不再承受高端模型的成本结构时,可搜索的个人知识库会变得更有用。

这一排名之所以重要,是因为它改变了默认问题。买家曾经问哪个模型最强。如今他们越来越多地问:哪种模型组合能以可接受的质量、风险和总成本完成其工作负载。

DeepSeek V4-Flash 与高端模型战略的较量

DeepSeek 正在挑战这样一种假设:有能力的智能体工作必须依赖高端推理。

主要对手并非某一家美国公司,而是高端模型战略——这种战略要求客户为更强推理能力、保障措施、支持服务和一致性支付更多费用。

DeepSeek 的定位几乎完全相反。V4-Flash 为开发者提供经济型默认选择,而 V4-Pro 则继续服务于更困难的工作。两款模型都强调长上下文,DeepSeek 表示 Flash 的推理能力接近 Pro。

公司的主张需要谨慎看待。基准测试衡量的是受控条件下的特定任务。它们无法复现每一种生产环境,而由供应商运行的评估可能会偏向模型的优势。

独立测试提供了更有力的比较,但仍只代表一个样本。Artificial Analysis 汇集了推理、数学、编程和知识等方面的评估。其指数可用于初步判断,但不能保证适用于某个具体应用。

高端模型可能通过减少重试次数来证明自身价值。它可能更稳定地遵循复杂系统指令,或从失败的工具调用中恢复。在一个高价值步骤上的更佳表现,可能抵消其他环节更便宜的生成成本。

反过来也可能成立。许多生产请求涉及提取、分类、摘要或常规代码修改。为每项任务都使用高端模型,可能类似于让高级工程师承担重复性的文书工作。

模型路由提供了一种务实折中。系统可以将直接请求发送给 V4-Flash,再将不确定的结果升级至另一模型。置信度规则、验证测试或人工审核可以控制这一过程。

这种安排减少了对供应商主张的依赖。开发者根据明确的工作任务评估每个模型,并依据观察到的表现分配流量。结果成为工程决策,而非忠诚度竞赛。

DeepSeek 的开放权重带来了另一层考量。组织可以通过本国云基础设施或受控的私有环境运行模型。这种方法可以减少对 DeepSeek 托管服务政策的暴露。

但这并不能消除风险。运营方仍需保护推理服务栈、监控生成内容、管理模型更新,并遵守适用规则。开放部署只是转移责任,而不是将其消除。

更广泛的采用趋势让 DeepSeek 的可信度不再仅限于 Google News 的曝光。2026 年的一项 NIST 评估报告称,DeepSeek 模型的累计下载量已从 400 万增长至超过 8600 万。该机构的 DeepSeek 评估也通过安全性和能力测试检验了这些模型。

下载量并不等于生产环境部署。一个人可能下载多个版本,实验也可能最终未被采用。不过,这种增长表明 DeepSeek 已成为全球开发生态的一部分。

这种覆盖面加大了对封闭式供应商的压力。开放权重模型可以通过托管服务、本地工具、学术项目和企业基础设施扩散。即使原始 API 不再适合买方使用,它仍可能继续可用。

历史背景在此很重要。DeepSeek R1 在 2025 年初受到关注,原因是它挑战了人们对高级推理所需资源的既有认知。V4-Flash 则将这一挑战从训练叙事延伸到持续发生的推理经济性。

因此,新的竞争关乎运营杠杆。每次请求收益较低的供应商,如果低成本吸引到更多使用量,仍然可能胜出。高端供应商则可以凭借更少的请求获胜,前提是客户更看重可靠性。

企业软件很可能会同时采用两种路径。高频写作、搜索和分类适合经济型模型。受监管的决策、复杂的代码变更和敏感的对外沟通,则可能值得采用成本更高的审查层。

最显著的影响可能会出现在 AI 智能体内部。智能体会重复调用模型,有时并没有直接的用户监督。单次调用中的微小差异,一旦乘以规划、工具使用、验证和修订的次数,就会变得举足轻重。

DeepSeek V4-Flash 降低了尝试这一循环的成本。高端供应商如今需要证明,其模型能更好地完成这一循环,而不只是基准测试得分更高。

“最便宜 AI 模型”这一说法没有说明什么

较低的测量任务成本具有意义,但无法证明生产环境的可靠性、安全性或总体拥有成本。

第一个不确定性是基准测试的匹配度。公开评估代表的是一组固定比例的任务。法律审查系统、医疗工作流或大型软件代码库的表现,可能与这种任务组合大不相同。

第二个不确定性是波动性。平均表现可能掩盖某一小类提示词上的严重失败。一个通常成功、却偶尔无视约束的模型,可能不适合高风险自动化。

编程智能体让这个问题变得直观。基准测试可能因为补丁通过了既定测试而接受它。生产团队还必须考虑可维护性、安全性、风格、未记录的依赖关系,以及测试套件之外的行为。

长上下文性能同样值得仔细审视。能够接受 100 万 token,并不意味着模型能同样有效地处理上下文中的每一部分。开发者应测试不同位置和不同提示词长度下的检索准确率。

延迟也会改变经济性。低成本模型若生成缓慢或服务容量受限,仍会令用户感到沮丧。智能体应用尤其敏感,因为多次顺序延迟会不断累积。

DeepSeek 的托管服务对一些组织提出了治理问题。数据驻留、保留期限、法律管辖权、采购规则和事件响应,都可能比模型费率更重要。这些约束因国家和行业而异。

自托管可以回应部分治理担忧,但也会带来新的支出。硬件采购、云容量、量化、监控、部署工程和随叫随到的支持,都会构成拥有成本。

量化会降低模型权重的数值精度,从而减少所需内存。这项技术可以让本地运行更可行,但激进压缩可能降低准确性。团队必须验证实际部署的确切版本,而不能依赖供应商端点的结果。

安全性仍是另一个未解决的问题。模型可能遵循隐藏在文档中的恶意指令、暴露敏感上下文,或误用已连接的工具。廉价模型并不会降低智能体被攻破后的影响。

DeepSeek 也处于充满争议的地缘政治环境中。政府限制、半导体管制和采购政策会影响模型可用的地区。这些因素可以独立于技术性能发生变化。

美联社对最初 V4 预览的报道指出,DeepSeek 将其更大模型与领先的美国系统进行比较。报道还强调了中国与美国之间更广泛的技术竞争。

这种背景并不意味着该模型默认不适用。但它意味着企业买家需要进行部署和合规审查。对于公共聊天机器人、本地研究工具,以及能够访问客户记录的智能体,正确答案可能不同。

供应商支持仍是另一项高端优势。大型客户通常需要服务承诺、客户团队、审计材料和快速事件处理。更便宜的 API 本身无法取代这些要求。

质量衡量提出了最棘手的问题。开发者可以统计成功通过的测试,但许多知识型任务没有唯一正确答案。当语气、证据、判断或业务背景决定质量时,人工审查仍然不可或缺。

因此,务实的评估应覆盖完整工作流。团队可以追踪任务完成率、修正时间、失败严重程度、延迟、工具调用准确性和人工接受度。token 消耗应纳入同一测试,而非置于测试之上。

买方还应比较模型组合。V4-Flash 可以处理初步研究,另一模型则验证结论。或者,两个经济型模型可以在人工审查最终输出前相互交叉验证。

这种结构可能比一次高端调用产生更好的结果。但如果路由规则薄弱,它也可能变得更复杂、更不可靠。架构选择应以测得的结果为依据。

对于公开用户报告也应保持克制。早期采用者描述了令人印象深刻的编程结果,但其他人报告了错误或不一致的行为。这些观察可以揭示测试思路,却不是具有代表性的证据。

“最便宜主流模型”这一标签应保持条件性。V4-Flash 在一项受尊重的标准化比较中显得极为经济,但尚未证明自己在每一种真实应用中的总成本最低。

Google News 的标题会压缩这种区别。生产团队不能如此。

将检验 DeepSeek 优势的三个信号

下一项考验在于,DeepSeek 能否将吸睛的比较结果转化为持久的生产环境采用。

第一个信号是对更新后 V4-Flash 模型的独立评估。多个测试团体应在编程、推理、工具使用、长上下文检索和结构化数据提取方面,复现其每任务成本优势。

一致的结果将增强这样一种判断:排名反映的是架构,而非单一基准测试的任务组合。不同评估之间若存在巨大差异,则会削弱“最便宜主流模型”这一宽泛说法。

最佳测试将衡量完整工作流。它们应包括重试、验证、延迟和生成长度。使用更多 token 的模型仍可能具备经济性,但前提是其完成的工作达到同样的质量门槛。

第二个信号是真实的生产路由。关注智能体平台、编程工具和企业 AI 服务在初步实验后,是否持续将流量分配给 V4-Flash。

采用公告不如持续使用重要。企业常因集成方便而测试新模型,随后在边缘案例出现时回归成熟供应商。稳定的路由将表明 DeepSeek 满足了实际可靠性要求。

来自智能体公司的兴趣报告尤其相关,因为智能体会放大推理成本。Axios 曾描述,成本与安全之间的权衡如何影响考虑采用中国开放权重模型的企业。

如果更多服务在受控的美国或欧洲基础设施中部署 V4,DeepSeek 的覆盖范围就能扩大,而无需依赖自身托管 API。这将强化其开放权重分发策略。

第三个信号是高端供应商的回应。关注是否会出现新的经济型模型、改进的缓存、更低的智能体成本,或减少每项任务所需调用次数的性能提升。

直接的费率回应将确认 DeepSeek 已形成定价压力。能力层面的回应同样可能重要。高端供应商可以通过让智能体更可靠、更快或更易于治理来巩固自身位置。

最有力的反击将结合两者。一家美国供应商可能发布一款在经济性上接近 V4-Flash、同时提供成熟企业控制能力的小型模型。这将在不挑战其基准测试结果的情况下削弱 DeepSeek 的差异化优势。

DeepSeek 也必须持续改进。一次竞争对手发布就可能抹去成本领先优势。保持领先需要高效服务、充足容量、频繁的模型更新,以及支持生产系统的开发者体验。

读者还应关注政策变化。对模型使用、芯片、云托管或政府采购的限制可能重塑采用格局。技术赢家仍可能面对更狭窄的可服务市场。

对开发者而言,下一步应是有边界的评估。选择具有代表性的任务,定义验收标准,并比较 V4-Flash 与现有供应商的完整结果。在分配生产流量之前,应纳入安全和运营要求。

企业买家应避免两个极端。因 DeepSeek 的来源而否定它,会忽视一个重要的成本信号。因一项排名而替换成熟系统,则会忽视可靠性、治理和迁移风险。

知识工作者也可以采取同样的证据优先方法。将经济型模型用于可搜索档案、文档分流和初稿,同时为重要结论保留人工审查。设计良好的 AI 工作流应展示来源并保留底层材料。

Google News 会继续奖励“哪个模型最便宜”这种简单竞赛。更有价值的问题是:DeepSeek V4-Flash 能否以更少的总投入,准确、安全地完成你的工作。请用真实任务检验这一主张,像记录成功一样仔细记录失败,并关注竞争对手如何回应。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page