top of page

DeepSeek Pro 逼近 Fable 5,但基准测试差距尚未定论

DeepSeek Pro 于 8 月 13 日获得新的 API 模型构建版本,其公布的基准测试成绩在多项测试中已接近 Anthropic 的 Fable 5。这一变化出现在 DeepSeek 面向 API 的模型信息中,但详细的发布公告和完整评测报告仍未出现。

这正是事件的核心。DeepSeek 并非只是宣称模型又有一次渐进式提升,而是在邀请开发者思考:一款中国开源权重模型能否通过现有 API 端点逼近领先的闭源模型。

早期对比图表显示,DeepSeek V4 Pro 0813 在一组选定的推理与编程评测中接近 Fable 5。这些结果尚未得到广泛的独立复现,也无法证明双方在可靠性、计算机操作、安全性、延迟或长期生产工作方面实现对等。

尽管如此,这次更新仍给 Anthropic 及其他前沿厂商带来压力。若外部评测者复现这些结果,领先模型的竞争优势将更难仅凭基准分数来界定。

DeepSeek Pro API 有何变化

8 月 13 日的变更似乎替换了现有 API 名称背后的模型,使开发者无需进行新的集成即可获得新的模型行为。

DeepSeek 的 API 文档将 deepseek-v4-pro 标为其更大规模 V4 系统的模型名称。开发者可以通过兼容 OpenAI 或兼容 Anthropic 的接口调用该名称。

新近发现的版本通常被称为 DeepSeek-V4-Pro-0813。该后缀遵循基于日期的命名模式,代表 8 月 13 日构建版本。不过,在更新出现时,DeepSeek 的公开 API 更新日志尚未提供详细条目,说明其中每一项变更。

这很重要,因为模型名称和模型版本的作用不同。应用可以持续向 deepseek-v4-pro 发送请求,而 DeepSeek 可以更换实际接收这些请求的底层构建版本。

这种做法减少了迁移工作,但也使可复现性变得更复杂:使用相同公开模型名称进行的两次基准测试,可能实际调用了不同的底层版本。

DeepSeek 于 2026 年 4 月 24 日推出 V4 系列。其最初的 V4 发布说明介绍了两款混合专家模型,这类模型会在每个 token 的处理过程中仅激活其总参数中的一部分。

据 DeepSeek 介绍,规模更大的 V4 Pro 预览版拥有 1.6 万亿总参数和 490 亿激活参数;V4 Flash 则拥有 2840 亿总参数和 130 亿激活参数。

两款模型均支持 100 万 token 的上下文窗口。上下文窗口是模型在单次请求中可处理的文本及其他 token 化材料的最大数量。

4 月的发布还引入了 DeepSeek Sparse Attention,这是一种旨在降低长上下文计算与内存需求的注意力设计。DeepSeek 表示,该架构结合了 token 级压缩与选择性注意力。

这些 4 月公布的说法将 V4 Pro 确立为该系列中以准确性为重点的成员,而 Flash 则定位为更快、更经济的选择。

在 DeepSeek 于 8 月初发布较新的 V4 Flash API 构建版本供公开测试后,这一区分变得不那么清晰。DeepSeek 表示,Flash 更新提升了 agent 性能,而 Pro API 保持不变。

当时,DeepSeek 表示最终版 V4 Pro 将随后推出。因此,即使没有完整公告,0813 版本的出现也符合预期的产品发布顺序。

对开发者而言,实际变化很直接:现有应用可继续使用相同的基础 API 地址和模型标识符。不过,他们仍应将此次更新视为一项实质性的依赖变更。

团队需要重新运行针对工具调用、结构化输出、指令遵循和长对话的回归测试。更高的综合得分并不能保证模型会保留现有应用所依赖的行为。

DeepSeek 公布的 API 规范将 JSON 输出、工具调用、前缀补全和中间填充补全列为支持功能,也介绍了思考模式与非思考模式。

思考模式允许模型为回答投入更多推理资源;非思考模式则优先提供更直接的答案。性能对比必须说明使用了哪种模式,因为这一设置会改变准确性、延迟和输出长度。

因此,8 月更新包含两个层面:一是基于早期测试的模型质量主张,二是影响在线 API 用户的运营变化。

只有第二个层面可以通过模型行为和 API 元数据立即验证。关于其接近 Fable 5 的更广泛主张,仍取决于测试如何选择和执行。

为什么与 Fable 5 的比较提高了赌注

Fable 5 是一个要求很高的参照点,因为 Anthropic 将其定位为高于此前已普遍可用模型的产品,尤其适合长期且复杂的工作。

Anthropic 于 2026 年 6 月 9 日发布 Claude Fable 5。该公司将其描述为一款可供普遍使用、并配备额外防护措施的 Mythos 级模型。

在其 Fable 5 公告中,Anthropic 表示,该模型在其测试的几乎所有能力基准中领先。公司重点强调了软件工程、知识工作、视觉、科研以及更长时间的自主任务。

Fable 5 并未被包装成一次简单的聊天机器人升级。Anthropic 将其定位为适用于大型代码库、扩展上下文、多工具协作和反复决策的工作型模型。

这种定位使其成为 DeepSeek Pro 的重要对手。缩小短程推理测试中的差距已足够引人注目,但若能在持续性工作上匹敌 Fable 5,将具有更大的商业意义。

Anthropic 报告了若干体现这一差异的案例。Stripe 测试了 Fable 5 在一项涉及 5000 万行 Ruby 代码库迁移任务中的表现。Anthropic 称,该模型在一天内完成了一个团队手动完成原本需两个多月的工作。

这一结果来自早期客户,外部人士仍难以复现。不过,它反映了 Anthropic 希望买家将 Fable 5 与之关联的任务类型。

该公司还表示,Fable 5 能在长期任务中跨数百万 token 保持专注。据称,持久化笔记对其在一款策略游戏中的表现提升,超过了对 Opus 4.8 的提升。

这些案例超出了回答准确性的范畴。它们测试的是模型能否保持状态、从错误中恢复、使用工具,并完成一项漫长的目标。

据报道,早期 DeepSeek V4 Pro 0813 图表显示,该模型在若干选定测试中接近 Fable 5。一些流传的汇总结果显示,两者的综合成绩差距不到一个百分点。

这种微小差距听起来颇具决定性,但综合数字掩盖了底层任务构成。它可能将数学推理、编程、指令遵循、检索和 agent 任务合并为一个分数。

一款模型可能在总体上与另一款打平,却展现出截然不同的优势。它可能在数学上领先、在工具使用上落后,并且在长工作流中更频繁地失败。

比较结果还取决于推理设置。评测者必须披露提示词、思考预算、重试策略、采样参数、工具配置和评分规则。

即使是很小的实施选择也很重要。允许一款模型生成更长回答,可能提升推理成绩,但同时会增加延迟;给一个系统更多重试机会,也可能提高任务完成率,却不代表其首次尝试的可靠性有所改善。

Fable 5 自身的评测也存在复杂性。Anthropic 表示,分类器会将部分敏感请求转交给 Opus 4.8。这意味着,部署中的服务可能会根据请求内容涉及不止一款模型。

Anthropic 表示,这些防护措施平均在不到 5% 的会话中触发。该公司也警告,无害请求有时也可能激活它们。

因此,涉及网络安全、生物学、化学或模型蒸馏的基准测试,可能测试的是产品的路由系统,而非 Fable 5 本身。负责任的比较需要记录何时发生替换。

新出现的 DeepSeek V4 Pro 对比之所以具有意义,是因为它挑战了这样一种假设:前沿性能必须依赖一家美国大型实验室提供的闭源服务。但这一挑战尚未得到定论。

独立证据已显示,DeepSeek 的内部报告与外部测量之间存在差距。5 月,美国人工智能标准与创新中心评估了最初的 V4 Pro 预览版。

CAISI 评估称,V4 Pro 是该中心当时测试过的能力最强的中国模型。然而,其私有和公开评估均显示,该模型大约落后于领先前沿模型八个月。

CAISI 表示,DeepSeek 自行报告的结果让 V4 看起来可与比 CAISI 评估所支持的更新模型相媲美。该中心发现,其在整套评测中的表现更接近 GPT-5。

这一较早发现并未衡量 0813 构建版本,但它说明为何一张官方图表本身无法终结争论。

DeepSeek Pro 将成本效率转化为能力竞争

核心逆转在于,DeepSeek Pro 已不再需要在每一项基准中领先 Fable 5。它只需让剩余差距在实际运营中变得不重要。

模型买家很少仅凭排行榜选择 API。他们会在能力、可靠性、延迟、部署控制、集成工作量、容量和使用限制之间权衡。

DeepSeek 一直在这一更广泛的维度上积极竞争。V4 系列支持熟悉的 API 格式和极长的上下文窗口,而其开源权重发布也为技术团队提供了另一条部署路径。

开放权重是组织可在适用许可证下检查并运行的可下载模型参数。它们并不会自动揭示训练数据或完整训练过程。

这一区别很重要。DeepSeek 可以提供官方托管 API,同时允许第三方在其他环境中运行该模型。Anthropic 则将 Fable 5 保留在其托管服务之后。

这些路径为不同客户带来不同价值。处理敏感源代码的公司可能更看重部署控制能力;另一家公司则可能更重视 Anthropic 的托管安全系统、支持服务和集成式开发者环境。

如果新版 DeepSeek Pro 能持续接近 Fable 5,采购决策就会发生转变。团队可以开始追问:对于其特定工作负载而言,Fable 剩余的优势是否足以证明依赖闭源平台是合理的。

关键词在于“特定工作负载”。构建自动化编程 agent 的团队,需要的不只是孤立编程题上的高通过率。

其模型必须能定位相关文件、规划修改、正确调用工具、解读测试失败,并避免破坏无关代码。它还必须在多轮交互中完成这些步骤,而不丢失最初目标。

研究助理则面临不同要求。它需要强大的检索能力、严谨的引用规范、文档理解能力以及经过校准的不确定性表达。

客服智能体需要始终如一地遵守政策。它必须生成可预测的结构化输出,并在遇到不确定情况时升级处理,而不是即兴发挥。

DeepSeek 的百万 token 上下文可帮助应用摄取大型代码库或文档集合。然而,上下文容量并不等同于上下文利用能力。

模型可以接受大量输入,却无法检索到深埋其中的关键细节。它也可能耗费过多算力处理本应通过更好检索机制过滤掉的材料。

这正是团队应使用自身任务历史测试 DeepSeek Pro 的原因。一套有价值的评估集应包括成功案例、过去的失败案例、模糊请求以及对抗性输入。

开发者还应为每个案例保留准确的提示词、模型版本、工具定义和预期输出。没有这些记录,API 更新可能会悄然改变生产环境质量。

同样的严谨方法也有助于建立一个可搜索的知识库。团队可以在一个可追溯的工作空间中保留评估笔记、模型输出、技术文档和事故复盘。

DeepSeek 的 API 兼容性降低了直接测试的成本。一个已为 OpenAI 风格聊天补全而设计的应用,可能只需进行有限的接口调整。

Anthropic 兼容性同样面向围绕 Claude 风格消息和工具构建的智能体生态系统。这一点具有战略意义,因为 Fable 5 的优势部分取决于围绕它形成的工作流。

当开发者将模型置于智能体内部后,模型不再只是作为原始神经网络参与竞争。智能体还包括提示词、记忆、工具定义、权限控制、重试逻辑和人工审查。

DeepSeek 表示,V4 针对智能体编码进行了优化,并已集成 Claude Code 和 OpenCode 等系统。在更广泛的生产证据积累之前,这些仍只是公司自身的说法。

尽管如此,这些说法揭示了 DeepSeek 的目标。该公司追求的不只是基准测试上的对等,还希望开发者能在由竞争对手塑造的工作流中替换为其模型。

当 API 保留熟悉的惯例时,这种替换会更具可行性。当不同提供商之间的行为存在差异,或模型更新未附带详细版本说明时,其可行性则会降低。

因此,与 Fable 5 的竞争有两个战场:一个关乎模型智能,另一个关乎开发者能否可预测地获得这种智能。

Fable 5 拥有更多公开材料,用于说明其安全措施、客户试用和产品行为。DeepSeek 已发布模型架构细节和 API 文档,但 0813 更新仍需要更清晰的评估资料包。

在此之前,最有力的结论比标题中的说法更为有限:DeepSeek Pro 在早期测试中似乎已经足够接近,值得严肃的 API 用户进行直接评估。

仅此一点就会形成压力。前沿模型供应商如今必须展示能经受客户私有基准测试检验的优势,而不只是发布图表上呈现的优势。

早期基准测试数字未能说明什么

如果没有独立运行、完整的方法论以及来自长周期任务的证据,狭窄的基准差距无法证明生产环境中的对等性。

第一个不确定性来自出处。DeepSeek 的官方文档确认了 V4 Pro 产品及其支持的 API 功能,但早期的 0813 对比图仍需要稳定的一手来源。

正式发布资料应说明每一项基准测试、模型配置、提示词模板、评估日期和评分方法。在许可允许的情况下,还应提供原始输出。

第二个不确定性是数据污染。当训练数据包含基准测试的问题、解答或近似变体时,该基准的参考价值会下降。

模型开发者会尝试从训练语料中筛除评估材料,但外部人士很难审计这一过程。近期创建的私有测试有助于降低这一风险。

第三个不确定性是选择偏差。公司往往会发布对其模型有利的测试。这种做法并不会让结果失实,但会使未披露的评估同样重要。

DeepSeek 四月发布的技术材料曾在推理、编码和智能体任务上将 V4 Pro 与强劲模型进行比较。CAISI 后来在其自有测试套件中发现它的相对表现较弱。

这种差异说明了基准测试的敏感性。两个可信的评估者可能因使用不同任务和聚合方法而得出不同结论。

第四个不确定性是可靠性。平均准确率无法显示模型多常发生严重失败。

一个编码模型若能正确完成九项任务,却在第十项中损坏代码库,其实用性可能低于一个稍弱但失败模式更安全的模型。生产团队需要的是失败分布,而不只是均值。

第五个不确定性是版本控制。带日期的构建版本有助于识别模型,但开发者需要能够固定该版本,或在版本变化前获得提前通知。

静默替换模型可能使已验证的提示词失效。它可能改变响应长度、工具选择、拒答方式、格式以及提出无依据主张的可能性。

第六个不确定性是提供商差异。开放权重模型常通过多家托管服务出现,而不同服务可能采用不同的量化方式、推理服务软件、上下文限制和推理设置。

量化会降低用于存储或计算模型权重的数值精度。它可以降低硬件要求,但激进的设置也可能改变输出质量。

标为 DeepSeek V4 Pro 的第三方端点,其行为可能不同于 DeepSeek 官方端点。对比测试必须明确提供商和推理服务配置。

Fable 5 同样需要谨慎标注。Anthropic 的安全路由可能会将部分请求交给 Opus 4.8。因此,对公开产品的测试可能不同于对底层 Fable 模型的测试。

第七个不确定性涉及现实世界的自主性。Anthropic 的公开主张高度聚焦于长周期任务,包括代码库迁移和延展性研究。

DeepSeek 的早期对比需要同等的证据。短期基准测试无法证明模型能否在数小时的工具使用过程中维持连贯计划。

独立的智能体评估在这里很有价值,但必须控制周边测试框架。更好的工具配置可能让较弱的模型显得更强。

人工干预也必须被报告。一个在反复提示后完成任务的智能体,并不等同于一个仅凭单一规格说明就完成同一任务的智能体。

安全性提供了另一条分界线。Anthropic 发布了详尽的系统卡,涵盖 Fable 5 和 Mythos 5,包括模型行为和安全措施。

DeepSeek 四月的发布包含了有关架构和能力的技术信息。八月构建版本仍需提供关于安全测试和行为变化的可比披露。

这些缺口并不会使该更新失效。它们界定了基准测试主张要成为采购结论之前所需完成的工作。

开发者无需等待每一份公开报告就可以着手开展这项工作。他们应将一部分受控的非敏感流量路由至新模型,并将结果与当前系统进行比较。

评估应包括任务成功率、人工修正时间、工具调用有效性、延迟和失败严重程度。每个维度都能揭示综合评分可能遗漏的内容。

团队还应测试重复运行的结果。一个模型若成功一次、失败四次,就不适合需要一致性的工作流。

对于知识工作,评估者可以比较事实支持、引用准确性、文档检索能力以及表达不确定性的能力。对于编码,他们可以衡量通过的测试、引入的回归问题和审查工作量。

这种私有测试将决定 DeepSeek Pro 只是图表上接近,还是在真正重要的地方接近。

三个信号将决定差距是否真实存在

下一阶段是验证周期,而不是又一轮排行榜庆祝。

第一个信号是 DeepSeek 为 V4 Pro 0813 提供完整的发布记录。DeepSeek 应记录发布日期、架构连续性、API 行为变化和评估设置。

正式的更新日志条目将确认 8 月 13 日是全面发布、分阶段推出,还是内部版本变更。它也将帮助开发者在未来更新后复现模型行为。

如果 DeepSeek 发布完整方法并提供稳定的版本访问,这一信号将增强对等性的论点。即使社区测试仍然有利,持续的模糊性也会削弱信心。

第二个信号是跨编码、推理和智能体任务的独立复现。CAISI、学术团队、基准测试运营方和企业用户都可以分别测试这一主张的不同部分。

最有价值的研究将会在匹配条件下比较 DeepSeek V4 Pro 0813 和 Fable 5。它们应使用相同的提示词、工具权限、时间限制和重试策略。

结果应按任务分别呈现。单一综合评分可能掩盖对某个应用至关重要的弱点。

如果 DeepSeek 在多个测试套件中保持接近,并比其预览版产生更少的严重失败,独立结果将强化这一判断。若其在私有或长周期任务上存在明显差距,则会削弱这一判断。

第三个信号是生产环境采用情况。开发者需要证据表明,新构建版本能够处理持续流量、遵守结构化输出契约,并在部署后保持一致。

仅凭使用量无法证明质量。不过,公开迁移报告和详细的事后复盘可以揭示模型在哪些方面成功或失败。

应关注工程团队对代码审查、代码库迁移、研究或支持工作负载的描述。有价值的报告会包含修正率和运营约束,而不只是热情的示例。

如果组织在受控试验后继续使用该模型,这一信号将增强 DeepSeek 的论据。短暂试验后悄然回退,则会指向相反方向。

Anthropic 的回应同样重要,但它是辅助背景,而非主要测试。该公司可以改进 Fable、调整其周边工具,或推出另一款模型。

更重要的问题是,DeepSeek 是否压缩了可用能力差距。如果是这样,基准领先地位将成为一种更短暂的优势。

这种变化将首先影响开发者。他们将获得更多谈判筹码,以及更广泛的模型路由选择。

企业买家将面临更复杂的决策。部署控制和模型访问可能得到改善,而治理、安全审查和地缘政治问题依然重要。

知识工作者会通过那些在幕后切换模型提供商的产品间接感受到变化。更好的输出可能在没有明显界面变更的情况下出现。

这种不可见性使文档记录变得重要。组织应记录是哪一种模型生成了重要的分析、代码或建议。

一个个人知识系统可以帮助保留提示词、源材料、输出和后续修正。目标是问责,而不是收集更多 AI 生成的文本。

如果独立测试证实早期结果,DeepSeek Pro 就跨越了一个重要门槛。它将足够接近 Fable 5,以至于买家必须根据自身工作评估这两个系统。

目前,证据支持关注而非确定性。API 构建版本是真实的,竞争压力是真实的,而广泛对等的主张仍在接受检验。

开发者应保存确切的 0813 版本,重新运行最棘手的内部案例,并衡量人工修正所需时间。当基准测试变成你的生产工作负载时,DeepSeek Pro 还能否保持接近的表现?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page