top of page

DeepSeek V4 Pro 携先进 AI 智能体发布,但其宣称仍需接受现实检验

DeepSeek 于 8 月 13 日发布 V4 Pro 的正式版,将为期四个月的预览版本转为面向 AI 智能体的生产级模型。此次发布迅速登上 Google News,但其核心宣传需要结合背景来看。DeepSeek 称其在编程、工具使用和长时工作流方面实现显著提升;而对预览版的独立评估显示,其领先优势并不那么明确。

新模型可通过 DeepSeek 的应用、网页界面和 API 使用。开发者也可以下载其开放权重,并部署在自己掌控的基础设施上。这种组合对 Anthropic、Google 和 OpenAI 的闭源服务构成压力,尤其是在团队需要处理大量工作历史记录的智能体时。

然而,更强的基准测试成绩并不能保证智能体可靠。智能体必须在多步骤过程中选择工具、理解失败原因、保留状态并从错误中恢复。DeepSeek V4 Pro 具备支持这些工作流的能力,但它能否稳定执行,仍是核心问题。

DeepSeek V4 Pro 的 Google News 标题遗漏了什么

8 月的发布之所以重要,是因为 DeepSeek 将 V4 Pro 从雄心勃勃的预览版,推进为明确面向生产级智能体工作负载的模型。

DeepSeek 最初于 4 月 24 日发布 V4 预览版,其中包括 V4 Pro 和更小的 V4 Flash 模型。两者均支持一百万 token 的上下文窗口,这意味着每次请求最多可包含一百万个经过编码的文本片段。

8 月 13 日的 GA 发布并未推出一个完全独立的新模型家族。相反,DeepSeek 在预览期后更新了 V4 Pro,并强调其生产环境性能。公司通过其面向消费者的界面中的“Expert Mode”提供该模型,同时保留相同的 API 模型名称。

DeepSeek 还新增了对 OpenAI Responses API 格式的原生支持。该接口有助于应用管理工具调用、中间输出和多步骤交互。对 Anthropic API 格式的支持则已是更广泛 V4 发布的一部分。

这些兼容层减少了迁移工作。开发者可以更改端点和模型配置,而无需重写每条消息或工具定义。这并不意味着各家 API 完全相同,但它降低了在现有智能体系统中测试 DeepSeek 的初始门槛。

公司还引入了可选的推理强度。低强度面向更简单的请求,较高设置则会为复杂的智能体任务分配更多计算资源。这一选择很重要,因为智能体经常面对不均衡的工作负载。读取一个文件与规划一次覆盖整个代码库的改动,并不需要同样的推理预算。

V4 Pro 仍是一款规模极大的混合专家模型。混合专家架构会针对每个 token 仅激活网络的一部分。DeepSeek 的模型卡显示,其总参数量为 1.6 万亿,其中推理时激活 490 亿参数。

据 DeepSeek 称,该模型在超过 32 万亿 token 上训练。其后训练流程先分别培养领域专家,再整合其能力。公司表示,这一设计增强了单一模型中的知识、推理、编程和智能体行为能力。

这些数字说明,这次发布不应仅被视为一次常规更新。DeepSeek 将开放权重、大上下文窗口和面向智能体的后训练整合为一个可部署的软件包。闭源模型供应商通常将模型作为托管服务提供,而不提供可下载的权重。

不过,Google News 中有关“先进 AI 智能体”的标题,可能会让人以为 DeepSeek 发布了一款完整的自主产品。事实并非如此。V4 Pro 主要是智能体系统中的推理模型。

外围智能体仍需要一个 harness,即负责管理工具、权限、记忆和执行的软件。它还需要访问控制和验证规则。模型可以提出一条命令,但由 harness 决定该命令是否执行。

这一区别是评估此次发布的关键。DeepSeek 推出了更强的引擎和更便捷的集成路径,但并未消除围绕该引擎构建安全、可靠智能体所需的工程工作。

百万 Token 上下文改变了智能体的计算逻辑

DeepSeek 最具影响力的优势并非聊天机器人功能,而是一种面向长时间、重度工具调用执行轨迹的记忆机制。

长时间运行的智能体会迅速积累信息。一个编程智能体可能检查数百个文件、运行测试、读取错误日志,并修订多个计划。除非智能体丢弃或总结这些结果,否则每项结果都会成为工作上下文的一部分。

传统注意力机制会使这一过程成本高昂。模型每生成一个新 token,都需要反复处理不断扩展的记录。由于系统会保留早先 token 的键值缓存数据,即通常所说的 KV cache,内存使用量也会增加。

DeepSeek 通过两种互补的注意力机制应对这一问题。Compressed Sparse Attention 会先压缩 token 组,再选择与当前查询最相关的区块。Heavily Compressed Attention 则生成更小的表示形式,供每个查询查看。

该公司称,在百万 token 边界上,V4 Pro 的单 token 推理计算量仅为 V3.2 的 27%。它还表示,V4 Pro 使用的 KV cache 仅为早期模型的 10%。这些是 DeepSeek 提出的架构层面主张,并非所有服务环境下都普遍适用的结果。

一份技术架构分析解释了这些缩减为何对智能体重要。工具结果可以更长时间地保持可用,而不会迅速填满加速器内存。因此,智能体在延长任务期间所需的有损总结会更少。

容量本身并不等于理解力。模型可以接收一百万 token,却忽略位于中间位置的一条关键指令。长上下文测试必须衡量检索能力、跨远距离证据的推理能力,以及抵御无关细节干扰的能力。

不过,高效上下文改变了开发者能够尝试的工作方式。研究智能体可以保留来源摘录、被否决的假设和先前的搜索路径。编程智能体则可以将接口定义与测试失败信息和早期补丁一并保留。

这对闭源模型构成了具体的竞争挑战。Anthropic、Google 和 OpenAI 提供成熟的智能体生态系统和托管基础设施。DeepSeek 则提供开放权重模型,组织可以自行托管、检查、量化,并将其置于自有安全边界之后。

当智能体访问私有代码库或内部文档时,控制权尤为重要。本地部署可以让提示词和工具结果保留在组织自身的基础设施内,也可支持自定义的监控和留存策略。

开放权重并不意味着部署轻而易举。V4 Pro 的总体规模对存储和硬件提出了很高要求。即使每个 token 仅激活 490 亿参数,完整检查点仍必须被分发和服务。

不同托管方也可能提供不同的上下文上限。硬件容量、量化和服务软件都会缩小实际可用窗口。模型公布的最大值不应被视为每个提供商都能保证的上限。

因此,真正的机制是多种因素的组合。DeepSeek 更高效地压缩长历史记录,激活庞大模型中的有限部分,并让应用调整推理强度。这些选择共同瞄准了持续性智能体工作的经济性。

这一目标比又一项对话基准测试更重要。智能体在交付一个结果之前,会生成大量中间 token 并反复调用模型。微小的效率提升可以在整个工作流中不断累积。

对开发者而言,测试应围绕完整任务而非孤立提示词进行。向模型提供一个代码库、一个失败问题以及权限受限的工具,然后衡量完成率、回归率、工具错误、耗时和所需人工修正。

这种评估能够揭示长上下文是否带来有用的连续性,也会暴露模型是否会随着执行轨迹增长而变得混乱。宣传中的窗口决定了潜力,而工作流决定了价值。

DeepSeek AI 智能体令闭源模型承压

DeepSeek 正迫使智能体市场将模型能力与托管平台的便利性和治理能力区分开来。

主要竞争是 DeepSeek V4 Pro 与用于编程和办公智能体的闭源前沿模型之间的较量。Anthropic 的 Claude 系列、Google 的 Gemini 模型和 OpenAI 的 GPT 模型仍是重要参照对象。它们还配备由供应商运营的安全系统和成熟的应用生态系统。

DeepSeek 在 4 月的公告中声称,V4 Pro 在智能体工作上接近领先的闭源模型。智能体能力指的是通过规划、工具使用、观察和纠正来完成多步骤任务。它不同于正确回答一个困难问题。

公司在编程智能体基准测试中将 V4 Pro 与 Claude 模型进行定位比较,也在推理和知识测试中将该模型与 Google 和 OpenAI 的系统比较。这些比较来自 DeepSeek 自己的评估设置。

独立报道对早期结果采取了更审慎的态度。一篇 4 月发布报道援引 Omdia 分析师 Lian Jye Su 的说法,称 V4 与美国竞争对手具有竞争力。该报道同时明确将智能体比较归因于 DeepSeek。

这种归因很重要,因为智能体基准测试对其脚手架十分敏感。系统提示词、可用工具、重试策略和推理预算都可能改变得分。在一种 harness 中表现良好的模型,可能在另一种环境中遇到困难。

8 月更新通过聚焦生产环境增益,使这场竞争更加明确。DeepSeek 并非只是宣称抽象推理能力更强,而是重点展示模型必须操作工具、维持状态并完成更长任务的工作流。

兼容性带来了另一层压力。接受熟悉请求格式的 API,让开发者能够以实际方式进行并行评估。团队可以将选定任务路由至 V4 Pro,而无需先重新设计整个应用。

开放权重构成了第二条路径。组织可以通过自己的供应商或基础设施托管模型。这一选择可以减少对单一模型供应商的依赖,但也会将运营责任转移给部署团队。

闭源模型路线仍拥有重大优势。供应商可以集中更新安全防护措施、运营经过优化的推理系统,并提供集成监控。客户无需管理一个万亿参数检查点,也不必协调分布式服务。

闭源服务还可以更新底层模型,而无需用户下载新版本。这简化了维护,尽管也可能使行为变化更难预测。开放部署提供版本控制,但每位运营者都必须管理升级。

这种选择并非简单的开放与闭源之争,而是控制权与运营委托之间的取舍。DeepSeek 让控制权这一端更具可信度,因为 V4 Pro 已达到企业可以认真评估的能力范围。

NIST 的人工智能标准与创新中心(CAISI)对 4 月预览版进行了网络安全、软件工程、科学、推理和数学测试。其独立评估称,V4 Pro 是其评估过的最强中国模型。

CAISI 还发现,DeepSeek 报告的对比结果与其自身测试结果之间存在明显差距。其综合分析显示,该预览版大约落后领先的美国模型八个月。DeepSeek 的数据则表明,其性能更接近较新的前沿系统。

详细结果并非一律疲软,而是好坏参半。V4 Pro 在基于真实软件问题的基准测试 SWE-bench Verified 上得分为 74%。它在 GPQA Diamond 上达到 90%,并在一项高阶数学评估中达到 97%。

留出任务呈现出较不理想的情况。V4 Pro 在 CAISI 的私有软件基准 PortBench 上得分为 44%。它在半私有的抽象推理评估 ARC-AGI-2 中得分为 46%。

这些结果描述的是 4 月预览版,并不一定反映 8 月的 GA 更新。DeepSeek 表示,新版本提升了智能体性能,尤其是在生产环境中。独立测试如今必须确定,这次更新在多大程度上改变了此前的结论。

即使答案尚未揭晓,对竞争对手的压力依然真实存在。DeepSeek 无需赢下每一项基准测试,就能影响采购决策。它只需具备足够能力,让团队能够将适合的工作负载路由给它,而不会承受不可接受的失败率。

这种格局更像云服务采购,而非赢家通吃的模型竞赛。一家企业可能使用一种模型处理敏感的本地任务,另一种模型负责复杂规划,再使用较小模型完成常规提取。智能体平台正越来越能够实现这种路由。

DeepSeek V4 Pro 强化了采用此类混合技术栈的理由。其开放权重和 API 兼容性让替换更容易。其规模和长上下文能力,也使其适用于此前较小开放模型难以胜任的任务。

结果是对高端闭源模型默认选择的直接挑战。买方现在多了一个可信的测试选项。闭源提供商必须通过可靠性、安全性、集成质量和可衡量的任务完成表现来证明自身价值。

基准测试仍无法证明生产可靠性

最大的不确定性在于,DeepSeek 更高的智能体得分能否经受陌生任务、严格权限和对抗性输入的考验。

一项智能体基准测试将许多设计选择压缩为一个数字。这个数字可能掩盖重试、工具配置、提示工程和任务选择等因素。它还可能奖励完成任务的结果,却不衡量过程中产生的风险。

生产环境中的智能体面对的条件更加复杂。文档可能已经过时,工具可能超时,用户也可能提供相互冲突的指令。智能体必须识别不确定性,而不是将每个歧义都转化为行动。

8 月版本发布不久,尚未形成广泛的独立复现。DeepSeek 的公告称,V4 Pro 在生产智能体工作负载上的表现显著提升。但公告没有提供足够公开细节,无法确认这些提升能在外部测试框架中如何迁移。

CAISI 此前的评估提供了一个有益警示。DeepSeek 在自行报告的测试中表现优于多项留出评估。这并不意味着该公司的基准测试无效,但限制了其结果可被泛化的范围。

智能体表现也不仅仅取决于任务准确性。模型可能完成一个编码问题,却同时进行了无关修改。它可能调用不必要的外部服务,或在工具请求中暴露敏感内容。

对于开放权重而言,安全性尤为重要。组织可以在本地运行 V4 Pro,并应用自己的控制措施。然而,恶意操作者也可以移除安全防护或分发篡改版本。

FAR.AI 使用多种越狱方法测试了 V4 Pro 预览版。越狱是旨在绕过模型安全规则的提示词。其安全压力测试发现,一种较早的公开攻击无需修改即可迁移到 V4 Pro。

研究人员报告称,这种公开攻击在其测试领域中取得了完全成功。另两种方法的成功率达到 99.6%。部分攻击需要获得超出普通用户提示词范围的访问权限,包括控制系统消息或响应前缀。

这些发现并不意味着每种部署都会以相同方式失效。安全的测试框架可以过滤输入、隔离工具、限制权限并检查输出。即使底层模型抵御恶意提示词的能力较弱,外部安全防护仍可能有效。

但这些结果表明,不能想当然地认为模型层面的安全性已经具备。开放检查点一经发布便无法召回。运营者必须将模型视为分层安全设计中的一个组件。

智能体系统还会带来提示词注入风险。网页、文档或代码仓库评论中可能包含试图重定向智能体的文本。模型必须区分任务数据和指令,而测试框架必须阻止未经授权的行动。

一百万 token 的上下文可能扩大这种攻击面。智能体可能在一次会话中摄入更多文档、日志和网页内容。更多上下文能提供有用证据,但也会为相互冲突或敌对指令提供更多藏身之处。

因此,企业应将读取权限与行动权限分离。能够检查代码仓库的智能体,不应自动获得部署凭证。研究智能体也不应在未经明确批准的情况下发布结论。

对于具有重要后果的行动,人工审核仍不可或缺。适当的门槛取决于任务,但原则始终一致。在更改生产系统、发送消息或处理受监管数据之前,智能体应先生成可审计的建议方案。

组织还需要基于自身工作流开展行为评估。公开编码基准无法预测模型在公司私有架构上的表现。本地测试集应包括常见任务、异常故障和刻意误导性的输入。

评估不应只追踪成功率。团队还需要记录未经授权的工具调用尝试、重复命令、回归问题和人工纠正时间。他们也应检查模型是否如实报告不确定性。

知识密集型智能体同样需要类似控制。大上下文窗口能够容纳许多内部来源,但不会自动消除矛盾。系统应保留引用,并区分检索到的事实与模型生成的推断。

结构化的知识融合工作流可帮助用户将模型输出与支撑其结论的材料进行对照。随着智能体承担更长周期的研究和规划任务,这种可追溯性将变得更有价值。

决定性问题并不是 V4 Pro 能否生成一段令人印象深刻的执行轨迹,而是智能体能否在现实约束下反复达成正确结果。这个标准需要在 8 月更新后进行独立的端到端测试。

Google News 发布周期后值得关注的事项

三个信号将决定 DeepSeek V4 Pro 是成为持久的智能体平台,还是仅停留在令人印象深刻的基准测试发布。

第一个信号是对 8 月模型智能体得分的独立复现。评估者需要明确具体检查点、推理设置、测试框架和工具配置。测试应包括训练期间不可见的陌生任务。

有意义的结果应当是在多个智能体框架中都能显示提升,而不仅限于 DeepSeek 偏好的设置。私有软件任务上的稳定改进将强化该公司的生产环境主张。公开测试与留出测试之间的巨大差距则会削弱这一主张。

与 4 月预览版的比较尤为重要。CAISI 在 GA 更新前建立了详细基线。重复进行可比评估将显示 DeepSeek 是否弥合了 5 月识别出的八个月综合能力差距。

第二个信号是 DeepSeek 自身接口以外的部署表现。开发者将通过本地服务器、云主机、编码工具和自定义智能体测试 V4 Pro。这些环境具有不同的提示词、上下文限制和工具策略。

应同时关注任务完成情况和运营摩擦。推理缓慢、内存压力和不一致的工具格式,可能抹去仅在模型基准测试中显示出的优势。与常见 API 格式稳定兼容将使采用更容易。

长上下文行为值得单独审视。评估者应测试模型能否在极大输入中检索证据而不丢失指令。他们还应衡量模型在接近宣传的上下文上限时的表现,而不只是较短任务。

提供商差异也将很重要。量化部署的行为可能不同于原始检查点。第三方托管方可能施加上下文限制,或采用影响延迟和输出一致性的服务优化。

第三个信号是 DeepSeek 和下游运营者如何应对安全发现。GA 版本必须针对预览版中识别出的可迁移越狱攻击进行测试。研究人员还应在真实的工具使用会话中评估提示词注入。

DeepSeek 可以发布更新后的模型行为、评估方法和推荐防护措施。托管提供商可以增加权限边界和监控机制。智能体开发者可以在具有重要后果的行动前强制设置审批关卡。

强有力的回应并不需要宣称绝对安全。它应表明已研究已知攻击,并向部署者提供了具体的缓解指导。若对可迁移失效保持沉默,企业将不得不承担更多不确定性。

竞争对手的反应将提供辅助背景。Anthropic、Google 和 OpenAI 可以通过更可靠的智能体、更长的可用上下文或更灵活的部署方式作出回应。其他开放权重开发者也可用基础设施要求更低的小型模型挑战 DeepSeek。

不过,这些反应不应分散人们对主要竞争的注意力。DeepSeek V4 Pro 正在检验开放权重模型能否在持续智能体工作中挑战闭源系统。答案取决于执行,而非 Google News 报道的数量。

考虑采用该模型的开发者应从有限评估开始。选择结果客观、权限受限且行动可逆的任务。在同一测试框架中,将 V4 Pro 与当前使用的模型进行比较。

决策中也应纳入失败情况。一个成功率略高、却会制造更难发现错误的智能体,可能是更差的选择。完成率、纠正时间和安全行为应被综合考量。

企业买方还应区分本地部署与托管的 DeepSeek 服务。开放权重允许数据保留在选定的基础设施内。使用远程端点则会引入有关数据处理、司法管辖权和供应商控制的独立问题。

知识工作者将以更间接的方式感受到这一变化。V4 Pro 可以支持保留更多笔记、文档和既有工具结果的助手。这种能力可减少研究过程中的重复准备工作。

但用户仍需要看到来源。更长的上下文窗口可让答案信息更充分,却也可能让错误更难追溯。引用、来源溯源和明确的审批步骤仍然必要。

因此,这次发布代表着一次真正的转变,但尚未终结模型竞赛。DeepSeek 已通过界面、API 和开放权重,让一个面向智能体的大型模型得以广泛使用。其架构直接解决了长执行历史带来的成本问题。

独立证据仍然喜忧参半。该预览版在多项公开任务中表现良好,但留出测试显示,它与前沿系统之间存在更明显的差距。安全研究人员还发现,其安全防护措施在已知攻击下会失效。

8 月更新让 DeepSeek 有机会通过更好的真实世界表现回应这些担忧,同时也为竞争对手设定了明确目标:他们必须说明,为什么开发者应接受更少的部署控制权或更高的平台依赖度。

先暂时忽略 Google News 上那些最宽泛的说法,检验实际工作流程。V4 Pro 能否完成你的任务、遵守既定边界,并说明它做了哪些改动?这些结果的重要性将远远超过发布时的新闻标题。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page