top of page

DeepSeek 再次启动灰度测试,但更强模型的说法仍未获证实

8月28日
讀畢需時 14 分鐘

据报道,DeepSeek 于 8 月 19 日为部分用户调整了模型路由,再次引发了关于某个未发布系统优于其先前灰度测试模型的说法。

现有证据来自用户会话、截图和演示,而非公司公告。一些测试者报告称,其推理语言有所不同、界面生成能力更强,并能完成颇具雄心的交互式项目。不过,目前没有公开的模型标识符能将这些输出与某个特定检查点联系起来。

这一差别至关重要,因为 DeepSeek 仅在六天前发布了 V4 Pro。因此,这些新报告引发了一个令人不安的对比:一边是有据可查的生产模型,另一边则是通过选择性路由提供的匿名系统。

核心故事并不是又一位基准测试领跑者已经出现,而是灰度测试让 AI 公司能够展示表面上的进展,却无需让模型接受可重复、独立的评估。

Anthropic、Google 和 OpenAI 也会更新托管系统,有时不会披露每一项路由决策。DeepSeek 此次据报进行的实验将这一做法推得更远,因为测试者无法可靠地选择、识别或再次访问他们所遇到的模型。

据称 8 月 19 日发生了什么变化

部分用户似乎获得了不同的模型,但现有证据无法确定其名称、架构或发布状态。

一篇于 8 月 20 日发布的中国科技文章报道称,DeepSeek 的网页界面在此前一天下午开始呈现不同表现。报道重点提到了推理轨迹再次使用“我正在……”这类第一人称进行式表达。

据该报道援引的测试者称,这些表达也曾在此前一次有限测试中出现;当 V4 Pro 正式全面上线后,它们便消失了。

推理轨迹是与模型内部问题解决过程相关的可见摘要或片段。它们能够反映展示方式的变化,但并不能充当可靠的模型指纹。

服务提供商可以通过提示词、格式或界面代码修改这些轨迹。路由层也可以将不同请求发送至不同检查点,同时对外呈现同一个产品名称。

报道称,该系统在写作、代码生成和进度更新方面表现更好。后续演示显示,该系统可根据简短提示创建交互式环境,其中包括由生成代码渲染的可导航场景。

这些示例在视觉上颇具说服力,因为观众能够检视具体成果。一个可运行的环境比抽象的基准分数更让人觉得信息充分。

但一次成功的演示仍有重要变量未被控制。提示词历史、重试次数、人工修正、工具权限和选择过程,都可能影响最终结果。

据报的 8 月 19 日启动日期,作为公开讨论开始的时间点是可信的。由于 DeepSeek 尚未针对这次测试发布带日期的通知,实际部署时间仍未得到确认。

知乎上的原始提问也将该事件描述为被“曝光”,而非正式发布。这种措辞准确反映了当前的证据缺口。

此次灰度测试紧随 8 月 13 日 V4 Pro 的发布。DeepSeek 的官方更新日志显示,该版本于当日上线其应用、网页界面和 API。

这次有据可查的发布新增了三档推理力度设置,并原生支持 OpenAI Responses API 格式。DeepSeek 还公布了该生产检查点在多项智能体基准测试中的成绩。

这些事实构成了本文的张力所在。公司刚刚将一个具名模型投入生产,但一些用户很快便认为,一个身份不明的路由模型表现更好。

灰度测试本身并不罕见。它指的是在全面发布前,将某项变更暴露给有限比例的流量。

这种方法有助于团队衡量负载、故障、参与度和意外行为,也能限制有缺陷部署造成的影响。

然而,AI 灰度测试不同于传统的界面实验。模型输出本身就是产品,而细微的路由变化就可能实质性地改变用户体验。

获得出色结果的测试者不能假定其他用户会获得同一套系统。即使是原测试者,也可能在下一次会话中被路由到别处。

因此,最强的公开说法——该模型超越了此前的灰度测试——无法仅凭演示得到证实。

DeepSeek 的灰度测试为何在当下值得关注

这一时间点给 DeepSeek 带来压力:它需要解释为何其最新生产模型看起来弱于一条匿名实验路由。

V4 Pro 在经历早期预览期后,于 8 月 13 日全面上线。其发布重点在于智能体工作,即模型使用工具并完成多步骤任务的能力。

根据 DeepSeek 公布的数据,V4 Pro 在 Terminal Bench 2.1 上获得 87.9 分,在 DeepSWE 上获得 62.7 分;在 NL2Repo 上为 61.5 分,在 Toolathlon-Verified 上为 74.1 分。

这些是公司自行报告的基准测试结果。它们有助于界定该模型的预期优势,但无法独立验证其在真实项目中的表现。

据公司此前发布的 V4 preview,该生产模型还支持一百万 token 的上下文窗口。上下文窗口是指模型在单次请求中可处理的输入量。

大上下文容量可以支持代码仓库分析、长文档和延展的智能体工作流,但并不保证系统会准确使用所有提供的信息。

DeepSeek 将 V4 Pro 定位为该系列中规模更大的成员。公司列出的数据是,总参数量为 1.6 万亿,每生成一个 token 激活 490 亿参数。

V4 Flash 激活的参数更少,目标是实现更快运行。DeepSeek 报告称,该模型总参数量为 2840 亿,每个 token 激活 130 亿参数。

两者均采用混合专家架构,每个 token 仅激活网络的一部分。这种方法无需缩小模型总规模,便可减少计算量。

据报的灰度测试输出出现时,用户刚开始测试生产版本。这一顺序促使人们将有限实验与 V4-Pro-0813 进行比较。

一些社区帖子称,正式发布版的能力似乎不如此前经路由提供的版本。另一些用户则报告称,它在复杂代码仓库上表现良好,并警告不要根据单一代码库进行泛化。

例如,一位 Reddit 用户在一个私有项目中比较了 V4 Pro 与竞争系统。作者明确表示,该测试并未标准化,不应代表所有编程任务。

这一保留至关重要。真实代码仓库测试提供了实践性证据,但其中混合了模型质量、项目结构、提示词、工具和评估者判断等因素。

因此,8 月的实验从两个方向向 DeepSeek 施压。它既要持续快速改进,也要让生产系统足够稳定,以赢得开发者信任。

第一个目标奖励频繁的隐藏测试。第二个目标则要求具名版本、可复现行为、迁移指引和持久的 API 访问。

对于智能体应用而言,这种冲突更为尖锐。微小的质量变化就可能决定智能体是完成任务、反复循环,还是修改错误的文件。

开发者可以容忍消费级聊天界面中的实验,但他们不太可能接受自动化生产工作流中的无声变化。

企业买家也面临类似问题。除了模型原始能力外,他们还会评估可靠性、可审计性、安全性和行为可预测性。

一款偶尔能创造出令人惊艳交互世界的模型可以吸引关注。一款能在数千项内部任务中保持一致行为的模型,则能创造运营价值。

因此,DeepSeek 的下一项挑战不只是发布实验模型。它还必须将任何真实的能力提升关联到一个客户能够反复评估的可识别产品。

DeepSeek V4 Pro 面临自己的隐形继任者

主要竞争发生在 DeepSeek 的具名生产检查点与用户无法稳定访问的匿名路由模型之间。

将此称为 DeepSeek 与 Anthropic 之间的竞争,会夸大现有证据。测试者确实将输出与 Anthropic 模型作过比较,但没有受控评估能够确立新的排名。

更直接的对手就在 DeepSeek 自己的产品内部。V4-Pro-0813 拥有官方标识符、已记录的基准测试、API 支持和公布的发布日期。

灰度测试模型则没有任何此类保障。它拥有演示、行为线索,以及通过选择性接触逐步建立起来的声誉。

这种不对称可能让实验版看起来优于生产版本。用户往往会分享非同寻常的输出,而常规失败较少得到集中关注。

选择性路由又增加了一层筛选。只有部分账户会获得该系统,而观察者不知道 DeepSeek 如何选择请求或用户。

公司可能会根据容量、账户历史、任务类别、地理位置或随机分配来路由提示词,也可能会同时测试多种配置。

在没有稳定标识符的情况下,所有报告的输出都可能被归属于一个想象中的模型。实际上,用户遇到的可能是不同的检查点、提示词或工具配置。

对于交互式演示而言,这一归因问题尤其重要。一个生成场景依赖于推理、代码创建、素材选择、浏览器执行和修复循环。

底层模型或许更擅长规划;周边产品也可能只是获得了更好的工具、更长的执行时间,或经过修订的系统提示词。

这些变化对用户而言依然重要。但它们代表的是产品工程,而非新基础模型的证明。

DeepSeek 早期的 V4 材料有助于说明这种区别。公司既描述了模型架构和智能体能力,也为 API 用户提供了具名的模型选项。

灰度测试则先展示体验,随后才进行技术说明。它让服务提供商能够在记录改进来源之前,衡量用户是否注意到了改进。

这种做法有合理理由。公开模型名称可能制造过早预期,而早期检查点可能在生产流量下出现故障。

有限部署也能为 DeepSeek 提供离线基准测试无法获得的运营数据。真实用户会提交杂乱的提示词、不完整的需求和意料之外的工具请求。

问题在于,当社区解读超越证据时,“出现了不同的输出风格”会变成“新模型已经启用”,继而变成“该模型胜过上一版本”。

每一步都需要额外证据。第一步可以通过截图展示,而最后一步则需要针对已知检查点进行重复测试。

生产版本也值得获得更公平的比较。V4 Pro 包含可选的推理力度,因此结果会随配置和任务复杂度而变化。

较低的力度设置可能更快作答,同时消耗更少计算资源。最高设置则可以为困难的智能体工作分配更多推理。

即便如此,更多计算也不保证得到更好的答案。模型可能推理更久,却走上一条无效路径,并在未完成请求任务的情况下停止。

有关正式发布的独立报道指出,V4 Pro 强调智能体表现。Associated Press 的报道也将此次发布置于中美模型开发者持续竞争的背景之中。

这种更广泛的竞争解释了为何据报道的灰度测试受到关注。如今,每当竞争对手发布新品后,模型提供商都面临着尽快展示可见进展的压力。

不过,决定性的比较仍在内部。DeepSeek 必须证明,这条神秘路由究竟代表了更好的模型、更好的智能体框架,还是一组异常有利的案例。

在此之前,灰度测试只能证明正在进行积极实验。它并不能证明 V4 Pro 已被取代。

令人印象深刻的演示并不能证明能力跃升

交互式输出展现了有价值的产品方向,但在没有受控访问和可复现评估的情况下,无法支撑广泛的性能主张。

据称,最有力的演示始于一段简短请求,终于一个可探索的环境。系统会编写代码、渲染场景,并响应用户交互。

这一工作流结合了多项困难能力。模型必须理解意图、制定计划、维持状态、编写有效代码,并修复执行错误。

成功的结果所揭示的内容,可能多于一项选择题基准测试。它表明系统是否能将推理与工具连接起来,并产出人们实际可用的成果。

然而,演示质量高度依赖于筛选。创作者可以尝试许多提示词,然后发布其中最成功的结果。

观众很少看到被放弃的运行、损坏的界面、人工修复,或需要反复澄清的提示词。这些未呈现的情况决定了系统的可靠性。

“比上一次灰度测试更强”这一说法同样缺乏固定的评估对象。此前测试并未公开一个永久的模型标识符。

用户可以比较记忆、截图和保存的输出,却无法在相同条件下重新运行两个系统。

可信的比较需要共享提示词集、记录设置、多次试验,以及预先确定的评分规则。评估者还需要能稳定访问两个检查点。

编程和交互式生成还需要额外检查。审查人员应测试输出是否能正常运行、是否易于维护、是否符合要求,以及是否避免隐藏的安全问题。

视觉上的精致感可能掩盖脆弱的实现。一个场景可能看起来很有说服力,却依赖硬编码行为、复制的资产,或只能在一次交互后便失效的代码。

同样,模型可以生成冗长的进度更新,却并未改善其底层推理。可见的叙述不等于成功完成任务。

推理轨迹还会带来另一种风险。用户可能将第一人称表述视为更深层认知或某个特定隐藏模型的证据。

这些表述只是界面输出。即使不重新训练模型,它们也可以改变;提供商也可能有意进行摘要,而非暴露内部推理。

DeepSeek 尚未确认 8 月 19 日的行为意味着一个新的基础模型。它尚未公布参数量、训练细节、模型卡,或该路由系统的评估结果。

缺少这些材料并不意味着该实验是虚假的。这意味着最强的解读仍缺乏支持。

社区测试依然具有重要价值。它能发现正式评估遗漏的提示词,并展示用户在实践中重视什么。

例如,交互式世界生成表明,市场需要能将描述转化为可运行软件、而非静态文本的智能体。这种需求不止存在于娱乐演示中。

产品团队可以将类似系统用于原型、培训模拟、数据可视化和界面实验。开发者则可能在编写生产代码前,用它们探索一种设计。

知识工作者可以从文档或研究中生成交互式解释。这种可能性将模型能力与整理源材料这一更广泛的挑战联系起来。

个人AI 知识库可以在多次测试中保存提示词、输出和证据。这类记录能让主观的模型比较更加严谨。

不过,任何笔记集合都无法解决隐藏路由问题。评估者需要模型标识符,或由提供商控制的方式来选择所测试的检查点。

目前最公平的结论应当保持克制。一些用户遇到了不同于 V4 Pro 的行为,并产出了引人注目的演示。

这些证据并不能证明每个示例都由同一个连贯的新模型生成,也无法证明它在编程、写作、推理或智能体任务中全面更优。

因此,任何宣称已确认能力跃升的文章都超出了现有记录。负责任的叙事应聚焦于实验、归因和验证。

隐藏路由让模型质量成为信任问题

AI 产品越依赖动态路由,用户就越难知道自己评估、购买或部署的究竟是什么。

模型路由允许提供商在接收到请求后选择系统。选择可能取决于任务类型、延迟、容量、安全规则或账户权限。

这种架构可以提升效率。简单问题可以使用更快的模型,而困难的编程任务则获得更多计算资源。

它也能支持渐进式发布。公司可以将一小部分流量发送到新检查点,并比较完成率或用户反馈。

同样的灵活性削弱了可复现性。两个人输入相同提示词,可能在不知情的情况下获得实质不同的系统。

对于消费级聊天,这种差异可能造成困惑。对于软件开发、研究、法律审查或金融分析,它会使审计和问责更加复杂。

一个团队可能在强劲评估后批准某个工作流,却在日常使用中得到较弱的路由。提供商之后可能恢复较强模型,而不改变显示的产品名称。

缓存和对话历史会带来更多变化。在模型质量进入比较之前,工具可用性、系统指令和上下文长度都可能改变结果。

因此,仅有可见的模型标签并不够。提供商还需要版本记录、变更通知,以及有关 API 行为的清晰保证。

DeepSeek 已在公开发布方面朝这一方向迈出了一些步伐。其文档点名 V4-Pro-0813,并列出正式上线期间新增的能力。

据报道的灰度测试不在这一承诺范围内。它的目的推测是实验,因此公司没有承诺稳定性或广泛访问。

用户应据此看待它。他们可以探索系统并记录结果,但不应围绕这些体验规划生产部署。

竞争对手也面临同样的治理问题。Anthropic、Google 和 OpenAI 都运营着托管产品,其周边工具和指令可能随时间改变。

差别不在于是否存在路由。重要问题在于开发者能否固定版本,以及重大变更是否得到文档记录。

开放权重发布提供了另一条路径。它让独立研究人员能够运行已知检查点,并在受控条件下重复测试。

DeepSeek 的 V4 预览版包含开放权重,支持检查和本地部署。若未来发布灰度测试检查点,将大幅提升可验证性。

开放权重并不会自动解决评估问题。硬件、量化、推理软件和采样设置仍可能改变结果。

但它们确实为研究者提供了可长期测试的对象。临时路由的网页模型没有同等保证。

这还涉及安全维度。智能体模型可以执行命令、修改文件,并连接外部服务。

更强的智能体或许能完成更多任务,但更高的自主性也会放大错误。提供商需要在基准提升之外,评估权限处理、提示词注入和非预期操作。

8 月的演示主要强调系统能够构建什么。它们较少揭示系统面对恶意输入或模糊指令时的安全响应方式。

企业采用将取决于两方面。买方既需要证据证明模型能完成复杂工作,也需要证明其失败方式可预测、可控制。

灰度测试方法可以在发布前收集有价值的安全数据。然而,公开演示天然偏向能力展示,因为令人印象深刻的输出比谨慎的失败分析更容易传播。

这造成了一种熟悉的不平衡。营销价值立即到来,而验证和风险文档则在之后跟进。

现在,弥合这一差距的责任落在 DeepSeek 身上。具名发布、技术文档和稳定的评估访问,将把猜测转化为可检验的产品主张。

在称其为更强的 DeepSeek 模型前应关注什么

三个信号将决定据报道的实验究竟代表真正的模型进步、产品层改进,还是临时路由测试。

第一个信号是官方模型身份。DeepSeek 应发布版本说明、模型卡或 API 标识符,将该实验与特定检查点关联起来。

这一披露将增强能力主张,因为用户能够区分一个模型与多种可能配置。持续沉默则会让归因保持不确定。

最有价值的公告不应只包含产品名称。它还应说明变化是否影响模型权重、后训练、工具、系统指令或推理设置。

第二个信号是可复现的独立测试。研究人员需要稳定访问、记录在案的提示词集、多次试验,以及在观察结果之前选定的评估标准。

对于编程智能体,测试应包括任务完成情况、正确性、安全性,以及从失败工具调用中恢复的能力。交互式生成则应评估其在未见提示词上的可靠性。

独立测试可能确认,路由模型在实用智能体工作上超过 V4-Pro-0813。若结果参差不齐,则可能表明病毒式传播的演示只捕捉到了较为狭窄的优势。

第三个信号是生产部署路径。真正的进步最终应通过可选择的 API 模型、有文档记录的网页选项,或发布的权重体现出来。

生产路径将表明,DeepSeek 能够在正常流量下稳定交付据报道的行为。反复进行灰度测试却没有持久发布,将削弱这种解读。

读者还应关注该公司如何处理版本过渡。清晰的迁移说明将表明 DeepSeek 将模型行为视为一种运营承诺。

这些信号对不同受众的重要性各不相同。

开发者应推迟架构决策,直到能够固定模型版本并重复自身代码库测试。截图无法预测生产智能体中的工具可靠性。

企业买方应询问评估是否覆盖他们将部署的同一端点。他们还应要求变更通知、访问控制和可审计的版本记录。

AI 产品用户若被选中,可以探索灰度测试,但应记录提示词、设置、失败情况和成功输出。这些证据比单纯印象更有价值。

研究人员应将基础模型能力与智能体框架、路由层和界面区分开来。每个组件都可能改善结果,但并不意味着模型更大或经过了新的训练。

8月19日的报道值得关注,因为它们指向了更丰富的代码驱动界面和能力更强的智能体。但这些信息尚不足以支持明确的模型排名结论。

决定性的问题很简单:DeepSeek 能否将这种匿名但令人印象深刻的体验,转化为一个具名系统,让独立用户能够反复测试?

在此之前,应将这项灰度测试视为正在积极开发的可信信号,而非已经得到验证的后继版本。请保存具有代表性的任务,并在任何官方发布后重新运行。

如果同样的提升能够经受稳定访问、多轮测试和独立审查,事件就将成为一次模型进步。若不能,它仍会是一个颇具启发性的实验,揭示隐藏路由如何塑造人们对 AI 的认知。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page