DeepSeek Flash Vision Exp 已开放,但其最重磅的主张仍有待检验
- Olivia Johnson

- 1天前
- 讀畢需時 14 分鐘
DeepSeek 于 2026 年 9 月 1 日发布了 DeepSeek Flash Vision Exp 的开放权重,距离该实验模型通过 API 首次亮相仅十天。此举将一项开发者此前只能调用的服务,转变为可供其检查、调整并自行运行的软件。然而,这次发布也带来了一个更棘手的问题:DeepSeek 所报告的基准测试提升,能否在其偏好的智能体框架之外经受独立测试。
这一时间点之所以重要,是因为这并非又一个进入拥挤产品目录的视觉模型。DeepSeek 表示,该模型在增加图像理解能力的同时,保留了 V4 Flash 的文本和智能体能力。其公布的结果显示,多个分数接近 Anthropic 的 Opus 4.8,尽管这些比较来自 DeepSeek 自己的评估设置。
因此,这次发布在开放部署与托管式多模态系统之间形成了直接竞争。开发者如今拥有一款可在自身安全边界内部运行的模型,但该仓库列出了 3050 亿参数。这一规模让本地实验原则上成为可能,同时也使实际部署超出了普通桌面硬件的承载范围。
DeepSeek Flash 从 API 转向开放权重
9 月 1 日的发布,让 DeepSeek Flash Vision Exp 从一项托管实验转变为开发者可以自行检查和运行的模型。
DeepSeek 最初于 2026 年 8 月 21 日宣布这款多模态模型。最初的发布仅限于该公司的 API 平台。开发者可以选择 deepseek-v4-flash-vision-exp 并提交混合文本与图像输入,但无法下载底层权重。
API 的推出确立了产品的预期定位。根据该公司的视觉发布公告,该模型可通过 base64 数据、外部 URL 或上传文件接收图像。它可通过 Chat Completions、Messages 和 Responses 接口使用。
DeepSeek 还随模型推出了 Files API。开发者可上传一张图像一次,获得一个 file_id,并在后续请求中重复使用该引用。当智能体需要在多个推理步骤中检查同一张截图、图表、文档页面或界面时,这可以减少重复传输。
开放发布改变了这一等式中的部署侧。官方模型仓库包含权重、配置文件、提示词格式说明和示例推理路径。该仓库采用 MIT License,并将该软件包标注为一个拥有 3050 亿参数的模型。
这一参数数量不同于原始 V4 Flash 的 2840 亿参数。DeepSeek 表示,Vision Exp 在该架构基础上增加了视觉模块,并持续训练以提升图像理解能力。该公司尚未公布足够的架构细节,无法将全部增长归因于单一组件。
该仓库支持多条常见部署路径。其文档包含 Transformers、vLLM、SGLang 和 Docker Model Runner 的示例。这些示例降低了集成门槛,但并未消除模型可观的内存和计算需求。
这一顺序很重要。DeepSeek 并未在 8 月 21 日 API 上线时开放权重。它等待了十天,形成了一段开发者可以评估模型行为、却无法检查或自行托管模型的短暂时期。
这段间隔也解释了为何 9 月 1 日的事件重新吸引关注。该模型本身并非在当天首次公布。变化的是访问方式、许可协议,以及推理运行地点的控制权。
将此次发布称为“开源”与 DeepSeek 采用 MIT 许可的仓库大体一致。不过,开发者应区分获得权重与完整了解训练数据和方法之间的差别。公开的软件包支持使用与修改,但并未记录训练过程背后的每一项决策。
这一区别构成了本文的核心张力。DeepSeek 已使模型在运营层面开放,但其许多最重要的性能主张仍依赖公司自行运行的测试。
视觉能力将快速文本模型转变为智能体平台
图像理解在这里很重要,因为智能体越来越经常遇到无法仅从文本中恢复的信息。
原始 DeepSeek V4 Flash 于 2026 年 4 月 24 日作为 V4 系列中较小的成员发布。DeepSeek 将其描述为一个拥有 2840 亿参数的混合专家模型,每个 token 激活 130 亿参数。
混合专家模型包含许多专门化的参数组,但在每个推理步骤中只激活其中一部分。与为每个 token 激活全部参数相比,这种设计可以减少计算量。
DeepSeek 将这一结构与百万 token 上下文窗口结合。该公司的 V4 公告还强调了推理、编程和工具使用能力。不过,原始 Flash 发布仍以文本为中心。
这一限制在智能体工作流中至关重要。纯文本模型可以调用 API 并操作终端,但许多真实环境通过图像传递信息。浏览器可能展示没有可访问标签的图表。远程桌面可能弹出错误对话框。扫描表单可能包含从未出现在页面文本层中的字段。
Vision Exp 为在单一模型中处理这类情况提供了路径。编程智能体可以检查失败界面测试的截图,将其与设计参考进行比较,再编辑相关组件。文档智能体可以在决定调用何种工具之前阅读扫描页面。
客服智能体可以查看客户截图,并识别应用程序状态偏离预期行为的位置。数据智能体可以检查仪表板,识别视觉异常,并查询底层数据源以进行确认。
这些示例并不意味着该模型能可靠地执行每一种工作流。它们说明了多模态性——即处理不止一种输入类型的能力——为何会改变模型的战略定位。当模型同时具备规划和调用工具的能力时,视觉并非装饰性功能。
DeepSeek 表示,Vision Exp 在纯文本智能体任务上的表现与 V4 Flash 0731 相当。如果这一结果能够独立成立,团队便无需为文本推理和视觉检查分别使用不同模型。
这种整合可以简化智能体技术栈。每次模型交接都会引入格式决策、延迟和另一个故障点。能够读取屏幕并根据所见采取行动的单一模型,可以在整个工作流中保留更多上下文。
Files API 进一步强化了这一面向智能体的设计。当智能体在较长任务中反复查看图像时,持久文件引用非常有用。视觉调试流程可能会在阅读日志或编辑代码前后检查同一张截图。
开放权重将同一工作流延伸到私有基础设施中。公司可以将内部仪表板、未发布产品或敏感文档的截图保留在自身环境内,也可以围绕现有访问控制来调整服务层。
自行托管本身并不能保证隐私。运营方仍需要安全存储、受控日志、网络隔离和审慎的数据保留政策。这次发布给予他们对这些选择更多控制权,而非自动解决方案。
对知识工作者而言,更广泛的转变是从阅读孤立文件转向结合视觉和文本证据。这一挑战同样出现在个人AI 知识库中,其中有用的上下文可能横跨笔记、文档、截图和录音。
DeepSeek 的押注是,一个模型可以跨越这些格式进行推理,同时保留 Flash 以速度为核心的定位。开放发布让开发者能够在 DeepSeek 无法控制的条件下测试这一命题。
开放部署给托管式多模态模型带来压力
DeepSeek 是通过部署自由度施加压力,而非通过已被确证的基准测试胜利。
Anthropic 的 Opus 4.8 是 DeepSeek 材料中最明确的参照点。DeepSeek 多次表示,其实验模型在多模态智能体工作上接近 Opus 4.8。这一措辞并未宣称其整体领先。
这一比较之所以重要,是因为托管式前沿模型通常将多模态推理与托管基础设施打包提供。客户获得便捷访问和由供应商管理的扩展能力,而提供商则控制权重和服务环境。
DeepSeek Flash Vision Exp 提供了不同的安排。团队可以使用托管 API、下载模型,或构建混合工作流。即使该模型无法在每项评估中胜出,这种灵活性也会带来竞争压力。
仓库报告 Vision Exp 在 Terminal Bench 2.1 上的得分为 83.9。V4 Flash 0731 为 82.7,Opus 4.8 为 85.0。Terminal Bench 评估智能体在终端环境中执行任务的表现。
在 NL2Repo 上,DeepSeek 报告 Vision Exp 得分为 57.7,而 Flash 0731 为 54.2,Opus 4.8 为 69.7。该项目中更大的差距表明,“接近”在很大程度上取决于哪类任务被赋予最高权重。
据报告,Vision Exp 在 Cybergym 上得分为 75.3。列出的比较得分分别为 Flash 0731 的 76.7 和 Opus 4.8 的 78.3。这也提醒我们,增加视觉训练并不会提升每一项文本或工具导向的基准测试表现。
DeepSWE 则呈现了相反的趋势。DeepSeek 报告 Vision Exp 得分为 59.3,Flash 0731 为 54.4,Opus 4.8 为 58.0。在这一由公司发布的结果中,Vision Exp 高于两个比较模型。
Toolathlon-Verified 产生了另一组接近的结果。仓库列出 Vision Exp 为 75.9、Flash 0731 为 70.3、Opus 4.8 为 76.2。DSBench-Hard 显示出更大差距,对应得分分别为 63.6、59.6 和 71.7。
最明显的视觉提升体现在 ApexBench Pass@1 上。Vision Exp 得分为 36.5,而以文本为重点的 Flash 0731 为 26.2,Opus 4.8 为 39.4。
DeepSeek 指出,Flash 0731 忽略了 ApexBench 输入中的多模态元素。因此,这一提升证实视觉能力有助于对抗无法妥善接收相同证据的模型。但它并未分离两个版本之间的所有其他差异。
尽管如此,这一组合仍具有竞争意义。可下载的模型不需要在每项基准测试中击败封闭服务,便能影响采购决策。它只需对一组有价值的工作负载具备足够能力。
当企业希望尽量减少基础设施工作、获得成熟的服务控制和可预测的扩展能力时,可能会偏好封闭模型。当数据位置、定制能力或避免依赖单一 API 更重要时,它们可能会偏好开放模型。
研究人员获得了另一项优势。他们可以检查失败模式、测试替代性服务配置,并在不将每一条提示词发送给原始提供商的情况下复现评估。独立团队也可以挑战基准测试的框架。
此次发布也给其他开放模型开发者带来压力。如果智能体必须与截图、图表、扫描文档或图形应用程序交互,开放文本模型如今将面临更高的基准线。
这就是为何主要竞争并不只是 DeepSeek 对阵 Anthropic,而是开放部署与托管式多模态访问之间的竞争。Anthropic 提供了基准坐标,但更深层的选择关乎谁掌控模型及其运行环境。
基准测试叙事存在明显缺口
已公布的分数是有用证据,但尚不足以构成对可靠真实世界表现的独立证明。
DeepSeek 生成了所报告的结果,并选择了评测配置。模型卡显示,其文本智能体测试使用了 DeepSeek Harness 的最小模式、最高推理强度、1.0 的温度参数,以及 top_p 值 0.95。
这些细节提升了透明度,也说明了为什么需要由其他实验室复现这项工作。当测试采用不同的 harness、工具描述、重试策略、推理预算或终止规则时,智能体结果可能发生变化。
DeepSeek Harness 是该公司的智能体框架,而 0.1.1 版本在 API 发布期间新增了对 Vision Exp 的直接支持。在该框架中取得的有利结果,可能反映的是模型本身、harness,或两者之间的交互。
这并不意味着这些分数无效,但限制了读者应从中得出的推论。这些结果描述的是在已有文档记录的 DeepSeek 配置下的表现,而非在每一种第三方智能体系统中的保证行为。
该模型的实验性标签同样值得关注。DeepSeek 将其称为 Vision Exp,而非正式可用的多模态版本。尽管权重已公开可访问,这仍表明它处于积极开发阶段。
实验性模型可能快速变化。提示词格式可能演进,推理引擎可能需要补丁,后续检查点也可能呈现不同的行为。团队应固定确切版本,而不应假定仓库名称始终代表完全相同的权重。
规模也带来了另一层不确定性。Hugging Face 标注该模型包含 3050 亿参数。即便采用低精度格式和优化后的服务方案,这仍是一项严肃的基础设施投入。
开发者可以下载开放权重,却未必拥有以经济方式部署它们的能力。多 GPU 推理、内存规划、量化和请求批处理都会影响延迟和输出质量。某个框架的支持并不保证在每种硬件布局上都能获得良好表现。
量化本身也带来了测试要求。降低权重精度可以减少内存需求,但激进压缩可能改变视觉识别或工具使用的准确性。其影响必须针对确切工作负载进行测量。
视觉智能体还继承了文本基准测试很少能解决的安全风险。图像中可能包含误导性指令、隐藏文字,或旨在重定向智能体的界面元素。能够解读像素并控制工具的模型扩大了攻击面。
当视觉证据被自动赋予权威性时,风险会进一步加大。截图可能已经过时,图表可能省略刻度,按钮可能看似安全控件,却会触发影响重大的操作。
开发者应将感知与权限分离。模型可以识别界面状态,但策略层应决定它是否能够点击、上传、删除或披露信息。高影响操作应要求确认或范围严格限定的授权。
可靠性也会因图像类型而异。读取清晰截图不同于解读手写内容、密集技术图、低分辨率扫描件,或标签相互重叠的仪表盘。
DeepSeek 的公告并未提供这些条件下的完整细分结果。仓库中的基准测试衡量的是选定的智能体任务,而不是生产系统可能遇到的所有视觉工作负载。
目前也没有依据将相近的文本分数视为与 V4 Flash 0731 在所有场景下完全持平。模型卡显示,它在一些基准上有所提升,但在 Cybergym 上出现下滑。关于“匹配”早期模型的笼统表述,可能掩盖特定任务之间的取舍。
因此,独立测试应关注分布,而不只是平均值。团队需要了解重复运行中的成功率、重试成本、完成时间以及失败严重程度。
一个只成功过一次、却经常陷入重复工具循环的模型,可能不如能力略逊但行为可预测的模型实用。生产级智能体的评判标准是完成工作流,而不是孤立的基准峰值。
开放权重为开发者带来了什么变化
实际收益在于控制权,但获得控制权也意味着开发者要承担运营责任。
MIT License 允许团队在其条款下广泛使用、修改和再分发该仓库。这使此次发布与研究人员、基础设施供应商以及构建私有智能体系统的公司都具有相关性。
开发者如今可以检查配置和提示词编码,而不必将模型视为远程端点。他们可以针对同一检查点测试系统提示词、工具 schema 和视觉预处理方案。
团队还可以基于自身工作构建受控评测集。对软件公司而言,这可能包括构建失败截图、浏览器回归问题和内部仪表盘。文档处理企业则可能使用扫描发票、合同或带批注的表单。
第一个有用的问题并不是 Vision Exp 是否领跑公共排行榜,而是它能否比团队现有模型栈更可靠地完成某个明确工作流。
可信的测试应同时包含顺利路径和对抗性案例。开发者应改变图像分辨率、裁切、压缩、杂乱程度以及无关视觉内容,也应测试图像内文字与用户请求冲突时会发生什么。
智能体评测需要工具层面的日志记录。团队应记录模型选择了哪些工具、生成了哪些参数,以及它是否能在出错后恢复。一个正确的最终答案可能掩盖不安全或高成本的执行轨迹。
重复试验很重要,因为采样会引入变化。DeepSeek 列出的设置包含非零温度参数,因此一次成功运行并不能证明完成率稳定。团队应比较多次尝试中的通过率。
延迟必须涵盖整个工作流。多模态模型可能花费更多时间编码图像、生成推理并调用工具。更快的 token 生成并不保证任务整体完成得更快。
开放部署也带来维护工作。运营者必须管理模型文件、兼容的推理软件、GPU 分配、可观测性、访问控制和更新。托管 API 隐藏了其中很大一部分负担。
最佳部署方式可能是混合式的。敏感截图可以保留在私有集群内,而敏感度较低的任务则使用托管服务。路由层可根据数据分类和任务复杂度选择模型。
不过,模型路由增加了另一套需要评测的决策系统。如果路由器错误分类图像,敏感内容可能离开预定边界。在分类仍不确定时,控制措施应默认采用限制更严格的路径。
开发者还应保留源材料。模型生成的图表描述并不能替代图表本身。保留原始图像,能让审查者将智能体的结论追溯到证据。
这类溯源在知识工作流中至关重要。当人们结合笔记、截图和文档时,知识融合在每项主张都与其来源保持关联的情况下会更可信。
对于规模较小的团队,模型体量可能使实验更倾向于托管推理服务商或共享集群。即使一家公司无法自行托管整个模型,开放权重也扩大了供应商选择范围。
这依然会改变谈判能力。可在多个服务环境中使用的模型,比只能通过单一专有端点访问的检查点带来的依赖更少。
此次发布也可能加速优化变体的发展。社区开发者可以探索量化和推理改进,硬件供应商则可为其系统调优服务路径。每一种衍生版本都需要独立进行质量评估。
因此,开放访问创造了更广泛的实验空间,但并不意味着每一种由此产生的部署都等同于 DeepSeek 的参考配置。
三个信号将决定此次发布是否重要
独立复现、实用的服务方案以及稳定的后继版本,将决定 Vision Exp 是成为基础设施,还是停留在一个有趣的检查点。
第一个信号是独立复现基准测试。研究人员需要在相同的智能体任务上运行发布的权重,并记录其 harness、提示词、预算和重试策略。
若能复现所报告的分数,将加强 DeepSeek 关于视觉能力提升源于模型而非其私有评测环境的论据。若结果显著更低,则会削弱其与 Opus 4.8 的比较。
最有价值的测试将超出已公布的基准集合。它们应包括视觉浏览器操作、图表读取、文档检查以及工具故障后的恢复。安全评测则应测试嵌入图像中的指令。
第二个信号是实用服务配置的出现。仓库已记录 vLLM、SGLang、Transformers 和 Docker 路径,但仅有支持并不能证明可实现的吞吐量。
运营者需要经过验证的配置,具备明确的硬件要求、稳定的批处理能力,以及量化后的质量测量结果。社区报告应包含完整设置,而非孤立的速度数字。
如果优化后的部署能够保留视觉和智能体性能,这个开放模型就会与更多组织相关。如果有用的推理需要异常庞大的集群,其影响仍将集中在资源充足的团队中。
第三个信号是 DeepSeek 的下一次发布决策。实验性标签引出了多个问题:Vision Exp 是否会成为稳定的 Flash 变体、并入主模型,或被另一个检查点替代。
如果推出具备更完整文档的正式可用版本,将强化其适用于生产部署的理由。如果在缺乏迁移指导的情况下被迅速替换,则会加强这样一种看法:该检查点主要属于评测环境。
开发者也应关注 DeepSeek 是否会发布更完整的技术报告。当前仓库解释了总体设计和评测设置,但许多训练和架构细节仍未披露。
关于视觉模块、数据构建、安全测试和已知限制的更清晰文档,会让独立分析更容易。沉默不会抹去这些权重的实用性,但会保留模型为何如此表现的不确定性。
竞争对手的回应提供的是辅助证据,而不是主要结论。其他开放模型开发者可能以可下载的多模态智能体模型回应,托管服务提供商则可能强调可靠性、安全控制和更简单的部署。
这种回应将显示开放多模态访问是否正成为一项基准预期。但它本身并不能确定哪种模型最适合某个具体组织。
核心判断应保持聚焦。DeepSeek 在仅通过 API 首发后,发布了采用 MIT License 的权重,移除了一项重要的访问壁垒;它并未消除独立验证的必要性。
开发者如今已具备进行这种验证的条件。他们可以在自己的 harness 中、针对自己的图像、结合自己的工具和安全策略运行 DeepSeek Flash Vision Exp。
因此,下一步应当务实:选择一个视觉证据确实会阻碍纯文本代理完成的工作流,然后在多次重复运行中衡量完整任务的可靠性。记录失败情况、基础设施需求和不安全操作,而不要只追踪最终答案。
如果这些测试复现了 DeepSeek 报告的提升,9 月 1 日的发布将标志着开放多模态代理能力的一次重大扩展。即使未能复现,开放权重仍将发挥重要作用,让这一差距变得清晰可见。


