top of page

Google DeepMind 发布三款全新 Gemini 模型,但不包括 3.5 Pro

7月22日
讀畢需時 16 分鐘

Google DeepMind 于 7 月 21 日发布了三款全新 Gemini 模型,但备受期待的 Gemini 3.5 Pro 并不在其中。Google 推出的是 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite,以及一款名为 Gemini 3.5 Flash Cyber、使用受限的网络安全模型。

此次发布为开发者运行 AI 智能体提供了速度更快、专业性更强的选择,同时也形成了一个尴尬的反差。Google 正在改进为高频、低成本任务设计的模型,而其下一代旗舰模型仍处于合作伙伴测试阶段。

这一缺席值得关注,因为 Google 此前曾表示,Gemini 3.5 Pro 将在 Gemini 3.5 Flash 之后推出。此次发布前刊登的一篇模型延期报道称,这款旗舰模型已比原计划晚了数月,据报道,编程性能是其中一个问题。

在此延期期间,OpenAI 和 Anthropic 持续推进各自的编程模型和智能体模型。Google 如今拥有更强大的部署产品组合,但仍缺少在高端市场作出直接回应所需的旗舰模型。

因此,核心问题远不只是某项基准测试提高了几个百分点。Google DeepMind 发布三款全新 Gemini 模型却没有发布 3.5 Pro,是因为实际效率正成为一种竞争优势。然而,效率无法完全取代前沿性能,尤其是对于正在为高难度自主工作选择模型的开发者而言。

Google DeepMind 发布三款全新 Gemini 模型,但不包括 3.5 Pro

Google 此次发布增强了 Flash 系列,但其最显眼的产品缺口仍未解决。

新的产品阵容将生产工作负载分配给三款定位不同的模型。Gemini 3.6 Flash 面向复杂编程、多模态分析和多步骤智能体;Gemini 3.5 Flash-Lite 专注于高吞吐量任务;Gemini 3.5 Flash Cyber 则在 Google 的 CodeMender 安全智能体中负责漏洞研究。

根据 Google 的 Gemini 模型公告,在 Artificial Analysis Index 中,Gemini 3.6 Flash 使用的输出 token 比 Gemini 3.5 Flash 少 17%。输出 token 是模型收到请求后生成的文本和结构化数据。

Token 效率非常重要,因为智能体很少只调用一次模型。它可能需要检查文件、规划更改、运行工具、评估结果,并重复执行失败的步骤。在漫长的工作流中,每次交互的用量减少都可能累积成显著优势。

Google 表示,在多阶段任务中,Gemini 3.6 Flash 还需要更少的推理步骤、工具调用和对话轮次。这一说法回应了 AI 智能体的一个常见问题:模型的单次请求看似便宜,但当它不断修改计划时,成本可能迅速上升。

该公司报告称,与 Gemini 3.5 Flash 相比,新模型在多项基准测试中有所提升。在评估软件工程工作的 DeepSWE 上,据称分数从 37% 上升至 49%;MLE Bench 从 49.7% 提升至 63.9%;OSWorld-Verified 则从 78.4% 提升至 83%。

这些数据来自 Google 的发布材料,应被视为供应商自行报告的结果。基准测试有助于比较受控任务,但无法全面衡量模型在公司的代码库、文档集合或内部审批流程中的可靠性。

新模型现已通过 Gemini API 全面开放。它也已登陆 Google AI Studio、Android Studio、Gemini 应用和多款企业产品。Google 已将其设为 Gemini Managed Agents 中 Antigravity 智能体的默认模型。

Gemini 3.5 Flash-Lite 承担着不同的角色。Google 将其描述为 Gemini 3.5 系列中速度最快的模型,在 Artificial Analysis Index 中达到每秒输出 350 个 token。它面向文档提取、结构化数据处理、智能体搜索和轻量级子智能体集群。

Google 表示,Flash-Lite 在 Terminal-Bench 2.1 上的成绩从 31% 提升至 54%。该公司还称,这款模型在长上下文评估和现实任务执行方面取得了进步。模型支持不同的思考级别,使开发者可以在最低限度推理和更深入的多步骤处理之间进行选择。

两款通用模型均支持超过一百万输入 token 的上下文窗口。上下文窗口是模型在一次交互中可以处理的材料总量。根据 Gemini API 规格,它们的最大输出长度为 65,536 个 token。

即使没有 Gemini 3.5 Pro,这些能力也使此次发布颇具分量。Google 已推出两款可用于生产环境的模型和一个专业安全系统。然而,旗舰模型的缺席改变了外界解读这则公告的方式。

Google 表示,Gemini 3.5 Pro 正在与合作伙伴进行测试,并将在准备就绪后广泛开放。该公司还透露,Gemini 4 已开始预训练。不过,这两项声明都没有给出这款延期模型的发布日期。

这给开发者留下了明确的产品更新,以及一个尚未解决的战略问题。Google 现在可以高效处理更多常规智能体任务,但其最强大的下一代模型仍未全面开放。

AI 模型竞赛正从提供答案转向完成工作

Gemini 3.6 Flash 反映出一种市场趋势:完成整个工作流的成本,比生成一次回复的成本更加重要。

早期的模型发布往往聚焦于综合知识测试、数学成绩或聊天机器人对比。如今,生产环境中的买家更关注智能体能否完成任务,而不会因不必要的调用陷入失控循环。

这一变化有利于在智能水平、延迟和行为可预测性之间取得平衡的模型。如果一个略弱的模型能够快速完成常见工作并避免反复纠错,它可能更加实用。如果每个工作流都需要漫长的推理过程和昂贵的重试,那么更强大的模型也可能变得不切实际。

Gemini 3.6 Flash 正是围绕这一区别设计的。Google 不仅声称其基准测试成绩更高,还强调了更少的意外代码修改、更短的执行循环和更低的 token 消耗。

这些改进针对的是开发者可以直接观察到的问题。修改无关文件的智能体会增加审查工作;持续调用工具的智能体会提高延迟;生成冗长解释的智能体则可能在没有推动任务进展的情况下消耗资源。

Google 的文档还表示,该模型在编辑代码前更常运行诊断脚本。这种行为可以提高复杂技术工作的准确性,因为模型会先收集证据,再选择修复方案。

但其中也存在取舍。同一份文档警告称,对于简单的前端任务,预先检查可能会增加不必要的步骤。尽管 Gemini 3.6 Flash 生成的代码功能更完善,但在人类评估者看来,较早的模型在某些视觉样式工作中表现更佳。

这一限制十分重要。Google DeepMind 在效率主张需要接受工作负载级测试之际发布了三款全新 Gemini 模型,却没有发布 3.5 Pro。模型的整体表现可以有所提升,但同时可能变得不太适合特定的设计、写作或低复杂度任务。

Gemini 3.5 Flash-Lite 进一步扩展了效率战略。它可以作为能力更强的协调模型下属的工作模型。一个智能体可以规划任务,同时由多个 Flash-Lite 实例提取记录、检查文档或测试候选输出。

这种架构更像一个工作团队,而不是传统聊天机器人。协调模型负责处理模糊决策,较小的工作模型并行执行边界明确的任务,随后系统再整合它们的结果。

Google 通过一个案例展示了这种方式:将 Gemini 3.6 Flash 与 Flash-Lite 子智能体搭配,生成多个网页设计方案。该公司还重点介绍了收据处理、大规模产品特征提取和文档分析等潜在工作负载。

其商业吸引力非常直观。企业无需在每个步骤中都使用能力最强的模型,而是需要一个能为每个步骤分配适当智能水平,同时又不失去整体流程控制的系统。

OpenAI 也采用了类似的产品组合策略。其 GPT-5.6 系列包含多款模型,分别面向智能水平与效率之间的不同平衡。Anthropic 同样将旗舰级推理与速度更快、适合高频编程和办公任务的模型区分开来。

因此,Google 扩展 Flash 产品线是具有竞争性的常规举措,而非异乎寻常的选择。区别在于时机:当竞争对手已全面推出更新的旗舰模型时,Google 仍在拓展其高效模型产品组合。

Google 的企业 AI 业务承受着最大压力。买家在比较平台时,希望获得强大的编程、计算机操作、多模态理解、安全控制能力和可预测的运营成本。他们还希望确信供应商的旗舰产品路线图能够始终跟上市场发展。

Gemini 3.6 Flash 回应了这一等式中的运营需求,而 Gemini 3.5 Pro 的缺席则使产品路线图仍不够明朗。

缡席的 3.5 Pro 才是真正的重点

Google 的三模型发布展现了其在生产级 AI 方面的执行力,但无法抹去其旗舰模型延期的报道。

Gemini 3.5 Pro 原本被期待成为 Google 在 3.5 代产品中最强大的通用模型。它将竞争那些更看重深度推理和编程能力,而非单纯速度的任务。

Bloomberg 的一篇报道指出,由于 Google 正在努力改进该模型,尤其是其编程能力,因此进度已落后数月。该报道援引了知情人士的消息,而非 Google 公开发布的技术信息。

Google 目前只确认 Gemini 3.5 Pro 正在与合作伙伴进行测试。其公告称,公司将在模型准备就绪后广泛发布。这种表述回避了新的日期,也为 Google 继续开发保留了空间。

此次延期之所以变得更加重要,是因为编程已成为检验前沿模型的核心项目。编程智能体必须理解大型代码仓库、规划更改、操作工具、从错误中恢复,并保留现有行为。这些要求会暴露简短基准测试提示可能掩盖的弱点。

模型或许能够编写一个看似合理的函数,却难以完成涉及整个代码仓库的迁移;它可能识别出错误,却编辑了错误的文件;它可能生成有效代码,却没有测试周边系统。

据 Google 称,Gemini 3.6 Flash 改进了这一工作流的多个环节。它的进步并不一定能反映 Gemini 3.5 Pro 的状态。两款模型的性能目标不同,也可能采用不同的训练或后训练方法。

不过,Flash 的发布为 Google 提供了一种让开发者继续保持参与的切实方式。团队无需等待旗舰模型,即可测试新 API、更新智能体系统并评估 token 效率。

它还让 Google 能够获得更多关于智能体现实行为的反馈。Gemini 3.6 Flash 部署中呈现的规律,可以为未来模型提供参考,尤其是在工具使用、代码修改和长时间交互导致故障的场景中。

风险在于,开发者可能会在 Gemini 3.5 Pro 推出前作出长期的平台选择。智能体系统所需的远不只是更改模型标识符。团队会围绕供应商模型的行为构建评估套件、权限边界、监控机制、提示词和恢复逻辑。

一旦这些系统投入运行,切换平台就会变得困难。因此,旗舰模型延期带来的影响不只是发布当天的关注度。它还可能影响开发者为下一个生产工作流选择哪个平台。

OpenAI 较新的旗舰模型系列加剧了这种压力。Anthropic 的编码产品提供了另一种成熟的替代方案。对于倾向于在自有基础设施中运行模型的组织来说,开放权重模型又带来了另一项挑战。

Google 拥有多项优势。它掌控着广泛使用的开发者工具、云基础设施、Android、Search,以及一款拥有庞大用户群的消费级 AI 产品。Gemini 可以通过大多数模型提供商无法企及的分发渠道触达用户。

然而,对于构建高级智能体的开发者而言,分发能力并不能保证他们会优先选择某款模型。这些团队通常会逐项任务选择模型。他们可以使用一家提供商处理常规文档工作,再使用另一家处理高难度编码任务。

这就是为什么不能将此次缺席视为一个命名细节。Google DeepMind 发布了三款新的 Gemini 模型,却没有发布 3.5 Pro,而当前市场正在同时奖励高效的执行模型和能力强大的协调模型。

Gemini 3.6 Flash 巩固了 Google 在执行模型和中端市场的地位。Gemini 3.5 Pro 仍需证明,Google 能够引领同一系统中最具挑战性的层级。

Gemini 3.5 Flash Cyber 让专业化成为更大的押注

这款网络安全模型表明,Google 将专业化智能体系统视为实现前沿级成果的另一条路径。

Gemini 3.5 Flash Cyber 基于 Gemini 3.5 Flash 构建,并经过微调,可用于发现、验证和修补软件漏洞。它最初将通过 Google DeepMind 的安全智能体 CodeMender 运行。

与 Gemini 3.6 Flash 和 Flash-Lite 不同,这款网络安全模型不会广泛公开发布。由于漏洞发现显然既可用于防御,也可用于攻击,Google 计划仅面向政府和可信合作伙伴开展有限试点。

这一部署决定反映了一个棘手的现实。能够帮助维护人员发现缺陷的模型,也能帮助攻击者在补丁发布前定位弱点。扩大访问范围既会增加潜在防御者的数量,也会增加潜在滥用者的数量。

Google 的网络安全模型详情介绍了 CodeMender 如何在一次调查中多次调用这款专业模型。不同的智能体分别探索代码路径、验证潜在漏洞,并将各自的工作整合为最终报告。

这种方法将效率转化为一种技术机制,而不仅仅是预算上的优势。漏洞研究涉及庞大的搜索空间。更快的模型可以在相同的运行时间窗口内检查更多路径并检验更多假设。

在 CyberGym 基准测试中,Google 将 CodeMender 配置为针对一份最终报告最多调用 Gemini 3.5 Flash Cyber 五次。该公司表示,由此构建的智能体取得了可与规模大得多的模型相媲美的表现。

Google 也说明了一项重要限制。该基准测试中的竞争对手结果来自各提供商自行报告的分数。工具、提示词和智能体脚手架方面的差异都可能影响比较,因此不应将这一结果解读为严格控制条件下、仅针对模型能力的排名。

该公司还在 Chrome 的生产环境提交扫描流水线上测试了这款模型。这些漏洞此前尚未公开披露,从而降低了测试材料曾出现在训练数据中的风险。

在另一项涉及 V8 JavaScript 引擎的评估中,Google 表示 Flash Cyber 发现了 55 个已确认问题。主线版 Gemini 3.5 Flash 发现了 47 个,而 Claude Opus 4.6 发现了 36 个。这款专业模型识别出了 10 个两款对比模型均未发现的问题。

这些发现由公司自行报告,独立研究人员尚未复现完整评估。Google 还指出,由于安全控制机制,较新的竞争对手模型拒绝执行部分任务,这使直接比较能力变得更加复杂。

即便存在这些限制,Flash Cyber 仍体现了一项意义重大的转变。针对某项狭窄任务的最佳结果,可能来自较小型专业模型、重复调用和精心设计的智能体三者的结合。

这一理念挑战了“每个难题都需要使用现有最大通用模型”的假设。专业模型可以将自身能力集中于单一领域,而外围系统则负责提供工具、协调和验证。

受限试点也揭示了专业化背后的取舍。Google 可以让选定的防御者获得先发优势,但大多数开发者无法测试这款模型。外部研究人员评估误报、漏检漏洞或滥用防控措施的机会也将十分有限。

因此,政府和可信合作伙伴将塑造有关其实用价值的第一批证据。他们的实际结果将比基准测试图表更重要,尤其是在 CodeMender 能够发现并帮助修复此前未知缺陷的情况下。

这款模型能否成功将取决于完整的安全工作流。发现可疑代码路径只是第一步。一个实用的系统必须确认漏洞、提出安全的补丁、避免引发回归问题,并向人工维护人员清晰传达证据。

因此,Flash Cyber 不只是此次发布中附带的第三款模型。它是 Google 最明确的论证:模型专业化与智能体编排能够弥补通用模型的局限。

Google 的基准测试提升仍需生产环境验证

此次发布提供了可信的进步迹象,但 Google 的测量结果无法回答开发者面临的所有问题。

基准测试的提升提供了一个有用的起点。DeepSWE 测试编码行为,OSWorld 评估计算机操作能力,而长上下文测试则衡量模型能否从大量输入中找回信息。

每项基准测试都只单独衡量性能的一个切面。生产环境中的智能体则会同时结合多个切面。它们必须遵循指令、维护状态、选择工具、处理权限,并在任务完成时停止。

在这些工作流中,较小的失败率也可能不断累积。即使智能体在大多数单独步骤中都能成功,当一项任务需要数十个相互依赖的操作时,它仍可能频繁失败。

Token 减少也需要谨慎解读。输出 token 更少可能意味着模型更加专注,减少了无效推理;也可能意味着解释不完整、跳过检查或报告过短。

Google 自己的文档指出了特定工作负载中的弱点。Gemini 3.6 Flash 在处理简单的前端请求时,可能会执行额外的诊断工作。对于某些视觉布局和样式设计任务,人工评估者更偏好早期模型。

这些披露让此次发布更具参考价值,因为它们能帮助开发者设计符合现实情况的评估。同时,它们也说明了为什么单一的综合排名无法决定哪款模型最合适。

团队应使用来自实际环境的完整任务进行测试。对于编码,这意味着在仓库级别进行更改,并配合测试和人工审查。对于文档分析,这意味着使用真实的文件格式、图表、不完整记录和相互冲突的证据。

对于计算机操作,评估应包括从页面中断、界面变化和控件含义模糊等情况中恢复的能力。在稳定基准测试中表现良好的模型,可能会在网站毫无预警地发生变化时陷入困境。

组织还需要衡量不必要的操作。每一次额外的工具调用都可能增加延迟或风险。相比聊天机器人,有权编辑文件、发送消息或访问客户信息的智能体需要更严格的边界。

新 API 也带来了迁移工作。Google 表示,开发者必须移除若干已弃用的采样参数和预填充模型轮次。部分应用需要改变其维护多轮对话的方式。

这些变更是可控的,但会增加即时比较的复杂性。将现有应用迁移至 Gemini 3.6 Flash 的团队,可能会同时评估模型质量和 API 行为。

17% 的 token 减少同样需要谨慎看待。这一数据来自 Google 引用的外部指数,但实际收益会因提示词、工具和思考设置而异。简洁的编码智能体与详细的研究助手可能呈现不同的节省幅度。

Gemini 3.5 Flash-Lite 还带来了另一项评估挑战。它的高吞吐量对文档处理很有吸引力,但速度本身并不能证明提取准确性。在数千份文档中重复出现的错误,日后检测起来可能代价高昂。

企业应衡量字段级准确率、引用质量和异常率。它们还应跟踪是否需要更大的模型反复纠正 Flash-Lite 的工作。如果协调模型必须重做每一个棘手案例,那么快速执行模型就会失去优势。

同样的原则也适用于 Flash Cyber。多次模型调用可以扩大搜索空间,但也可能产生重复或低质量的发现。人工安全团队需要证据来确认整合后的报告能够优先呈现真实漏洞。

这些担忧均不意味着 Google 的主张无效。它们定义了模型发布之后需要开展的验证工作。

Gemini 3.5 Pro 的缺席又增加了一项不确定性。开发者尚不清楚 Google 的下一款旗舰模型是否会保留这些效率提升、使用兼容接口,或需要再次进行系统调优。

Google DeepMind 发布了三款新的 Gemini 模型,却没有发布 3.5 Pro,这为团队提供了当下可用的产品,也留下了一份不完整的未来路线图。最有力的应对方式既不是立即采用,也不是一概否定,而是针对真正重要的工作负载进行受控测试。

三个信号将决定 Google 的策略能否奏效

下一阶段将由 3.5 Pro 的发布、真实的智能体经济效益,以及受限网络安全试点提供的证据决定。

第一个信号是 Gemini 3.5 Pro 的可用性和质量。Google 表示合作伙伴测试正在进行中,但尚未承诺公开发布日期。

如果能在未来几个月内广泛发布,并得到出色的编码和智能体评估结果支持,那么当前延迟的重要性将会降低。这将使 Google 能够把高效的执行模型组合与当前一代旗舰协调模型结合起来。

如果再次延期,则会强化相反的解读:与实现产品线顶端的下一次性能跃升相比,Google 更有把握优化现有 Flash 模型。

第二个信号是 Gemini 3.6 Flash 和 Flash-Lite 在生产环境中的表现。开发者应关注任务完成率、工具调用次数、延迟、非预期编辑以及纠错需求。

如果团队能够以更少的重试完成更多工作,Google 关于效率的论点将变得更有说服力。届时,17% 的 token 减少将代表智能体经济效益得到更广泛的改善,而不仅仅是输出变短。

如果应用需要更多监督或重复调用,那么基准测试和 token 方面的提升就不会显得那么具有决定性。真正关键的衡量单位是已经完成并通过验证的任务。

这一区别将影响编码、研究、文档处理和客户运营等领域的采购决策。企业买家越来越倾向于评估完整工作流,而不是孤立地评估模型响应。

第三个信号是 Gemini 3.5 Flash Cyber 试点提供的证据。Google 将有限访问定位为一项安全措施,使防御者能够获得早期优势。

如果可信用户能够发现有意义的漏洞、生成可靠的补丁,并通过负责任的安全流程披露结果,那么这一主张将获得支持。来自真实代码库的证据将验证这种专业化、多智能体设计。

如果结果仍局限于厂商基准测试,这一论点就会减弱。如果误报令审查人员不堪重负,或访问限制阻碍可信的外部评估,它也将面临质疑。

竞争对手的回应将影响所有三个信号。OpenAI 和 Anthropic 可以通过改进其较小的模型来削弱 Google 的效率优势。开放权重提供商可以通过提供更大的部署控制权,对所有闭源平台施加压力。

Google 的分发能力仍是一项重要资产。新模型可以通过开发者熟悉的工具触达开发者,也可以通过 Gemini 和 Search 触达消费者。广泛的可用性为 Google 提供了庞大的反馈和迭代基础。

然而,分发能力并不能解决旗舰模型的问题。构建复杂智能体的开发者通常会比较多家提供商,并将任务分配给不同的模型。只有当 Gemini 的完整系统在其工作负载上表现更出色时,他们才会选择 Gemini。

对于知识工作者而言,此次发布也提醒我们:模型选择只是构建可靠 AI 工作流的一部分。提供给智能体的信息、智能体的权限,以及其引用证据的能力同样重要。

通过知识融合整理工作上下文的工具,可以帮助用户在文档和笔记之间维护这一证据层。底层模型可能会改变,但可访问上下文的质量仍会影响结果。

Google DeepMind 发布了三款新的 Gemini 模型,却没有发布 3.5 Pro,这是因为该公司在旗舰模型完成之前已经准备好了一些实用的改进。这是一个合理的产品决策,但并非完整的战略答案。

未来几个月将揭晓 Google 是建立了持久的效率优势,还是只是在完成 Gemini 3.5 Pro 的过程中争取了时间。开发者应立即测试这些模型,记录任务级别的结果,并在缺席的旗舰模型最终发布后再次进行比较。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page