Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,将速度与专业化拆分
- Aisha Washington

- 10小时前
- 讀畢需時 14 分鐘
Google DeepMind 于 7 月 21 日发布了三款 Gemini 模型,在通用智能体、大规模自动化和受限网络安全工作之间划出了更清晰的界线。Google DeepMind 此次发布的 Gemini 3.6 Flash 包括旗舰 Flash 模型、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。尽管它们的版本号非常接近,但三者共同体现出的战略转变要大得多。
Gemini 3.6 Flash 面向编码、多模态分析和长时程智能体工作流。Flash-Lite 负责需要低延迟和高吞吐量的重复性任务。Flash Cyber 用于查找和修复软件漏洞,但初期不会在公开的 Gemini API 中提供。
这种拆分给 OpenAI、Anthropic、xAI 以及其他争夺生产工作负载的模型提供商带来了压力。它也对开发者应将所有任务交给一个高能力模型的假设提出了挑战。Google 转而推广一种模型组合,由协调模型将范围更窄的任务委派给速度更快或更专业的系统。
这一战略仍存在尚未解决的矛盾。Google 展示了更出色的基准测试结果和更低的 token 消耗,但许多数据来自其自身测试。Cyber 模型也说明了为什么更广泛的可用性并不总是目标。一个经过训练、能够发现可利用缺陷的系统既能帮助防御者,也会带来严重的滥用风险。
Google DeepMind 发布 Gemini 3.6 Flash,改变 Flash 产品阵容
Google 正在将 Flash 从单一模型类别转变为适用于不同工作类型的分层系统。
Gemini 3.6 Flash 目前占据核心位置。Google 将其描述为一款面向复杂智能体和多模态任务的模型,尤其注重编码和知识工作。智能体任务是一种多步骤流程,其中软件会规划行动、调用工具并评估中间结果。
该模型可接收文本、图像、视频、音频和 PDF 文件。其模型文档列出的上下文限制为 1,048,576 个 token,最大输出为 65,536 个 token。这样的上下文容量使开发者能够在一次请求中提交大型代码仓库、文档集或长篇交互历史。
Gemini 3.6 Flash 还支持函数调用、代码执行、结构化输出、搜索溯源、文件搜索和 URL 上下文。计算机操作功能仍处于预览阶段。该模型不支持原生图像生成、音频生成或 Google 的 Live API。
第二款发布的模型 Gemini 3.5 Flash-Lite 针对的是另一种生产约束。它专为响应速度和请求量比在每个步骤中都使用最强模型更重要的任务而设计。
Google 将智能体搜索、文档处理、结构化提取和自主子智能体工作列为预期用途。子智能体是一个规模较小的委派流程,负责完成大型工作流中的某一部分。示例包括翻译收据、提取商品目录属性或并行评估多个设计方案。
第三款模型受到的控制最为严格。Gemini 3.5 Flash Cyber 基于 Gemini 3.5 Flash,并经过微调,可发现、验证和修补软件漏洞。Google 计划通过其托管式安全智能体 CodeMender 提供该模型,而不会开放不受限制的 API 访问。
因此,这三款模型并不构成简单的能力阶梯。Flash-Lite 不只是较弱的 3.6 Flash,Flash Cyber 也不只是另一款通用聊天机器人。每款模型都对 AI 推理应在工作流中的哪个位置进行这一问题给出了不同答案。
这种差异构成了本文的核心矛盾。Google 希望开发者评估整个智能体任务的成本和完成率,而不是每次只比较单个模型的孤立响应。
效率正在成为一个系统设计问题
Gemini 3.6 Flash 背后的重要主张是,减少步骤与加快单次响应同样重要。
即使每次请求看起来都很高效,AI 智能体仍可能消耗大量资源。它可能反复检查相同的文件、修改原本正确的代码,或在无法改善答案的情况下调用工具。这些循环会增加延迟,并提升生成文本的数量。
Google 表示,在 Artificial Analysis Intelligence Index 上,Gemini 3.6 Flash 消耗的输出 token 比 Gemini 3.5 Flash 少 17%。据该公司称,它在多步骤工作流中使用的推理步骤和工具调用次数也更少。
这是一个具有实际意义的设计目标,因为智能体成本会在整个执行路径上不断累积。如果一个模型进行了不必要的调用,那么即使它生成的 token 更少,表现仍可能不佳。反过来,如果一次稍慢的响应能够避免下一轮调试,那么它也可能产生更好的结果。
Google 的开发者迁移指南称,3.6 Flash 减少了不必要的文件更改,并缓解了执行循环失控问题。指南还称,该模型在诊断工作期间能更好地遵循指令。这些行为对于编码智能体非常重要,因为一次不必要的编辑可能引发测试、审查和进一步修正。
据报道,该模型倾向于在修改代码之前运行诊断脚本。由于智能体会先收集证据,这种行为可以改善其处理复杂任务时的决策。Google 承认,在较简单的前端任务中,同样的习惯可能增加探索步骤。
这一限定值得关注。智能体效率并非单一指标,一项基准测试也无法涵盖所有生产环境。有些团队优先考虑即时响应,另一些团队则更重视在较长工作流中减少失败。
Gemini 3.5 Flash-Lite 更直接地满足了第一种需求。Google 报告称,在 Artificial Analysis 的测试中,该模型每秒可生成 350 个输出 token。该公司将其定位为 Gemini 3.5 系列中速度最快的成员。
仅有速度并不能保证生产系统真正有用。如果快速模型的输出需要反复验证,反而可能制造更多工作。因此,Google 强调了它相较于早期 Flash-Lite 版本在编码、长上下文检索和计算机操作基准测试上的改进。
Google 报告称,Flash-Lite 在 Terminal-Bench 2.1 上的得分为 54%,而 Gemini 3.1 Flash-Lite 为 31%。Terminal-Bench 衡量智能体在终端环境中完成任务的能力。
在 GDM-MRCR v2 上,Google 报告新旧两款 Flash-Lite 模型的得分分别为 72.2% 和 60.1%。这项评估测试模型能否从包含多个隐藏目标的长上下文中检索相关细节。
这些结果支持了 Google 的效率论点,但仍取决于具体工作负载。一个从发票中提取固定字段的团队,与要求智能体诊断分布式系统故障的团队有着不同需求。因此,正确的比较方式并不只是模型与模型之间的比较。
开发者必须在工作流层面衡量完成率、总调用次数、验证工作量和延迟。这种方法还需要更强的可观测性。团队需要了解智能体为何选择某个工具、重复某个步骤,或将工作升级交给另一个模型。
Google 押注模型路由,而非一个模型包办所有任务
当前的主要竞争已成为一种系统设计选择:使用一个通用模型,还是使用经过路由的专业模型组合。
Google DeepMind 此次发布 Gemini 3.6 Flash,明确凸显了这种选择。Gemini 3.6 Flash 可以充当协调模型,而 Flash-Lite 则执行大规模子任务。Flash Cyber 为防御性安全工作增加了一条专业化路径。
这类似于经理与专家的结构。经理负责理解目标、分解任务并检查结果。专家则处理范围明确的任务,在这些任务中,其速度、调优或访问控制能够带来优势。
Google 通过一个示例展示了这种模式:3.6 Flash 在生成多个网页设计概念时负责协调 Flash-Lite。Flash-Lite 还可以处理商品目录、翻译收据和总结文档。这些示例展示的是并行执行,而非单次对话式交互。
对开发者而言,路由带来了新的决策。系统必须确定每项任务交给哪个模型、哪些上下文随任务传递,以及何时需要审查结果。糟糕的路由可能会抵消所承诺的效率优势。
轻量级模型可能会遗漏隐藏在代码库其他位置的依赖项。协调模型检查答案所消耗的资源,也可能超过委派任务所节省的资源。当路由层压缩或重组信息时,上下文传递还可能丢失细节。
即使产品封装方式有所不同,OpenAI 和 Anthropic 也面临着相同的广泛生产挑战。它们的模型同样支持工具使用、编码智能体和扩展推理。竞争的关键在于,哪家提供商能够最有效地帮助开发者控制完整的执行流程。
原始基准测试领先地位仍然重要,但已不再足够。生产环境采购者必须考虑工具可靠性、延迟一致性、上下文处理、安全控制、监控和模型生命周期策略。一个在演示中运行良好的智能体,在大规模部署时仍可能变得难以运维。
Google 的分发能力进一步增强了这一战略的分量。Gemini 3.6 Flash 和 Flash-Lite 可通过 Google AI Studio 和 Android Studio 中的 Gemini API 使用。Google 还通过其企业智能体平台和面向消费者的 Gemini 应用提供这两款模型。
Flash-Lite 正逐步进入 Google Search,而 Gemini 3.6 Flash 可通过 Google Antigravity 使用。这种分发方式使 Google 能够在消费者、开发者和企业场景中测试同一模型系列。
该公司还将 Gemini 3.6 Flash 设为其 Antigravity 智能体的默认模型。这一变化为 Google 的主张提供了一项重要的内部检验。默认智能体产生的使用方式比基准测试套件更多样,也更容易暴露长工具调用序列中的问题。
模型组合也可能使采购过程更加复杂。企业可能需要为每款模型及每种路由组合制定单独的评估策略。安全团队必须审查智能体之间传输的数据、它们能够调用的工具,以及每项输出的记录方式。
知识工作者也面临着类似问题。当多个智能体处理同一份材料时,输出会变得更难追溯。可搜索的AI 知识库可以保留来源上下文,但无法消除对模型级审计记录的需求。
如果路由比迫使所有工作负载都通过一个模型更容易,Google 的战略就会成功。如果开发者将节省下来的成本都花在评估、编排和错误恢复上,这一战略的优势就会减弱。
Gemini 3.5 Flash Cyber 测试开放访问的边界
Flash Cyber 表明,专业化可以增强能力,同时也会缩小适合获得该能力的用户范围。
网络安全模型服务于一个具有双重用途的领域。识别易受攻击代码路径的同一种能力,也可能帮助攻击者找到可利用的目标。一个有用的防御模型必须能够分析弱点,同时不让攻击性滥用变得更加容易。
Gemini 3.5 Flash Cyber 经过微调,专门用于发现、验证和修复软件漏洞。在 CodeMender 中,多个 Flash Cyber 智能体会检查同一个问题,并生成一份合并报告。这种方法采用反复的专业化分析,而不是仅凭单次分析结果作出判断。
Google 表示,该模型在 CyberGym(一个面向漏洞研究智能体的基准测试)上达到了具有竞争力的表现。不过,该公司尚未提供足够的公开证据,无法将基准测试表现视为该模型能够在陌生软件项目中可靠部署的证明。
其可用性计划反映了这种不确定性。Flash Cyber 最初将通过 CodeMender 试点项目,仅向政府和可信合作伙伴开放。它不会像 3.6 Flash 和 Flash-Lite 那样,成为普遍可用的 Gemini API 模型。
Google 表示,这种受控发布方式应能让防御者获得先发优势,同时减少更广泛的滥用。DeepMind 的安全负责人将这种做法描述为对该技术双重用途属性的有意回应。
这次网络安全版本发布还表明,Google 预计将把该模型扩展到红队工作和更广泛的企业防御领域。红队测试是指通过获得授权的攻击尝试来暴露系统的安全弱点。
这种扩展将同时增加实用性和风险。一个能够提出补丁建议的防御性扫描器,可以被限制为仅访问组织自身拥有的代码仓库。红队智能体则需要具备更广泛的进攻性推理能力,这会带来更加棘手的访问控制问题。
CodeMender 充当了一个隔离层。Google 可以决定谁有权访问、限制支持的活动、监控使用情况,并通过托管服务合并分析结果。这种方式比直接分发模型权重或不受限制的 API 凭据更具可控性。
但它也限制了独立审查。当访问范围仍然狭窄时,外部研究人员无法全面测试其故障模式。试点项目之外的企业也无法使用有代表性的代码,将该模型与现有安全工具进行比较。
另一个不确定因素是补丁质量。发现可疑模式与生成安全的修正方案并不是一回事。一个补丁可能在消除某个漏洞的同时引入另一个漏洞、改变软件行为或损害性能。
因此,人工审查仍然必不可少,尤其是对于关键基础设施和广泛使用的依赖项。安全团队必须重现每项发现、测试建议的变更,并记录补丁为何安全。较高的基准测试分数无法替代这一流程。
误报同样值得关注。一个报告过多不确定问题的模型可能会让维护人员不堪重负。漏报则更加危险,因为它可能让人们对仍存在漏洞的代码产生错误的安全感。
因此,Google 的受控推出既是一项保护措施,也造成了证据缺口。它减少了暴露风险,同时也让独立观察者更难了解其在真实环境中的可靠性。该试点项目的价值将取决于是否能够透明报告已确认的发现、获接受的补丁和遭拒绝的建议。
基准测试进步仍需独立的生产环境证据
Google 的数据构成了一项严肃的性能主张,但并不能最终说明这些模型在真实组织内部会有怎样的表现。
在 Google 发布的多项结果中,Gemini 3.6 Flash 均领先于 Gemini 3.5 Flash。该公司报告称,在衡量长期软件工程工作的 DeepSWE 测试中,两者得分分别为 49% 和 37%;在面向机器学习工程的 MLE-Bench 中,两者得分分别为 63.9% 和 49.7%。
在评估计算机操作智能体的 OSWorld-Verified 中,Google 列出的 Gemini 3.6 Flash 得分为 83%,Gemini 3.5 Flash 为 78.4%。该公司还报告称,新模型在图表推理和长上下文检索方面有所提升。
更广泛的 Gemini 评估还包括与 OpenAI、Anthropic 和 xAI 模型的比较。没有任何一个模型在列出的所有类别中都处于领先地位。这种多有胜负的结果比宣称全面领先更有参考价值。
Gemini 3.6 Flash 在一些软件工程和知识工作指标上落后于部分竞争对手,但在计算机操作、多模态推理和 Google 的长上下文评估中表现强劲。这些差异进一步说明,测试必须与实际工作负载相匹配。
基准测试方法可能改变结果。工具配置、提示词、重试次数限制、辅助框架和时间预算都会影响智能体的得分。测试框架上的细微差异,就可能决定模型能否发现错误或获得再次尝试的机会。
数据污染是另一个值得关注的问题。当评估任务与训练数据中的材料相似时,模型的表现可能会更好。私有测试或近期更新的测试能够降低这种风险,但也会增加外部复现的难度。
Google 的效率主张也需要接受类似的审视。输出 token 减少 17%,并不意味着每位客户的总资源使用量都会降低同样的比例。应用程序的提示词、工具、验证规则和用户行为都会影响最终结果。
Flash-Lite 报告的速度也可能有所不同。吞吐量取决于请求规模、地理位置、服务负载、批处理方式和账户配置。醒目的每秒 token 数结果应该用于指导测试,而不能替代测试。
视觉设计方面还存在质量权衡。Google 的开发者文档指出,在某些布局和样式任务中,人工评估者更偏爱较早的模型。该文档建议,当视觉偏好十分重要时,应向 3.6 Flash 提供明确的设计指导。
这一披露很有价值,因为能力提升很少会在所有方面均匀发生。一个模型可能在编写可靠的功能代码方面有所进步,却生成吸引力较弱的默认布局。团队需要开展既包含技术判断、也包含人工判断的任务专项评估。
模型更新还会带来另一项运营风险。Google 将 3.6 Flash 和 Flash-Lite 定义为普遍可用版本,这比预览版提供了更强的稳定性。即便如此,应用程序在更改模型标识符或默认路由之前,仍然需要进行回归测试。
迁移指南指出,这两个新的公开模型都要求开发者移除某些已弃用的采样参数和预填充模型轮次。这些变化可能会影响围绕早期 API 行为构建的应用程序。
负责任的部署应从一组具有代表性的任务开始。团队应记录成功率、工具调用总数、输出长度、纠正周期和人工审查时间,还应测试对抗性指令和上下文不完整的情况。
对于编程智能体,评估应统计不必要的修改和失败的测试。对于文档提取,应衡量字段级准确性和缺乏依据的推断。对于计算机操作,应追踪错误点击、恢复行为和权限边界。
只有当开发者报告这些场景中的结果后,独立证据才会逐渐形成。在此之前,Google 的基准测试只能说明发展方向,而生产环境中的可靠性仍是一个有待实证回答的问题。
三款模型发布后值得关注的事项
下一阶段将揭示 Google 的产品组合究竟能减少工作流的总体投入,还是只会将这些投入重新分配到更多模型之间。
第一个信号是 Gemini 3.6 Flash 和 Flash-Lite 在生产环境中的持续表现。开发者应关注有关已完成任务数、模型调用总数、延迟和人工纠正时间的独立测量结果。只有当完整工作流也变得更加高效时,更低的输出 token 使用量才能强化 Google 的主张。
编程智能体部署的相关报告尤其具有参考价值。如果 3.6 Flash 能够持续减少不必要的修改,并摆脱执行失败的循环,Google 对其机制的主张就会获得更多支持。如果团队仍然需要大量重试逻辑,那么基准测试上的提升在实际运营中的意义就会减弱。
Flash-Lite 需要另一种形式的验证。它最具优势的场景是可以自动检查的重复性任务,例如结构化提取或文档分类。只有当准确性在大量且多样化的输入中保持稳定时,高吞吐量才真正有价值。
第二个信号是 Flash Cyber 试点项目。Google 最终应披露有多少项发现得到确认、有多少个补丁被维护人员接受,以及人工审查者拒绝其建议的频率。汇总报告可以在不暴露敏感漏洞的前提下提供证据。
将使用范围扩展到政府和选定合作伙伴以外,将表明 Google 相信其访问控制和监控机制足以支持更广泛的应用。继续限制使用范围,则意味着双重用途风险依然难以管理。
观察者还应考察 CodeMender 是否能在重要的开源项目中发现此前未知的漏洞。得到确认的发现和获接受的修复将增强专业化防御智能体的说服力。未经验证的主张或充斥噪声的报告则会削弱这种说服力。
第三个信号是竞争对手的回应。Anthropic、OpenAI 和其他提供商可能会通过更快的模型、更强的路由系统、专业化安全工具或更简洁的智能体操作流程作出回应。他们的反应将说明 Google 是否找到了一种持久有效的产品结构。
Google 自身的路线图同样重要。该公司表示,Gemini 3.5 Pro 仍处于合作伙伴测试阶段,同时 Gemini 4 的开发工作已经启动。这些未来版本将揭示其产品组合会继续走专业化路线,还是重新整合到另一款旗舰模型周围。
更强大的 Pro 模型可能会作为 3.6 Flash 和 Flash-Lite 之上的规划器,也可能会让不同模型角色之间的区别变得更加难以理解。开发者重视能力,但他们也需要可预测的迁移路径和清晰的产品边界。
对于企业买家而言,当前应该采取的行动是受控评估,而不是全面迁移。使用真实工作构建一个小型测试集,保留源文档,并比较完成任务所需的总投入。记录每次升级处理、工具调用和人工纠正。
对于知识工作者而言,关键问题是委派给智能体的任务能否在提高速度的同时保留证据。只有当人们能够将生成的主张追溯到其来源时,可搜索的工作流才真正有用。
Google DeepMind 发布 Gemini 3.6 Flash 明确传达了一项战略主张:下一轮效率竞争将在完整的智能体系统之间展开。值得关注的是,真实部署能否证实循环次数减少、Flash Cyber 能否生成获接受的修复方案,以及竞争对手是否会采用相同的分层模型战略。


