top of page

Gemini 3.7 Flash 在编程和智能体领域向更大规模 AI 模型施压

Google 于 8 月 13 日发布 Gemini 3.7 Flash,在编程能力上带来可量化的提升,并直接向更大规模的 AI 模型发起挑战。这则最新 Google 新闻之所以重要,是因为 Flash 不再只是面向简单、高并发请求的轻量级选项。Google 如今将其定位为适用于软件工程、知识工作和多步骤智能体的生产级模型。

这一说法改变了竞争焦点。过去,开发者会在响应速度和运营效率比高难度推理更重要时选择 Flash 模型。Gemini 3.7 Flash 则表明,至少在 Google 选定评估的编程和智能体任务中,团队可以兼得两者。

首要压力落在更大的通用模型上,包括 Claude Sonnet 5 和 GPT-5.6 Terra。这些模型在多项高难度评估中仍然领先。然而,Google 的结果显示,其更小的主力模型正逐步接近甚至超越它们在特定生产任务中的表现。

重要的竞争并非 Google 对阵某一家实验室,而是高效的主力模型与开发者留给高难度工作的更大模型之间的较量。如果 Gemini 3.7 Flash 能可靠完成更多此类工作,仅凭模型规模来解释路由决策将变得更困难。

新版 Gemini 模型瞄准生产级工作

Gemini 3.7 Flash 将 Google 侧重速度的模型转变为编程和智能体系统核心循环的候选方案。

Google 通过 Gemini API、Google AI Studio、Google Antigravity 及其企业智能体产品正式全面推出 Gemini 3.7 Flash。它也已在支持的市场上线 Gemini app 和 Gemini Spark。

该模型可接收文本、图像、视频、音频和 PDF 文件。输出仍为文本,其工具支持则包括函数调用、搜索和计算机使用。

这些细节很重要,因为智能体需要的不只是流畅的回答。它还必须检查信息、选择行动、调用工具、发现失败,并持续朝目标推进。

Google 将该模型称为其能力最强的 Flash 版本,适合复杂编程和可靠的多步骤执行。Gemini 模型列表将其列为稳定的 API 模型,而非实验性预览版本。

Gemini 3.7 Flash 支持 100 万 token 的输入上下文,以及最多 64,000 token 的输出。上下文是模型在一次请求中能够处理的信息量。

大型上下文窗口可以容纳代码库、设计文件、技术文档和工具结果,但这并不保证模型会正确使用每一项细节。

此次发布聚焦三类工作负载:软件工程、Web 开发和文档密集型知识工作。每一类都可能需要在产生有用结果前完成多个相互依赖的操作。

Google 的示例包括根据提示生成可玩的 3D 游戏,以及通过协同子智能体构建交互式落地页。另一项演示则将年度报告转化为带有图表和摘要结论的交互式演示文稿。

这些是公司演示,并非可重复生产表现的独立证据。不过,它们仍揭示了 Google 希望开发者考虑的部署模式。

该模型旨在运行于一个 harness 中,即负责管理提示、工具、权限、记忆和重试的软件。这个 harness 可以为 Gemini 分配任务,并评估中间结果。

在编程场景中,模型可能会检查代码库、修改多个文件、运行测试,并修正失败的实现。在知识工作中,它可能会搜索文档、比较证据,并准备可追溯的答案。

这使 Gemini 3.7 Flash 的意义超越了一次常规的小版本更新。Google 正在要求团队重新考虑,哪一个模型应承担首次尝试,而不只是处理溢出流量。

这种区别构成了本文的核心张力。当一个更快的模型可以完成过去需要昂贵升级路径才能完成的工作时,它就具有战略重要性。

因此,围绕此次发布的 Google 新闻,关注的不仅是基准测试分数,也包括模型部署位置。真正的决策在于 Gemini 应处于一个运行系统的哪个环节。

为什么有关 Flash 的 Google 新闻此刻重要

此次发布正值 AI 团队将注意力从令人惊艳的回答转向可靠的任务完成。

早期生成式 AI 产品通常依赖一次提示和一次响应。智能体系统会形成更长的链条,而每增加一个操作,就会多一个失败机会。

编程智能体可能会搜索错误的目录、误解测试,或覆盖有效改动。工作场所智能体则可能选择错误文档,或使用不完整的参数调用外部工具。

这些错误会不断累积。即使模型在大多数单独步骤中成功,错误累积后,它仍可能在漫长工作流中失败。

延迟同样会累积。当智能体进行数十次模型调用、工具请求和修正时,即使是很小的延迟也会更加明显。

这正是主力模型重要的原因。它们往往负责智能体循环中的重复决策,而更大的模型只接手异常困难的情况。

Google 表示,Gemini 3.7 Flash 改善了指令遵循、首次编程准确率和从障碍中恢复的能力。这些能力瞄准了智能体开发的反复性成本。

首次准确率尤其宝贵,因为错误的初始实现可能引发多轮诊断。更好的遵循能力也能减少防御性提示和人工审查。

Google 发布的 Gemini 性能结果支持了这一论点的部分内容。Gemini 3.7 Flash 在 FrontierCode 1.1 上取得 43.6%,而 Gemini 3.6 Flash 为 34.4%。

在衡量长程软件工程能力的 DeepSWE v1.1 上,新模型得分为 65.3%,其前代模型为 48.6%。

该模型在 Web 开发的 Code Arena 中也获得了 1,588 的评分。Google 的对比中,Gemini 3.6 Flash 的评分为 1,538。

这些结果表明,最大幅度的提升出现在具有执行结构的任务中。Gemini 3.7 Flash 并不只是能生成更好的琐碎问答答案或更精致的文案。

其 AutomationBench 得分从 Gemini 3.6 Flash 的 17% 上升至 30.4%。这项私有评估针对企业工作流自动化。

私有基准测试需要谨慎看待,因为外部人士无法完整复现数据集或评分流程。它们仍可显示 Google 优化了什么,但无法说明模型在所有场景中的表现。

这一时机也紧随 Google 将计算机使用整合进 Gemini 3.5 Flash 之后。计算机使用使模型能够理解界面,并通过点击或输入等操作进行交互。

此前的发布为 Google 提供了进入浏览器、移动端和桌面任务的原生路径。Gemini 3.7 Flash 现在则尝试改进控制这些操作的推理能力。

对企业团队而言,这一变化会影响架构决策。能在无需升级的情况下处理更多任务的模型,可以简化路由、监控和评估。

开发者仍然需要权限、日志和回滚控制。模型能力的提升并不能消除对设计完善的智能体系统的需求。

但它可以减少该系统触及自身极限的频率。这正是这则 Google 新闻超越又一次排行榜更新的实际原因。

Gemini 3.7 Flash 挑战“大模型优先”的默认选择

Google 的核心押注是,主力模型能够接手过去会被自动分配给更大模型的工作。

许多 AI 系统采用模型路由,即根据难度、速度或运营限制,将每个请求发送给相应的模型。简单请求交给高效模型,复杂请求则交给更大的模型。

当高效模型在生产基准上接近更大的竞争对手时,这种划分的实用性就会下降。它不会消失,但升级门槛会随之移动。

Google 报告称,在 FrontierCode 1.1 上,Gemini 3.7 Flash 领先 Claude Sonnet 5 和 GPT-5.6 Terra。在 Google 发布的对比中,它在 Code Arena 上也领先这两款模型。

其他测试的情况则相反。GPT-5.6 Terra 在 DeepSWE v1.1 上取得 69.6%,高于 Gemini 的 65.3%。

GPT-5.6 Terra 还以 87.4% 领跑 Terminal-bench 2.1。Gemini 3.7 Flash 得分为 85.8%,Claude Sonnet 5 则达到 80.4%。

Terminal-bench 测试智能体能否在终端环境中完成任务。它为编程智能体提供了有用信号,尽管没有任何基准能代表每一个代码库或工具链。

在通用知识工作方面,这一比较对 Google 则不那么有利。Gemini 的 GDPVal-AA v2 评分为 1,525,低于 Claude 的 1,598 和 GPT-5.6 Terra 的 1,578。

这种分化明确了模型的角色。Gemini 3.7 Flash 并不是对更大模型的通用替代品。对于与编程、工具和结构化执行相契合的工作负载,它是更强的默认选择。

这是一种机制变化,而不是一次简单的排行榜胜利。更强的主力模型表现改变了系统调用最强模型的频率。

以一个收到错误报告的编程工作流为例。智能体必须定位相关代码、形成假设、修改文件、运行测试并解读失败原因。

较弱的默认模型可能在更大模型介入前生成嘈杂的补丁。更好的默认模型则能解决常规问题,或为升级处理提供更清晰的证据。

研究工作流也是如此。团队可以在一个可搜索的知识库中整合项目文件、会议记录和技术参考资料。

智能体仍需要准确检索和来源控制。然而,更强的文档推理能力可以提升其将检索到的证据串联为可用回答的能力。

Google 引用了早期合作伙伴结果来支持这一定位。Browser Use 报告称,与此前的 Flash 模型相比,使用 Gemini 3.7 Flash 后,工具错误更少,运营成本也更低。

Harvey 报告其 Legal Agent Bench 提升了 2.6 个百分点。Box 表示,该模型在高难度分析任务上带来了其最大的改进。

这些评估来自 Google 合作伙伴,并采用组织特定的工作负载。它们比通用演示更具相关性,但并非中立审计。

竞争压力看起来依然真实。更大模型的提供商必须证明,为什么它们的系统值得每一次额外升级。

Google 则必须证明,在长上下文、不完善的工具和不可预测的用户请求进入循环后,其模型仍能保持质量。这比赢得一项干净的基准测试更难。

基准测试提升无法证明什么

Gemini 3.7 Flash 拥有更有力的证据支持,但此次发布并未解决可靠性、安全性或现实世界所有权成本的问题。

基准测试结果是在既定提示、工具和评分规则下形成的快照。智能体部署则是与不断变化的数据交互的动态系统。

模型可能在评估中表现出色,却仍会在采用特殊约定的代码库中失败。它也可能在测试期间成功,但在模型更新后表现不同。

Google 的数据包括公开、私有和合作伙伴运行的测试。读者应区分它们。

公开基准提供了更高透明度,但团队可以针对熟悉的测试格式进行优化。私有基准能限制这种担忧,却阻碍独立审查。

合作伙伴评估让真实工作负载更接近分析场景。但它们也可能反映了经过筛选的任务、定制提示词,或在 Google 支持下构建的集成。

评估方法论为解读这些结果提供了必要背景。不过,内部方法论无法取代在组织自身数据上进行的验证。

Google 的多项结果也清楚显示了其局限性。Gemini 3.7 Flash 在衡量通用智能体能力的 Terminal-bench 3.0 评估中得分为 14.9%。

这一结果是其前代得分的两倍多,但大多数任务仍未解决。GPT-5.6 Terra 在同一对比中达到 20.8%。

在衡量多模态桌面和操作系统任务的 Agent’s Last Exam 中,Gemini 的通过率为 26.3%。Claude Sonnet 5 达到 33.3%。

这些数据对有关自主工作的宽泛说法提供了有益的修正。即使是领先模型,也会在相当一部分受控智能体任务中失败。

计算机使用还带来了额外的不确定性。视觉界面可能在没有预警的情况下变化,而一次错误点击可能造成文本答案出错所不会带来的后果。

权限必须保持在有限范围内。高影响操作应当要求确认,同时日志应记录是哪个模型选择了每一次工具调用。

开发者还需要衡量恢复行为。能够识别失败并停止的智能体,可能比自信地沿着错误路径继续执行的智能体更安全。

同样的谨慎也适用于生成的代码。通过基准测试并不能证明其安全性、可维护性,或符合团队架构要求。

编码智能体可以生成能运行的软件,却可能引入薄弱的授权检查或脆弱的依赖关系。人工审查和自动化测试仍然必不可少。

Google 的限时发布折扣带来了另一个评估问题,但团队无需过度关注标价。架构决策应基于预期的长期运行条件。

总体拥有成本包括 token 消耗、重试、工具调用、人工审查和失败的工作流。响应迅速的模型如果生成了不必要的步骤,依然可能变得低效。

提示词缓存可以减少重复处理,但其收益取决于工作负载结构。Browser Use 观察到了更高的缓存命中率,但其他系统的表现可能不同。

社区反应也仍然不一。一些早期用户报告称,其指令遵循能力更好,并成功修复了 bug;另一些人则质疑基准测试的提升能否经受日常使用的考验。

轶事可以揭示失败模式,但无法证明平均质量。它们最适合作为团队可复现测试的线索。

恰当的结论应比 Google 的营销说法更克制。Gemini 3.7 Flash 值得进行严肃的生产环境评估,而非获得自动信任。

AI 智能体工作流正在成为一场系统能力竞赛

模型竞争的下一阶段,将奖励那些能够将强大推理能力与可靠工具、监控及部署控制相结合的提供商。

Gemini 3.7 Flash 不仅通过 API 推出。Google 可以将其部署在 AI Studio、Antigravity、Android Studio、Gemini Enterprise 以及面向消费者的智能体产品中。

这种分发能力为 Google 带来了重要优势。开发者可以在原型开发、编码、企业和个人工作流中测试同一个模型。

Google Antigravity 与编码领域尤其相关。它提供了一个智能体开发环境,让模型能够规划并执行软件任务。

AI Studio 为提示词、工具和应用提供了更广泛的构建空间。随后,Gemini API 为接入定制生产系统提供了路径。

企业智能体平台将这一模式扩展到工作场所工作流中。Gemini Spark 则推出了面向消费者的版本,专注于在受支持的 Google 服务之间执行多步骤操作。

这一集成战略对竞争对手施加的压力不同于单纯的基准领先。Google 控制着许多智能体获取上下文和执行操作的界面。

Gmail、Calendar、Docs、Android 和 Google Cloud 既能提供有用的上下文,也能作为操作端点。这种覆盖范围同样引发了隐私和权限方面的担忧。

智能体应只接收完成当前任务所需的信息。广泛访问权限可能让一条错误指令演变为更大的数据处理问题。

因此,胜出的模型提供商必须解决编排问题,而不仅仅是生成问题。编排负责协调模型、工具、数据、检查点和恢复路径。

Google 自己的演示说明了这一方向。视差网站示例使用 Gemini 3.7 Flash 协调子智能体,并使用另一款 Gemini 模型创建视觉组件。

这是一套多模型系统,而非由一个模型包办一切。Gemini Flash 控制重复性工作流,而专门能力则处理范围更窄的任务。

AlphaEvolve 更早展示了相同原则的一种版本。这个 Google 研究系统将 Flash 模型用于广泛探索,并将 Pro 模型用于更深入的分析。

自动评估器随后测试候选程序,并保留表现更强的方案。AlphaEvolve 系统表明,模型协调为何可能比单次回答更重要。

Gemini 3.7 Flash 将这种模式推向了更广泛的开发者。一个有能力的主力模型可以生成候选方案、检查反馈,并在必要时调用专用模型。

竞争对手也可以采用同样的架构。Anthropic、OpenAI 和独立工具提供商都可以将各自模型与编码环境和工作流引擎结合。

这使 Google 无法仅凭模型质量取胜。当其运行框架使用可移植工具和标准化接口时,开发者可以切换模型。

函数调用和 Model Context Protocol 集成可以降低切换成本。Model Context Protocol,即 MCP,标准化了 AI 应用连接外部工具和数据的方式。

可移植性带来了另一种压力。由于开发者有更多方式比较输出,提供商必须在可靠性和集成质量上竞争。

企业应围绕完整任务设计评估。实用指标包括完成率、工具错误、修正周期、审查时间和不安全操作尝试。

仅看 token 总量无法反映智能体的价值。忽略审查工作量的编码基准同样无法做到。

一个能写出更少错误补丁的模型,可以提升整个系统的效率。一个生成结果看似吸引人却忽视指令的模型,则可能增加隐性工作。

这种系统视角解释了为何 Gemini 编码模型值得关注。其价值取决于围绕它的一切,包括防止一次快速失误变成昂贵错误的控制机制。

将检验 Google 主张的三个信号

只有当采用情况、独立测试和持续可靠性共同支持 Google 的发布结果时,Gemini 3.7 Flash 才会成为一次有意义的平台转变。

第一个信号是在生产编码和计算机使用任务上的独立评估。研究人员和开发者应使用公开运行框架、披露的提示词和重复运行来复现实验结果。

如果该模型在陌生代码库和不断变化的界面中仍能保持优势,成功复现将强化 Google 的论点。独立结果与已发布结果之间若存在巨大差距,则会削弱这一论点。

第二个信号是竞争模型提供商的回应。最有力的回应将把更出色的主力模型与更好的编码工具和更低的工作流失败率结合起来。

快速的竞争性回应将证实,高效智能体模型已成为一个战略类别。有限的回应则表明,提供商仍将更大模型视为主要的生产路径。

第三个信号是在发布期结束后的持续采用。开发者应关注 Gemini 3.7 Flash 是否仍是实际编码和企业系统中的默认选择。

仅有使用量还不够。团队应考察该模型是否在数月内减少了升级处理、重试、人工修正和工具失败。

Google 还需要清晰地传达模型更新。悄无声息的行为变化可能使评估失效,并使受监管部署变得复杂。

稳定的模型标识符有助于团队控制迁移。变更日志、弃用周期和可重复的安全评估,与基准测试改进同样重要。

这正是这则 Google 新闻成为工程负责人实际决策的地方。他们不需要宣布某个模型是普遍赢家。

他们需要确定哪些任务可以转移到主力模型层级,同时不降低质量。这需要具有代表性的测试集和记录在案的失败案例。

从可逆工作流开始。代码库分析、补丁草稿、文档比较和内部研究,比自主执行外部操作提供了更安全的评估场景。

衡量完整结果,而非经过打磨的样例。一项有用的评估会记录智能体是否完成任务、需要多少次修正,以及哪些工具发生失败。

为困难案例保留更大的模型。Gemini 3.7 Flash 最强的价值主张是更好的路由,而不是消除路由。

团队还应为安全敏感代码、客户沟通以及会改变外部系统的操作保留人工批准。更强的模型能够减少阻力,但不会转移责任。

Gemini 3.7 Flash 代表了 Google 模型战略中一次可信的变化。Flash 如今开始竞争复杂的生产工作,而不再只是快速替代方案。

剩下的问题是,这种定位能否经受普通代码库、杂乱文档、变化界面和长时间运行智能体的考验。开发者只能通过自己的受控评估来回答这一问题。

选择一个具有代表性的 AI 智能体工作流,定义可衡量的完成标准,并将 Gemini 3.7 Flash 与当前处理该工作流的模型进行比较。连续数周跟踪失败、重试、工具错误和审查时间。如果 Google 的主力模型能持续以更少干预完成更多任务,它就值得承担更大的角色。如果这一优势在精选基准之外消失,则应保留现有路径,并在独立证据更充分后重新审视这一决定。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page