top of page

Google Gemini 向 Pro 和 Ultra 用户开放 3.7 Flash,但智能体可靠性才是真正考验

8月28日
讀畢需時 15 分鐘

Google Gemini 已向 Pro 和 Ultra 用户开放 Gemini 3.7 Flash,将这款最新的快速模型从开发者工具和企业环境扩展至更广泛的使用场景。这次扩展让该模型进入 Gemini 对话界面,同时也让 Google 的个人 AI 智能体 Gemini Spark 建立在同一基础之上。

这一组合的重要性,不止于模型选择器中新增了一个选项。Google 正让 3.7 Flash 搜索文件、解读消息、调用 Workspace 工具,并以更少的监督完成相互关联的任务。核心竞争已不再是 Flash 与更慢的旗舰模型之间的较量,而是 Google 对可靠智能体执行能力的承诺,与个人数据和不完美工具调用这一现实之间的较量。

该模型在 Gemini 3.6 Flash 发布仅三周后便推出。Google 表示,紧凑的发布周期反映了开发者反馈和算法改进。这也给 OpenAI、Anthropic 及其他 AI 提供商带来压力:它们需要让更快的模型具备持续完成工作的能力,而不只是快速给出答案。

Google 公布了令人鼓舞的基准测试提升,一项独立实测也发现其在 Gmail 和 Drive 中取得了实用成果。不过,早期用户反馈也提到访问权限不稳定、用量意外消耗以及界面错误。这些报告并未推翻 Google 的说法,但也说明这次发布应通过实际完成的任务来评判,而不能只看模型分数。

Google Gemini 实际向订阅用户开放了什么

关键变化在于,Gemini 3.7 Flash 现已同时进入面向消费者的对话层和 Google 的智能体层。

Google 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash。随后,其 Gemini chat rollout 将访问范围扩展至 Google AI Pro 和 Ultra 账户。Google 还表示,Spark 现已在 160 多个受支持国家和地区使用该模型。

Spark 是一种可在用户指引下持续执行工作的个人智能体。与标准聊天机器人的单次回复不同,智能体工作流涉及规划多个步骤、选择工具、读取不断变化的信息,并产出可执行的结果。

这种差异改变了失败的含义。较差的聊天机器人回答只会浪费几分钟;而忽略截止日期、误读附件或更新错误文档的智能体,则可能引发更大的问题。

Google 将 3.7 Flash 定位为其用于编程和智能体的新一代主力模型。该公司表示,它能更准确地遵循指令,在任务遇到阻碍时进行调整,并在规划和工具调用上投入更多推理能力。

这些能力瞄准了个人 AI 系统长期存在的弱点。模型可以生成看似有说服力的摘要,却遗漏某个来源、丢失一项约束,或虚构无关文档之间的联系。多步骤任务会放大每一个小错误,因为一次错误输出会成为下一步的输入。

最清晰的消费者场景并不是回答一道高难度的冷知识题,而是处理这样一种请求:搜索数十封邮件和文件,解决重复信息,并整理出一份主文档。一份真正有用的结果必须保留日期、识别冲突、将论断链接至来源,并区分已确认事实与假设。

Google 表示,Spark 现在可以更高效地整合文件、起草邮件和更新状态文档。底层模型也已通过 Google AI Studio、Gemini API、Android Studio、Gemini Enterprise 以及 Google 的 Antigravity 开发环境提供。

面向消费者和开发者的版本服务于不同工作流,但共同强化了同一战略。Google 希望用一个快速模型支撑交互式对话、软件开发、业务自动化和持续运行的个人智能体。

这一覆盖范围使此次推出格外值得关注。专用模型可以围绕单一且狭窄的评估进行优化;而通用主力模型必须在代码、文档、网页界面和 Workspace 操作之间保持实用性,同时不能因频繁使用而变得过慢。

关于可用性的表述仍需谨慎。Google 的公告确认了受支持市场中 Pro 和 Ultra 订阅用户的资格,但并不保证每个账户、界面、组织管理员或区域配置都会在同一时刻提供完全一致的控制选项。

一些用户报告称,3.7 Flash 没有立即出现在他们的模型选择器中。另一些用户则遇到了个人订阅与受管理工作账户之间的差异。这些发布细节属于运营问题,但会影响已宣布的能力是否真正触达实际用户。

因此,这次发布形成了本文的核心张力。Google 已让一款面向智能体的 Flash 模型与广泛的付费消费者群体建立关联。如今,该公司必须证明,更广泛的访问能够带来稳定完成的工作,而不只是让更多人看到一个模型名称。

为什么更快的 Flash 模型如今承载着更高赌注

Google 正在将 Flash 从快速替代选项转变为默认引擎,用于那些需要判断力、持续性和工具调用的任务。

早期 Flash 模型通常与速度、更低延迟和高频请求相关。更具挑战性的推理任务往往会促使用户转向 Pro 级模型。Gemini 3.7 Flash 则试图缩小这种差距:它瞄准复杂编程和知识工作,同时保留 Flash 的定位。

Google 的 model announcement 显示,3.7 Flash 相较于 3.6 Flash 有显著提升。在 FrontierCode 1.1 Main 上,Google 给出的分数是 3.7 Flash 为 43.6%,其前代产品为 34.4%。

该公司报告称,DeepSWE v1.1 也有类似提升,从 49.0% 增至 65.3%。这些评估面向软件工程任务,包括调试和问题解决。

在网页开发方面,Google 报告称,其在 WebDev Arena 上的 Elo 得分为 1,588,而 3.6 Flash 为 1,538。Elo 是一种基于比较结果的相对评级系统,而非简单的正确率百分比。

知识工作同样受到重视。Google 报告称,其在 GDP.pdf 文档基准测试中的得分为 34.0%,高于 3.6 Flash 的 22.0%。它还报告称,在 AutomationBench 上的得分为 30.4%,而早期模型为 17.0%。

这些数字支持了 Google 关于 Flash 可以处理更长工作流的论点。但它们并不能证明该模型会在每个用户账户、文档集合或 Workspace 权限结构中都可靠运行。

基准测试任务通常以受控输入和可衡量结果为起点。个人知识工作面对的则是重复文件、含糊的文件名、过时消息、无法访问的文件夹、相互冲突的日期以及不明确的意图。

这正是 Workspace 工具调用至关重要的原因。模型无法仅靠对其上下文中已有文本的良好推理,就完成多来源任务。它必须找到正确材料,识别自己无法访问的内容,并在起草结果时保留来源之间的关系。

对 Google 来说,这是一个异常有利的竞争场域。Gmail、Drive、Docs、Calendar 和其他 Workspace 服务已经存放着用户希望由助手整理的信息。Google 无需先说服用户建立新的数据仓库,智能体便可发挥作用。

但仅有访问权限并不能决定胜负。智能体必须知道何时搜索结果不完整、何时两份文档彼此冲突,以及何时一项操作需要确认。它还必须应对个人、工作和学校账户之间不同的权限设置。

这会立即给竞争对手的助手提供商带来压力。OpenAI 和 Anthropic 可以提供强大的推理能力,并连接外部服务;Google 则可以将模型与已经构成用户大部分工作日的信息产品结合起来。

竞争问题不在于哪家公司拥有最高的孤立分数,而在于哪种助手能够在保留用户控制权的同时,将分散信息转化为值得信赖的结果。

这也改变了团队评估个人 AI 的方式。请求改写时,快速响应很有用;但当智能体需要花数分钟搜索二十个文件、验证日期并准备状态报告时,速度的重要性就会下降。

完成质量成为更有力的衡量标准。团队应考察智能体找到所有必要来源的频率、是否尊重边界、是否引用原始材料,以及在采取不确定操作前是否要求澄清。

Google 实际上是在押注:具备更好规划能力的快速模型,能够让这些工作流在消费者规模上变得切实可行。如果这一赌注成功,Flash 将成为主要工作引擎,而非轻量级备用选项。

更好的工具调用是核心机制,而非附属功能

Gemini 3.7 Flash 的重要性在于,Google 改进了推理与行动之间的链条——而个人智能体通常正是在这里失去可靠性。

处理单个提示词的模型可以直接对可见文本进行推理。Workspace 智能体则必须反复决定查询哪项服务、打开哪条结果、提取哪些信息,以及接下来应采取什么操作。

每一项决策都是一次工具调用,即模型向外部应用程序或服务发出的结构化请求。更好的工具使用不只是调用正确的应用程序;模型还必须构造有效参数、解读返回数据,并在结果不完整时恢复处理。

Google 表示,3.7 Flash 会对这些序列采用更有纪律的规划。据称,该模型会在必要时澄清意图,并在工作流遇到阻碍时更有效地调整。

设想一个请求:根据邮件线程、会议记录和共享文件制作一份项目简报。智能体首先需要定位每一个相关来源,随后还必须识别最新版本、区分已作决定与提案,并标记分歧。

最终文档应链接回每个来源。它不应悄然合并彼此不兼容的日期,也不应将未获答复的问题视为已确认的决定。如果某个文件夹无法访问,这一限制也应在输出中说明。

这一工作流类似于 knowledge blending:在不抹去来源信息的前提下整合多种信息来源。综合结果的质量取决于模型推理能力,也取决于严谨的来源处理。

同样的机制也适用于软件开发。处理问题的智能体可能需要检查代码仓库、搜索文档、编辑代码、运行测试、解读错误信息,并调整其方法。高质量的首次代码输出有所帮助,但恢复行为决定了整个任务能否成功。

Google 的基准测试提升表明,两个层面都可能有所改进。编程评估衡量结果质量,而 AutomationBench 则更接近于观察相互连接的业务工作流。

不过,接近 30% 的基准测试分数并不能证明已具备普遍自主性。它只显示了在特定评估集合上的进步,也说明距离让用户将无人值守自动化视为常规操作,还有很大空间。

Google 在 Spark 中部署 3.7 Flash,使这一限制成为一个现实的产品问题。Spark 处理的数据可能是个人的、不完整的或对时间敏感的。用户需要的不只是一个看起来正确的答案。

一个实用的智能体应当明确呈现不确定性。它应提供原始消息链接、标注假设、指出无法获取的来源,并在发送消息或更改记录前请求批准。

这些行为无法仅凭语言流畅度推断出来。一份润色完善的主文档,仍可能遗漏那个决定截止日期的表单、附件或电子邮件。

一项真实场景测试展示了两面性。评测者要求 Spark 在 Gmail 和 Drive 中搜索即将到期的事项、矛盾信息、缺失表单和未回复的消息。

该智能体找到了被忽视的学校文件、账户通知以及其他可操作事项。它还将结果链接至原始来源,使输出更易于核查。

然而,测试发现 Gemini 跳过了一些电子邮件,也遗漏了未命名的 Google 文档。这套工作流依然有用,但还不足以取消人工审核。

这一结果揭示了此次发布背后的机制。更强的推理能力让智能体的规划更加可靠。更完善的 Workspace 调用扩展了它可检查的范围。来源链接和审批边界则让由此产生的操作保持可追责性。

因此,该模型提升了个人自动化能力,但并不会使其自动变得可信。Google 最强的优势在于其对应用程序的深度访问能力;其最大的责任,则是确保这种访问不会将一次不完整的搜索变成看似权威的答案。

Google 的智能体承诺仍面临可靠性缺口

此次推广的成败将取决于遗漏来源、配额表现和操作失败,而非 Google 最亮眼的基准测试案例。

Google 此次发布还配套更新了针对化学、生物、放射性、核与网络滥用的安全防护措施。其模型卡提供了审查安全评估、预期用途和已知局限性的正式入口。

这些防护措施针对的是高影响力滥用。面向消费者的智能体则引入了另一类风险:在日常工作中不断重复发生的普通错误。

一项 Spark 任务可能涉及预约、发票、学校表单、业务文件和私人通信。即使模型并未发送或删除任何内容,错误的综合判断仍可能影响用户的下一步决策。

最重要的可靠性问题在于召回率。当系统被要求扫描一组资料时,它找到的是所有相关项目,还是仅仅那些最容易检索到的项目?

第二个问题是溯源性。用户能否将每个截止日期、主张和建议追溯至原始电子邮件或文档?

第三个问题是约束保留能力。智能体能否在长序列任务中始终记住审批边界和格式要求,包括一次工具调用失败之后?

早期报告显示,此次推广并不均匀。一些符合条件的用户表示,模型并未立即出现。还有用户称,Gemini 聊天中的 3.7 Flash 出现错误,而较轻量的模型仍可使用。

这些报告来自社区帖子,而非受控研究。它们可能反映账户设置、地区推广差异、临时服务问题或 Workspace 扩展冲突。

使用限制引发了另一项担忧。一则配额讨论称,更新后 Spark 日程安排消耗的五小时额度明显更多。

一位志愿产品专家回应称,Gemini 的限制取决于计算资源消耗,而非固定的提示次数。因此,模型选择、提示复杂度和对话长度都会改变额度消耗速度。

这一解释并不能证明 3.7 Flash 导致了所报告的现象。类似投诉在发布前就已存在,个别账户也无法反映全系统范围的表现。

但这确实说明,消费者采用与可预测的执行表现密切相关。一旦定时智能体在工作流进行到一半时耗尽额度,它不只是变慢了,还可能在用户未察觉的情况下让周期性任务停留在未完成状态。

界面可靠性同样重要,原因也在于此。开发者往往能看到明确的错误、日志和重试状态;面向消费者的智能体则倾向于将基础设施隐藏在对话式界面之后。

Google 应让未完成状态变得可见。用户需要知道 Spark 是否搜索了所有被请求的服务、哪些调用失败、哪些来源仍无法访问,以及最终输出是否覆盖了所要求的时间范围。

该公司还应区分模型错误与访问错误。如果企业管理员阻止访问某个 Drive 文件夹,正确的响应不应是一份猜测性的摘要,而应明确说明该文件夹无法被搜索。

基准测试证据仍具参考价值,但无法回答这些运营层面的问题。更高的文档得分表明,在正确文件已送达模型之后,模型的理解能力有所提升;但这并不保证 Spark 能检索到该文件。

同样,改进后的规划能力可以减少指令遗漏,但并不能保证服务可用性稳定,也不能保证资源消耗可预测。

谨慎的结论是,Gemini 3.7 Flash 强化了 Google 的智能体基础,但最棘手的信任问题仍未解决。用户可以将发现信息和起草内容委托给它,但仍应核查来源并批准具有重要后果的操作。

这并不是附加在一个原本完整产品上的小小保留。人工核验目前仍是该产品可靠运行模式的一部分。

Google Gemini 智能体让竞争对手承受另一种压力

Google 正迫使市场围绕集成式执行能力展开竞争,而竞争对手历来则通过推理质量和跨平台灵活性实现差异化。

OpenAI、Anthropic 和 Google 都希望其助手能够完成更长的任务。它们通往这一目标的路径各不相同,因为每家公司掌握的模型、应用程序、开发者平台和用户数据组合不同。

Google 的优势始于 Workspace。用户可能已在同一账户中积累了多年的邮件、文档、日历事件和共享文件。Spark 可以通过整理既有材料来体现价值,而不必等待用户创建新的工作流。

这种访问能力带来了切换压力。如果一名助手能找到被遗忘的附件、梳理电子邮件线程并起草带链接的状态报告,用户就能从周边应用关系图中获得价值。

竞争助手可以通过连接器和 API 访问类似服务,也可能在非 Google 应用之间提供更广泛的灵活性。差异在于,集成在多大程度上显得原生,以及权限、检索和操作能否稳定协同。

Google 更快的发布节奏带来了另一层压力。Gemini 3.7 Flash 在 3.6 Flash 发布三周后推出。这表明 Google 打算利用开发者反馈和评估结果,快速迭代其主力模型。

快速发布能够更快提升能力,但也可能让依赖稳定自动化的团队面临更难预测的行为变化。

测试智能体的组织需要了解,在模型更新后,提示、工具策略和审批流程能否持续可靠。基准测试上的提升,无法弥补一个在未预警情况下改变行为的周期性工作流。

这正是竞争焦点重新回到承诺与现实之处。Google 可以宣传更强大的智能体,因为它同时拥有模型和周边生产力套件;它也必须管理这两个层面的运营复杂性。

OpenAI 和 Anthropic 面临相反的挑战:它们必须足够深入地接入用户工作,同时在第三方系统中维持清晰的权限管理和可靠的检索能力。

对于买方而言,有价值的比较并不是通用模型排行榜,而是一组使用组织实际数据和控制措施的可重复工作流测试。

团队可以要求每个助手根据会议记录、问题跟踪器、电子邮件决策和上一份报告编写每周项目更新。审核者随后可以统计遗漏来源、缺乏支持的主张、重复项目,以及未经批准就提出的操作。

同一评估应重复运行。智能体可靠性还包括方差,也就是说,系统不应在周一给出完整结果,却在周二遗漏关键材料。

延迟仍然重要,尤其当智能体需要进行多次调用时。较慢的模型会让每一步的延迟累积。Gemini 3.7 Flash 旨在降低这类成本,同时保留足以支撑整体规划的推理能力。

然而,只有在工作流达到可接受的准确性门槛后,速度才有价值。更快完成一次不完整搜索,并不会改善结果。

Google 最强的战略举措,是将改进后的 Flash 模型直接部署到 Spark 中。这为非开发者提供了一个通过日常工作评估智能体 AI 的具体理由。

它的风险也同样具体。用户会比注意到基准测试提升更容易注意到遗漏的预约和无法访问的文件。个人数据提供了令人信服的使用场景,但也让错误更容易被理解。

因此,此次发布提高了整个类别的预期。快速模型必须成为更好的规划者。互联助手必须展示其来源。个人智能体必须传达未完成的工作,而不是用润色过的文字将其掩盖。

三个信号将显示 3.7 Flash 是否兑现承诺

下一阶段取决于推广的一致性、可验证的任务完成情况,以及竞争对手对 Google Workspace 优势的回应。

第一个信号是,符合条件的 Pro 和 Ultra 用户能否在 Gemini 聊天、Spark 和受支持设备上获得一致的访问权限。公告宣称广泛可用,但社区报告表明,不同账户的体验可能存在差异。

顺利的推广将强化 Google 关于 3.7 Flash 已准备好担任通用主力模型的说法。若模型选择器仍存在缺口,或界面错误持续出现,即使 API 访问保持稳定,这一结论也会被削弱。

Google 的企业版发布说明提供了另一个有用指标。说明显示,3.7 Flash 于 8 月 13 日进入 Business 版本的模型选择器,为管理员和受管理用户提供了正式的部署渠道。

企业可用性应带来更结构化的反馈。公司可以在重复工作流中衡量任务完成率、检索准确性、审批合规性和失败率。

第二个信号是来自真实多来源任务的证据。Google 已发布基准测试改进数据,早期实地测试也发现了有用结果。决定性证据将来自记录成功与遗漏情况的重复测试。

用户应关注 Spark 是否能持续将主张链接至原始文档。他们还应检查,智能体能否在无需每次明确提醒的情况下,报告无法访问的文件、相互矛盾的日期和不确定的结论。

可靠的智能体不必做到毫无瑕疵。它需要让自身的不确定性可见,并将具有重要后果的操作置于用户控制之下。

配额表现也应归入同一信号。Google 应明确复杂 Spark 作业如何消耗使用额度,以及定时任务达到限制时会发生什么。

可见的部分完成状态将降低风险。无声终止,或基于仅部分请求数据生成一份润色摘要,都会损害信任。

第三个信号是竞争对手如何回应。OpenAI 和 Anthropic 无需复制 Google 的产品结构,但它们确实需要为互联知识工作提供可信的答案。

更强有力的回应可能包括更深入的应用连接器、更具持续性的智能体、更清晰的来源追踪,或针对无人值守工作流的更佳控制。如果这些功能加速发展,Google 的此次发布将推动竞争转向执行能力。

如果竞争对手继续强调模型智能,却无法匹配这种一体化行动能力,Google 在 Workspace 中的地位将更具价值。若它们能提供更广泛、更可靠的跨平台自动化能力,Google 的优势就会缩小。

对开发者而言,眼下的行动很直接:在完整工作流中测试 Gemini 3.7 Flash,而不是只测试孤立提示词。除最终答案质量外,还应记录检索失败、工具错误、重试情况以及缺乏支持依据的声明。

企业采购方在扩大自主能力前,应先测试权限管理与可审计性。知识工作者则应在发送消息、更改日历或更新文档前,要求提供来源链接并进行确认。

Google Gemini 已将一款更快的模型置于一个对速度要求不止于此的角色中。此次发布值得关注,因为它把智能体执行能力嵌入了数百万人已经在使用的产品。

未来几个月的问题在于:这种整合能否持续减少工作量,同时不掩盖错误。先尝试一项范围明确、可逆且对来源有清晰要求的任务。然后检查 Gemini 找到了什么、遗漏了什么,以及它接下来尝试执行了什么。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page