top of page

Gemini 3.7 Flash 提高 Google AI Mode 的竞争门槛

Google 在 8 月 13 日发布该模型仅一天后,便将 Gemini 3.7 Flash 引入 AI Mode,再次提高了 Search 的智能能力下限。这则最新的 Google 新闻之所以重要,在于这并非一次有限的聊天机器人实验。Google 正将更新一代的推理模型置入一款面向全球海量需求的搜索产品中。

眼前的变化听起来很直接。AI Mode 现在可以使用一款被 Google 定位为更快、能力更强且更擅长完成多步骤工作的模型。然而,真正的竞争并不是 Gemini 3.7 Flash 与其直接前代之间的较量,而是 Google 的生成式回答体验与奠定 Search 基础的传统网页结果之间的竞争。

这种张力并不止于 Google。OpenAI、Microsoft、Perplexity 及其他 AI 搜索服务商,必须与一家同时拥有主要信息发现入口及其底层模型家族的公司竞争。出版商则面临另一重问题:更好的生成式回答能够满足用户需求,却也可能让来源可见性、导流流量和署名归属变得更加不确定。

Google 新闻将 Gemini 3.7 Flash 纳入 AI Mode

Google 将一次模型发布直接转化为 Search 升级,缩短了实验室进展与日常信息发现之间的距离。

Google DeepMind 于 2026 年 8 月 13 日发布 Gemini 3.7 Flash。其模型卡介绍了对继承自 Gemini 3.6 Flash 的推理基础所作的算法改进。

该模型可接受文本、图像、音频、视频和文档输入。它支持最高达一百万 token 的上下文窗口,并可生成最多 64,000 个输出 token。上下文窗口是指模型在一次交互中能够考虑的输入量。

这些规格之所以重要,是因为 AI Mode 处理的不只是简短的事实性问题。用户可能提供一张图片、附加一个文件、描述多项限制条件,并期待 Search 整理出有用的回答。模型必须理解每一种输入,同时从网络中检索最新资料。

Gemini 3.7 Flash 还支持可调节的思考配置。这些控制项让系统能够根据任务,在回答质量、响应时间和计算工作量之间取得平衡。因此,Google 可以有选择地采用更深层的推理,而不是将每个查询都视为同等困难。

这种灵活性尤其适合 Search。查询明天的天气,不应需要与一项比较型研究问题相同的工作量。后者可能涉及多个来源、相互矛盾的细节,以及受个人限制条件影响的推荐。

Google 表示,该模型面向代理式任务、编程和知识工作设计。代理式任务是指模型选择工具、检查结果并调整计划的多步骤任务。在 Search 中,这种模式可将一次查询转变为一个小型研究工作流。

此次推出延续了快速替换周期。在 2026 年 5 月的 Search 公告中,Google 将 Gemini 3.5 Flash 设为全球 AI Mode 的默认模型。不到三个月后,Gemini 3.7 Flash 又推进了这一战略。

这一速度表明,Search 不再等待偶尔出现、极具可见度的重大改版。每当更新的模型带来有用的运行平衡时,Google 都可以修订 AI Mode 底层的推理层。用户可能会经历实质性变化,却无需更换产品或学习新的界面。

AI Mode 与 AI Overviews 之间的区别仍然重要。AI Overviews 会针对特定查询出现在传统结果上方。AI Mode 则是一个更具对话性的目的地,支持追问和更广泛的任务。

Gemini 3.7 Flash 与后者体验尤其相关。AI Mode 鼓励用户留在生成式对话中,而不是在每次提问后回到链接列表。更强的默认模型会让这种使用方式更具吸引力。

这一部署也让 Google 获得了少有模型开发者能够匹敌的分发优势。开发者必须通过应用程序编程接口主动选择模型;Search 用户则只需选择 AI Mode,就可能接触到同一模型。

这改变了模型改进触达普通人的速度。升级并不只依赖开发者构建新应用。Google 可以通过一款已经处于众多在线旅程起点的产品来交付它。

Google 为何如此迅速升级 AI 搜索

这次升级旨在维持 Search 的实用性,因为查询正从简短关键词演变为包含多项预期结果的复杂请求。

Google 的 Search 战略正稳步转向更长、更具对话性的输入。在其 I/O Search 更新中,公司表示 AI Mode 的月活用户已超过十亿。Google 还表示,自推出以来,该体验中的查询量每个季度都增长一倍以上。

这些是公司自行披露的数据,并非对满意度或留存率的独立衡量。不过,它们仍说明了 Google 为何持续为该产品配备更新模型。哪怕只是小幅改进,也可能影响大量搜索。

Google 还重新设计了 Search 框,使其可接受文本、图像、文件、视频和 Chrome 标签页。这一界面带来了更艰巨的技术负担。系统必须理解混合输入、检索最新信息、保留上下文,并迅速呈现结构化回答。

传统搜索排序并未从这一过程中消失。检索仍决定哪些页面、产品、地点或记录为回答提供支撑。模型则增加了另一层,用于理解请求并组织最终呈现方式。

这种组合使延迟变得至关重要。用户更容易接受偶尔使用的研究工具等待更久,却不会以同样的耐心对待日常 Search。Google 需要让推理显得有用,同时避免让每次查询都像一次漫长的代理式运行。

Flash 系列正是为满足这一需求而设。Google 将这些模型定位在针对基础任务优化的小型系统与留给最困难推理任务的大型模型之间。Gemini 3.7 Flash 旨在将更强能力带入速度更快的类别。

该模型的基准测试结果说明了 Google 为何认为它已准备好承担更广泛的工作。据该公司称,它在测试长周期软件工程能力的 DeepSWE v1.1 上得分为 65.3%。在同一项报告的评测中,Gemini 3.6 Flash 的得分为 48.6%。

在内部企业工作流测试集 AutomationBench 上,新模型得分为 30.4%。其前代得分为 17%。这些结果表明,在 Google 的测试条件下存在显著改进,尽管内部基准测试仍应谨慎解读。

该模型还在 Google 的长上下文检索测试中,于 128,000 token 条件下取得 97% 的成绩。长上下文表现衡量的是模型能否在大量输入中定位并使用相关细节。当 Search 需要比较文档或维持长时间对话时,这项能力很有用。

然而,Search 的表现不能被简化为模型基准成绩。编程和工作流测试并不直接衡量引用质量、本地搜索准确性或向用户展示的来源多样性。它们也无法揭示 Google 在生产环境中如何路由不同查询。

公司的更深层动机在于战略层面。用户越来越多地在能够直接提供解释的 AI 助手中开始信息任务。Google 必须让 Search 显得同样强大,同时保留使其与众不同的实时网页索引、商业系统和本地数据。

Google 已于 2025 年 12 月通过 Gemini 3 Flash 奠定基础。当时,公司将该模型设为 AI Mode 的默认选项,并描述了一种将研究与即时行动结合的体验。此前的推出公告确立了 Flash 不仅仅是开发者模型的定位。

Gemini 3.7 Flash 推进了同一套运行模式。Google 并非要求用户在快速搜索引擎与推理助手之间做选择,而是试图让 AI Mode 在同一界面中满足两种期待。

AI Mode 如今向独立回答引擎施压

Google 的主要优势并非某一项基准测试的胜利,而是将新模型与 Search 分发能力及实时信息系统结合起来的能力。

独立回答引擎的吸引力建立在对传统搜索的一项简单批评之上:用户往往想要综合后的答案,而不是十个需要分别阅读的链接。AI Mode 现在已在 Google 自身产品中提供这种形式。

OpenAI 可以将 ChatGPT 接入网页搜索和更广泛的代理工作流。Microsoft 可以将模型与 Bing 及其生产力产品结合。Perplexity 则围绕带引用的回答和研究功能塑造了自身定位。

这些竞争对手仍可通过界面设计、模型选择、引用方式和专业工作流实现差异化。然而,它们必须说服用户放弃既有习惯。Google 则可以将对话式搜索放在其传统结果旁边。

这种分发差异提高了频繁模型升级的价值。更强的 Gemini 默认模型能够改善 Google 的竞争地位,而无需单独推出新产品。AI Mode 仍是目的地,其底层推理系统则持续变化。

Google 还掌控着多套可丰富回答的数据系统。其 5 月公告强调了来自 Maps、购物、金融、体育及其他 Search 服务的实时信息。模型可以组织这些材料,但底层数据赋予回答实际相关性。

以计划一次临时旅行的用户为例。请求可能包含天气偏好、行程时间、餐厅可订位情况和固定日程。通用聊天机器人可以研究这些限制条件;Google 则可以将推理层连接到实时的 Search 和 Maps 信息。

同一机制也适用于购物、本地服务和活动规划。用户需要的不只是解释,还需要一个连接到当前库存、可用性、地点或预订选项的回答。

Gemini 3.7 Flash 专为协调此类多步骤任务设计。Google 表示,其改进后的代理式执行能力有助于模型绕过障碍并解决现实问题。这一说法仍需要 AI Mode 内的生产环境证据来验证。

对于知识工作者而言,这一转变改变了研究的形态。生成式回答可以汇集多个来源、比较其内容,并保留用户的限制条件。其结果更像一名轻量级研究助手,而非传统结果页面。

这一工作流也提高了来源管理的重要性。收集生成式研究结果的用户仍需要访问原始材料。个人的知识融合流程可以帮助将外部研究与私有笔记连接起来,但它无法弥补缺失或薄弱的引用。

出版商则面临这种便利的另一面。当 AI Mode 直接解决问题时,用户打开每一个支撑页面的理由会减少。因此,更好的综合能力可能改善搜索体验,同时削弱导流机会。

问题不只是 Google 是否展示链接。链接的位置、具体程度和相关性决定了用户是否会注意到或点击它们。一个出现在完整回答之后的引用,未必会带来与显著自然搜索结果相同的用户行为。

Google 表示,AI Mode 会使用来自整个网络的有用链接。这一原则很重要,但出版商关注的将是可衡量的流量,而不是产品表述。他们需要知道,更深入地使用 AI Mode 是否能带来有意义的访问量和品牌发现。

因此,竞争压力来自两个方向。答案引擎必须匹配 Google 的分发能力和数据连接。Google 则必须证明,其生成式体验仍在支持为其提供大量信息的开放网络。

Gemini 3.7 Flash 加剧了这一冲突,因为更优质的答案会增加用户在 Search 内完成查询的可能性。该模型既能让 AI Mode 更有用,也能同时降低外部访问的必要性。

更快的模型仍面临验证问题

Gemini 3.7 Flash 改进了 AI Mode 的底层机制,但并未消除基于不完整证据生成自信答案这一根本风险。

Google 自己的模型文档指出,Gemini 3.7 Flash 可能产生幻觉。所谓幻觉,是指模型在将信息呈现为看似合理的答案时,生成了缺乏依据或错误的信息。

文档还提到,模型偶尔会出现响应缓慢和超时。这些限制对代理式搜索尤为重要,因为多步骤任务比简单查询可能在更多环节失败。检索、工具选择、理解和综合都必须协同工作。

模型的底层知识还有另一层边界。Google 将知识截止日期列为 2026 年 3 月,但部分领域可能仅覆盖至 2025 年 1 月。网页检索可以提供更新的事实,但检索并不保证能够做出正确解读。

近期的一类查询就说明了这个问题。假设用户询问一项在训练截止日期之后宣布的政策。AI Mode 必须找到当前来源,区分最终规则与早期提案,并避免混合相互冲突的版本。

推理能力更强的模型可以更好地完成这一流程。但它仍可能选择过时页面、误解某项限定条件,或引用只能部分支持其结论的来源。新鲜检索与事实可靠性相关,但两者并不等同。

基准测试记录也呈现出复杂局面。Gemini 3.7 Flash 在许多编程、工作流和长上下文测试中显著提升。然而,在 Google 的无工具图表推理测试中,它的得分略低于 Gemini 3.6 Flash。

这一单项结果并不能证明存在普遍弱点。但它说明,关于全面提升的广泛说法应当保持克制。模型可以在代理式执行方面取得进步,同时在某项具体评估中持平或退步。

外部比较也需要同样谨慎。基准排名取决于提示词、模型设置、测试污染控制和评分程序。Search 还增加了一层生产环境因素,而公开模型评估很少能复现这一层。

Google 的 Gemini 概览 收录了来自企业软件、法律工作、开发和研究领域早期合作伙伴的积极评价。这些案例提供了有用示例,但并非对 AI Mode 的中立审计。

因此,Search 用户应将引用可见性视为答案质量的一部分。当每项重要表述都能清晰对应到相关来源时,回答更容易获得信任。一组笼统的链接无法提供同等程度的保障。

用户还应区分事实综合与建议。模型可能正确检索营业时间和评论摘要,却因误解用户优先事项而给出糟糕建议。某一阶段的准确性并不能验证整个答案。

高风险问题需要更加谨慎。医疗、法律和金融决策不应仅依赖生成式摘要。当错误可能带来严重后果时,用户需要查阅一手文件并获得合格专业人士的指导。

Google 的模型卡称,专业团队进行了人工红队测试。公司表示未发现严重问题,并称该模型满足了其所要求的儿童安全发布门槛。它也承认,仍在持续改进越狱攻击抵抗能力和安全缓解措施。

这些保护措施针对的是有害使用,但并不能解决日常事实可靠性问题。安全的答案仍可能是错误的。引用充分的答案也仍可能遗漏重要的反对来源。

这是此次发布中的核心权衡。Gemini 3.7 Flash 可以让复杂搜索显得更快、更连贯。它的流畅性也会让薄弱证据更容易被忽略。

Google 需要衡量的不只是互动度。有用指标包括更正频率、引用质量、任务完成率和用户回访行为。出版商也会寻找证据,证明他们的内容仍然可见且具有价值。

下一批 Google News 信号将揭示什么

三个信号将决定 Gemini 3.7 Flash 是代表了持久的 Search 改进,还是又一次快速的模型轮换。

第一个信号是 AI Mode 中引用的质量。Google 必须证明,能力更强的模型能够将具体主张连接到相关页面。对于研究重要议题的读者而言,笼统的来源列表并不足够。

引用质量包含几个独立问题。链接页面是否支持相邻表述?在可获得的情况下,AI Mode 是否展示一手来源?它是否呈现分歧,而不是将冲突的主张混合成虚假的共识?

独立测试在这里将尤其有价值。模型基准测试描述的是受控条件下的推理能力。Search 审计则可以检验真实查询、不断变化的网页结果、本地数据和引用多样性。

如果引用精确性与答案质量同步提升,Google 的论点就会更有说服力。这将表明,该公司可以提升 AI Mode 的能力,而不让验证变得更困难。来源薄弱或不一致则会削弱这一结论。

第二个信号是出版商流量。Google 曾表示,AI 体验能够鼓励更广泛、更复杂的搜索。出版商需要看到数据,证明这些搜索是否会转化为高质量访问。

原始曝光量无法回答这一问题。被引用的页面可以出现在 AI 回答中,却没有获得点击。出版商将关注引荐流量、访客互动、品牌搜索行为,以及来自 AI 界面的转化。

访问量下降将加剧答案质量与网络激励结构之间的冲突。Google 依赖出版商、企业、论坛和机构来产出其系统所检索的大量内容。

公司无需保留每一种历史流量模式。搜索产品一直在变化。然而,若一个答案层吸收的价值多于其回馈的价值,长期来看可能削弱来源基础。

如果出版商获得有价值的流量和更清晰的署名,此次发布将强化 Google 的立场。如果可见度提高而访问量下降,公司将面临更棘手的问题:AI Mode 究竟如何分配价值。

第三个信号是 Google 的下一次模型替换。Gemini 3.5 Flash 在 5 月成为 AI Mode 默认模型,Gemini 3.7 Flash 则在 8 月接替。这一节奏表明,默认推理层在一年内可能变更数次。

频繁升级可能惠及用户,但也让评估更加复杂。研究人员可能刚完成对某个生产模型的测试,Google 就已经将其替换。企业也无法假设连续数月的行为完全一致。

Google 应为重要模型过渡提供更清晰的变更记录。用户需要知道答案行为、多模态处理或引用选择何时发生变化。出版商则需要可比较的日期来进行流量分析。

替换节奏也会影响开发者。Gemini 3.7 Flash 可通过 Google AI Studio、Gemini API、Gemini Enterprise 和 Google Antigravity 使用。Search 部署可以在外部团队完成自身评估之前,大规模暴露模型行为。

快速推出后继模型将表明,Google 更重视持续的效率提升,而非长期稳定的模型世代。更长的部署周期则会给研究人员更多时间衡量可靠性和用户结果。

因此,更广泛的 google news 故事并不只是 AI Mode 获得了又一个模型。Google 已构建出一套交付系统,能够迅速、全球化地将新的推理能力部署到 Search 中,并且几乎不需要用户付出额外操作。

这套系统给所有争夺信息任务起点的答案引擎带来压力。它也给 Google 带来压力,要求其证明更快的综合能力不会削弱验证或来源发现。

读者应使用自己能够独立核查答案的问题来测试 AI Mode。让它比较多个当前来源、识别分歧,并为每项重要主张提供链接。然后检查这些链接是否真正支持回答。

对于必须在日后仍保持实用的研究,应将原始页面与生成式摘要一并保存。记录发布日期、重要限定条件和未解决的冲突。精心润色的答案应是验证的开始,而不是终点。

Gemini 3.7 Flash 提升了 Google Search 内可用的能力。更重要的结果将出现在模型基准测试之外:AI Mode 能否帮助人们得出可靠结论,同时保留一条清晰可见、回到网络的路径?

这正是下一项值得关注的 google news 信号。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page