top of page

Google 将其最快的 AI 模型免费开放。这才是它真正要卖的。

已更新:6月17日

5 月 19 日,Google 将 Gemini 3.5 Flash 设为 900 万用户的默认模型,且不收取额外费用。该模型在五个独立的基准测试中表现优于 Google 自家的 Pro 级旗舰模型。无需更改订阅,无需排队,无需迁移。如果你在那天早上打开 Google Search 或 Gemini 应用,你已经在运行它了。

这个时机让问题变得更加尖锐。OpenAI 的 GPT-5.5 对开发者的收费是每百万输入 token 5 美元。Anthropic 的 Claude Opus 4.7 价格相同。而 Gemini 3.5 Flash 每百万输入 token 仅需 1.50 美元,且在消费者层面,google gemini 默认是免费的。对于一家刚刚发布了能与市场上最昂贵产品竞争的模型的公司来说,将其免费提供的决定需要一个解释。

这个解释并不新鲜。2008 年,Google 让 Android 对手机制造商免费,让 Chrome 对用户免费。这两个决定都不是出于慷慨,而是为了控制新兴市场的平台层,同时将其上方的一切变现。Nokia 和 BlackBerry 构建了那个时代最好的封闭移动操作系统。Google 则提供了免费的开放系统,并夺取了它们下方的市场。Gemini Flash 是 Google 第三次玩这套把戏。这一次,处于 Nokia 位置的公司是 OpenAI 和 Anthropic。

这款模型抵达时,已有 9 亿用户预装

大多数 AI 模型的发布都遵循一个可预测的弧线:发布公告、开放 API 访问、开发者采用、在数周或数月内逐步推向消费者。Google 跳过了所有这些步骤。Gemini 3.5 Flash 在 Google I/O 2026 发布的当天就实现了全面可用,并在同一天同步成为了 Gemini 应用、Google Search 中的 AI Mode、Antigravity 2.0、Vertex AI、Android Studio、AI Studio 以及 GitHub Copilot 的默认模型。

这意味着在规模上:该模型不需要寻找用户,它继承了用户。Gemini 在发布当天拥有 9 亿月活跃用户,高于 I/O 2025 时的 4 亿。Google 的 AI Overviews(出现在传统搜索结果上方的 AI 生成摘要)拥有 25 亿月活跃用户。AI Mode(Google 的全对话式搜索界面)拥有 10 亿用户。当 Flash 成为默认模型时,它立即在世界上最大的 AI 交付基础设施底层运行。

Token 数量让这种规模变得具体。在 I/O 2025 上,Google 每月处理 480 万亿个 token。到 2026 年 5 月 19 日,Sundar Pichai 报告称该数字已增长至 3.2 千万亿,在 12 个月内增长了 7 倍。每月有超过 850 万开发者使用 Gemini API 进行构建。至少有 375 家企业客户每年各自处理超过 1 万亿个 token。Flash 在第一天就成为了这一切背后的引擎。

与竞争对手发布模型的方式相比,这种差异是运营层面的,而非表面上的。当 OpenAI 在 2026 年 4 月发布 GPT-5.5 时,现有用户群必须主动切换、更新集成或支付升级费用才能访问。而当 Google 发布模型并将其设为平台默认值时,用户无需进行任何操作。该模型直接就成为了他们正在使用的工具。

Google 首席科学家 Jeff Dean 以明确的智能体术语描述了设计意图。Flash 的构建是为了“部署能够协作、运行高频迭代循环并大规模解决现实世界问题的子智能体”。作为演示,Google 展示了 Flash 在约 12 小时内生成了一个功能完备的操作系统,这利用了跨持续复杂任务的智能体协作,而此类任务通常需要持续的工程投入。

Google 的 Flash 模型击败了自家的 Pro 以及来自 OpenAI 和 Anthropic 的大多数前沿模型

模型名称中的“Flash”一词在历史上一直预示着一种权衡:速度更快、价格更低,但能力明显低于其下方的旗舰层级。Gemini 3.5 Flash 打破了这一惯例。

在与现实世界智能体和编码工作流相关的五项基准测试中,Flash 3.5 的表现优于定价更高的 Gemini 3.1 Pro,并与来自 OpenAI 和 Anthropic 的竞争模型持平或领先。在测试持续多步命令行任务完成情况的 Terminal-Bench 2.1 上,Flash 3.5 得分为 76.2%,而 Pro 为 70.3%。在 MCP Atlas(多智能体工具编排,与生产智能体流水线关联最直接的基准测试)上,Flash 3.5 达到 83.6%,而 Pro 为 78.2%。在 Finance Agent v2 上,它得分 57.9%,而 Pro 为 43.0%。在基于 Elo 的实际对话性能测量指标 GDPval-AA 上,Flash 3.5 记录为 1,656,而 Pro 为 1,314。在评估图像、视频和文本跨模态推理的 MMMU-Pro 上,Flash 3.5 达到了84%,这是最高分,创下了发布时所有模型的最高纪录。

速度进一步拉大了差距。根据 Sundar Pichai 在台上引用的数据,Flash 3.5 的运行速度为每秒 289 个输出 token,而 GPT-5.5 为每秒 71 个 token。比例约为四比一。独立衡量模型性能的 Artificial Analysis 将 Flash 3.5 的智能指数(Intelligence Index)定为 55,比 Gemini 3 Flash 提高了 9 点,这主要受智能体性能提升和幻觉率降低 31 个百分点的推动。

Flash 3.5 并非在每个类别中都获胜。在测试跨专业领域深度学术知识的 Humanity's Last Exam 上,它落后于 Gemini 3.1 Pro。在旨在测试无法从训练数据中进行模式匹配的新颖抽象推理的 ARC-AGI-2 上,GPT-5.5 以 84.6% 保持明显领先,而 Flash 3.5 为 72.1%。对于需要持续长上下文检索或密集演绎推理的工作流,Pro 层级仍然具有优势。

但在 Flash 3.5 胜出的基准测试中,正是 2026 年 AI 采用增长最快的类别:智能体工具调用、金融自动化、多模态数据处理、高频迭代工作流。在 Flash 的定价水平上领先这些类别的模型,才是会被构建进生产系统的模型。这正是 Google 试图建立的竞争地位。

OpenAI 和 Anthropic 每百万 Token 收费 5 美元。Google 收费 1.50 美元,然后还免费提供。

Google 与其两个主要 AI 竞争对手之间的价格差距是结构性的,而非边际性的。

GPT-5.5 对开发者的收费是每百万输入 Token 5 美元,每百万输出 30 美元。Claude Opus 4.7 的定价为输入 5 美元,输出 25 美元。Gemini 3.5 Flash 的成本为输入 1.50 美元,输出 9 美元,大约是竞争对手输入和输出价格的三分之一。对于调用数百万次 API 的应用来说,每百万输入 Token 节省 3.50 美元并不是舍入误差,而是一个预算级别的决策。

Sundar Pichai 在 I/O 2026 上给出了一个数字:从竞争对手的 AI 服务切换到 Gemini 的企业每年可节省超过 10 亿美元。该数字反映了 Google 自己的建模结果,应据此解读,但在大规模应用下,其趋势性的算术逻辑是显而易见的。

消费者端的接入则更进一步。对于任何使用 Google Search、Gemini 应用或 AI Mode 的用户,Gemini 3.5 Flash 就是他们正在使用的模型,无需支付任何费用。ChatGPT Plus 每月收费 20 美元。Claude Pro 每月收费 20 美元。在消费者层级免费提供 google gemini,同时在智能体基准测试中达到或超过这些产品,这在两端同时施加了压力。

Google 之所以能这样构建接入方式,是因为它不需要 Flash 成为收入中心。OpenAI 的收入几乎完全来自 API 费用和订阅。模型即产品。Anthropic 约 80% 的收入来自企业合同,这使得其定价直接取决于客户为模型接入支付的意愿。当 Google 将 gemini flash 的定价设为每百万 Token 1.50 美元时,它不仅让自己的产品更便宜,还压缩了两家公司的可获得利润空间。

Google 从 Flash 获得的收益位于模型之上。每个在 Flash API 上构建的开发者都在为 Google Cloud 计算付费。每个在 Search 中使用 AI Mode 的消费者都在 Google 生态系统内产生广告库存。每一条由 Flash 处理而非路由到竞争对手的查询,都将行为数据保留在 Google 的基础设施内。模型是获客成本,Cloud、Search 和数据才是回报。

结构性的讽刺在于,这种动态已经直接适用于 Google 的竞争对手。Google 拥有 向 Anthropic 投资了 40 亿美元,并运营着 Anthropic 运行其模型的云基础设施。在 Google Cloud 上处理的每一次 Claude 推理都会为 Google Cloud 产生利润。OpenAI 已经在 Google 的 TPU 基础设施上运行过训练负载。Google 不需要取代这两家公司中的任何一家。无论结果如何,它都处于获利的位置。

OpenAI 目前的财务状况使得这种压力是不对称的。据报道,OpenAI 未能达到 第一季度营收目标,预计今年将消耗约 250 亿美元现金。对于一家拥有如此高的烧钱率且没有平台层产生并行收入的公司来说,在定价上与 Google 竞争是一个本质上不同的问题。

Google 以前也这么做过。Android 曾经也是免费的。

2008 年,主导智能手机平台的是 Nokia 的 Symbian 和 BlackBerry OS。两者都根据专有条款获得许可。两者都产生了许可收入。对于那个时代的设备来说,两者在技术上都是功能强大的产品。

Google 将 Android 作为一种免费的开源操作系统推出,任何硬件制造商都可以在无需支付许可费的情况下采用。这一决定并不反映移动操作系统应该免费的原则。它反映了一种业务分析:Google 的收入来自网页搜索和广告,而保护该收入最快的方法是确保每台移动设备在出厂时都带有进入 Google 服务的默认路径。Nokia 和 BlackBerry 无法与免费的替代方案竞争。在四年内,Android 占据了全球智能手机市场的大部分份额。

同年,Chrome 也遵循了同样的逻辑。Internet Explorer 占据了约 65% 的浏览器市场。Google 的广告收入取决于用户在网页上花费的时间,而缓慢、碎片化的浏览器体验是对该收入的结构性威胁。Chrome 被构建出来并免费提供,随后成为了主导浏览器。Microsoft 的浏览器市场份额再未恢复。

这种模式是一致的:识别控制用户访问权限的基础设施层,免费提供它,并在其上一层实现货币化。对于 Android 而言,上层架构是搜索、广告和 Play Store。对于 Chrome,则是搜索和广告位。而对于 Gemini Flash,则是 Google Cloud 计算收入、Google Search 广告,以及 9 亿 Gemini 用户以近乎零边际分发成本产生的行为数据。

Google DeepMind 文档使这一切成为可能的计算基础设施:定制的 TPU 芯片降低了训练成本,Google Cloud 将这些算力对外变现,Gemini 模型运行在相同的基础设施上,而消费级产品则以近乎零边际成本向数十亿用户分发 AI 输出。每一层都在强化其他层。OpenAI 和 Anthropic 作为付费客户存在于这一结构中。他们资助了支撑 Google 用来对抗他们的平台的计算资源。

这是 Gemini Flash 故事中基准测试对比无法捕捉到的部分。其优势主要不在于 Flash 比 GPT-5.5 更快或更便宜。优势在于 Google 可以在消费层无限期地保持 google gemini 免费,因为收益累积在 OpenAI 和 Anthropic 尚未涉足的层级。

问题所在:Flash 3.5 的每 Token 成本是其前代产品的三倍

Gemini 3.5 Flash 的“廉价”定位是相对于竞争对手的定价而言的。相对于 Google 自己的上一代产品,这一说法并不准确。

Gemini 3 Flash 的定价为每百万输入 Token 0.50 美元,每百万输出 Token 3 美元。Gemini 3.5 Flash 的定价为 1.50 美元和 9 美元,对于所有一直在 Flash 层级上构建应用的开发者来说,每 Token 费率翻了三倍。TechTimes 在发布当天直接记录了这一点,并指出尽管智能体性能有所提升,但其3 倍的每 Token 成本增加(相较于上一代 Flash)并未获得同等的关注。对于在 Gemini 3 Flash 上运行高容量推理的开发者来说,迁移到 3.5 意味着 API 账单翻三倍,无论 gemini flash pricing 与 GPT-5.5 相比如何。

Flash 3.5 在特定工作流中也存在实质性的能力限制。在 Humanity's Last Exam 测试中,Flash 3.5 在密集型专业学术知识方面的得分低于 Gemini 3.1 Pro。在测试新颖抽象推理能力的 ARC-AGI-2 上,GPT-5.5 的得分为 84.6%,而 Flash 3.5 为 72.1%。对于 AI 工作流依赖于长上下文密集检索或抽象推理,而非高频 Agent 执行的团队来说,“Flash 胜过 Pro”的说法在这些领域并不成立。

市场情绪反映了这种局限性。在 Polymarket 预测市场上,Anthropic 在 2026 年 5 月底前被评为最佳 AI 模型提供商的概率为 96%,而 Google 仅为 1%。根据追踪九个竞争维度 AI 势头得分的分析,Google 的得分为 3 分(满分 10 分),而 OpenAI 为 10 分,Anthropic 为 8 分。造成这一差距的主要驱动因素是,基于代码的使用场景已成为 2026 年 AI 采用的主导矢量,而在这一对话中,Google 并非首选。

华尔街也指出了这种定价策略的成本。Google 对 Gemini 产品线进行的激进打折(包括将 AI Ultra 订阅价格下调 20%)在公司大举投入 AI 基础设施之际压缩了 Google Cloud 的利润率。这一策略逻辑自洽,但并非没有代价。

预示 Google 的豪赌是否奏效的三个信号

Google 的分发布局已经就位。它能否产生持久的竞争优势,取决于未来 90 天内的三个事件。

首先是预计于 2026 年 6 月发布的 Gemini 3.5 Pro。Google 在 I/O 大会上确认,3.5 系列中的 Pro 级模型正在开发中。Flash 3.5 在 Agent 和多模态基准测试中胜出。而密集推理和长上下文召回目前更倾向于 Gemini 3.1 Pro 和 Claude Opus 4.7。如果 3.5 Pro 在弥补这些差距的同时,还能在整个产品线中保持 Flash 的价格和速度优势,Google 将同时掌握质量和分发渠道。这种组合对于任何没有 Google 基础设施深度的公司来说在结构上都是无法实现的,并且它将在更大规模的影响力上验证 Flash 策略。

其次是 OpenAI 和 Anthropic 的定价反应。从历史上看,大型模型的发布通常会在两到四周内引发竞争举措。如果其中任何一家公司降低每 token 的 API 定价,则证实了 Flash 的发布已对 API 变现模式产生了实质性的利润压力。如果没有公司做出回应,则表明企业客户目前对模型质量的偏好超过了价格敏感度,该策略在企业级的有效性仍有待证明。

第三是 GitHub Copilot 对 Flash 的采用率。Google 确认 Gemini 3.5 Flash 正在 GitHub Copilot 中逐步推出。从“逐步推出”到“设为默认”之间的距离,正是开发者采用率故事尘埃落定之处。9 亿用户的消费级分发创造了规模,而日常编码工具层的采用则培养了习惯。如果 GitHub 将 Flash 移至 Copilot 的主要推理引擎,这标志着 Google 已进入 Anthropic 目前占据最强地位的工作流层。

对于在 AI 优先的信息环境中穿梭的知识工作者来说,构建独立于任何单一模型默认设置的系统正成为一个现实问题。了解个人 AI 知识系统如何与日益嵌入的 AI 搜索层进行交互是一个切入点。Google Search 中的默认模型不再是一个中立的信息层。它是 Google 构建、控制并作为基础设施部署的模型。

Google 的赌注是,等到哪家公司拥有最佳模型的问题尘埃落定时,哪家公司是默认基础设施的问题早已有了答案。如果该策略的前两个版本有任何参考价值的话,第二个问题才是决定结果的关键。

从 AI 作为产品到 AI 作为嵌入式基础设施的转变并非未来场景。截至本周,这就是 Google Search、Gemini 应用和 GitHub Copilot 的现状。对于开发者而言,问题在于每百万 token 1.50 美元的代理能力模型访问权限是否会改变他们所构建产品的经济效益。对于企业团队来说,声称每年节省 10 亿美元是一个值得针对实际工作负载进行验证的数字。而对于任何工作依赖于在线信息发现和处理的人来说,更根本的问题是:当搜索层和 AI 层现在是同一个产品、由同一家公司控制并为同一目标进行优化时,这意味着什么。这才是 Google 通过 Gemini Flash 真正销售的产品。模型本身只是他们吸引你进入其中的手段。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page