top of page

Google 对 Gemini 4 的预告暴露了雄心与交付之间的差距

7月28日
讀畢需時 14 分鐘

尽管错过了原定于 6 月发布 Gemini 3.5 Pro 的承诺窗口,Google 已开始训练 Gemini 4。9to5Google 对近期披露信息的梳理呈现出一个耐人寻味的矛盾:Google 一边描述其迄今最具雄心的训练项目,一边让当前旗舰模型仍未面世。

这一矛盾比模型名称本身更重要。Gemini 4 并非产品发布公告,Google 也未提供发布日期、规格、基准测试或公开预览。它更多是在表明,这家公司正将算力与技术注意力投向何处。

CEO Sundar Pichai 表示,Google 希望 Gemini 4 在发布时能够与届时的前沿模型竞争。然而,在 Google 的训练周期内,OpenAI、Anthropic、Meta 及其他实验室也在推进各自的系统。因此,Gemini 4 既代表 Google 的下一项重大押注,也考验其发布流程能否匹配自身的技术雄心。

9to5Google 的 Google Gemini 4 报道究竟披露了什么

Google 确认正在进行一项异常宏大的 Gemini 4 训练工作,但几乎没有披露开发者如今可测试的内容。

最清晰的一组披露出现在 7 月 26 日的一篇报道中,该报道涵盖了近期的产品公告以及 Alphabet 的第二季度财报电话会议。Gemini 4 详情确立了三个重要事实。

首先,Google 已开始对 Gemini 4 进行预训练。预训练是资源密集型阶段,基础模型会在大量数据中学习模式。这一阶段发生在广泛的后训练、安全评估、产品整合和公开部署之前。

Google 称这是其“迄今最具雄心的预训练项目”。这句话暗示了规模,但并未界定其具体规模。Google 没有披露模型参数数量、训练预算、数据构成、算力分配或预计完成日期。

其次,Pichai 表示,Gemini 4 需要更大的基础模型,才能在下一阶段的前沿竞争中立足。这是对 Google 技术方向的明确表态。尽管业界同样强调更优质的数据、推理方法、工具和后训练,Google 仍认为进一步扩展规模是必要的。

更大的基础模型并不会自动带来更好的公开产品。它可能增加训练复杂度、基础设施需求、评估时间和推理成本。最终价值取决于 Google 如何将基础模型转化为用户可以获得的可靠能力。

第三,Google 正优先将内部 TPU 容量用于前沿开发。Tensor Processing Units,简称 TPU,是 Google 为机器学习工作负载打造的定制加速器。Pichai 告诉分析师,Google 的首要分配优先级,是满足其在先进 AI 开发中竞争所需的容量。

这一表态将 Gemini 4 与 Alphabet 的基础设施战略直接联系起来。Google 并未将该模型视为一个孤立的研究项目,而是在为一个旨在支撑 Search、Cloud、Gemini app 和开发者平台未来产品的系统预留稀缺计算资源。

该公司还表示,内部进展令人鼓舞。然而,内部印象不能替代公开评估。在 Google 提供访问权限和文档之前,开发者无法比较延迟、可靠性、编码表现、上下文处理、工具使用或运营成本。

对于时间节点也应保持同样谨慎。原始报道认为,过往 Gemini 的发布规律指向 11 月或 12 月。Google 本身并未公布这一窗口。将其视为确定时间表,会重蹈围绕 Gemini 3.5 Pro 的同样错误。

因此,改变之处并非 Gemini 4 突然可用。Google 公开将其前沿叙事推进到了延迟的 3.5 代之后,并把这一叙事与更大的基础模型及大量计算资源投入联系起来。

这便形成了核心张力。Google 要求客户和投资者评判其未来方向,而最相关的证据仍留在公司内部。

Gemini 3.5 Pro 让一次预告变成了信誉考验

如果 Gemini 3.5 Pro 能按 Google 所说的时间发布,Gemini 4 听起来本会只是常规的路线图进展。

在 5 月 19 日的 Google I/O 上,Pichai 表示 Gemini 3.5 Pro 已在内部使用。公司预计将在次月发布它。当时的I/O 发布报道记录了这一承诺,以及更广泛的 Gemini 3.5 推出计划。

6 月结束时,Gemini 3.5 Pro 仍未公开发布。Google 后来表示,该模型正在与合作伙伴进行测试,并会在准备就绪后尽快提供。这是合理的质量标准,但它以一个开放式条件取代了明确的发布时间目标。

错过这一窗口改变了人们应如何解读每一项 Gemini 4 表态。Google 训练一款雄心勃勃模型的能力并不是主要不确定性。更困难的问题是,公司能否将这次训练转化为有竞争力、可靠且及时的服务。

Google 确实继续发布了其他模型。7 月,它推出了 Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。这些版本面向速度、高吞吐处理和专业安全工作,而非填补缺失旗舰模型的角色。

据对更低成本 Flash 模型的报道,Gemini 3.6 Flash 在提升多项能力的同时,最多可减少 17% 的输出 token。Flash-Lite 面向需要执行大量相对简单操作的工作负载。Flash Cyber 则专注于为选定合作伙伴识别和修复软件漏洞。

这些发布表明,Google 的模型管线并未停滞。它们也说明了产品组合势头与前沿领导地位之间的区别。一家公司可以持续推出有用、高效的模型,同时仍在最困难的编码、推理和智能体任务上落后。

智能体编码指的是能够在有限监督下规划并执行多步骤软件工作的系统。Pichai 承认,编码和智能体编码是 Google 需要改进的领域。这一承认让 3.5 Pro 的延迟更具意义,因为编码已成为重要的竞争基准和商业应用场景。

Google 的处境并非天然矛盾。不同团队可以在训练 Gemini 4 的同时,由其他团队打磨 Gemini 3.5 Pro 并发布 Flash 变体。大型 AI 组织通常会并行推进重叠的模型代际。

信誉问题来自沟通与执行。Google 为 3.5 Pro 给出了近期预期,却未能兑现,随后又强调下一代模型的进展。客户没有公开证据表明,这款延迟模型是否接近发布,或是否已在内部被后续模型超越。

存在几种可能解释。Google 可能因评估发现不可接受的弱点而延迟 3.5 Pro;也可能在公开发布前提升其编码表现;还可能正在统筹各产品与外部客户之间的部署容量。

Google 没有提供足够经过验证的细节,无法在这些解释之间作出选择。这一信息缺口应当保持明确。声称 Gemini 3.5 Pro 已失败、被取消或被 Gemini 4 取代,都超出了现有证据所能支持的范围。

更稳妥的结论更为有限:Google 一边让 3.5 Pro 继续接受合作伙伴测试,一边公开讨论更具雄心的继任者。这一顺序提高了 Gemini 4 在独立用户最终评估它时必须达到的标准。

Google 正在扩展基础模型,而对手瞄准了交付缺口

当前最主要的竞争,是 Google 雄心勃勃的路线图与其不均衡交付能力之间的较量,而不只是 Gemini 与某一款竞争模型的对比。

AI 竞争常被描述为 Google、OpenAI、Anthropic、Meta 和 xAI 之间的排行榜竞赛。这种比较很重要,但可能掩盖 Google 面临的直接挑战:它首先必须缩小内部信心与外部可用性之间的差距。

Pichai 将前沿领域描述为动态且竞争激烈。这一表述是准确的。一款在训练期间看似先进的模型,到了发布日可能面对截然不同的市场。在同一时期,竞争对手可以改进编码、工具使用、多模态推理、记忆、安全性和推理效率。

Google 表示,它希望与未来的前沿竞争,而不是与当今的基准领先者竞争。这在战略上是合理的。若仅为当下进行训练,Gemini 4 就容易受到部署前出现的新进展影响。

但这一做法也带来了棘手的预测问题。Google 必须预测竞争对手的系统数月后会做什么,随后选择足够的模型规模、训练数据、算力和后训练工作,以在不进一步延迟部署的情况下保持相关性。

更大的基础模型提供了一条路径。在合适的数据和优化支持下,更大规模的训练可以提升广泛能力。然而,仅靠规模并不能保证可靠的软件工程或智能体行为。

编码智能体需要的不只是看似合理的文本生成。它们必须检查代码仓库、使用工具、维持上下文、验证改动、从错误中恢复,并避免损害用户系统。任何一个环节的薄弱,都可能抵消在狭窄基准上的提升。

企业智能体也是如此。企业关心准确性、访问控制、可审计性、延迟和可预测的成本。一款在受控演示中表现出色的模型,在涉及私有数据和外部应用的长流程中仍可能失败。

Google 拥有大多数模型实验室无法匹敌的分发优势。它可以将 Gemini 能力嵌入 Search、Android、Chrome、Workspace、Cloud 和消费级设备中。在 I/O 上,Google 表示 Gemini app 的月活跃用户已突破 9 亿,高于前一年的 4 亿。

Google 还表示,Search 中的 AI Mode 月用户已超过 10 亿。这些由公司报告的数据表明,其覆盖范围是独立 AI 实验室难以复制的。它们并不能证明 Gemini 在前沿模型质量上处于领先。

分发能力可以为 Google 赢得时间,但也提高了犯错的代价。部署于主要消费和商业产品中的模型,必须满足比有限研究预览更严格的要求。安全性、延迟、地区合规性和基础设施可用性都会影响发布决策。

公司的 Flash 策略提供了另一项优势。Google 可以为不需要最高智能水平的工作负载提供专用模型。这种产品组合策略能在前沿模型开发期间,将开发者留在 Google 的平台内。

但这一策略无法完全替代具备竞争力的 Pro 模型。构建复杂编码智能体或推理系统的开发者,会比较最强的可用选项。如果另一家提供商表现更好,团队可能会在 Gemini 4 到来前围绕该提供商设计工作流。

迁移并不总是容易。应用会围绕选定模型积累提示词、评估、数据管线、安全审查和工具集成。因此,延迟发布的代价可能不止于短期使用量。它还可能决定哪个平台会嵌入生产系统。

9to5Google 对 Google 的报道让这一交付缺口变得清晰可见,却未能解释它。Google 的技术方向似乎很明确,但其公开时间表并不明确。这个缺口持续得越久,Gemini 4 就越需要拿出成果来改变开发者既有的选择。

更大的训练规模无法解决 Google 的组织问题

如果 Google 无法留住人才、优先发展正确的能力,并持续稳定地发布模型,Gemini 4 的算力规模就没那么重要。

近期报道为技术挑战之外又增添了组织层面的难题。现任和前任 Google DeepMind 员工告诉 Axios,士气问题正在导致发布延期。这篇关于 DeepMind 士气 的报道提到了倦怠、竞争压力、人员离职,以及围绕 Google 军事业务的内部意见分歧。

Google 对这一描述提出异议。该公司表示,2026 年上半年 AI 人才流失率低于一年前;同时,超过 90% 获得 AI 职位邀约的人接受了职位。

两种观点都值得审慎看待。匿名员工的说法能够揭示内部状况,但无法衡量整个组织。Google 的整体招聘和留任数据同样可能忽略特定团队或专业领域内部的扰动。

对 Gemini 4 而言,关键在于该组织能否在漫长的训练和部署周期中保持连续性。前沿模型需要研究人员、基础设施工程师、数据团队、评估人员、安全专家和产品团队之间的协调。

即便整体人员规模依然很高,人员流动也可能造成延误。失去熟悉训练系统细节的人员,可能拖慢问题诊断和决策。新员工则需要时间理解内部工具和研究假设。

优先级安排也构成另一项风险。据报道,一项批评是 Google 因忙于防守 Search 对抗 ChatGPT,未能足够早地聚焦智能体式编程。考虑到 Search 的重要性,这种取舍可以理解,但它可能让 Gemini 在快速增长的开发者领域处于劣势。

Pichai 承认编程能力需要改进,在一定程度上支持了这种担忧。但这并不能证明能力差距为何出现。Google 尚未公布 Gemini 3.5 Pro 的详细开发过程,也未说明哪些评估阻碍了其发布。

公司的规模可以帮助解决这些问题。Google 能开展大规模实验、构建定制 TPU、在全球招募人才,并将模型部署到多个产品中。它还可以从极其广泛的真实交互中收集反馈。

但规模也会带来协调成本。产品团队可能需要不同的模型行为、发布时间表和安全阈值。Search、Cloud、Workspace、Android 和 Gemini app 未必需要完全相同的系统。

Gemini 4 更大的基础模型或许可以统一这些产品中的部分能力,但也可能增加高效服务它们的复杂性。Google 可能需要更小的衍生模型、专门的后训练,或路由系统,以维持可控的性能和成本。

另一项不确定性在于评估。Google 尚未说明哪些内部指标正在驱动 Gemini 4 的开发。公开基准测试可能有用,但它们往往范围狭窄、趋于饱和,或容易被针对性优化。

现实世界中的智能体表现需要更长时间的测试。团队需要了解模型能否完成多步骤工作、识别不确定性、遵循权限要求,并检查自身输出。这些特质更难被压缩成一个单一分数。

因此,企业买家不应将“最具雄心”视为性能指标。它描述的是 Google 的投入,而非已验证的结果。更大规模的训练可能带来更好的模型、更昂贵的模型、延期的模型,或三者的某种组合。

同样的谨慎也适用于 Pichai 对用户会感到满意的信心。他的评论传达了 Google 的官方立场及其内部乐观情绪,但并不能取代针对真实工作流的独立测试。

Gemini 4 最终必须回答的,既是组织问题,也是技术问题:Google 能否足够迅速地协调资源,在其选定目标再次变化之前发布一款可靠的模型?

Alphabet 的 AI 支出提高了再次延期的代价

Gemini 4 所依托的基础设施投入规模如此庞大,以至于时间表执行力已经成为投资者关切的问题。

Alphabet 的模型开发由一项快速扩张的资本计划支持。在 I/O 上,该公司预计 2026 年资本支出可能达到 1900 亿美元。这笔支出覆盖的范围不止 Gemini,但 AI 基础设施是核心驱动力。

Google Cloud 也报告了强劲增长。根据近期关于 AI 支出压力 的报道,需求仍持续超过 Google 扩充后的产能。

这一背景解释了 Pichai 关于 TPU 分配的评论。Google 必须在内部前沿研究与客户对同一基础设施的需求之间取得平衡。每一台分配给模型训练的加速器,便无法同时为外部工作负载提供服务。

这种分配在商业上仍可能合理。更强的 Gemini 模型可以增加对 Google Cloud 的需求,支持高端消费者服务,改进 Search 产品,并增强 Workspace 功能。Google 能够将底层研究复用于多个收入来源。

不过,模型延期会推迟其中一部分回报。基础设施成本在成品系统到达客户手中之前就已开始产生。若训练或后训练时间超过原计划,投资与变现之间的周期就会拉长。

风险不在于 Google 缺少能够为这项工作提供资金的业务。Alphabet 拥有庞大的分发能力和成熟的收入来源。风险在于,竞争对手利用发布延迟吸引开发者,并塑造客户预期。

云客户同样需要规划确定性。他们会通过安全审查、性能测试、治理流程和应用试点来评估模型。模糊的“准备好时发布”时间表,会让这些决策难以安排。

Gemini 3.5 Pro 的缺席带来了一个具体的采购问题。团队可以评估现有的 Flash 模型,但这些系统服务于不同的优先事项。需要 Google 最强推理或编程模型的客户,无法假设 Gemini 4 会在方便的时间表内到来。

这并不意味着买家应放弃 Google 的平台。对许多工作负载而言,Flash 系列可能提供更好的经济性。更小的模型通常适合信息提取、分类、文档处理和常规智能体步骤。

模型选择正日益在任务层面发生。一家公司可能为常见操作使用快速模型,并将前沿模型留给困难的推理任务。Google 的产品组合支持这种架构。

不过,旗舰模型仍然重要,因为它定义了平台能力的上限。若开发者必须在复杂任务上转向 Google 之外,多供应商架构就会更具吸引力。届时,Google 将失去对部分支出和集成的控制。

基础模型规模也存在战略问题。行业正在探索测试时计算、合成数据、工具使用、专用模型和改进后训练所带来的收益。Google 对更大基础模型的强调表明,它仍预期从预训练规模中获得显著回报。

这一押注可以与其他方法并行发挥作用。Google 并未表示只依赖规模扩张。然而,其表述让规模成为目前披露的最具体技术线索。

投资者和客户最终需要看到,这些支出能够带来实用能力的证据。基准测试提升是一种证据;采用率、使用量增长、Cloud 收入和留存率则是更有力的商业指标。

因此,Gemini 4 处于研究雄心与资本纪律的交汇点。又一次模糊或错失的发布窗口,不仅会令模型爱好者失望,还会加深外界对 Alphabet 如何高效地将基础设施投资转化为产品的疑问。

三个信号将显示 Gemini 4 是否不止是一份路线图

故事的下一阶段取决于 3.5 Pro 的发布、可验证的编程结果,以及明确的 Gemini 4 部署路径。

第一个信号是 Gemini 3.5 Pro 实现广泛公开可用。这是最直接的考验,因为 Google 已经设定并错过了 6 月的预期。若能以稳定的 API 访问方式发布,将表明公司可以在训练下一代模型的同时完成当前一代。

这次发布的质量与日期同样重要。开发者应考察编程可靠性、工具使用、延迟、上下文保持能力和安全行为。仓促推出且表现不一致,无法消除交付方面的担忧。

强劲的 3.5 Pro 发布将支持 Google 的说法,即延期源于审慎测试。持续沉默则会削弱人们对任何非正式 Gemini 4 时间表的信心。若被取消或悄然替换,将进一步引发外界对 Google 模型管线的疑问。

第二个信号是编程和智能体式编程取得进展的独立证据。Pichai 将其列为需要改进的领域,因此它们可以公平地衡量 Google 的执行力。

没有任何单一基准能够解决这个问题。有价值的评估应包含不熟悉的代码库、多文件修改、测试执行、错误恢复和工具权限处理。结果还应考虑成本及所需人工干预的程度。

开发者需要能够复现这些说法。私下演示和选择性披露的内部测试可以为研究提供指引,但不足以支撑采购决策。公开 API 和透明的模型文档提供了更坚实的基础。

编程性能的提升将强化 Google 的前沿叙事。若结果疲软或不一致,则可能表明更大规模的预训练并未弥合最显眼的能力差距。

第三个信号是明确的 Gemini 4 发布时间与访问计划。Google 无需披露敏感的训练细节,但客户需要的不只是高管的热情表态。

一份有意义的计划应说明预期的产品入口、预览结构以及走向更广泛可用的路径。它还应澄清,开发者是否会与 Google 的消费者产品同时获得访问权限,还是要等到漫长的内部推广之后。

发布顺序很重要。据报道,Google 在 2025 年 11 月发布 Gemini 3 Pro 时,首日便覆盖了多个主要产品入口。若能再次实现协调发布,将表明 Google 已改善从研究到产品的路径。

分阶段预览并不必然意味着失败。前沿系统需要安全测试和产能规划。然而,无限期的合作伙伴测试将延续围绕 Gemini 3.5 Pro 的同样不确定性。

读者还应区分官方信号与推断。Google 已确认正在积极训练 Gemini 4,并描述了其战略目的。它尚未确认年末发布、具体能力或基准目标。

这种区分有助于避免一种熟悉的循环:模型传闻制造预期,非正式日期逐渐被视为承诺,而延期则会按照公司从未作出的说法来评判。

9to5Google 对 Google 的报道之所以有价值,是因为它将 Google 的实际表态集中在一处。这些表态展现了真实的雄心、显著的算力投入,以及对自身弱点的认识。但它们也让最具商业重要性的问题仍未得到回答。

对开发者而言,务实的应对方式是测试现有能力,而不是围绕一个尚未命名的未来功能进行设计。评估应保持可移植性,记录模型特定的假设,并避免将关键工作流建立在未经确认的发布之上。

企业买家应要求基于自身任务的证据。衡量完成质量、监督需求、延迟、安全控制以及总体资源消耗。供应商在广泛模型排名中的表现,未必能够预测其在特定业务流程中的性能。

知识工作者面临的决定更简单。Gemini 4 并不会改变当下可用的工具。它的重要性在于揭示了 Google 的发展方向,以及推动这一方向背后的压力。

Google 拥有基础设施、分发能力和研究深度,足以继续作为前沿领域的竞争者。只有当外部用户能够对 Gemini 4 进行评估时,它才能巩固这一地位。在此之前,延期的 Gemini 3.5 Pro 仍是衡量 Google 交付能力的最清晰标准。

请依次关注这三个信号:公开发布 3.5 Pro、可复现的编程能力提升,以及具体的 Gemini 4 访问计划。哪一个会最先到来?它又能否弥合 Google 的雄心与执行力之间的差距?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page