top of page

Google Gemini 延期暴露算力与编程瓶颈

据报道,Google 将 Gemini 3.5 Pro 的发布推迟了两个月,尽管该模型是其重振 AI 势头的核心。此次延期让一次常规产品更新演变为一场考验:Google 能否将其庞大的基础设施转化为前沿模型性能。

一则中国关于 Gemini 开发的报道援引知情人士称,内部测试暴露出该模型在编程方面仍存在短板。报道还称,算力限制以及 Google 内部的分歧拖慢了模型开发。这些说法尚未得到独立全面证实。

据报道,Google 联合创始人 Sergey Brin 的介入提高了事态的重要性。Brin 据称一直敦促核心 AI 员工缩小与领先竞争对手之间的差距,并将更多资源投入能够改进自身开发流程的系统。

Google 的公开时间线已显示出明显变化。5 月,该公司表示 Gemini 3.5 Pro 正在内部运行,并将于次月推出。到 7 月,Google 则将其描述为一款正在接受合作伙伴测试的模型,只有在准备就绪后才会广泛开放。

这种变化让 Google 的公开信心与更复杂的运营现实形成对照。该公司能够在全球范围内推出高效模型,但其旗舰模型还必须在编程、智能体和长时技术任务方面与 Anthropic 和 OpenAI 竞争。

Google 调整了 Gemini 3.5 Pro 的发布时间表

Google 将 Gemini 3.5 Pro 的具体发布窗口替换为不设期限的“准备就绪”承诺。

Google 于 5 月 19 日推出 Gemini 3.5 系列,首先发布 Gemini 3.5 Flash。在同一篇Gemini 3.5 公告中,该公司表示 Pro 已在内部使用,并称该模型将在下个月推出。

6 月过去了,该版本并未发布。Google 反而在 7 月 21 日推出了三款侧重效率的模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。

随附的7 月模型更新将 Gemini 3.5 Pro 描述为正在与合作伙伴进行测试。Google 表示,计划在模型准备就绪后尽快广泛开放。

这一措辞很重要,因为它取消了明确日期。它也表明 Google 已达到可让部分合作伙伴评估模型的阶段,但更广泛部署仍需更多工作。

8 月 13 日发布的这则中国新闻快讯进一步称,在内部结果仍落后于竞争对手、包括代码生成能力在内的多个领域表现不足后,Google 已将新旗舰模型的发布时间推迟至 8 月。

该报道还将较慢的开发周期归因于算力有限和内部意见分歧。Google 和 Google DeepMind 均未公开确认这些具体原因。

Google 的可见行动仍支持更广泛叙事的一部分:在更大的 Pro 模型持续缺席之际,该公司仍在不断推出更小、更快的模型。

这未必意味着整个 Gemini 项目已经停滞。Flash 模型面向的是不同工作负载,尤其是需要低延迟和高吞吐量的应用。即使无法匹配旗舰模型最深层的推理能力,它们仍可能在商业上取得成功。

然而,Pro 的缺席改变了人们解读这些发布的方式。原本看似协调一致的产品扩展,如今也像是 Google 在完成更困难模型期间维持势头的一种方式。

这一区别对开发者很重要。Flash 模型可以分类文档、调用工具、处理图像并管理常规智能体任务。旗舰 Pro 模型则承载着不同期待:高难度编程、延展推理、研究,以及跨越多个步骤的复杂工作。

这些工作负载会暴露短暂演示往往掩盖的错误。模型可能一次就生成令人信服的界面,却仍难以安全地修改大型代码库。

长时任务还会放大微小错误。规划阶段的一个薄弱假设,就可能让智能体在有人发现失败之前连续进行多次错误的工具调用。

因此,Google 面临的是比一次简单聊天机器人更新更严格的发布决策。过早发布,可能会暴露其在企业开发者如今最积极比较前沿模型的确切类别中的短板。

等待同样有代价。在 Google 持续测试期间,开发者可能会将评估流程、提示词和智能体框架迁移至其他供应商。

这是故事中的第一个重要逆转。Google 以一个精确的近期承诺开启 Gemini 3.5 周期,随后转向以准备程度而非时间定义的发布标准。

为什么编程已成为 Google 最显眼的压力点

编程不再只是专业基准,因为它检验 AI 系统能否规划、行动、验证和恢复。

Gemini 面临的压力并不只来自代码补全。现代编程智能体必须检查代码库、理解指令、编辑多个文件、运行工具、解读失败并调整方法。

这一过程与许多企业智能体工作流相似。审查财务记录或准备合规文件的智能体,同样需要收集上下文、执行步骤并检查自身输出。

编程为这些能力提供了可衡量的环境。补丁要么通过测试,要么无法通过。应用要么成功构建,要么失败。工具调用要么修改正确资源,要么制造新问题。

这使软件工程成为衡量更广泛智能体可靠性的有用代理指标,也解释了为何据称的编程能力短板会延迟一款面向高要求专业用途的模型。

Google 公开将 Gemini 3.5 定位为具备“前沿智能与行动能力”的模型。该公司将 Flash 描述为其发布时最强大的智能体和编程模型。

Google 报告称,其在评估智能体完成终端任务的 Terminal-Bench 2.1 上取得 76.2% 的分数;还报告称,在测试与通过 Model Context Protocol 暴露的工具交互能力的 MCP Atlas 上取得 83.6%。

这些是公司自行选择的基准结果,并不能证明其在每个代码库中都能保持稳定表现。但它们仍显示出 Google 认为竞争正朝哪个方向发展。

更困难的问题,是将评测结果转化为可靠的工作能力。模型可能在精心设计的基准上得分良好,却仍会进行不必要的编辑、误读本地约定,或陷入循环。

开发者关心的是围绕模型的整个系统。智能体框架、工具权限、上下文管理、测试环境和恢复逻辑,都可能与基础模型一样影响结果。

Google 一直通过 Antigravity 及其 Gemini 开发者平台构建这套外围系统。它还展示过代码迁移、界面生成和智能体协作完成更长任务的案例。

不过,更强的框架无法完全弥补薄弱的规划能力或不可靠的代码推理。它可以为模型提供更好的工具,但模型必须正确选择并使用这些工具。

Anthropic 已将编程塑造成 Claude 身份的核心部分。OpenAI 也投入大量精力开发编程智能体和用于软件开发的内部工具。

这种竞争为 Google 带来直接考验。一家拥有数十年软件工程经验的公司,必须证明 Gemini 能够在复杂的技术环境中高效工作。

据报道,Brin 的参与正反映了这一压力。早期报道称,他敦促 Google 团队缩小内部工程师所用 AI 编程工具的差距。

改进内部编程智能体具有复合吸引力。更好的智能体可以提升研究人员和工程师的生产力,进而加快后续模型的研发。

这并不意味着内部编程工具会自动造就更好的公开模型。Google 的私有代码、基础设施和安全要求,可能会催生无法对外发布的能力。

但这意味着编程质量已成为开发引擎本身的一部分。如果竞争对手的研究人员能够使用更好的智能体进行实验、分析失败或维护训练系统,其优势就会延伸到面向客户的产品之外。

对于选择模型的工程团队而言,这种竞争让严谨评估变得更重要。团队应针对自身的代码库、安全边界和审查要求测试模型。

他们还需要在多次实验中保留持久的上下文。可搜索的工程知识库可以在反复试验中保存架构决策、测试证据和模型失败模式。

实际问题并不是 Gemini 能否生成代码,而是延期的 Pro 模型能否以比替代方案更少的干预完成高难度工程工作。

真正的限制在于算力分配,而非算力所有权

拥有庞大基础设施并不能消除稀缺性,因为训练、评估、云端需求和产品推理都在争夺同一容量。

Google 运营着全球最大的计算平台之一,并设计自己的张量处理单元。这种规模让有关算力限制的报道听起来有些反直觉。

然而,拥有基础设施并不意味着可用容量无限。前沿模型开发会在预训练、后训练、合成数据生成、安全测试和反复评估中消耗算力。

一次失败的训练方向可能尤其昂贵。团队无法收回已经投入的时间和容量,而新的训练运行还必须与其他内部优先事项竞争。

Google 还必须满足消费者和企业需求。Gemini 覆盖 Gemini app、Search、开发者 API、Workspace 和云产品。

每一次成功的产品扩展都会增加推理需求。除非基础设施以相同速度增长,否则这种需求可能会与研究能力竞争。

因此,据报道的 Gemini 延期指向一个分配问题。Google 必须决定多少容量用于支持现有用户、较小模型、旗舰模型开发以及下一代研究。

7 月的发布展示了一种应对方式。Gemini 3.6 Flash 的设计目标是在提升多项测量能力的同时,比 Gemini 3.5 Flash 使用更少的输出 token。

更少的 token 可以降低完成任务所需的算力。更高的效率也有助于 Google 以固定规模的基础设施服务更多请求。

Gemini 3.5 Flash-Lite 面向并非始终需要最大模型的高容量工作负载。将常规任务路由至较小模型,可以为更困难的请求保留昂贵的容量。

这种产品组合方式在运营上合乎逻辑。企业并不需要为每一项分类、提取或摘要工作都使用最高级别的推理能力。

但高效模型并不能消除 Pro 的象征性重要性。Google 仍需要一款旗舰模型,来确立 Gemini 家族能力的上限。

这则中国报道称,内部意见分歧也导致进展缓慢。这些分歧的性质仍不清楚,该说法也缺乏公开细节。

潜在的紧张关系可能涉及发布质量、资源分配、安全性,或即时产品与长期研究之间的平衡。在没有直接证据的情况下,不能将其中任何一项表述为已确认的原因。

更站得住脚的结论更为有限。Google 不断调整的时间表表明,技术就绪度压过了其原定发布计划。

这不仅给研究人员,也给管理者带来压力。增加算力无法修复所有数据、架构、评估或组织层面的问题。

一次令人失望的训练运行,可能意味着存在可修复的数据问题;也可能表明某种方法已接近收益递减点。

团队随后必须决定:继续延长同一轮训练、调整后训练方法、修改评估方式,还是启动成本更高的新一轮再训练。每种选择都会消耗时间和稀缺的基础设施资源。

算力限制同样影响实验。研究人员若可用容量有限,就只能测试更少的想法、采用规模更小的试点运行,或等待更久才能获得结果。

这会拖慢模型改进所依赖的反馈循环。它也可能加剧内部争议,因为每项重大实验都意味着更高的机会成本。

Google 的基础设施仍是一项重大优势。该公司能够协调定制芯片、数据中心、模型研究、云端分发和消费级产品。

这次延期表明,这种优势并不会自动转化为成果。基础设施必须在恰当的时间可用、投入正确的实验方向,并辅以可靠的技术判断。

这一教训不止适用于 Google。前沿 AI 的竞争日益取决于排期与运营纪律,而不只是模型架构。

一家实验室或许拥有优秀研究人员和充足的计算能力。但如果训练、评估和部署的优先级将这些能力拉向不同方向,它仍可能损失时间。

Sergey Brin 的自我改进推动遭遇验证缺口

递归自我改进提供了一个颇具吸引力的加速循环,但据报道的 Google 计划仍未得到验证,且在技术上存在边界。

8 月的报道称,Brin 鼓励 Google 的 AI 组织将资源投入递归自我改进(通常简称 RSI)。RSI 指的是一个有助于改进其后继系统构建过程的系统。

最强的一种诠释设想 AI 能够在无人干预的情况下自行重新设计和升级。当前系统通常仍在由人设计和监控的更狭窄循环内运行。

一个编码代理可能会提出对评估工具链的修改、运行测试、比较结果,并建议新的实验。研究人员仍然定义目标、控制访问权限,并决定是否接受结果。

Google 已公开展示过较小规模的改进循环。其 Gemini 3.5 材料描述了两个代理分别担任构建者和玩家角色,并在迭代中完成一款游戏。

这一示例展示的是任务层面的优化,而不是对底层 Gemini 模型的自主重新设计。两者的差别至关重要。

修改应用程序的系统是在受限环境内工作。修改训练数据、模型架构或评估方法的系统,则可能引入更难察觉的错误。

自生成训练数据也可能强化既有弱点。如果模型生成存在缺陷的示例,再从中学习,看似的进步可能掩盖能力范围的收窄或扭曲。

自动化评估器带来另一种风险。模型可能在测量指标上取得改进,却没有改善人们实际需要的行为表现。

这是机器学习中的常见问题。一旦某项指标成为目标,团队就必须检查它是否仍然代表期望的结果。

编码为 Google 的改进循环提供了一个相对有据可依的场景。测试、构建和代码库检查能够提供直接反馈。

即使如此,通过测试也不能保证改动是好的。测试可能并不完整,代理也可能生成难以维护或在生产环境中不安全的代码。

因此,据报道的 RSI 推动应被理解为一种研发方向,而非 Google 已实现自主模型改进的证据。Google 尚未公开宣布具备此类能力。

即使技术细节仍不确定,Brin 的参与也具有组织层面的意义。创始人能够抬升某一研究方向的优先级、打破资源分配僵局,并将缩小竞争差距确立为高管层优先事项。

这种干预可以加快决策,也可能增加在团队尚未就最安全或最高效的实施方案达成一致前追求宏大设想的压力。

在 Gemini 项目的早期阶段,据报道 Brin 曾推动员工增加到办公室工作的时间,同样体现了这种张力。他的信息强调了赢得 AI 竞赛的紧迫性。

紧迫感可以缩短协调周期,但并不保证实验更好。前沿模型工作往往依赖审慎评估,恰恰是因为训练结果难以预测。

Google 还必须清楚区分“自我改进”的不同含义。优化回答的消费级助手,并不等同于编辑代码库的编码代理。

这两个例子都不等于模型独立改进自身训练系统。混淆这些类别,会让 Google 据报道开展的工作显得比现有证据所支持的程度更先进。

验证缺口是这个故事的核心。快讯依赖匿名消息来源,而 Google 的公开公告以更有限的方式讨论代理工作流和快速迭代。

因此,读者应区分三项说法:据报道,Brin 正在施加高管层压力;Google 公开支持迭代式代理工作流;向自主 RSI 的广泛内部转向尚未有公开记录。

这一区分并不意味着该报道无关紧要。它指出了 Google 可能认为具有战略吸引力的一个方向。

如果代理能够安全地加速实验,Google 或可减少评估、数据准备和软件维护所需的人力时间。即使没有开放式自我改进,这些收益也可能十分重要。

近期的检验标准是务实而非哲学性的:Google 能否利用 AI 辅助开发,按可预测的进度打造出更好的 Gemini 模型?

Google 的 Flash 战略无法完全替代 Pro

Google 较小规模的 Gemini 发布能够维持产品势头,但无法决定前沿推理与编码能力之争的胜负。

Google 在 7 月的发布为开发者提供了三种专门选项。Gemini 3.6 Flash 聚焦编码、知识工作、多模态任务,以及更高的 token 效率。

Gemini 3.5 Flash-Lite 面向文档处理和代理式搜索等低延迟、高吞吐量应用。Gemini 3.5 Flash Cyber 则专注于在受限部署环境中发现和修复软件漏洞。

这些产品反映出,市场既重视效率,也重视最高智能水平。当每项请求都使用可用的最大模型时,许多企业任务会变得不经济或过于缓慢。

Axios 将此次发布描述为部署竞争正转向模型质量与运行效率最佳平衡的证据。其 Flash 发布报道也强调了 Gemini 3.5 Pro 仍未发布。

这种平衡是 Google 的真实优势。Search、Workspace、Android 和 Cloud 为其部署专用模型提供了众多场景。

Google 可以将简单请求路由至小型模型,并将更大的模型留给困难的推理任务。这可以改善延迟并控制基础设施需求。

这一产品组合也降低了对单一旗舰发布的依赖。如果 Pro 需要更多时间,Google 仍可向客户交付可量化的改进。

不过,产品组合战略在拥有可信的高端层级时效果最佳。开发者希望知道,当工作流超出较小模型能力时该怎么办。

文档代理可能先处理提取和分类,随后遇到需要更深层推理的冲突记录。编码代理或许能处理常规修改,直至面对架构迁移。

如果没有具竞争力的旗舰模型,客户要么接受较弱的结果,要么将困难任务路由至另一家供应商。多模型框架使后一选择日益可行。

Anthropic 通过面向编码的 Claude 模型和代理工具施加压力。OpenAI 则通过面向长程推理与软件工作的模型和产品施加压力。

因此,核心竞争并非 Gemini 在每项基准测试上与所有对手逐一较量,而是 Google 对一体化 AI 平台的承诺,与高要求用户可为最困难步骤选择其他模型这一现实之间的竞争。

Google 的分发能力仍难以匹敌。Gemini 可以通过消费者已在使用的产品触达用户,也能通过成熟的云平台触达开发者。

分发可以让一款足够合格的模型以极大规模取得成功,但无法自动说服技术团队相信它最适合其最敏感的工作。

Google 还必须管理自身基准测试声明所带来的预期。当公司称某款模型达到前沿水平时,开发者就会用生产任务将其与竞争系统比较。

这些比较往往会得出不一致的结果。一款模型可能在视觉工作中表现出色,另一款则可能更可靠地处理大型代码改动。

这正是 Pro 延期并不能确立永久排名的原因。前沿模型的领先位置经常更替,基准测试领先地位也可能随着新模型或代理工具链而改变。

延期仍为竞争对手创造了窗口期。每过去一个月,其他供应商都有时间改进模型、吸引研究人员,并嵌入客户工作流。

切换成本不仅来自 API 语法。团队会围绕供应商积累提示词、评估数据、安全审批、可观测性系统和组织知识。

因此,Google 必须交付足以证明等待合理性的改进。一款姗姗来迟、却只能追平较早竞争对手的模型,会让公司继续追逐移动中的目标。

最理想的结果,是将 Pro 级推理能力与 Google 的效率、分发能力和工具生态相结合。最糟糕的结果,则是时间表再次变动,随后编码表现依然不稳定。

Flash 让 Google 继续留在市场中。Pro 将决定该公司能否引领前沿,而非只是围绕前沿进行优化。

Gemini 3.5 Pro 到来前应关注什么

三项信号将显示,Google 的延期是否带来了更强的模型,还是仅仅推迟了同一个竞争问题。

第一个信号是确定的发布,以及独立的编码评估。Google 的合作伙伴测试措辞证实了进展,但并不能证明已具备广泛就绪度。

公开模型将让开发者能够在真实代码库上,将 Gemini 3.5 Pro 与 Claude 和 OpenAI 系统进行比较。可靠的多文件编辑、从测试失败中恢复的能力,以及有纪律的工具使用,将比孤立的演示更重要。

关注模型在长任务中的表现。当代理在多步之后丢失上下文,或重复执行未成功的操作时,强劲的首个回答就没那么重要了。

第二个信号是 Google 已缓解基础设施瓶颈的证据。这类证据可能体现为更广泛的 API 可用性、稳定的速率限制,或更少的容量限制。

如果客户无法获得可预测的访问权限,再出色的模型也无法成为企业平台。可用性还揭示了 Google 能否在不从持续研究中挪走容量的情况下支撑需求。

Flash 系列的效率改进有所帮助,但 Pro 将对系统提出更高要求。Google 既需要更强的智能,也需要能规模化提供这种能力的运营模式。

第三个信号是 Google 下一次公开说明 AI 辅助模型开发的情况。具体且边界明确的案例,将有助于厘清据称的 RSI 计划究竟意味着什么。

有价值的证据包括:智能体改进训练工具、生成经过验证的测试用例,或帮助研究人员识别故障。Google 还应说明,人类在何处保留审批权。

对于系统自我改进的宽泛说法,则应保持更高程度的怀疑。AI 一旦影响用于评判自身进展的衡量指标,风险就会随之上升。

投资者和企业采购方还应关注组织稳定性。关于 DeepMind 士气的报道将延期发布与职业倦怠、人才流失,以及对落后的挫败感联系起来。

Google 不认同士气问题正导致模型表现不及预期的说法。该公司能否留住研究人员并维持清晰的技术领导地位,将构成更具体的检验。

对开发者而言,最佳做法不是在 Pro 发布前就宣布永久赢家。应基于实际工作负载持续进行评估,并记录各模型的失效之处。

测试编程智能体时,应采用真实的权限设置、审查关卡和回滚路径。在工具不受限制时表现出色的模型,置于生产环境的安全控制之下时可能会有不同表现。

企业采购方也应将模型质量与平台质量区分开来。治理、可用性、数据控制、可观测性和支持服务的重要性,可能超过一项微小的基准优势。

知识工作者应预期,这场竞争将影响日常产品。更优秀的智能体可能改善 Google 面向消费者和工作场景服务中的研究、文档分析及任务自动化。

据报道的延期,最终让 Gemini 3.5 Pro 更具重要性。Google 已经证明,它能够快速发布高效模型,并将其广泛分发。

尚未解决的问题是,Google 能否将算力、人才和创始人级别的紧迫感,转化为最能胜任高难度工作的模型。下一次 Gemini Pro 发布必须以可观察的性能回答这个问题,而不是再作一次承诺。

在此之前,应将这次延期视为一个重要警示,而非最终定论。针对真正重要的工作比较 Gemini,关注这三个信号,并在独立结果取代内部说法后重新审视你的模型选择。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page