top of page

Google 推出 Gemini Windows 应用,加入拥挤的桌面 AI 之争

9月12日
讀畢需時 14 分鐘

Google 于 9 月 10 日推出 Gemini Windows 应用,在多年以浏览器为先的使用方式之后,将其 AI 助手带到 Windows 10 和 Windows 11。该应用可通过 Alt + Space 在当前工作内容上方打开,而这一快捷键此前已与 Windows 上的 ChatGPT 关联。这种碰撞恰好体现了更大的竞争:每一家主要 AI 供应商都希望成为用户在离开当前任务前首先唤起的助手。

这次发布并不只是为 Gemini 网站增加了一个新外壳。Google 正将持续可用的桌面访问能力与 Gmail、Google Drive 及其他已连接服务中的信息结合起来。用户还可以将多步骤工作委派给 Gemini Spark、使用 Nano Banana 生成图片,并通过 Gemini Omni 制作视频。

Microsoft 仍掌控着操作系统,而 Copilot 已通过专用键盘按键、语音激活和屏幕感知功能,更深入地接入 Windows。OpenAI 也已将 Alt + Space 确立为其 ChatGPT 伴随窗口的快捷键。Google 入场较晚,但它拥有两家竞争对手都无法忽视的账户上下文优势。

Gemini Windows 应用实际改变了什么

Google 将 Gemini 从一个访问目的地变成了可覆盖几乎所有 Windows 任务的常驻层。

据 Google 的 Windows 发布公告介绍,这款新应用现已面向全球 Windows 10 和 Windows 11 用户推出。按下 Alt + Space,即可在当前应用上方打开 Gemini,让用户无需切换至浏览器标签页就能提问。

这一交互看似细微,但对于在一个工作日中可能使用数十次的助手而言,唤起速度至关重要。打开网站会在发现问题和寻求帮助之间形成一段小小的间隔,而全局快捷键可将这一间隔缩短为两次按键。

Google 描述了几种即时使用场景。审阅文档的人可以让 Gemini 核查事实;准备幻灯片的人可以请求标题创意;其他用户则可以打开更大的工作区,进行更长时间的对话。

专用窗口还提供了现有的 Gemini 功能。Google 将 Gemini Spark 描述为个人 AI 代理,它能够处理多步骤任务,而不只是回答单一提示。使用 Spark 需要符合条件的 Google AI 订阅,且可用性因地区和条件而异。

Connected Apps 又提供了一层能力。用户可以让 Gemini 根据存储在 Gmail 和 Google Drive 中的材料起草项目摘要。该助手会检索相关账户信息,再利用这些上下文生成所需输出。

这一流程不同于手动将邮件线程和文档复制到聊天机器人中。它减少了准备工作,并可能保留消息、文件和项目历史之间的关联。不过,结果质量仍取决于 Gemini 能够访问和检索哪些内容。

创意生成也集成在同一界面中。Nano Banana 用于创建和编辑图片,Gemini Omni 则负责视频创作。这些工具让用户无需打开独立的生成式应用,便可将文字创意转化为视觉素材。

Google 称该应用轻量,能够在不拖慢电脑的情况下安静运行。这是公司的说法,而非独立的性能测试结论。其资源占用仍需在较旧的 Windows 10 系统、主流笔记本电脑和较新的 Arm 架构设备上进行测试。

官方 安装要求 的门槛相对亲民。该应用需要 Windows 10 或更高版本、至少 8 GB 内存、200 MB 可用存储空间,以及稳定的互联网连接。

Google 为 x64 和 ARM64 硬件提供了版本支持。这一点很重要,因为如今的 Windows 市场既包括传统的 Intel 和 AMD 系统,也包括 Arm 设备。若桌面助手遗漏一种架构,就等于放弃了新兴 PC 市场的一部分。

此次发布也带来了某种张力,因为其最显著的优势是访问便利性,而非操作系统控制权。Gemini 可以显示在其他程序上方,并使用已连接的 Google 数据。Google 尚未表示,它能够广泛操控任意 Windows 应用或控制系统设置。

目前,这款应用让 Gemini 更接近工作过程,而非完全进入操作系统内部。这仍是一次重要改变。它让 Google 在 Microsoft 控制平台、OpenAI 已占据同一快捷键的 PC 上获得了一个常驻位置。

一个快捷键如今代表三款竞争助手

桌面 AI 竞争正演变为一场争夺用户第一次按键交给哪位助手的较量。

Google 选择 Alt + Space 作为打开 Gemini 的默认方式。OpenAI 在其 Windows 应用运行时,也使用同一组合键打开 ChatGPT 伴随窗口。两家公司正在争夺完全相同的肌肉记忆。

OpenAI 的 伴随窗口 可以发起对话、接受上传文件并生成图片。它还会记住上一次的屏幕位置,使用户无需打开完整的 ChatGPT 界面即可使用。

快捷键冲突会带来实际后果。Windows 无法可靠地将同一个全局键盘组合分配给多个同时运行的应用。OpenAI 建议用户在其他程序已注册 Alt + Space 时更改其热键。

Google 的支持材料同样将这一快捷键视为进入应用的快速入口。最终结果很可能不会是戏剧性的技术对抗。用户会选择一个默认助手、重新分配快捷键,或关闭较少使用的应用。

这个小决定可能塑造长期行为。绑定到最便捷快捷键的助手,会获得更多即兴提问、快速改写和轻量级请求。这些交互有助于将偶尔使用转化为日常习惯。

Microsoft 则凭借更强的平台地位处理同一问题。其 Copilot 应用可通过受支持键盘上的 Copilot 键或 Windows + C 打开。用户可以将这些控件配置为启动完整应用或更小的快速视图。

Microsoft 还支持可选的“Hey Copilot”唤醒短语。启用相关设置后,长按 Copilot 键或 Windows + C 即可开始语音对话。这些入口赋予 Copilot 来自 Microsoft 对 Windows 所有权的特权。

该公司的 Copilot 访问 文档说明了其中的差异。Google 和 OpenAI 必须发布与 Windows 共存的应用,而 Microsoft 可以连接软件、键盘硬件和操作系统行为。

Copilot Vision 进一步抬高了竞争门槛。在获得许可后,它能够查看共享的应用或浏览器窗口,并对屏幕上显示的内容作出回应。Microsoft 还开发了引导式辅助功能,可指引用户找到应用内的控件。

Gemini 的 Windows 发布公告并未宣称具备同等的屏幕共享或视觉引导能力。它强调的是覆盖式访问、Google 服务连接、多步骤任务和媒体生成。这些功能很实用,但反映的是不同的起点。

这使 Microsoft Copilot 成为 Google Windows 战略的主要对手。ChatGPT 直接争夺用户,甚至共享同一快捷键,但 Microsoft 决定了任何助手能够多深入地集成到操作系统中。

Google 无法仅靠匹配 Copilot 的启动手势赢得这场竞争。它需要让用户足够偏好 Gemini 的智能、已连接上下文或创意工具,从而选择它而非围绕 Windows 构建的助手。

Google 早期的桌面搜索实验提供了一条历史线索。2025 年 9 月,该公司推出了一款 Windows Labs 应用,使用 Alt + Space 搜索本地文件、已安装应用、Google Drive 和网络。

那项桌面实验还包含 Google Lens 和 AI Mode。这表明,在专用 Gemini 应用发布前一年,Google 已在探索 Windows 上的通用入口点。

新版本围绕 Gemini 收窄了这一概念。Google 不再主打跨多个位置的搜索,而是主打能起草、创作、检索账户信息并管理较长任务的助手。

这一转变反映了桌面软件更广泛的变化。搜索框过去的竞争重点是帮助用户找到应用或文件。如今,AI 助手则竞争理解任务并完成部分成品工作。

Google 账户上下文才是 Gemini Windows 应用真正的突破口

安装 Gemini 的最强理由不是 Alt + Space,而是已经存储在用户 Google 账户中的信息。

竞争对手很容易复制键盘快捷键。对多年积累的消息、文档、日历和项目材料的访问则更难复刻。Google 可以将 Gemini 连接到许多知识工作者每小时都在使用的服务。

以准备每周更新的项目经理为例。有价值的任务并不只是“写一份状态报告”。助手必须识别邮件中的最新决策、找到支持文档、区分当前计划与过时计划,并整理出结果。

通用聊天机器人在收到正确材料后可以完成写作阶段,但收集这些材料仍是成本最高的部分。当 Gemini 能以更少的人工准备找到相关 Gmail 和 Drive 内容时,Google 的优势便会显现。

这与 knowledge blending 所解决的问题相同:助手会在生成答案前整合分散的工作上下文。其价值来自让输出基于用户的真实信息,而不只是生成流畅的文字。

Google 表示,Windows 应用可以利用已连接服务起草项目摘要。这个例子指向了更大的野心:Gemini 希望成为用户查询和重组其工作历史的界面。

桌面位置强化了这一野心。用户可能在 Excel、浏览器、PDF 阅读器或消息应用中遇到问题。此时,Alt + Space 提供了一条通往账户级上下文的路径,无需用户重新打开多个 Google 标签页。

Gemini Spark 将这一理念从检索延伸至执行。Google 将 Spark 定位为处理多步骤任务的代理,这意味着它能够完成一系列步骤,而非仅返回一个孤立的答案。Windows 应用为这些任务提供了一个常驻入口。

然而,已连接上下文并不等同于完整的桌面感知。Gemini 可以从用户已授权的服务中检索信息。发布公告并未称它能够自动理解每一个可见窗口、本地文件夹或应用状态。

这一区别划分了应用上下文和操作系统上下文。工作存在于其云服务中时,Google 最具优势;任务依赖 Windows、Microsoft 365 或对当前屏幕的直接理解时,Microsoft 则最具优势。

企业身份又形成了另一条分界线。使用 Google Workspace 的组织可能会认为 Gemini 是更自然的助手,因为其文件和通信本就位于 Google 环境中。以 Microsoft 为主的组织则有相反的动力。

最终不会出现一个通吃市场的桌面端赢家。助手的选择往往取决于企业知识资产所在的位置、身份系统以及管理策略。桌面应用让 Gemini 成为这一决策中一个可信的选项。

创意工具将吸引力从办公信息检索扩展到了更多场景。营销人员可以在同一工作区中总结规划讨论、起草营销文案、生成概念图,并指导制作一段短视频。每一步都建立在此前的对话之上。

Nano Banana 尤其值得关注,因为图像生成可用于演示文稿、原型图和早期营销创意。Gemini Omni 则将视频加入这一工作流。Google 将两者置于文本工作旁,而非将其视为独立的目的地。

这种整合也给 OpenAI 和 Microsoft 带来压力。ChatGPT 仍是重要的跨平台助手,但 Google 无需用户重新构建上下文,就能将创作与账户信息关联起来。Microsoft 则能将 Copilot 与组织数据及 Windows 本身连接起来。

因此,Google 的较晚入场也带来了明确的突破口。它并未承诺在首个版本中就比 Microsoft 更懂 Windows。它押注的是:拥有最相关个人或工作场景上下文的助手,能够赢得用户频繁的桌面端使用。

随着模型在基础能力上逐渐趋同,这一判断变得更为重要。多数领先助手都能总结文本、改写段落、构思标题和生成图像。差异化越来越取决于上下文、分发能力和任务连续性。

Gemini Windows 应用结合了这三者。Windows 提供分发渠道,Alt + Space 改善了访问便利性,而 Google 服务则提供上下文。Spark 和创意模型则为多步骤工作增添了连续性。

这一组合能否成功,取决于执行效果。检索必须找到正确的信息,权限控制必须保持易于理解,生成结果也必须足够准确、值得信任。一个便捷的快捷方式无法弥补薄弱的事实依据。

首个版本仍存在原生桌面能力缺口

Google 将 Gemini 称为 Windows 应用,但其发布承诺的桌面感知能力,或许低于“原生”一词所暗示的水平。

该应用可覆盖在当前工作内容之上打开,但 Google 并未表示它会自动读取活动窗口。它能够访问获准的 Google 服务,但公告没有描述广泛的本地文件搜索、屏幕共享或直接控制 Windows 设置等能力。

这些缺失尤其显眼,因为 Google 已在 macOS 上提供了更丰富的屏幕上下文能力。该公司的 Mac desktop app 允许用户共享一个窗口,包括本地文件,并就窗口中显示的内容提问。

在 Mac 上,Google 用一张复杂图表展示了这一功能。用户可以共享相关窗口,并让 Gemini 识别其中最重要的三项要点。这一工作流将可见的本地资料转化为即时上下文。

Windows 发布采用了一个更受限的示例。它表示,用户在处理文档时可以要求进行事实核查。Google 并未明确 Gemini 能否自动看到该文档,因此用户可能仍需提供必要的文本或文件。

这一差异可能只是暂时的。Google 表示,更多原生桌面能力将逐步推出。不过,它没有给出这些新增功能的时间表、功能清单或区域路线图。

这一缺口之所以重要,是因为 Microsoft 已将屏幕上下文作为 Copilot 的核心能力。经用户许可后,Copilot Vision 可以查看共享的桌面或应用程序,解释其所见内容,并引导用户完成任务。

当任务涉及 Windows 本身时,Microsoft 的优势最为明显。排查设置问题、定位某项控件,或理解一个陌生应用程序,所需的不只是云账户信息检索,还需要了解当前桌面状态。

Google 最强的发布功能则运行在这一状态之上的一层。Gemini 可以创建内容、检索 Google 数据并处理任务。它出现在 Windows 应用旁边,但尚未宣称在应用内部拥有深度控制能力。

隐私和控制同样值得审视。便捷访问 Gmail 和 Drive 增加了对话期间可用的个人或工作场景上下文。用户需要了解哪些已连接服务处于启用状态,以及每项请求能够检索什么内容。

发布材料并未提出专门面向 Windows 的新隐私模式。现有的 Google 账户和 Gemini 控制机制仍然管理这一体验。组织将需要依据自身的管理、保留和合规要求来评估访问权限。

硬件支持也构成另一项考验。Google 正式支持配备 8 GB 内存的 Windows 10 及更高版本系统,包括 x64 和 ARM64 系统。广泛兼容性固然有用,但也扩大了必须保持性能一致的设备范围。

Google 表示,该应用轻量且安静。独立测试需要确定其内存占用、后台活动、启动行为、快捷键可靠性,以及在图像或视频工作期间的性能。公告中没有这些测量数据。

Windows 10 支持也值得注意,因为 Microsoft 已于 2025 年 10 月结束对该操作系统的常规支持。Gemini 可以在其上运行,但安装 AI 助手并不能解决使用已停止支持操作系统的安全风险。

可用性也附带条件。用户需要使用个人 Google 账户,或符合条件的工作或学校账户。管理员必须为受管理账户启用 Gemini,而某些代理式或媒体功能则需要符合条件的订阅。

Gemini Spark 和 Gemini Omni 同样存在资格限制。Google 的发布说明称,可用性因情况而异,且用户必须年满 18 岁才能使用这些功能。因此,实际体验会因账户和地区而不同。

这些限制并不意味着此次发布无足轻重。它们表明,Google 在完成更深层的 Windows 集成之前,已先建立了一个分发入口。这种顺序很常见,但用户应区分当前功能与未来承诺。

最大的不确定性在于,Google 能否在不拥有平台的情况下弥合桌面感知能力缺口。Windows API 可以支持大量集成,但 Microsoft 控制着操作系统的特权界面以及平台变更的节奏。

第二个不确定性涉及采用情况。Google 尚未披露 Windows 下载总量、活跃使用量、留存率,或通过快捷方式调用 Gemini 的用户占比。没有这些数字,覆盖范围仍是一项承诺,而非已被证明的使用习惯。

第三个不确定性涉及差异化。如果用户将该应用视为通往同一 Gemini 网站的更快入口,参与度可能仍然有限。当已连接的上下文和多步骤工作能够持续节省时间时,这一发布才更具说服力。

因此,这款应用应被视为开局之举。Google 已在桌面端占据一席之地,并匹配了一种熟悉的助手使用模式。但它尚未证明 Gemini 比竞争对手更了解 Windows 工作。

桌面 AI 竞赛接下来会发生什么

三个信号将表明 Gemini Windows 应用会成为工作层,还是仍只是一扇聊天机器人窗口。

第一个信号是 Google 承诺推出更多原生桌面能力。屏幕共享、本地文件上下文、系统集成或感知应用状态的辅助功能,都将弥合当前版本最明显的缺口。

屏幕上下文将巩固 Google 的地位,因为它能减少手动输入。用户可以将 Gemini 指向屏幕上已经打开的图表、设计稿、错误信息或文档。这会让 Alt + Space 不再只是一个快捷方式。

如果这些能力迅速到来,并能在常见应用程序中正常工作,此次发布将看起来像更广泛桌面助手的基础。如果它们始终含糊不清,Microsoft 的操作系统优势将更加明显。

第二个信号是 Microsoft 和 OpenAI 的回应方式。Microsoft 可以通过 Windows 深化 Copilot 的集成,而 OpenAI 可以扩展 ChatGPT 的伴随式体验和已连接服务。两家公司都可能削弱 Google 的差异化优势。

Microsoft 的回应最为关键,因为它控制着平台。它可以将 Copilot 键、任务栏访问、语音调用、Vision、文件搜索和引导式辅助功能,打磨为 Windows 相互连接的组成部分。

OpenAI 的回应同样重要,因为 ChatGPT 直接争夺相同的 Alt + Space 使用习惯。更好的文件集成、代理式工作能力或账户连接,可能让现有 ChatGPT 用户几乎没有理由更换默认快捷方式。

快捷方式配置本身也可能成为一个显著战场。如果用户反复遇到 Gemini、ChatGPT 与其他工具之间的冲突,各供应商都需要提供更清晰的引导和更便捷的自定义方式。

第三个信号是采用质量,而非仅仅是下载量。Google 需要证明,人们会回到 Windows 应用、连接有用服务、分配多步骤任务,并在无需退回浏览器的情况下完成工作。

留存率将强化这样一种论点:桌面端布局会改变用户行为。频繁使用已连接的 Gmail 和 Drive 上下文,也将验证 Google 相对于缺乏同等访问能力的助手所具备的核心优势。

相反,如果高下载量之后是低重复使用率,则表明该应用相较于现有网页体验并没有增加太多价值。用户已经可以固定 Web 应用、保持浏览器标签页打开,或安装渐进式 Web 应用。

企业部署将为采用质量提供另一扇观察窗口。管理员关心身份、访问权限、数据控制、更新管理和可衡量的生产力。单靠一个面向消费者的快捷方式,无法解决这些问题。

当前版本使 Google 成为 Windows 分发渠道的直接参与者,而不再只是用户主要通过 Chrome 或网页访问的助手。这一转变迫使 Microsoft 和 OpenAI 在问题出现的那一刻就与 Gemini 竞争。

Google 的战略很明确。它希望桌面用户在手动搜索、切换应用程序或重新构建项目上下文之前,先召唤 Gemini。Gmail、Drive、Spark、Nano Banana 和 Omni 为该应用提供了多种延续互动的方式。

尚未解决的问题在于深度。真正的桌面助手必须理解用户当前的任务、检索正确的背景信息、遵守清晰的边界,并帮助完成下一步操作。快速访问只解决了第一步。

未来三个月,应首先关注 Google 的原生功能更新,其次关注竞争对手的桌面端变化,第三关注重复使用的证据。这些信号将共同表明,Gemini Windows 应用是否正在成为日常工作的一部分。

对于现在正在选择桌面助手的人来说,应测试最耗费准备时间的工作流。比较 Gemini、Copilot 和 ChatGPT 如何收集上下文、遵守权限,并在不同步骤间保留工作成果。不要只根据单一回答或生成图像来评判它们。最有用的助手,将是那个能减少上下文收集工作、同时不隐藏其访问内容的助手。Google 为 Windows 用户提供了一个可信的新选择,但决定性的功能仍在后面。下一批 Gemini Windows 应用更新将揭示,Alt + Space 打开的会是一个持久工作区,还是仅仅另一扇对话窗口。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page