top of page

在 Google App 17.2 中发现 Gemini Live Thinking Mode

Gemini Live Thinking Mode Found in Google App 17.2

最新 Google App 17.2 更新中隐藏的代码显示,Google 终于在解决 其语音 AI 面临的最大投诉。拆解分析指向即将推出的专用 Gemini Live Thinking Mode,以及一套归入全新“Labs”设置下的实验性功能。

对于过去几个月一直在与当前版本 Gemini Live 搏斗的用户(由更快但往往更浅薄的 Gemini 2.5 Flash 驱动)而言,这是一个转折点。泄露信息确认 Google 正转向一种会暂停以处理复杂查询的模型,而不是直接吐出幻觉的第一个标志。

以下是发现内容的详细分解、社区要求这些具体更改的原因,以及新 Labs 功能的工作方式。

为什么用户需要更慢、更智能的 AI

Why Users Need a Slower, Smarter AI

在剖析代码之前,我们需要先解决 Gemini Live Thinking Mode 旨在填补的用户体验差距。当前 Gemini Live 的迭代速度很快,但这种速度是有代价的。

早期采用者的反馈一致:当前模型在细微对话中常常感觉“脑死亡”。系统优先考虑延迟而非逻辑,导致表面化的答案在 scrutiny 下崩溃。但挫败感远不止于糟糕的答案。

打断问题

最强烈的投诉涉及激进的语音活动检测 (VAD)。试图进行流畅对话的用户发现,只要他们停下来呼吸或思考,就会被打断。

系统将沉默视为任务完成。它在用户完成想法之前就触发响应。这创造了一个不连贯的循环,让用户感到被催促。需求很明确:人们想要一个“手动发送”按钮或切换开关,强制 AI 等待。虽然 17.2 版本中的泄露并未明确确认手动按钮,但 Thinking Mode 的引入暗示了 AI 管理时间和节奏方式的根本转变。

探索 Google App 17.2 中的新“Labs”

Exploring the New "Labs" in Google App 17.2

Google 似乎正在采用与其他科技巨头类似的策略,将这些高级、可能不稳定的功能隐藏在“Labs”切换开关后面。这使他们能够在不干扰主流体验的情况下向高级用户推送 Gemini Live Thinking Mode

根据文件拆解,Labs 部分将托管两个主要类别:

  1. Live Thinking Mode

  2. Live Experimental Features

这种分段表明 Google 承认速度与智能之间的权衡。他们不会替换快速、健谈的 Gemini 版本;而是为重度任务提供单独的通道。

Gemini Live Thinking Mode 的工作原理

代码字符串将 Gemini Live Thinking Mode 描述为 AI“花时间思考”以提供“更详细响应”的状态。

这很可能是 Gemini 3 Pro 模型(2025 年 11 月推出)推理能力的移动端实现。此前,移动用户只能使用轻量级 Flash 模型以节省电池并减少延迟。

启用此模式,相当于告诉应用你不介意 5 到 10 秒的延迟,只要这能让代理执行思维链处理即可。对于编码问题、复杂旅行规划或哲学辩论,这种额外的延迟是功能而非缺陷。

然而,一些用户持怀疑态度。他们担心“Thinking Mode”可能只是充当额外安全层和公关友好过滤的缓冲,而不是真正的认知处理。如果延迟仅导致更 sanitized、“企业安全”的响应,采用率将会骤降。此处的价值主张完全取决于暂停期间获得的洞察质量。

Project Astra 与视觉能力

Gemini Live Thinking Mode 一起发现的最令人兴奋的补充可能是对视觉的引用。实验性标志包括“看到某物时响应”的功能。

这是 Project Astra 实时多模态能力的期待已久的到来。它不是拍摄静态照片并请求分析,而是暗示连续视频流,让 Gemini 观看摄像头所见并实时评论。

对于硬件故障排除或导航新城市,这将手机从被动屏幕转变为主动观察者。它还与“Agent”概念相关联,即 AI 不仅仅是聊天机器人,而是理解你物理环境的界面。

多模态记忆与上下文

Multimodal Memory and Context

“Experimental Features”部分还引用了“多模态记忆”。这与标准历史不同。标准历史是文本日志。多模态记忆意味着 AI 记得你上周展示给它的图像、昨天分析的声音片段,以及一小时前进行的语音对话的上下文。

目前,移动端的上下文窗口有限。你经常需要重新上传图像或提醒机器人之前的约束。如果 Gemini Live Thinking Mode 能够访问持久的跨媒体记忆库,它将解决困扰长期 AI 交互的连续性问题。

噪音与可靠性问题

剖析此泄露的 Reddit 线程突出了另一个关键领域:噪音消除。代码显示“更好的噪音处理”是本次更新的一部分。

对于以语音为先的功能,Gemini Live 在非安静家庭办公室的环境中 historically 表现不佳。在汽车或繁忙咖啡馆中使用它,常常导致 AI 将背景对话转录为用户输入。改进的噪音门控不如 Thinking Mode“性感”,但它是产品在现实世界中可用的技术要求。

我们何时能看到 Gemini Live Thinking Mode?

这些字符串在 Google App 17.2 中的存在表明代码已在设备上。服务器端开关尚未开启。

历史上,Google 以交错 rollout 方式发布这些功能,通常优先考虑美国英语用户和 AI Premium 订阅者。社区情绪强烈反对这种区域锁定。欧洲和亚洲用户已经在表达不满:2025 年宣布的功能在 2026 年初仍未在他们的地区出现。

开发者访问

还有推动在 AI Studio 中开放这些功能。开发者希望构建利用“Thinking”端点的应用,而无需 Gemini 应用包装器。如果架构支持,我们可能会看到第三方应用利用 Gemini Live Thinking Mode 进行专业任务,如移动端的医疗诊断辅助或法律文档审查。

评估升级路径

Assessing the Upgrade Path

此更新代表 mobile AI 的成熟里程碑。我们正在超越即时语音生成的“哇”因素,进入实用阶段。

用户不只是想要一个能立即回应的 AI;他们想要一个知道何时闭嘴、何时倾听、何时思考的 AI。Gemini Live Thinking Mode 的成功不取决于模型有多聪明——我们知道 Gemini 3 有能力。它将取决于实现方式。

如果 Google 能解决打断问题,并证明“思考”时间能产生切实价值,这将定义 2026 年移动代理的标准。如果它仍然是一个粗鲁、易打断的聊天机器人,只是回答时间更长,切换开关很可能保持关闭。

FAQ

Gemini Live Thinking Mode 与标准模式有什么区别?

标准模式优先考虑速度,可能使用 Gemini 2.5 Flash 模型实现即时回复。Thinking Mode allows the AI to pause and process complex logic,可能利用 Gemini 3 Pro 进行更深入的推理和更详细的答案。

Gemini Live Thinking Mode 会阻止 AI 打断我吗?

虽然未明确确认为“不要打断”设置,但转向基于思考的架构暗示了节奏的变化。然而,用户特别要求手动“发送”按钮以完全防止过早打断。

如何启用新的 Gemini Live 功能?

这些功能将出现在 Google App 设置中的新“Labs”或“Opt-in”部分。你需要使用 17.2 或更高版本,且功能必须通过 Google 的服务器端更新激活。

新更新是否包含视觉能力?

是的。代码引用了“看到某物时响应”,这与 Project Astra 的技术一致。这允许 AI 分析来自摄像头的实时视频流,而不仅仅是静态图像。

Gemini Live Thinking Mode 是否免费使用?

泄露未指定定价,但高级推理功能通常捆绑在 Google One AI Premium 订阅中。基本功能可能免费,但完整的“Thinking”能力可能受限。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page