Gemini Intelligence 能用,但受众仍不明确
- Olivia Johnson

- 1天前
- 讀畢需時 15 分鐘
Google 已在 Samsung 最新的折叠屏手机上推出 Gemini Intelligence,但一项早期测试暴露出其技术能力与实际价值之间的矛盾。
9to5Google 的测试成功让 Gemini 通过 Expedia 查找从伦敦希思罗机场飞往都柏林的航班。然而,系统在开始操作前从未询问用户偏好的时间或航空公司。
这一遗漏之所以重要,是因为 Google 将 Gemini Intelligence 定位为可代办日常数字事务的工具。早期体验表明,对于那些涉及个人偏好、成本高昂或难以撤销的决定,用户仍需亲自监督。
Samsung 的 Galaxy Z Fold8 Ultra、Fold8 和 Flip8 是首批搭载这一新平台的手机。在 Gemini Intelligence 扩展至 Pixel 手机和其他 Android 设备之前,它们为 Google 提供了一个高曝光度的发布平台。
这项技术可以在支持的应用中导航、理解屏幕内容,并在收到语音请求后完成多个步骤。相比仅能打开应用或展示搜索结果的传统助手,它的能力更强。
然而,导航成功并不意味着人们愿意让软件在航班、餐厅、商品或出行服务之间替自己做选择。更难的挑战在于:系统要在采取行动前知道哪些偏好至关重要。
因此,这次发布测试的不只是 Google 自动化 Android 的能力,也是在测试移动用户是否愿意委托普通决策——尤其当检查代理工作成果可能耗去它原本承诺节省的大部分时间时。
首次 Gemini Intelligence 测试暴露了真正的差距
Gemini Intelligence 完成了指定流程,但完成流程并不等于理解用户的决策。
Samsung 于 2026 年 7 月 22 日在伦敦的 Galaxy Unpacked 活动上发布了新款折叠屏设备。Google 借此推出了 Gemini Intelligence 相关的首批公开功能。
首批功能将任务自动化从少量服务扩展至 40 多款热门应用。Google 列出的支持场景包括购物、餐厅预订、旅行体验和活动门票。
Gemini 可以跨多个屏幕执行操作,并展示进度。用户可让它在后台继续运行、中途打断某一步、作出调整,然后再将控制权交还给代理。
这一设计代表着对早期智能手机助手的重要改变。Gemini 不再只是把请求转换为快捷操作,而是尝试直接操作界面并推进任务本身。
9to5Google 的 Damien Wilde 曾在一台预发布 Samsung 设备上短暂体验这项自动化功能。包括 Expedia 在内的一些必要服务已经安装,使他能够复现一段旅行演示。
Wilde 要求 Gemini 为一周后的日期查找从希思罗机场飞往都柏林的航班。根据他的 Gemini Intelligence 测试,系统打开 Expedia 并成功完成了搜索。
这一结果证实,Gemini 能将自然语言请求转化为多步骤交互。它也揭示了原始指令中有多少相关信息未被说明。
Gemini 没有询问 Wilde 偏好的航空公司,也没有要求提供出发时间,尽管这两项选择都可能决定推荐航班是否实用。
用户在注意到这一遗漏后可以介入。Google 的流程设计支持此类修正,用户提供更多指示后,Gemini 可以继续执行。
不过,介入会改变价值判断。用户必须观察流程、识别遗漏的限制条件、暂停代理、输入细节,并审核最终选择。
敏感信息则形成了另一道边界。预订流程进入旅客信息页面后,Wilde 必须接管操作;不过,如果应用已保存账户信息,实际行为可能有所不同。
这一保护措施限制了未经许可的信息披露和意外交易。但这也意味着,代理并不能仅仅接收目的地后就返回一笔已完成的预订。
这次体验是在整合尚未完成的预发布硬件上进行的。它无法说明所有流程在全面推出后将如何运行。
不过,它很早就指出了核心问题:一项任务可以在技术上成功完成,却仍让用户不确定结果是否反映了自己的真实偏好。
这种区别构成了本文的主要张力。Google 已展示 Android 代理可以操作应用,但尚未证明日常委托是否比直接控制更轻松。
Google 打造了一个仍需管理者的代理
这次发布迫使 Google 证明,监督代理所需的注意力成本低于手动完成任务。
Google 将 Gemini Intelligence 描述为一种主动式技术:它在让用户保持控制权的同时处理繁琐工作。其示例集中于需要多个应用、屏幕或上下文信息的事务。
其中一个示例以笔记应用中显示的购物清单开始。用户可以在该清单上唤起 Gemini,并要求它建立配送购物车。
另一个示例从旅行宣传册开始。Google 表示,用户可以拍下宣传册,并要求 Gemini 为六人团体寻找类似旅行团。
这些示例比航班测试更有说服力,因为屏幕或图像提供了有用的上下文。代理接收到的是具体清单、图片或来源,而不是要从简短指令中重建用户偏好。
Google 的 Android 发布详情还介绍了后台进度通知和最终确认步骤。用户仍负责审核拟执行的操作。
这种结构适合购物和预订。未经核查的代理可能选错日期、重复下单、泄露个人信息,或在不合适的条款下动用资金。
但每个保护性检查点都会增加摩擦。如果用户必须提供大量指令,并检查每个重要字段,直接使用应用仍可能更快、更可预测。
航班搜索让这一问题格外明显。出发时间、机场、行李额度、中转、退票规则、航空公司和常旅客会员资格,都会影响正确选择。
原始请求只包含两个机场和一个日期。因此,Gemini 面对的是一个信息不足的决策,而不只是界面导航问题。
人类旅行顾问通常会在给出选项前澄清重要偏好。数字代理也需要类似机制,以判断何时应提问、何时可以继续。
事无巨细地提问会让交互令人疲惫。什么都不问,则会把过多判断交给一个未必了解用户优先事项的模型。
个性化可能缩小这一差距。Google 的更广泛方向是将 Gemini 与应用和服务中的信息连接,可能让它获取既有习惯和偏好。
然而,推断出的偏好本身也有风险。过去的一次购买并不总意味着长期规则,熟悉的航空公司也未必适合某次具体旅行。
因此,代理需要的不只是记忆。它还需要经过校准的不确定性,也就是在既有上下文不足以支撑重大选择时能够识别出来。
这正是“需要管理者的代理”这一批评为何重要。问题不在于 Gemini 在演示中没能按下正确按钮。
问题在于,用户仍要提供判断、监控执行、处理敏感数据并检查结果。这些活动包含了原始任务背后很大一部分认知工作。
Google 眼下面临的压力,是让这种管理负担显著降低。精美的动画或成功的操作序列,无法替代可衡量的时间和注意力节省。
Samsung 同样有利害关系。其折叠屏设备是首批与 Gemini Intelligence 标识关联的产品,因此,消费者将通过 Samsung 硬件接触 Google 的早期产品决策。
Samsung 表示,其新 Galaxy 产品线将合作伙伴 AI 服务与透明度、隐私和用户控制结合起来。这些原则必不可少,但用户会根据实际可靠性评价这些手机。
自动化错误可能同时损害两家公司的声誉,即使问题由第三方应用或不完整的用户指令造成。此次合作同时分担了机会与声誉风险。
9to5Google 的发现挑战了便利性卖点
核心反转很简单:代理确实能工作,但它成功完成任务依然可能显得没有必要。
Google 并未将 Gemini Intelligence 作为实验室项目推出。它将这一平台定位为 Android 上处理日常“生活管理”事务的实用方案。
9to5Google 的发现挑战了这一说法,因为演示中的任务本身已有熟悉且相当高效的界面。用户知道如何在旅行应用中输入机场、日期和筛选条件。
当自动化消除了人们不喜欢的协调工作时,它才更具价值。跨应用复制长购物清单就是更清晰的例子,因为代理可以免去重复输入。
复杂的研究任务则是另一个有前景的场景。用户可能需要从电子邮件中提取项目、在另一项服务中查找、比较可用性,并准备一份可供审核的结果。
预订一趟简单航班则不同。用户通常希望直接比较选项,而比较过程可能比填写搜索表单更重要。
在这种情况下,界面不只是摩擦来源。它是用户发现取舍、调整优先级并建立对最终选择信心的地方。
点餐也存在同样的问题。重复订购一家信任餐厅的熟悉订单适合委托,因为期望结果已经明确。
为多人选择晚餐则涉及饮食限制、配送时间、替换选项和不断变化的偏好。自动化可以穿梭于各个屏幕,却无法解决这些人类约束。
因此,Google 的代理式 AI 模型——即能围绕目标规划并执行多个行动的软件——面对的是一片用途并不均衡的任务领域。
高重复性、低模糊度的任务有利于自动化。后果重大、选择主观的任务则更适合用户直接参与,即使技术流程本身很容易自动化。
这种划分解释了 Wilde 为何将该技术描述为更接近一个引人注目的演示,而非不可或缺的服务。代理显而易见的活动看上去令人印象深刻,却未必改变用户的结果。
这次发布也凸显了一个棘手的产品设计问题。Google 必须决定 Gemini Intelligence 应该取代应用交互,还是为更快的人类审核做好准备。
目前看来,第二种模式更可信。Gemini 可以收集信息、填充购物车或缩小选项范围,同时将最终判断留给用户。
这种方式既能提供协助,又不会假装代理掌握了所有偏好。它也符合 Google 的最终确认要求。
不过,准备工作仍必须节省足够多的精力。若结果要求逐行核查,它可能变成用户不得不处理的又一个收件箱。
可靠的个人上下文正是在这里变得重要。人们本就难以找回分散在不同服务中的项目细节、出行要求和决策记录。
一个可搜索的个人知识库可以缓解这种检索难题。但它并不能免除用户对外部智能体拟执行操作进行核实的必要。
Google 面临的挑战更为广泛,因为 Gemini 必须在并非由其完全控制的系统之间执行操作。每个支持的应用都有不同的界面布局、账户状态、确认页面和错误情形。
超过 40 项集成让这次发布听起来颇具规模。真正有意义的衡量标准,是有多少工作流能在日常且复杂的条件下正确完成。
餐厅可能没有空位,产品可能缺货,票务服务也可能出现排队、身份验证请求或不断变化的座位图。
这些例外情形,正是可靠智能体与预设脚本演示之间的分界线。它们也决定了用户是否仍愿意让软件在后台继续运行。
早期的航班测试并不能证明 Gemini 会在这些情况下失败。它表明,仅凭一次成功执行,无法回答该产品是否值得被用户日常信任。
超过 40 款应用并不保证日常信任
覆盖范围衡量的是 Gemini 可以在哪些场景中行动,而信任取决于当指令、界面和后果变得不确定时,它会如何表现。
Google 扩展后的应用支持,是首个 Gemini Intelligence 版本中最明确的量化改进。此前的任务自动化测试版仅支持少数餐饮和网约车服务。
根据 Google 的Unpacked 公告,新版本覆盖了超过 40 款热门应用。它还将应用控制能力与屏幕和图像理解结合起来。
这些能力扩大了可处理请求的范围,但并不意味着每个应用都支持每种工作流,也无法保证每个流程都能一致地应对中断。
Google 的支持文档称,该功能可通过 Android 上的 Gemini 移动应用使用。用户也可以通过触控或语音唤起 Gemini 来运行它。
在 Samsung 新推出的 Fold8 和 Flip8 设备上,Gemini 可以请求用户接管任务。如果用户在十分钟内没有回应,自动化便会停止。
这一超时机制说明了该产品的混合性质。Gemini 在流程的一部分中独立行动,但某些状态仍需要即时的人类判断或身份验证。
这种交接可以保护用户,但也可能恰好打断本应通过后台自动化释放用户注意力的时刻。
信任将取决于这些中断是否发生在用户能够理解的边界上。支付确认和乘客信息是合理的人工接管节点。
若在简单导航过程中出现意外交接,感受则会截然不同。反复中断可能会让用户认为,委派任务带来的不确定性比亲自完成更大。
Google 还需要提供一致的解释。用户应当知道智能体选择了什么、哪些信息影响了这一决定,以及它排除了哪些替代方案。
仅有最终页面并不总是足够。如果 Gemini 展示一趟航班却不说明搜索参数,用户就必须重新比较,才能评估它的推荐。
可逆操作和不可逆操作之间也存在重要差异。将杂货加入购物车很容易撤销,而提交预订可能产生费用,或只有有限的补救空间。
成熟的系统应根据这种差异调整自主程度。它可以快速完成低风险步骤,并在后果更难逆转时放慢节奏。
Samsung 在其Fold8 公告中强调了控制权和隐私。Google 同样表示,Gemini 会在接到用户指令后行动,并在任务完成后停止。
这些说法描述的是预期中的保障措施。独立测试仍需验证,它们能否在支持的服务和异常应用状态中稳定、可预测地发挥作用。
硬件要求也限制了初期受众。Google 将 Gemini Intelligence 与具备端侧 AI 模型、较新媒体能力以及至少 12GB RAM 的高端设备关联起来。
Samsung 的新款折叠屏设备符合这些要求,并引入了 Gemini Nano 4。该端侧模型支持本地 AI 功能,可与基于云端的 Gemini 服务互补。
根据设备要求详情,Google 也在评估发布质量和实际使用场景下的性能标准。
有限的硬件发布为 Google 提供了一个可控的起点。不过,购买新款高端折叠屏手机的用户,未必正是最需要应用自动化的人群。
他们可能因为主动追求新技术而更能容忍实验性体验。这可能带来热情的演示,却不能证明其会在主流 Android 用户中获得持久采用。
原始评测也承认了这一限制。Wilde 遇到了不完整的集成,并且仅短暂接触过发布前硬件,因此他的体验并非最终产品。
这一限定应当淡化关于可靠性的结论。但它并不能消除受众问题,因为被测试的工作流正是 Google 和 Samsung 选择重点展示的内容。
营销示例揭示了企业认为其产品能够完成的工作。如果示例比直接使用应用更慢或更不值得信赖,其价值主张就需要进一步打磨。
最佳使用场景比 Google 的愿景更狭窄
当预期结果明确、重复性高、可逆且手动录入成本较高时,Gemini Intelligence 看起来最具优势。
与旅行预订相比,购物清单示例更符合这些条件。书面清单明确了商品,而购物车在购买前仍可供用户审核。
重新订购熟悉的食品也是一个合理场景。智能体可以复用已知选择,只询问变更内容,从而减少模糊性和手动输入。
当目的地已经明确时,叫车也具有潜力。用户仍需确认上车点、时间、车型和预计到达时间。
无障碍服务提供了一个影响更深远的机会。语音驱动的自动化可以减少复杂触控界面给部分用户带来的操作负担。
这一价值不应被视为边缘化的附带功能。能够操作杂乱应用界面的智能体,即使只节省少量时间,也可能消除真实障碍。
该产品还可以帮助用户同时处理多个信息源。Google 所举的在 Gmail 中找到课程大纲并将所需书籍加入购物车的例子,涉及信息检索和转移。
这一工作流包含用户可能乐于委派的机械性劳动。清单仍需审核,但智能体可以减少搜索和重复录入。
相比之下,开放式购物会引入主观判断。“找一台好笔记本电脑”需要预算、工作负载、便携性偏好、操作系统以及对妥协的接受程度。
智能体可以询问这些问题,但过长的问答会削弱便利性。它也可以推断答案,但无声推断会增加结果不合适的风险。
这为早期使用提供了一条实用原则:用户应先委派准备工作,再委派判断。
让 Gemini 汇集选项、转移明确的信息或填写可逆字段。对于偏好、敏感信息和最终承诺,仍应保持直接控制。
这一模式不如 Google 所设想的全天候主动式技术那样雄心勃勃,却可能为形成习惯性使用提供更可信的路径。
信任往往通过小而可预测的成功逐步建立。用户或许会先接受购物车和表单方面的帮助,再允许智能体处理预订或购买。
Google 更广泛的发布计划可以支持这一渐进过程。该公司表示,Gemini Intelligence 功能将先在 Samsung 和 Pixel 手机上分批推出,随后扩展到手表、汽车、眼镜和笔记本电脑。
跨设备访问提高了风险门槛。通过智能眼镜发起请求可能很方便,但在该界面上审查详细替代方案可能很困难。
届时,智能体需要理解何时行动、何时总结,以及何时将决策转移到屏幕上。界面选择将成为智能辅助的一部分。
这一未来也进一步凸显了个人上下文的重要性。用户不希望在手机、手表、汽车和眼镜上反复说明同样的偏好。
Google 可以通过连接账户数据和 Personal Intelligence 功能来减少重复。它也必须清晰控制哪些信息会影响每一次操作。
有用的智能体不能只是知道得更多。它还必须让用户理解已记住的事实、推断出的偏好和当前指令之间的边界。
对知识工作者而言,这一区别类似于回忆与授权之间的差异。找到过去的决策很有帮助,但据此采取行动需要确信该决策仍然适用。
用于工作记忆的工具可以帮助人们定位既有上下文。Gemini Intelligence 则更进一步,试图将上下文转化为外部操作。
这一步额外的推进既构成了它的吸引力,也带来了风险。只有当用户愿意给予更多控制权时,智能体才能节省更多精力。
早期证据支持一个更狭窄的结论。Gemini Intelligence 已跨越操作多款应用的技术门槛,但尚未跨越实现广泛委派的社会信任门槛。
三个信号将显示 Gemini Intelligence 是否重要
下一个考验不是又一次精心打磨的演示,而是普通用户是否能反复委派任务,而无需通过监督重新完成这些工作。
第一个信号是 Samsung Fold8 系列完整量产发布的质量。评测应追踪多个支持应用中的完成率、中断、修正次数和节省时间。
一次成功的航班搜索只能证明智能体能够沿着准备好的路径导航。反复测试将显示它是否能处理账户提示、不可用选项、变化的界面和不完整的指令。
最有启发性的比较将衡量用户投入的总注意力。一项自动化即使运行数分钟,只要用户仅需短暂审核,仍然可能有价值。
但如果用户必须盯着每个页面并反复介入,同一工作流就会失去价值。单靠时间无法反映这种差异,因此评测者应记录主动监督的程度。
第二个信号是 Google 如何处理偏好澄清。Gemini 必须学会,在开始重要任务前,哪些缺失细节必须先向用户询问。
如果它开始就航班、购买和预订提出简洁且相关的问题,早期批评将会减弱。这种行为将表明它对不确定性的判断有所改善。
如果它继续不作解释地选择默认选项,用户仍会将该系统视为界面操作工具,而不会轻易把它看作可靠的个人智能体。
Google 还应让最终审核更具信息量。一份好的摘要应列出已选择的约束条件、未解决的假设、敏感步骤,以及值得核查的替代方案。
第三个信号是超越发布周演示的采用情况。Google 向 Pixel 的扩展,以及随后跨设备的发布,将揭示应用自动化是否会成为一种重复性的使用行为。
功能可用并不等于真正被采用。更有力的证据应包括:用户反复委派任务、获得更广泛的第三方支持,以及用户在没有营销引导的情况下主动发起相关工作流。
Pixel 用户提供了一项重要测试,因为 Google 同时掌控硬件、操作系统、助手以及许多互联服务。这种整合本应减少第三方设备上常见的不一致问题。
如果 Gemini Intelligence 主要仍与高端折叠屏演示绑定,它的受众就会始终有限。这项技术或许依然令人印象深刻,却未必能成为标准的 Android 使用习惯。
如果用户开始每周多次委派重复且目标明确的任务,产品就算找到了立足点。Google 随后可以在此基础上扩大自主能力。
9to5Google 的 Google 测试并不能决定代理式 Android 的未来。它只是提供了一个有价值的早期提醒:不要把能力与价值混为一谈。
Gemini Intelligence 可以执行多步骤任务、展示进度、接受修正,并在敏感环节交还控制权。这些都是重要的产品进展。
但人们不会仅仅因为软件能够在应用中点击操作,就把任务交给它。只有当结果可预测、交接清晰,而且监督所需的精力更少时,他们才会委派任务。
目前,谨慎的用户应先用预期结果已明确、且可逆的任务来测试该系统。清单、熟悉的下单流程和信息转移,比影响重大的选择更适合作为起点。
随后,在每次尝试后直接问自己一个问题:Gemini 是否真正减少了工作,还是仅仅把这些工作变成了指令和审核?
Google 的答案将通过产品行为而非发布会话术浮现。只有当用户不再管理这个代理,而开始信任结果时,Gemini Intelligence 的受众才会变得清晰。


