Waymo 引入 Google Gemini,但不让 AI 碰方向盘
- Olivia Johnson

- 7月30日
- 讀畢需時 13 分鐘
Waymo 已在其 Ojai robotaxi 中加入 Gemini,但这款新助手无法转向、选择路线,也不能访问实时驾驶数据。与其说最新的 9to5Google Google 报道由语音控温功能定义,不如说它更清楚地揭示了这一边界。Gemini 可以回答问题、调整部分车厢设置,并请求靠边停车。负责车辆行驶的仍是独立的 Waymo Driver。
这一区别之所以重要,是因为 Ojai 并非只是又一辆获得熟悉车载信息娱乐系统更新的车辆。它是 Waymo 专为 robotaxi 打造的车型,配备该公司的第六代自动驾驶系统,车厢设计围绕乘客而非人类驾驶员展开。随着 Waymo 准备向更多公众乘客开放服务,Gemini 正将这一车厢转变为一个对话空间。
这也暴露出 Alphabet 内部一种耐人寻味的张力。Google 希望 Gemini 能够出现在人们提问或操控软件的任何地方;而 Waymo 则必须守住建立在严格治理驾驶系统之上的安全论证。Tesla、Zoox 和其他 robotaxi 开发商也面临类似的界面问题,但 Waymo 如今正公开划定边界:生成式 AI 可以服务乘客,但不能成为驾驶员。
9to5Google:Google Gemini 在严格边界内上线
关键变化不在于 Gemini 进入了一辆车,而在于 Waymo 精确限制了这款助手可以触及的范围。
Waymo 于 2026 年 7 月 29 日宣布在 Waymo 中引入 Gemini,同时为 Ojai 车厢推出重新设计的界面。该助手仍处于 beta 阶段,且仅会在乘客选择 Gemini 图标后启动。根据 Waymo 的 Gemini 介绍,它通过车辆屏幕呈现,而不是作为持续监听的功能层运行。
乘客可以询问附近的咖啡店、地标信息、常识问题或行程详情,也可以让 Gemini 调整车厢温度。想要停车的乘客,则可通过语音请求让车辆靠边停下。
这些例子让 Gemini 的角色超越了基础语音菜单。传统命令系统会将预设短语匹配到特定控制项;对话式助手则能理解自然语言、保持上下文,并在请求不遵循固定脚本时生成有用回应。
不过,Waymo 为这项功能设下了明确的硬性限制。该公司表示,Gemini 独立于其自动驾驶硬件与软件系统 Waymo Driver 运行。Gemini 不控制车辆运动或路线规划,也无法访问实时驾驶数据。
这种隔离意味着,Gemini 无法精确解释车辆为何减速,无法识别驾驶传感器当前看到的内容,也不能自行协商另一条路线。靠边停车请求会进入获批准的车辆工作流程,而不会赋予语言模型直接控制转向或制动的权限。
这一区别保护的不只是安全,也让责任划分保持清晰。如果 Gemini 就某个地标提供了不准确的信息,那是助手的失误;如果车辆做出了不安全的操作,调查人员可以审查 Waymo Driver,而无需先梳理生成式模型的对话过程。
因此,初始功能集刻意呈现出不对称性。Gemini 拥有广泛的语言能力,但操作权限有限;Waymo Driver 拥有广泛的物理控制权限,却并不充当通用对话助手。
这一设计回答了 9to5Google Google 报道提出的直接问题。Gemini 是作为面向乘客的软件层进入 Waymo,而不是自动驾驶能力的升级。两个系统共享同一车厢,却不共享道路控制权。
Waymo 表示,计划随时间推移扩展助手的功能。后续新增功能将检验这种隔离是否仍能保持简单。每增加一项新命令,都会新增一个节点:对话意图必须在此转化为可预测的车辆动作。
Ojai 将 robotaxi 车厢变成产品本身
Gemini 之所以重要,是因为 Ojai 将车辆设计的重心从驾驶座转向了乘客体验。
大多数汽车都围绕控制车辆的人来组织信息。速度表、导航显示、警示灯和中央控制台,都服务于驾驶。robotaxi 移除了这项工作,给设计师留下了一个不同的问题:当车厢内无人驾驶时,乘客应该看到什么、控制什么?
Ojai 为 Waymo 提供了回答这个问题的平台。该车辆配备三块大型 LED 屏幕、平整地板、较低的踏入高度和滑动门。Waymo 还强调了嵌入式盲文、屏幕阅读器兼容性以及集成于座椅的把手。该车辆专为自动驾驶叫车服务设计,不过报道指出它并不支持轮椅通行。
重新设计的界面是 Waymo 多年来首次重大屏幕更新。更大的触控目标适配了 Ojai 更大的显示屏,同时媒体控制和车厢设置仍可使用,不会遮挡关键行程信息。这听起来并不起眼,却解决了无人驾驶车辆中的一个基本问题:乘客需要确信自己能够理解并影响这段旅程。
Waymo 将这一安排称为经过编排的三屏体验。这三块显示屏并非简单互相镜像,而是会根据已占用的座位以及各位置所需的控制项改变内容。
独自坐在右后座的乘客可以在最近的显示屏上获得完整控制项。其他屏幕可显示简化的行程信息或环境媒体内容。若有多名乘客,界面可以采用不同方式分配信息,而不是迫使所有人共用一个中央面板。
Calm Mode 则朝着相反方向发展。它会调暗屏幕,并减少可见的行程信息。这一选项承认,控制并不总是意味着增加更多数据。有些乘客希望通过详细的进度指示获得安心感,另一些人则希望车厢保持安静、视觉上更克制。
Gemini 为相同的控制项提供了第二条路径。乘客可以点击大按钮,也可以用自然语言提出请求。这种冗余在陌生车辆中很有价值,尤其是当乘客在行动能力、视力、技术熟悉度或语言习惯方面存在差异时。
Waymo 此前已允许乘客在其 app 中保存温度、腿部空间、音频、车内照明和其他设置偏好。该公司的 乘客公告 也记录了靠边停车和调整车内播报的控制项。Gemini 建立在这一既有控制层之上,而不是从零开始创建每一项车厢功能。
车厢正成为核心竞争界面。一旦 robotaxi 服务能够以可接受的等待时间抵达相近的目的地,乘车体验本身便会成为差异化因素。屏幕清晰度、温度控制、媒体访问、无障碍设计和支持服务,都可能影响乘客是否足够信任该服务并再次使用。
这正是为什么不应仅将其视为 Gemini 出现在另一块屏幕上。Ojai 让 Waymo 得以完全掌控一个新的乘客环境;Gemini 则为 Google 提供了这一环境中的对话式界面。两者结合,使车辆内的时间成为 Alphabet 可以持续打磨的产品。
真正的较量是便利与控制之间的平衡
Waymo 希望 Gemini 能让无人驾驶出行感觉更灵活响应,同时不让驾驶系统变得更难预测。
人类驾驶员同时承担多项工作:控制汽车、回答问题、调整温度、回应紧张的乘客,以及理解不寻常的停车请求。robotaxi 则将这些工作分散到软件、传感器、远程支持和物理控制装置之间。
Gemini 可以填补驾驶员缺席后留下的部分社交和信息空白。访客无需打开另一个 app,便可询问街区信息;乘客可以通过对话调整温度;感到不适的人可以请求靠边停车,而不必在陌生菜单中寻找选项。
这些互动能让车厢感觉不那么机械化。但它们也暴露出一个风险:人们可能将表达流畅的助手误认为是了解驾驶状况的系统。尽管 Waymo 表示 Gemini 无法访问实时驾驶数据,它听起来仍可能像是理解这段行程。
这种错配正是本文的核心权衡。自然对话鼓励人们提出开放式问题;而安全工程在允许动作、系统状态和故障响应保持受限时效果最佳。
设想一位乘客询问:“我们为什么在这里停车?”Gemini 或许能依据一般行程信息作答,但无法查看实时驾驶情境。因此,一个自信的解释可能被误认为是对 Waymo Driver 决策的事实说明。
“走一条更快的路”这类请求则带来不同问题。乘客可能期待对话式助手像人类驾驶员一样协商路线。Waymo 所声明的边界意味着 Gemini 无法做到这一点。界面必须传达这一限制,同时不能让助手显得失灵。
靠边停车命令就处在这条界线附近。Gemini 可以接收语音请求,但 Waymo 表示,它在其他方面不控制车辆运动或路线。获批准的靠边停车流程必须将乘客意图转化为独立驾驶系统的动作,并具备可预测的约束条件。
这种架构类似于其他安全敏感系统中的隔离方式。便捷界面可以收集指令,但受控子系统决定是否以及如何执行。语言模型负责对话,Waymo Driver 负责物理环境。
9to5Google Google 的报道正确强调了 Gemini 没有实时驾驶数据源。这一限制降低了生成式回应成为驾驶闭环一部分的可能性,但也限制了乘客自然会提出的一些最具吸引力的问题。
因此,这项设计为了更清晰的权限划分而牺牲了整合度。深度整合的助手或许能提供更丰富的解释和路线讨论,却也会对模型错误、系统验证、事故重建和责任归属带来更棘手的问题。
Waymo 在 beta 阶段选择了谨慎的一边。Gemini 可以让车厢更易使用,但不能即兴改变车辆行为。这一选择既支持 Waymo 的安全叙事,也让 Google 能在新的实体场景中测试对话式助手。
随着乘客逐渐习惯让助手控制手机、家庭设备和传统汽车系统,这种压力将会加大。他们会期待 robotaxi 内也具备同样的灵活性。Waymo 必须决定,哪些请求可以安全地跨越这条边界,而不会让 Gemini 成为未经验证的驾驶组件。
Gemini 为 Waymo 对阵 Tesla 和 Zoox 开辟了另一条战线
robotaxi 的竞争正从自动驾驶性能扩展到完整的乘客体验。
Waymo 进入 2026 年时已拥有显著的运营领先优势。一篇 Associated Press 报道 称,该公司 2 月在六个都市区的每周乘车量超过 40 万次。报道还提到 Waymo 正扩展至更多 Texas 和 Florida 市场。
该公司后来表示,Waymo Driver 已在超过 11 个城市完成逾 2,000 万次全自动出行。公司数据仍需照例注明来源,但它们显示出:一个小小的界面改进可以在多大规模上影响真实乘客。
Waymo 的竞争优势主要建立在部署能力及其以大量传感器为核心的自动驾驶方案之上。Gemini 则引入了 Alphabet 的另一项资产,而独立汽车开发商难以轻易复制这种资产。Google 已运营着广泛分布的助手、地图产品、媒体服务,以及庞大的本地信息体系。
这并不必然意味着会造就更好的 robotaxi。但它确实让 Waymo 可以将车舱连接至现有 AI 平台,而不必从零开始构建对话模型。共同的企业所有权也使双方能够实现比传统供应商关系更深层的产品协同。
Tesla 代表了另一条路径。其消费级车辆将驾驶辅助软件、导航、娱乐和车辆控制整合在同一套垂直整合产品中。其 robotaxi 抱负同样将自动驾驶能力与庞大的整车业务及既有车主群体联系起来。
Waymo 的方式不同。它围绕无人驾驶系统打造专门的出行服务,再在车舱内加入独立的对话层。Gemini 与 Waymo Driver 之间的分离,使这种架构清晰可见。
Zoox 则提供了另一种参照。其专门打造的车辆也将乘客车舱视为首要设计问题,而非照搬人类驾驶汽车的所有惯例。多种专用 robotaxi 设计的出现,意味着舒适性和界面选择将获得更多关注。
Ojai 为这场竞争增添了规模因素。经过改装的 Zeekr 平台采用 Waymo 第六代传感器套件,包括 13 个摄像头、4 个 lidar 传感器和 6 个雷达单元。Lidar 通过激光脉冲测量周围物体的距离和形状。
该系统使用的摄像头和 lidar 单元少于 Waymo 第五代 Jaguar I-Pace 配置。Waymo 将这种减少归因于传感器升级和更优的布置方式。该公司称,第六代硬件能以显著更低的成本提供更强性能,不过独立的运营成本比较仍然有限。
一篇车辆发布分析报道称,Waymo 正朝着年产能以数万辆计的目标推进。文章还称,当时其车队约有 3,700 辆 Jaguar I-Pace 车辆。
Gemini 不会决定 Waymo 能否达成这一制造目标。但它可能影响最终服务是否显得与众不同。一辆能够可靠抵达、却因控制方式令人困惑而让乘客感到沮丧的 robotaxi,会为竞争对手留下机会。
这种优势也可能反哺 Google。每一种新的计算终端都为 Gemini 提供了一个新的实际应用场景。汽车不同于手机,因为互动往往通过语音发生,涉及多名乘客,并且发生在不断变化的行程中。
Waymo 可以为 Google 提供一个受控环境,用于了解人们在出行时会使用哪些助手功能。Google 则可以为 Waymo 提供熟悉的 AI 身份与灵活的输入方式。因此,这一合作会同时在自动驾驶和车舱软件两方面给竞争对手施压,尽管驾驶系统本身仍然相互独立。
Beta 版仍未解答隐私与可靠性问题
Waymo 已明确 Gemini 无法控制什么,但对乘车对话在实际中将如何处理的披露较少。
Waymo 表示,乘客隐私是一项优先事项,且 Gemini 会在乘客与其互动前保持未激活状态。这是重要的默认设置。它告诉乘客,助手不应持续参与每一次行程。
然而,激活只是隐私的一部分。乘客还需要清楚了解哪些音频会被处理、是否保存转录文本、记录保存多久,以及互动是否会与 Waymo 或 Google 账户关联。发布公告并未对这些问题给出完整答案。
robotaxi 车舱带来了私人手机会话中不存在的复杂情况。账户持有人可能与朋友、儿童、同事或共同乘车的陌生人同行。一人可以激活助手,而其他所有人的讲话仍然可被听到。
三屏界面也引出了共享可见性的问题。如果一名乘客向 Gemini 询问目的地或个人事务,系统必须决定在哪个屏幕显示回复。Waymo 的座位感知设计为这一选择提供了基础,但该公司尚未说明所有多乘客场景的细节。
可靠性同样重要。Gemini 可以回答附近商家或地标相关的问题,但生成式回答可能出错。错误的餐厅推荐只是带来不便;错误的行程指引或对 Waymo 规则的不准确解释,则可能造成更严重的困惑。
助手缺乏实时驾驶数据,限制了一类错误。它无法根据从未接收的信息编造基于传感器的解释。不过,对话界面仍必须避免让乘客误以为一般行程信息描述了车辆当前的判断过程。
Waymo 应在回复中清晰呈现这些边界,而不应只在发布文章中说明。当乘客询问车辆为何停车时,Gemini 应明确表示自己无法看到实时驾驶状况。含糊的回答会削弱这种技术分离的价值。
语音识别带来了另一项考验。嘈杂的车舱、重叠的说话声、口音、儿童声音或音乐都可能扭曲指令。车舱温度请求允许一定程度的纠正;被误解的靠边停车请求则需要更清晰的确认流程。
因此,Beta 标签意义重大。它表明这一体验仍在开发中,但不能成为安全相关指令含糊不清的借口。Waymo 必须在扩大访问范围前,衡量激活失败、错误理解、放弃请求和联系客服的情况。
公开可用性也仍不均衡。Waymo 最初在旧金山、凤凰城和洛杉矶向部分乘客推出 Ojai 乘车服务。其Ojai 推出计划称,公司将在欢迎更多乘客及进入更多城市前收集反馈。
早期用户报告称车辆可用性并不稳定,尽管这些轶事并不能证明整体车队表现。有限的推出范围意味着,大多数乘客尚未在不同口音、群体规模、无障碍需求和网络条件下测试 Gemini。
9to5Google Google 的标题捕捉到了一次真实的产品发布,但公开证据仍主要来自 Waymo 自身的演示和描述。独立测试将揭示 Gemini 是否能够可靠理解普通车舱请求,并在恰当时机传达自身限制。
隐私披露也将塑造信任。乘客不应需要自行推断,激活 Gemini 是否改变了其行程的数据关系。车内简明、易获取的说明会比仅依赖通用政策页面更有用。
Waymo 通过将 Gemini 与驾驶系统隔离,迈出了正确的第一步架构设计。接下来更困难的工作涉及人们的预期。人们经常赋予表达流畅的软件超出其实际能力的权威,尤其是在系统以自信语音回应时。
三个信号将显示这一设计是否奏效
下一项考验是,Waymo 能否在不削弱使该功能具有合理性的边界前提下,扩大 Gemini 的实用性。
第一个信号是 Ojai 公开推广的广度。Waymo 最初向部分乘客提供该车辆,并表示计划扩大开放范围。更多公开行程将能在不同城市、乘客群体、天气条件和日常车舱噪声中带来更好的测试。
规模会暴露受控演示所遗漏的界面问题。乘客会按错屏幕、以难以预测的方式表达指令、彼此打断,并要求 Gemini 执行不受支持的操作。Waymo 对这些失败的应对,将比打磨精致的发布示例更重要。
如果该公司在扩大开放范围的同时,仍能将支持投诉和指令失败控制在较低水平,其乘客界面理念就会更具可信度。如果 Gemini 仍仅向狭窄的测试群体开放,就很难判断该助手是否改善了普通乘车体验。
第二个信号是下一批获准执行的指令。Waymo 表示会随时间增加功能,但每项新增功能都会揭示该公司如何划分风险。媒体选择和灯光控制仍明确属于车舱舒适性范畴。路线变更、紧急请求或对驾驶行为的解释,则接近自动驾驶系统的边界。
最安全的扩展路径,是让 Gemini 作为已在经过验证菜单中存在的操作的自然语言前端。这种方法可在不赋予模型独立物理控制权的前提下提升无障碍性,也让失败更容易得到控制。
更具野心的路径是赋予 Gemini 更丰富的行程上下文。即使只是对部分行程数据的只读访问,也可能改善到达时间预估和解释能力。但这同样要求谨慎区分计划路线信息与 Waymo Driver 的实时感知。
请关注未来公告的措辞。如果 Waymo 继续表示 Gemini 独立于 Waymo Driver 运行,那么该公司是在强化模块化架构。如果这种表述发生变化,读者应追问两个系统之间新增了哪些数据或权限传递。
第三个信号是竞争对手如何回应车舱问题。Tesla 可以在自身硬件中连接 AI、车辆软件和自动驾驶工作。Zoox 可以进一步完善专为无人驾驶车舱打造的界面。传统网约车平台也可以通过合作车辆和移动应用加入 AI 辅助功能。
竞争对手的回应不必复制 Gemini。更好的无障碍体验、更清晰的路线沟通、更快速的人工支持或更可靠的控制方式,可能比开放式对话更重要。最佳界面是在不寻常行程中让乘客信任的界面,而非功能列表最长的界面。
Waymo 的优势在于,它可以在保持独立自动驾驶技术栈的同时,以具有实际意义的服务规模测试 Gemini。其挑战在于证明,助手能够改善乘车体验,而不会对控制、感知能力或隐私制造错误预期。
这正是 9to5Google Google 报道背后的持久意义。Alphabet 正将两种 AI 置于同一辆车中,并在两者之间划出明确界线。一个系统与乘客交谈。另一个系统解读道路。
未来几个月,乘客应关注 Gemini 增加功能后,这条界线是否仍然易于理解。Ojai 开放后可以尝试使用助手,但应像测试其便利性一样谨慎测试其限制。问问它知道什么、保存什么,以及指令失败时会发生什么。这些答案将决定,对话式 AI 是否能作为值得信赖的界面进入 robotaxi 车舱,还是仅仅成为又一个屏幕层面的新奇功能。


