top of page

Gemini 登山计划以沙斯塔山救援告终

9月6日
讀畢需時 14 分鐘

三名登山新手使用 Gemini 规划攀登沙斯塔山后需要救援,令 Google 面临一宗令人尴尬的 AI 安全案例。Google TechCrunch 的报道聚焦于一项据称低估了他们食物和饮水需求的建议。原本预计耗时八小时的登顶,最终变成了一场持续数日的困境,期间经历了黑夜、膝盖受伤以及偏离路线后被迫露宿。

这些登山者并非只是听从了一条错误指引后受困。他们在建议的折返点之后继续前进,于晚上 7 点左右抵达山顶,并在天黑后开始下撤。他们的经历揭示了一个比单一错误答案更棘手的问题。

通用型助手可以生成看似完整的计划,却不了解其假设是否符合用户的体能、装备、路线、天气或紧急应对选项。Google 警告称,Gemini 可能提供不准确的信息。与此同时,沙斯塔山主管部门则引导登山者参考最新的当地指导,并依赖有经验的人类判断。

真正的故事就在这种冲突之中。Gemini 承诺提供便捷、个性化的协助,但荒野中的决策需要可验证的信息和保守的安全余量。当两种方式出现分歧时,承担人身风险的是用户。

八小时计划演变为过夜救援

此次救援始于一份几乎没有为延误、失误、受伤或条件变化留出余量的行程安排。

据公开报道,这三名年轻男子从加利福尼亚州 Roseville 出发,经 Clear Creek Route 攀登沙斯塔山。他们在约 8,400 英尺处扎营,并在凌晨 3 点左右出发。

据报道,他们原本预计在上午 11 点左右抵达山顶。他们的规划将上升路段视作一次八小时的行程,而非一趟还需下撤并预留紧急储备的完整登山活动。

沙斯塔山位于北加利福尼亚州,海拔达 14,179 英尺。即使被描述为非技术性路线,攀登它仍是一项严肃的高海拔挑战。距离、松散地形、路线辨识、疲劳以及快速变化的环境条件,都可能延长行程。

这支队伍大约在晚上 7 点抵达山顶。这比他们预期的抵达时间晚了约八小时,也比建议的中午折返时间晚了七小时。

折返时间是指预先设定的、必须放弃冲顶尝试的截止时间。它能防止登顶的执念耗尽安全下撤所需的日照和补给。抵达山顶并不意味着登山结束,因为队伍仍必须返回。

登山者在黑暗中开始下撤。大约一小时后,他们因迷失路线而致电 Siskiyou County Sheriff’s Office 寻求指引。

他们最终偏离 Clear Creek Route,进入 Mud Creek Canyon。一名成员在队伍穿越陡峭沟谷时跌倒并伤及膝盖。

由于无法安全继续前进,登山者被迫停下过夜。Forest Service 登山巡护员、警长办公室人员和救援志愿者于次日上午找到他们。

这份救援报道称,主管部门将他们补给不足与通过 Gemini 获得的建议联系起来。警长办公室表示,该助手建议的食物和饮水量远低于这支队伍最终所需的数量。

其他报道补充了重要背景。这些登山者携带的是日用背包,缺乏足够的紧急装备,剩余食物和饮水也很少。他们原本计划的一日行程,已远远超出打包决策所依据的假设。

据报道,其中一名登山者在手机上安装了 AllTrails,但设备电量耗尽。将导航方式存储在一台依赖电池的设备上,并不构成完整的备用方案。

因此,这起事件涉及多项相互关联的失误。登山者低估了行程时间,携带的储备有限,在折返点后仍继续前进,在黑暗中下撤,迷失路线,并有人受伤。

据登山者和主管部门称,Gemini 影响了最初的计划。随后,人为决策在整个攀登过程中进一步放大了该计划的弱点。

这一区分很重要。该事件并不能证明 AI 的回复直接指示了每一项不安全行为。它表明,当缺乏更可靠的参照时,一份自信的初始计划会如何塑造缺乏经验用户后续的决策。

Google TechCrunch 的叙述抓住了最明显的矛盾。一款以个人助手为卖点的工具,帮助制定了一份表面上可行的行程,但该计划据称在真实的山地条件下失效了。

Google TechCrunch 的关注让日常 AI 建议承受压力

这起事件促使 Google 必须厘清通用协助的边界,以及安全关键型指导的起点。

Gemini 正日益融入搜索、移动设备、生产力工具和日常规划之中。Google 将该产品描述为一款能够支持从文档分析到旅行行程等各类任务的助手。

这种广泛性使其局限更难被清楚传达。当无害的头脑风暴与后果重大的规划都在同一个对话界面中进行时,用户未必会将两者区分开来。

餐厅推荐出错,最多只是带来不便。对饮水量、行程时间或导航难度作出错误假设,在偏远地形中则可能演变为危险。

Google 的一般指导称,Gemini Apps 可能生成不准确或不恰当的回复。其回复指导建议用户核实信息,并承认 Gemini 可能将虚构的信息表述为事实。

这一警告具有相关性,但并未解决设计层面的问题。即使底层系统缺少关键细节,对话式回答仍可能让人感觉个性化且完整。

用户可能会询问应携带多少饮水,却没有提供气温、体重、行进速度、适应高海拔的程度、可用积雪、路线暴露程度或紧急情况下需要支撑多久等信息。模型要么必须追问这些变量,要么拒绝给出精确建议,要么自行作出假设。

悄然作出假设的回答,听起来可能比其证据允许的程度更确定。当聊天机器人将回复整理成精美的清单时,这种呈现风险会进一步增加。

沙斯塔山事件也挑战了这样一种观点:免责声明可以将全部责任转移给用户。答案下方的警告,需要与答案本身的清晰度和自信感竞争。

Google 尚未公开报道中提到的完整 Gemini 对话记录。登山者的确切提示词、后续问题、模型版本、引用来源和展示的警告仍不可得。

没有这份记录,Google 和用户之外的任何人都无法复现这段对话。目前尚不清楚 Gemini 是给出了单一的错误估算、误解了问题,还是针对不完整的信息作出了回应。

同样不清楚的是,登山者是否忽略了 Gemini 回答中的限定条件。公开证据支持保持谨慎,而非对模型作出确定性的技术诊断。

不过,缺少对话记录并不会让安全问题消失。主管部门表示,登山者将 Gemini 描述为其路线和装备计划的主要信息来源。

Google 必须考虑 Gemini 如何处理涉及荒野旅行、极端天气、危险维修及其他人身风险的请求。系统可以在提供操作性建议之前识别这类情境。

它可以突出不确定性、询问用户经验,并将用户引导至官方当地信息来源。当关键变量缺失时,它也可以避免给出精确的补给建议。

压力不只来自 Google。OpenAI 的 ChatGPT、Anthropic 的 Claude、Microsoft Copilot 以及其他助手也支持类似的规划对话。

每一家提供商都面临同样的界面问题。即使系统并不了解当前环境,一段流畅的回复仍会传达出专业能力。

这正是 Google TechCrunch 的报道为何超越单次救援而具有意义。它将人们熟悉的“幻觉”警告,转化为一个涉及真实人身暴露风险的案例。

风险没有停留在浏览器窗口内。它跟随用户来到山上,而电量、日照、热量、水和行动能力都是有限的。

核心冲突在于便利性与经验证的当地判断

Gemini 提供了快速整合,而沙斯塔山需要来自对特定地形负责的人员和系统所提供的最新指导。

聊天机器人能在数秒内汇总路线说明、装备清单、行程报告和一般营养建议。这种便利能帮助用户开始研究并梳理问题。

然而,整合并不等于验证。语言模型会基于模式和检索到的材料预测有用的文本,但它不会检查用户的背包,也无法观察步道状况。

它同样无法保证其来源反映当前条件。积雪覆盖、水源可用性、防火限制、路线变化和救援可达性都可能随季节而变化。

当地巡护员所处的信息结构不同。他们接收现场报告、观察反复出现的错误、跟踪环境条件,并了解通用描述会在何处变得具有误导性。

警长办公室建议登山者在出发前联系 Mount Shasta ranger station。它还警告游客,绝不能仅依赖人工智能进行规划。

联邦登山检查清单建议携带额外食物、保暖衣物、照明设备、急救用品和充满电的手机。当行程计划失效时,这些物品能够形成冗余保障。

冗余意味着为关键需求保留相互独立的应对方式。如果共用的电池耗尽,同一部手机上的两个导航应用并不构成冗余。

地图、指南针、下载好的路线、备用电源和明确的折返规则可以彼此独立地失效。它们结合在一起,能降低单一问题令整个计划失效的概率。

据报道,登山者依赖 Gemini 获取路线、时间安排、食物选择和饮水规划。这将多项决策集中在一个未经验证的信息源中。

这种集中会使错误彼此关联。如果预测的行程时间过短,建议的食物、饮水、电池容量和衣物可能会同时变得不足。

报道中的食物建议说明了这种关系。该团队称,Gemini 更倾向于推荐简单碳水化合物,因为脂肪需要更长时间消化。

碳水化合物可以在高强度运动中提供有用的能量。问题并不只是选择了一种营养素而非另一种。据报道,该团队没有为实际遭遇的行程时长携带足够的总食物量。

因此,一句在技术上看似合理的话,在缺乏数量、时长或紧急情境的情况下使用时,也可能支撑一份不安全的计划。句子层面的准确性并不能保证计划层面的充分性。

这是 AI 生成工作流程的常见局限。输出内容可以包含许多单独看来合理的步骤,却遗漏了连接它们的安全余量。

同样的问题也出现在工作场景的决策中。助手可以总结政策、技术文档或会议记录,但用户在采取后果重大的行动时,仍需要可追溯的来源。

维护一套个人知识系统可以保存源材料和决策过程。然而,当涉及人身安全时,良好的组织并不能替代专家审查。

对于荒野旅行,官方指引必须高于生成式综合内容。AI 助手应帮助用户查找和比较这些来源,而不是取代它们。

理想的角色比自主行程规划更有限。Gemini 可以创建问题清单、识别缺失信息、比较官方路线说明,并标记尚未解决的假设。

它不应悄然将不完整的输入转化为精确的装备清单建议。缺乏经过验证的背景信息时,精确性会让薄弱的建议显得权威。

因此,Google TechCrunch 的报道构成了对“助手叙事”的反转。个性化看似增添了智能,但安全往往取决于能否意识到个性化缺乏足够证据。

Gemini 并非唯一的失误环节

如果把整场救援归咎于 Gemini,就会忽视原始计划明显失效后发生的若干决策。

这支队伍原预计在上午 11 点左右登顶。到中午时,他们不仅错过了这一预期时间,也到了建议的折返点。

这一偏差直接证明原定行程有误。继续上行意味着在现实已经否定计划后,仍继续依赖该计划。

据报道,徒步者在约 12,800 英尺处抵达 Mushroom Rock,并从其他登山者那里得到相互矛盾的鼓励。他们当时也感到不适,却仍继续向山顶前进。

这些细节让“盲从算法”的简单叙事变得复杂。用户获得了新信息,却仍选择继续前进。

这份登山者的叙述中有一项直白的承认:他们过度依赖 AI,而非自身的批判性思考。

这一承认将人类判断纳入因果链中。Gemini 提供了规划信息,但出发、折返、路线选择以及对恶化条件的应对,均由这支队伍自行决定。

公开记录中也缺少完整的聊天记录。读者无法得知徒步者如何描述自己的能力,也无法判断 Gemini 是否曾给出他们忽略的警告。

正如 Google 所承认的,其系统可能给出不准确的答案。用户也可能选择性采纳方便的建议,同时忽略不便的警示。

两种可能都可能成立。产品可能提供了不足的指引,而用户也可能犯下各自本可避免的错误。

这种区分对负责任的报道很重要。该事件并不能证明 Gemini 总是给出不安全的徒步建议,也不能证明其回复直接导致了受伤。

但这也不意味着应将聊天机器人视为无关紧要。有关部门将对 Gemini 的依赖视为关键因素,尤其是在路线和物资规划方面。

更站得住脚的结论关乎系统设计。当用户提出涉及实质性人身风险的问题时,通用型助手需要更强的不确定性处理能力。

具备安全意识的回复应避免接受“一个预估时长就能决定整份装备清单”这一前提。它应为延误预留空间,并明确指出缺失的变量。

它还应识别何时建议依赖实时的本地信息。山地状况无法仅凭通用网页文本可靠地加以概括。

对用户而言,教训并非在任何情况下都避免使用 AI,而是将 AI 用于即使答案出错也仍可补救的任务。

对可能路线进行头脑风暴是可补救的。依赖一项生成的预估来决定食物、饮水和折返决策,则不是。

一个有用的测试是:如果答案不完整,会发生什么?如果失误会造成身体危险、经济损失、法律风险或医疗伤害,就必须进行独立核实。

这场夜间救援说明了为什么应在规划之初进行这项测试。当队伍在补给不足的情况下进入黑暗后,可选方案很快收窄。

一部手机没电了。一人膝盖受伤。地形让行动更加困难,原本计划中的一日往返变成了需要外部援助的紧急事件。

这是一场系统性失误,因为多道安全保障缺失或被忽视。AI 建议、用户过度自信、冗余不足以及延迟作出折返决定,共同酿成了这起事件。

这比寻找单一的反派更有启发性。安全事故往往源于数个看似合理、却在叠加后变得危险的选择。

AI 助手需要为高风险规划设置更明确的边界

聊天机器人应将具有重大后果的规划视为一个核验工作流程,而不是又一次给出精致答案的机会。

当前的助手往往通过填补信息空白来回应宽泛问题。这种行为使它们在创意和行政任务中颇具实用性。

但在安全敏感场景中,填补空白会带来风险。缺失的信息应触发提问和警示,而不是隐性的假设。

荒野规划请求中包含可识别的风险信号。诸如登顶、偏远路线、水源、夜间条件、海拔和应急装备等词语,都应影响回复方式。

助手可以先说明它无法核实当前状况。随后,它可以要求提供确切路线、日期、经验水平、队伍人数、预期速度和备用装备。

接下来,它可以识别权威来源。对于 Mount Shasta,这些来源包括护林站、Forest Service 资料、当前天气信息和当地登山公告。

模型应区分有来源支撑的事实与一般性建议。它应直接链接用户至这些来源,并明确标注任何依赖未知条件的估算。

更安全的计划应包含阈值,而不是鼓励。若队伍错过既定折返时间、出现不适、失去导航能力,或储备消耗过快,计划应指示他们撤退。

界面同样重要。隐藏在详细建议下方的警告,获得的关注远少于置于建议之前的提醒。

Google 的Gemini 方法描述了安全测试和红队演练,即通过对抗性评估寻找失效情形。真实事件则提供了另一种关于产品行为的证据。

Mount Shasta 案例提供了一个实用的评估场景。测试人员可以询问 Gemini 是否识别出缺失背景信息,以及它是否会拒绝没有依据的精确性。

他们还可以改变用户经验、天气、路线、季节、队伍人数和取水条件。可靠的安全行为应在这些变化中始终保持谨慎。

其他助手开发者也面临同样的需求。行业竞争推动更广泛的能力和更顺畅地完成复杂任务。

然而,最安全的回复有时会显得不那么有帮助。它可能拒绝给出精确数量、提出多个问题,或将用户转向人类权威。

当互动参与度与风险降低发生冲突时,产品团队必须决定哪一个优先。在错误可能导致受伤的场景中,答案应当更明确。

该事件还提出了一个衡量问题。标准 AI 评估通常考察事实准确性、推理、编程或用户偏好。

这些指标可能遗漏复合型规划失误。一份回复可以显得有帮助,却在时间安排、物资、导航和应急准备上制造不安全的依赖。

开发者需要衡量恰当不确定性和升级处理的评估体系。问题不只是模型是否知道某个事实。

而是助手是否认识到自身知识的边界,并据此调整行为。只要软件从回答问题转向塑造行动,这种能力就至关重要。

Google TechCrunch 的报道为这种转变提供了一个具体的压力测试。Gemini 无需控制徒步者的设备,也能影响其行为。

据报道,它的建议影响了他们携带的物品以及预期的行程时长。当用户围绕建议组织现实决策时,仅仅是建议也会变得具有操作性。

这使溯源变得不可或缺。溯源能够识别一项主张的来源,并使用户评估其权威性、日期和适用性。

引用官方路线页面的助手为用户提供了核验路径。没有引用的综合性回答,则是在要求用户信任界面。

即便有引用,如果模型误读了它们,也仍然不够。用户依然需要清楚地区分官方要求、当前观测和生成式解读。

更明确的边界无法消除糟糕判断,但可以降低对话式系统为本就危险的计划增添虚假信心的可能性。

Google 和 AI 用户接下来应关注什么

下一项考验在于:这场救援是否会改变产品行为、用户习惯,还是只会改变围绕这起特殊事件的新闻标题。

第一个信号是 Google 对高风险规划提示的回应。用户和研究人员应测试,Gemini 是否会在推荐数量、路线或时间表前索取关键背景信息。

有意义的改变应在类似提示中持续出现。仅在单个徒步查询中加入一条显眼免责声明,证据力度较弱。

第二个信号是围绕原始对话的透明度。完整对话尚未出现在公开报道中,因此归因仍然有限。

提示词记录可以显示徒步者提供了哪些信息、由哪个模型处理请求,以及答案是否包含来源或警告。它可以强化或削弱有关 Gemini 角色的主张。

第三个信号是户外主管部门是否报告类似案例。一次救援可以暴露真实的设计风险,却不能说明其发生频率。

涉及不同助手的重复事件,将表明存在更广泛的采用问题。若几乎没有新增案例,则更支持将 Mount Shasta 视为严重但不寻常的例子。

Google 不应等到积累大量统计意义上的事件后,才测试这一潜在失效模式。评估危险提示的成本远低于一次救援行动。

用户也承担着即时责任。他们应将聊天机器人输出视为研究的起点,并通过最新、可追责的来源确认关键决策。

对于偏远旅行,这意味着联系当地主管部门、核查官方状况、携带独立导航工具,并为超出预期行程的情况规划储备。

这也意味着,当情况与计划相矛盾时,应遵守折返规则。队伍选择晚些时候继续前进后,没有任何聊天机器人能够让白昼重现。

Google TechCrunch 这一说法可能会让读者想到一家特定公司和一场特定救援。长远的问题关乎人们如何解读自信的机器生成建议。

便利性鼓励用户将研究、综合和判断压缩进一次对话中。安全则要求重新将这些功能分开。

AI 助手可以收集问题并整理经核实的信息。但护林员、当前公告、经验丰富的向导或可追责的专业人士,仍必须为高风险决策提供锚点。

在根据生成计划采取行动前,请问三个问题:哪些主张来自最新的官方来源,哪些假设仍未经核实,以及如果估算失败会发生什么?

如果答案不清楚,计划就尚未完成。在偏远地形中,这种不确定性应推迟行程,而不是被一份精美的清单掩盖。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page