AidALL 的雨天机器人测试表明:98% 的 AI 准确率为何仍可能不够
- Aisha Washington

- 8月2日
- 讀畢需時 16 分鐘
据报道,AidALL 的自主机器人在一次雨天实地测试中失去了方向感,尽管其模型准确率达到了常常能吸引资金和关注的 98%。这一事件经由 Google News 传播,并由 KoreaTechDesk 报道,对人工智能领域一个常见的假设提出了挑战:模型分数出色,并不保证一台完整机器人能在受控测试之外可靠运行。
该机器人并非只是停机。随着雨水改变视觉环境,其定位估计开始漂移,但置信度依然很高。正是这种组合造成了更严重的故障。机器仍在按照自己对世界的理解依然准确这一前提继续行动。
对韩国的 Physical AI 初创公司而言,这一事件改变了竞争问题。打造一款评分很高的模型已不再足够。企业必须证明,传感器、软件、硬件、监控和恢复逻辑能够在不断变化的条件下协同工作。Tesla、中国的人形机器人制造商以及美国的机器人基础模型公司都面临同样的考验,但韩国初创公司承受高成本现场故障的空间更小。
AidALL 的雨天机器人测试中发生了什么变化
关键事件并非普通运行条件下的低基准测试成绩,而是一次高置信度的失败。
AidALL 创始人兼 CEO Raymond Kim 在 6 月 28 日的一篇 KoreaTechDesk 分析中描述了这一事件。他的公司当时正在韩国光州测试自主移动平台 Bedivere。夏末测试期间,雨势加大。
天气同时改变了机器人视觉环境的多个部分。湿滑路面产生了此前干燥天气数据中不存在的反射。重复的混凝土砖块也让不同地点呈现出相似的视觉特征。
这些条件干扰了视觉匹配——即将摄像头所见与此前观测到的地标进行比较的过程。机器人的估计位置开始偏离其实际位置。工程师称之为定位漂移,即系统运行时微小的位置误差不断累积。
据报道,机器人仍然对其估计结果赋予很高的置信度。根据 Kim 的说法,以传统测试所衡量的狭义标准来看,模型本身并未损坏。失效的是其训练条件与现场环境之间的边界。
这一区别是原始 机器人基准分析 的核心。准确率衡量的是模型是否能在既定评估范围内产生正确输出。而已部署的机器人依赖于一条更长的组件与假设链条。
摄像头必须捕捉到可用图像。定位模型必须正确解读这些图像。控制系统必须将估计结果转化为运动。监控软件必须识别不确定性。回退流程必须在错误变得危险之前让机器停下或改变路线。
98% 的分数可能只描述了这条链条中的一个环节。它也可能代表大量测试样本上的平均表现。当机器人在人员、设备、车辆或高价值库存附近移动时,剩余的 2% 会呈现出截然不同的重要性。
即使“98% 准确”本身的含义也需要谨慎对待。KoreaTechDesk 的报道将基准准确率作为更广泛问题的例子。它并未公布 Bedivere 经独立审计的 98% 分数,也未提供对该事件的完整技术评估。
这一验证缺口并不会削弱背后的工程学教训,反而让它更清晰。读者应将该数字视为对指标解读的警示,而非 AidALL 已部署系统经过认证的测量结果。
模型可能在指定测试中表现良好,但机器人仍可能失效,因为测试未涵盖雨天、反光表面、传感器老化、不熟悉的布局,或这些条件的组合。故障存在于组件之间,而非某一个孤立模型之内。
Physical AI 让这一差距变得格外重要。该术语指的是利用 AI 和传感器在物理环境中感知、决策和行动的机器。聊天机器人答错了,错误仍停留在屏幕上;运动估计错误,则会改变机器移动的位置。
因此,光州测试为创始人和投资者带来了一个具体挑战。他们需要证据证明:机器人能够识别自身内部图景何时已不再与现实相符。单凭很高的平均分无法提供这种保证。
这也是该事件通过 Google News 获得关注的原因。它将有关基准测试的抽象讨论转化为一个可见的部署问题。恰恰在整体系统最需要保持怀疑的时候,模型显得十分自信。
为什么 Google News 的基准测试标题忽略了部署差距
基准分数将性能压缩成一个简洁数字,而部署会暴露这个数字遗漏的每一种条件。
模型排名会影响投资、产品营销、采购和技术招聘。它们让不同系统更容易比较,也激励团队在具有已知数据集和评分规则的标准化任务上优化结果。
这些比较依然有用。开发者需要可重复的测试来识别回归并衡量进展。问题出现在决策者将模型基准测试视为完整机器人系统已准备好无人监督运行的证明之时。
基准测试定义了自己的世界。它规定输入、预期输出和可接受的误差。真实环境则会引入训练和评估阶段未被代表、或代表不足的条件。
分布偏移是这一不匹配的技术术语。当运行数据不同于用于开发或测试模型的数据时,就会发生分布偏移。路面上的雨水只是一个例子。新的光照、灰尘、眩光、磨损的传感器、重新摆放的物体或陌生的摄像头角度,都可能造成同类问题。
这种偏移不必十分剧烈。多个细微差异可以相互作用,进而引发系统级故障。摄像头图像变得略微嘈杂。定位略微偏离路线。控制器基于错误位置作出响应。每一次新动作随后都会从非预期地点生成观测结果。
这种反馈回路使机器人技术不同于许多静态预测任务。一次错误决策会改变下一次输入。错误可能不断累积,而不是彼此独立。
研究人员已多次记录与天气相关的感知局限。一项 LiDAR 天气综述 发现,雨、雪和雾会改变传感器强度、点分布和最大感知范围。摄像头同样会受到反射、眩光、低照度和视觉歧义的影响。
结合多种传感器可以减轻部分弱点,但传感器融合并不能消除不确定性。摄像头、雷达、LiDAR、惯性传感器和轮编码器具有不同的失效模式,其读数也需要校准和同步。
当多个组件相互强化同一种错误解读时,系统可能会自信地得出错误结论。如果监控层无法识别传感器退化,软件又对已经退化的传感器赋予过高权重,系统同样可能失效。
这导致了适合新闻标题的性能与运行可靠性之间的错位。准确率分数告诉读者,模型在多大程度上正确回答了一个定义明确的问题。可靠性则关注整台机器能否在长期运行和条件变化中持续在可接受的范围内工作。
可用性同样重要。一台机器人在演示中完成 100 项任务中的 98 项,听起来或许很成功。但在处理数千次操作的仓库中,反复人工干预可能会抹去原本支撑部署决策的人工或生产率收益。
每次故障的严重程度也比平均值更重要。在空旷测试区域漏检低风险物体,与在工人身旁发生定位错误并不相同。准确率相同的两个模型,可能带来截然不同的运行风险。
校准提供了另一项关键衡量标准。校准良好的系统应在其正确概率下降时表达更低的置信度。AidALL 的描述表明,危险问题不仅在于位置误差,还在于置信度没有相应下降。
这改变了机器人团队应衡量的内容。他们需要按天气、地面、光照、地点、传感器状态和任务阶段拆分性能数据。他们还需要衡量干预率、恢复成功率、故障间隔时间,以及不确定性开始上升后机器人继续移动的距离。
持续监控很重要,因为部署前测试无法覆盖所有运行条件。一份 2026 年的 NIST 监控报告 强调了在 AI 系统进入真实环境后观察其行为的难度。监控工具必须捕捉相关变化,同时不能制造难以管理的告警洪流。
因此,围绕 98% 准确率的 Google News 叙事,只有在读者超越这个百分比时才有意义。核心问题并非 98% 听起来高还是低,而是这一评估是否能预测客户实际会遇到的条件下的安全行为。
对机器人买家而言,这意味着需要追问基准测试涵盖了什么。系统是否跨季节、跨地点接受过测试?评估是否包括传感器退化?故障彼此独立,还是一次错误会提高后续错误发生的可能性?
买家还应询问由谁进行测试。公司演示可以证明某项能力存在,但无法替代跨客户现场开展的独立部署研究。
对创始人而言,教训同样直接。排行榜成绩可以开启销售对话,只有运行证据才能在试点之后留住客户。
韩国 Physical AI 初创公司如今面临系统级测试
韩国的制造业优势创造了更好的训练机会,但也提高了对能够经受工厂现实考验的机器人的期待。
韩国有充分理由发展 Physical AI。其经济体拥有大型半导体、汽车、电子、物流和工业制造业务。这些环境中有技术熟练的工人、专业化流程,以及智能机器的潜在客户。
该国在工业自动化方面也拥有丰富经验。国际机器人联合会持续将韩国列为全球机器人密度最高的制造业经济体之一。其 工业机器人数据 显示,自动化已深深嵌入全球生产体系。
现有自动化并不会自动转化为通用型 Physical AI。传统工业机器人通常在经过精心设计的工作单元内执行受限、重复的动作。它们的周边环境保持可预测,是因为工程师已将任务中的变化因素移除。
Physical AI 公司承诺提供更大的灵活性。它们的机器人应能识别陌生物体、理解变化的场景,并在无需为每个动作编写定制程序的情况下调整行动。这种灵活性也扩大了系统遇到训练分布之外情况的可能性。
韩国初创公司 RLWRLD 正通过人体动作数据来解决这一问题。首尔乐天酒店的员工在折叠餐巾、擦拭玻璃杯和布置服务区域时佩戴了摄像头。类似的数据采集工作还记录了物流员工如何抓握、搬运和摆放货物。
目标是将人类的隐性技能转化为机器人基础模型所需的数据。机器人基础模型是经过广泛训练、旨在支持多种实体任务的系统,而非只能执行某一项固定操作。
这项员工培训项目体现了韩国的战略逻辑。该国或许没有规模最大的英语文本语料库,但拥有能够产出高价值实体训练数据的工厂和经验丰富的劳动者。
这种方法直面一个关键的输入难题。相比高质量的人体动作、接触、受力和工具使用记录,互联网文本极为丰富。收集实体数据需要设备、场地、工作人员、安全流程以及细致的标注。
然而,更多动作数据并不会自动解决 AidALL 的问题。一个数据集即使包含数千个示例,也仍可能遗漏导致定位漂移的天气、反射、重复表面和摄像头行为组合。
覆盖度并不只是数据量的问题。团队需要具代表性的变化样本,并证明模型能够识别陌生条件。他们还需要在客户现场暴露出新的故障模式时更新系统的方法。
另一家韩国初创公司 Config 正在围绕这一数据瓶颈建设基础设施。该公司在工作室和现场环境中记录人们执行任务的过程,随后将动作数据转换为更适合机器人训练的格式。
其竞争对手和同行包括 Physical Intelligence、Generalist 和 Skild AI。这些公司在硬件获取能力、模型设计、数据策略和目标市场上各不相同,但都面临同一个根本问题:实体交互产生的数据昂贵、碎片化,并且高度依赖具体的机器人形态。
“具身形态”指机器人的实际物理形式,包括其关节、尺寸、传感器和运动限制。人类完成的一次示范并不能被每一台机器人直接复制。数据必须被转化为特定机器能够执行的动作。
仿真提供了另一条路径。WIRobotics 于 6 月为其 ALLEX 人形机器人平台发布了仿真模型。该公司表示,它复现了重要的物理特性,使研究人员能够在获得硬件之前测试控制方法并生成合成数据。
仿真可以加快实验进程,并让系统接触更多场景。它无法消除仿真到现实之间的差距,也就是模拟行为与真实机器之间的不匹配。摩擦、柔性材料、传感器噪声、磨损和不可预测的接触,仍然难以被完美复现。
因此,竞争不仅仅是谁拥有最聪明模型的竞赛。它更是一场涉及数据采集、仿真、硬件、现场测试、监控和恢复机制的系统工程较量。
大型企业在这场较量中拥有多项优势。它们可以运营更多机器人、收集更多故障案例、维持专业的安全团队,并资助更长期的试点项目。它们还可以将基础设施成本分摊到多座工厂或多条产品线中。
初创公司行动更快,也能聚焦于狭窄的技术问题。它们可能打造出更好的定位、灵巧操作、仿真或数据转换工具。然而,在缺乏足够现场证据之前,它们也可能将子系统改进包装成具备部署条件。
当投资者将韩国公司与资金雄厚的美国和中国竞争对手比较时,压力会尤为强烈。一个出色的基准测试结果能迅速讲出一个好故事。长期现场可靠性则需要数月反复测试,产生的公告也不那么吸睛。
如果客户愿意以受控方式开放真实设施,韩国的工业基础可以抵消这种压力。工厂、酒店、仓库、商店和公共空间都可以成为测试环境,让团队收集实验室无法复现的故障案例。
这种开放必须配合运营纪律。试点项目应明确机器人可活动的范围、何时触发人工干预、保留哪些日志,以及由谁审查事故。否则,部署只会产生零散轶事,而非可复用的证据。
劳工问题也令这一战略更加复杂。实体 AI 开发者依赖员工示范任务并解释例外情况。与此同时,这些员工可能担心由此产生的系统会减少未来岗位,或削弱学徒培养路径。
忽视这种张力会带来另一种部署风险。员工往往知道哪些任务变化至关重要、哪些捷径不安全,以及哪些环境变化意味着问题。他们的参与会同时影响数据质量和运营接受度。
因此,韩国初创公司正承受来自两个方向的压力。全球竞争对手要求能力更快提升;国内客户则需要更慢、针对具体现场的证据,证明机器人能够安全运行并带来可量化的价值。
真正的问题是恢复能力,而不是最后两个百分点的准确率
机器人具备部署条件,是因为它能识别自身确定性正在下降并进入安全状态,而不是因为某项基准测试接近完美。
机器人团队无法预见每一种故障。天气会变化,传感器会老化,设备会移动,人类行为也难以预测。实际目标是防止不确定性演变为失控运动。
Kim 对 Bedivere 测试的描述指向了恢复机制设计。系统需要检测到其定位估计已变得不可靠。随后,它需要减速、停止、请求协助,或切换到更安全的导航方式。
这些行为属于优雅降级。当条件恶化时,系统会提供较少的能力,而不是在信息不可靠的情况下继续以完全自主的模式运行。
安全停车听起来很简单,但具体实施取决于场景。配送机器人通常可以靠边停下。搬运重物的机器人可能需要先放下物体。在交通附近作业的机器则不能在任何位置停车,否则可能造成另一种危险。
因此,恢复策略需要针对具体任务进行设计。团队必须在部署前确定安全状态、允许的后备动作和升级路径。他们还需要测试机器能否在初始错误发生后抵达这些状态。
仅靠置信度阈值并不足够。若模型始终过度自信,它永远不会跨过触发后备机制的阈值。监控还必须考虑传感器之间的不一致、定位的突发变化、异常的控制修正,以及超出已验证范围的条件。
时间维度的行为也提供了另一种信号。单个异常画面可能无害,但摄像头定位与车轮运动之间持续存在的不一致,可能意味着发生了漂移。系统需要评估随时间出现的模式,而不是孤立地判断每一次预测。
当故障模式不同,独立冗余会有所帮助。摄像头因眩光受阻时,雷达可能仍可用。视觉地标消失时,惯性测量可以提供短期运动估计。地图则可以约束不可能的位置变化。
当组件共享某种隐性依赖时,冗余的作用会变小。两个摄像头模型可能会因同一处反射而失效。多个软件模块也可能使用同一张错误地图。团队必须分析相关性故障,而非仅仅计算组件数量。
人工监督仍是许多早期部署的一部分。远程操作员可以检查不确定情况并授权操作。这种方式有助于数据采集和恢复,但也带来了劳动力、延迟、连接性和扩展性限制。
企业应披露操作员干预的频率,以及每次干预的原因。没有这些信息,买方无法区分真正的自主能力与由隐性人工工作支撑的演示。
持怀疑态度的观点认为,初创公司的可靠性主张往往缺乏共同的衡量标准。企业可以报告任务成功率,却不披露任务难度、运行条件、重置次数、远程协助情况,或被排除的尝试次数。
即使是独立测试,如果只覆盖短时间或一个经过准备的场地,也可能制造虚假的信心。罕见故障只有在积累足够运行时长后才会出现。季节性变化也可能暴露为期两周的试点永远遇不到的问题。
这也是为什么“模型准确率达到 98%”不应被表述为“机器人可靠性达到 98%”。这两项指标衡量的是不同对象:前者涉及数据集上的预测,后者涉及整个系统随时间运行的表现。
企业应发布运营安全论证,即一套由证据支持的结构化论述,用于识别风险并说明控制措施如何降低风险。证据可包括现场日志、事故分类、后备机制表现,以及预期用途的限制。
它们还应定义运行设计域。该术语描述系统预期运行的条件,例如特定的天气、表面、速度、光照和交通模式。
机器人不必在所有地方都能工作才有价值。边界清晰、能力受限的产品,可能比边界模糊的通用系统更安全,也更具商业可信度。
挑战在于如何执行这些边界。如果机器人尚未针对大雨完成验证,它就必须能够识别大雨,或接收可靠的外部信号。随后,它必须在感知变得不可靠之前改变行为。
最初关于 AidALL 的叙述仍是创始人的描述,而非公开发布的事故报告。它没有提供原始传感器日志、纠正措施的时间线或第三方验证。读者不应据此推断 Bedivere 造成了伤害,或 AidALL 未达到正式安全要求。
这段叙述仍为行业话术提供了有价值的压力测试。关于准确率的主张应说明具体组件、数据集、条件和评估流程。关于部署的主张应说明运行时长、干预情况、故障严重程度和恢复行为。
Google News 的读者仍会持续看到令人印象深刻的机器人演示和基准测试公告。更有价值的问题是:机器遇到自己无法理解的场景后,紧接着会发生什么。
机器人买家和投资者接下来应关注什么
韩国实体 AI 推进的下一阶段,将由现场证据、恢复指标,以及超越预先准备演示的客户扩展情况决定。
第一个值得关注的信号是,韩国机器人公司是否开始发布按条件细分的现场结果。一份有价值的报告会按降雨、光照、表面类型、传感器状态和地点分别呈现表现。
它还应说明测试的限制。机器人运行了多久?发生了多少次干预?什么才算任务成功?困难尝试是否被排除在报告结果之外?
按条件报告将强化这样一种论点:初创公司已超越基准测试营销。若继续依赖单一的综合分数,则会削弱这一论点。
第二个信号是,恢复能力是否成为明确命名的产品能力。企业应描述机器人如何检测定位漂移、传感器不一致或分布外输入,并展示机器在检测到问题后会采取什么行动。
一场可信的恢复演示应包含受控故障,而不只是成功完成任务。工程师可能遮挡传感器、改变光照、引入反射表面,或修改已知布局。机器人应识别可靠性正在下降,并进入预先定义的安全状态。
这类测试并不要求机器做到完美。它提供的是系统能够将预期故障控制在可管理范围内的证据。随着机器人进入共享空间,这一区别愈发重要。
第三个信号,是客户从有人监督的试点项目转向重复部署。一次经过精心准备的工厂测试,所能提供的证据有限。将部署扩展至不同场地、班次、季节和设备布局,才能带来更严苛的评估。
买方应关注机器人是否能在不按比例增加远程操作员或现场工程师的情况下被反复使用。如果人工支持的增长速度与机器人规模一样快,那么该自主运行模式尚未证明其具备可扩展性。
投资者应索取运营数据,而不是只看基准测试截图。有参考价值的指标包括自主运行时长、每小时人工干预次数、恢复成功率、与安全相关故障的平均间隔时间,以及在已验证条件内完成的作业比例。
他们还应考察现场故障转化为训练或工程改进的速度。一家拥有完善事件处理流程的公司,能将部署过程转化为更优质的数据;一家无法复现故障的公司,则很难实现可靠改进。
对开发者而言,关键在于保留每项结果周围的证据。模型版本、传感器配置、环境条件、部署记录和事件复盘都需要彼此关联。当类似故障再次出现时,一个可搜索的知识库可以帮助团队找回这些记录。
对企业买方而言,采购流程必须及早让运营与安全团队参与。一台技术表现亮眼的机器人,仍可能因为设施缺乏明确的升级处理程序、维护责任归属或员工培训而失败。
员工也应参与验证。他们理解日常任务中隐藏的例外情况。他们的观察可以揭示开发团队在最初基准测试中未曾纳入的场景。
政府支持可以通过资助共享测试设施和通用报告方法,提高这类证据的质量。政府也可以鼓励初创企业在追求大规模部署前,先在不同地区和运营环境中开展测试。
标准不应强迫每一台机器人都用同一个准确率数字来衡量。它们应让各种声明更容易被理解。买方需要知道测试了什么、在何种条件下测试、使用了哪些硬件,以及系统发生故障时如何响应。
最强的韩国具身 AI 公司,很可能是那些抵制过早展示通用自主能力压力的公司。狭窄的部署领域可以产生真实的运营数据,同时限制风险暴露。
在一个受限环境中取得成功,随后可以支持谨慎扩展。每一种新条件都应被视为新的验证问题,而不是原始基准测试的自动延伸。
AidALL 现场测试说明了这种纪律为何重要。雨水并非只是拉低了分数。它改变了机器人内部状态与物理世界之间的关系,而据报道,系统的置信度仍然很高。
这正是 Google News 标题背后的残酷事实:一个模型在某项基准测试中可以有 98% 的时间是正确的,却仍可能被装进一台不可靠的机器人里。缺失的衡量标准,是完整系统如何识别并控制其余的故障。
下次有具身 AI 公司宣布接近完美的分数时,请问三个问题:测试中缺少了哪些条件?已部署的机器人多久会请求一次协助?当它的置信度出错时,会发生什么?
这些答案比排行榜上再多一个小数点,更能说明系统是否已具备部署条件。


