Generalist AI 称 GEN-1.5 可通过一次演示学习机器人任务
- Sophie Larsen

- 1天前
- 讀畢需時 12 分鐘
Generalist AI 在发布 GEN-1.5 后登上 Google News;据称,这一机器人模型可从一次人类演示中学会一项任务。与 4 月发布的 GEN-1 相比,这一说法变化显著:后者针对每项展示任务仍需要约一小时的机器人数据。核心问题已不再是机器人能否复制一个受控示例,而是这一经验能否经受住新物体、被打乱的场景、重复运行及安全约束的考验。
Generalist 将 GEN-1.5 称为单次学习者。在机器人领域,单次学习是指依托早期训练获得的知识,仅通过一个示例适应新任务。机器人并非从零开始,而是通过一个已预训练的模型来理解演示;该模型已具备感知、抓取、运动和物理交互的模式。
这种区分构成了报道的主要张力。Physical Intelligence、Google DeepMind、NVIDIA、Figure 以及多个学术团队同样希望打造对任务专属数据依赖更少的通用机器人策略。Generalist 现在提出了一种更直接的接口:向机器人展示一次,再让它执行。在独立测试结果出现前,GEN-1.5 仍是一项令人印象深刻的公司演示,而非部署就绪的单次学习机器人技术证据。
为什么 GEN-1.5 正在吸引 Google News 的关注
GEN-1.5 将机器人拟议中的编程接口,从收集任务数据集转变为展示一个示例。
Generalist 于 2026 年 8 月 19 日通过一篇 GEN-1.5 官方文章和演示视频发布了该模型。发布内容展示了一名人员先完成一项任务,随后机器人在相同物理环境中尝试执行该行为。Generalist 表示,该模型随后可泛化这一经验,而非只是重放已记录的轨迹。
最关键的并不只是模仿。多年来,机器人一直能够通过行为克隆来复制演示;这种方法从记录的示例中学习动作。更强的主张是,GEN-1.5 利用广泛的既有训练来理解演示者的意图,并在实际执行与示例不同时作出调整。
这一差异体现在网上流传的演示中。一名人员将物体放入杯中,机器人随后尝试执行相应任务。当场景不再符合原始设置时,机器人似乎采取了纠正动作,而不是在首次偏差出现时停止。
纠正动作之所以重要,是因为真实任务很少会完全按照演示展开。物体会滑落,容器会移动,材料会变形,而先前的动作也会改变下一次观察结果。一个有用的策略必须观察这些变化,并在任务进行过程中选择新的动作。
Generalist 将这种能力定义为用于机器人控制的上下文学习。该术语描述的是:无需为每一项新指令经历传统训练周期,而是根据推理时提供的信息进行适应。大语言模型通过置于提示词中的示例,让这种交互方式变得广为人知。GEN-1.5 则将相关理念应用于物理动作,而错误可能会损坏设备或伤及人员。
该公司尚未公布足够信息,使外部人士能够判断这种适应能力的边界。此次发布并未证明一次演示适用于任意任务、环境或机器人本体,也没有将一段成功视频转化为可量化的成功率。
这些缺口并不意味着该公告不重要。它们恰恰界定了发生变化的内容。Generalist 提出,演示可以充当即时的任务规格说明,而不仅是更大规模数据收集活动中的一个训练样本。
这一主张直指机器人技术中最大的运营成本之一。当工程师能够严格定义每一个物体、动作和例外情况时,传统自动化效果很好。但当工作流程频繁变化或包含大量物体变体时,成本就会迅速上升。
一个可从一次演示中学习的系统,能让操作人员无需编写控制代码或收集数小时遥操作数据即可定义工作。工厂可以在短期生产批次之间重新分配机器人。仓库可以教授不熟悉的包装流程。实验室可以在不重建整个控制栈的情况下调整处理流程。
对于 GEN-1.5 而言,这些应用仍停留在假设阶段。此次发布确立的是研究方向和公司主张,而非客户部署记录。不过,这也解释了为何该消息会迅速传播至 Google News 和社交平台。一次演示的接口易于理解,其经济影响也格外直接。
一次演示瞄准机器人领域的数据瓶颈
GEN-1.5 的战略价值在于减少任务专属数据收集,而不在于让机器人在一次运行中显得聪明。
机器人学习面临着大语言模型所没有的数据问题。互联网中存在大量文本和图像,但有用的机器人轨迹需要实体机器、合适的环境、操作人员和安全流程。每一项记录的动作都会消耗真实世界中的时间。
Generalist 围绕大规模物理交互数据构建了其方法。其早期的 GEN-1 结果称,该模型从零开始训练,使用了约 50 万小时的真实世界数据。该公司表示,在每项任务使用约一小时机器人数据后,模型在选定任务上的平均成功率约为 99%。
4 月公布的结果涵盖手机包装、纸箱折叠、机器人吸尘器维护和积木包装。Generalist 还表示,GEN-1 折叠一个纸箱约需 12 秒,而使用类似纸箱的早期系统约需 34 秒。所有数据均来自该公司自身的评估。
GEN-1.5 将重点从掌握预先准备的任务,转向即时获得新行为。它并未消除大规模预训练数据集的需求。相反,该数据集应当提供可复用的物理知识,使模型能从一个新的示例中提取更多价值。
这类似于熟练工人接触陌生设备时的做法。工人不会在每次任务中重新学习视觉、手部协调、重力或物体恒存性。既有经验缩小了理解当前目标所需的新信息范围。
这一类比也揭示了一项限制。工人的成功取决于新任务在某种有用层面上与既有经验相似。如果 GEN-1.5 遇到陌生的力、工具、危险因素或隐藏状态,一次演示可能无法包含足够信息。
因此,数据问题并未消失,而是发生了转移。买方不再只需问新任务需要多少示例,还必须了解基础模型在预训练中见过什么。他们还需要知道,演示与该已学习分布之间的距离有多近。
Generalist 尚未公开披露其训练语料的完整构成。缺少这些信息,观察者无法判断展示的任务是否真正新颖,还是熟悉操作原语的新组合。抓取、放置、旋转和恢复掉落物体等能力可以迁移到许多可见任务中。
这种迁移依然很有价值。商业机器人通常更需要重组能力,而非完全未知的运动技能。仓库操作人员可能希望机器人将不同产品放入熟悉的包装中,然后在封箱前重新定位包装。
问题在于重组能力能延伸多远。一个视觉示例或许能传达物体顺序和目标放置位置,但未必能传达可接受的力度、禁止接触、脆弱表面、污染控制规则,或需要紧急停止的条件。
单次学习也不会自动解决长时程可靠性问题。若机器人完成每一个单独步骤的概率为 99%,那么成功完成十个相互独立步骤的概率约为 90%。真实世界中的错误并不独立,而一次失误可能会让后续所有动作都更加困难。
这也是操作人员关注干预率而非孤立任务成功率的原因。他们需要知道,机器人在完整班次中有多频繁会暂停、请求帮助、损坏物品,或进入无法恢复的状态。
GEN-1.5 对其他基础模型开发者形成压力,因为它让非专业人士也能直观看到数据效率。竞争对手不能再仅将广泛预训练描述为获得更高基准分数的途径,而必须展示客户能够多快定义有用的新工作。
竞争如今是单次学习与任务专属后训练之争
GEN-1.5 挑战了这样一种假设:可靠的新行为必须始于专门的机器人数据收集活动。
Physical Intelligence 的 首个通用策略体现了当前主流的基础模型路线。其 π0 系统结合了互联网规模的视觉和语言预训练,以及来自多种机器人类型的数据。该模型可以直接遵循指令,也可以针对困难应用接受额外后训练。
这种方法将广泛预训练视为基础,再用规模更小、质量更高的数据集对模型进行专门化。Physical Intelligence 描述了来自八种机器人配置的数据,以及最高每秒 50 次的动作生成。较高的控制频率有助于系统生成流畅动作,而非孤立的符号化决策。
开放的 Octo 项目走的是相近路径。其 通用机器人策略在来自 25 个数据集的 80 万个机器人回合上进行了预训练。研究人员随后在九种真实机器人配置上对其进行评估,并针对新的观测、动作空间和任务进行微调。
Octo 公布的实验中,每项微调任务约使用了 100 个目标演示。其结果显示了预训练的重要性,但也反映出一种既定流程:准备目标数据集、运行优化,再评估专门化策略。
NVIDIA 则通过更广泛的数据来源来攻克同一瓶颈。其 GR00T N1.5 研究结合了机器人数据、仿真、合成轨迹和人类视频。NVIDIA 报告称,N1.5 在使用 30 个演示时,在 RoboCasa 任务上达到 47.5% 的得分,而 N1 为 17.4%。
NVIDIA 还在实体 GR-1 人形机器人上测试了语言条件操控。它报告称,N1.5 的总体成功率为 83%,而 N1 为 43.3%。这些数字来自 NVIDIA 自身评估,无法与 Generalist 的演示形成直接比较。
GEN-1.5 提出了一种更激进的终点。它不再将目标数据集从数百个演示减少到数十个,而是将一次演示呈现为足以实现即时任务适应的条件。若这一结果可重复,将能把部署调试流程从数据收集和训练压缩为一次操作人员交互。
这是本文的主要竞争:单次适应与任务专属后训练之争。它在根本上并非 Generalist 与某一个特定竞争者之间的竞争。每家领先实验室都以不同方式混合预训练、演示、合成数据和专门化。
后训练具有实际优势。工程师可以检查数据集、重复优化、调整安全约束,并在部署前衡量性能。这个过程需要时间,但它会产出一个稳定的产物,可在明确的运行边界内完成验证。
即时适应则提供速度与灵活性,但也带来了模糊性。机器人必须判断示范中的哪些部分定义了目标,哪些只是附带动作,以及哪些约束并未显现。
设想一个人将样品管放入试管架。可见轨迹规定了位置和方向,却未必表明试管必须保持直立、某个表面必须无菌,或容器一旦破裂就应放弃操作。
人类工作人员可以提问,或依据语言和工作场所规则运用背景知识。机器人则需要将这些约束体现在其观测、指令、策略或安全控制器中的某个位置。一次视觉示范无法保证这种表征存在。
因此,Generalist 面临的挑战远不止展示快速模仿。该公司必须证明,操作人员能够以足够精确的方式传达意图、例外情况和边界,以满足实际工作需求。竞争对手则可以通过加快后训练速度,同时保留明确验证机制来应对。
最可能的商业系统将结合两条路径。一次示范或许用于初始化任务,随后再进行自动练习、仿真、定向修正或人工审批。这种混合模式会削弱纯粹的“一次示范”口号,但仍能保留其大部分运营价值。
GEN-1.5 演示尚未证明什么
一段引人入胜的视频无法回答决定一次示范机器人学习能否进入生产环境的可靠性、新颖性和安全性问题。
第一个不确定性涉及任务新颖性。一次示范学习通常依赖元学习或大规模预训练,即模型在大量先前任务中学习可复用的模式。随后,一项新的示范可以选择或组合模型中已经编码的模式。
研究人员早在当前机器人基础模型出现之前就探索过这一原理。2018 年的一项模仿学习研究训练机器人在观看一段人类视频后组合熟悉的操作原语。随着任务变得更长,性能有所下降,部分原因是错误会在多个阶段中不断累积。
GEN-1.5 可能代表了相较于那项工作的重大进展,但公开材料不足以支持同等条件下的比较。Generalist 尚未发布有关该新系统的同行评审论文、模型权重、测试集或完整评估协议。
第二个不确定性是可重复性。一段视频可能展示一次成功尝试、若干次经过挑选的尝试,或持续评估过程。这些形式提供的证据截然不同。部署决策需要了解试验次数、失败类别、场景变化和干预规则。
一项有力的测试应将熟悉物体与陌生物体区分开来。它还应改变光照、摆放位置、杂乱程度、相机角度和示范者风格,并在每种条件下重复足够多次,以估计性能,而非仅突出一次成功运行。
评估还应包含负面示例。操作人员需要知道,模型是否会拒绝含糊的示范、不可能完成的任务和不安全的目标。一个总是尝试给出解释的系统,可能比会请求澄清的系统更危险。
第三个不确定性涉及适应机制。Generalist 将 GEN-1.5 描述为从一次示范中学习,但“学习”可以涵盖多种过程。该系统可能根据示例调整其动作、更新内部状态、调整模型参数、检索相关经验,或结合这些方法。
这些差异会影响延迟、可复现性和治理方式。纯推理过程可以在每次任务分配后重置为已知的模型状态。在线权重更新或许能够保留一项新技能,但也可能改变无关行为。
该公司应澄清,操作人员是否可以检查、保存、撤销和复现一项已学习的任务。企业还需要版本控制,以显示每项行为由哪一次示范、指令、模型构建版本和安全策略产生。
第四个不确定性是具身迁移。Generalist 曾展示 GEN-1 使用不同末端执行器运行;末端执行器是连接在机器人手臂上的手部或工具。GEN-1.5 的一次示范主张并不能自动证明其能够适应不同的机器人本体。
由人完成的示范包含机器人无法直接复制的动作。人类与机器人手臂的关节、可达范围、施力能力和感知方式不同。模型必须推断目标,并将其转化为自身身体可执行的动作。
第五个不确定性是安全性。GEN-1 的早期发布承认,即兴动作会带来物理后果。拾回掉落的柔软物体是可取的,但试图处理碎玻璃或泄漏的化学品可能会使事故恶化。
当操作人员随意定义任务时,这个问题会更加突出。最快的教学界面也可能最不正式。生产系统需要明确约束、受保护区域、力限值、紧急停止机制和可审计的审批流程。
这些担忧都不能证伪 Generalist 的主张。它们只是为物理系统设定了相称的证据门槛。GEN-1.5 值得关注,因为它似乎让适应更接近实际使用的时刻;它也值得谨慎对待,因为公开证据仍比标题所暗示的范围更窄。
Google News 读者接下来应关注什么
接下来的三个信号是独立任务评估、持续客户运营的证据,以及对已学习行为如何受到控制的清晰说明。
第一个信号是在保留任务上的可重复评估。Generalist 应在测试前定义任务类别,然后防止这些确切任务进入后训练。外部研究人员或客户应执行评估并报告完整结果。
一项有用的协议应包含多位示范者、不同物体、布局和扰动。它应衡量任务成功率、耗时、人工干预、不安全动作和恢复质量。结果应区分一次示范适应与通过既往记忆完成的任务。
如果 GEN-1.5 在这些条件下仍保持强劲性能,其核心主张将大幅增强。如果其性能在公司挑选的场景之外迅速崩溃,那么该模型仍然只是一个有效的演示解读器,而非通用的一次示范学习系统。
第二个信号是持续的客户使用。短期演示优化的是可见能力,而部署会暴露罕见故障。仓库、工厂和实验室关注的是数千次循环、班次级正常运行时间、受损单元和操作人员工作量。
Generalist 的 GEN-1 发布已经强调了在选定任务上的重复运行。该公司报告了超过 1,800 次连续积木装箱循环,以及超过 200 次机器人吸尘器服务循环。若能为通过一次示范获得的任务提供可比证据,就能将 GEN-1.5 的灵活性与 GEN-1 的可靠性叙事联系起来。
关键指标并非任务启动得有多快,而是新教会的行为在物体位置变化、设备磨损和操作人员轮换后是否仍然有用。客户案例还应披露,在最初示例之后进行了多少次修正。
频繁进行隐性调优的证据会削弱严格的“一次示范”解释,但不会抹去该产品的价值,因为更快的调试流程仍可能带来显著节省。它只会让 GEN-1.5 更接近高效后训练,而非即时的人类式学习。
第三个信号是对已学习行为的控制。Generalist 需要说明客户如何指定禁止动作、消除歧义,以及恢复到已知策略状态。买家还应了解,在机器人靠近人员或贵重设备执行任务前,这些任务如何接受审查。
一个可信的系统应保留原始示范及机器人对其的解读。操作人员应能够比较不同版本、在安全环境中测试变更,并撤销产生意外结果的行为。
这很重要,因为物理学习除了控制问题之外,还会带来知识管理问题。一支机器人机群可能积累许多本地教授的操作流程,每一项都与特定人员、地点、机器人配置和模型版本相关联。缺乏可追溯性时,快速教学会造成运营混乱。
竞争对手的反应也将揭示这次发布的重要程度。Physical Intelligence、NVIDIA、Google DeepMind 和开放研究团队可以通过更少示范次数的适应、人类视频学习、更强的基准测试或更易部署的工具来回应。
目前,最公平的解读是范围有限但影响深远。Generalist 表示,GEN-1.5 能在一次示范后推断并执行一项新的物理任务。现有证据尚未表明,这种方法能够在任意任务或生产环境中可靠运行。
这种不确定性正是持续关注这一事件的理由,而非将其一笔带过的理由。多年来,机器人技术一直在减少每种新行为所需的工程工作。GEN-1.5 展示了一个清晰目标:在工作发生变化的当下,通过示例进行教学。
通过 Google News 看到这篇报道的读者应关注证据,而非口号。留意保留任务、完整失败率、长期部署和明确的安全控制。如果这些要素逐步出现,一次示范学习将成为一种新的调试模式;如果没有,GEN-1.5 仍将是对一个尚在攻克的更困难问题的引人入胜预览。


