OpenBMB MiniCPM-Robot 具身 AI 模型系列引发小型机器人“大脑”新一轮竞争
- Ethan Carter

- 3天前
- 讀畢需時 17 分鐘
已更新:2天前
OpenBMB 发布了首个具身 AI 系列,核心包括一个拥有 15 亿参数的操控模型和一个独立的跟踪模型。OpenBMB MiniCPM-Robot 具身 AI 模型系列试图解决一个棘手的矛盾:在不牺牲可靠实体操作性能的前提下,让机器人智能变得更小巧、更易获取。
该公司的 MiniCPM-Robot 公告列出了三个组件。MiniCPM-RobotManip 负责视觉、语言和机器人动作。MiniCPM-RobotTrack 用于跟踪选定目标,而 PhyAI 则提供旨在连接理解、记忆与行动的推理框架。
这一整套方案意义重大,因为 OpenBMB 进入的并非一个空白领域。OpenVLA、Hugging Face 的 SmolVLA、NVIDIA 的 GR00T 系列、Physical Intelligence 的模型以及 Qwen-RobotManip,都已代表了通用机器人学习领域的不同竞争路线。
因此,OpenBMB 提出的主张比发布又一个多模态模型更具挑战性。它认为,一个紧凑的开放模型家族能够成为实用的机器人软件栈。模型的参数规模听起来颇具吸引力,但能否成功仍取决于延迟、数据质量、硬件支持、故障恢复行为以及可复现的评测。
OpenBMB 随 MiniCPM-Robot 具身 AI 模型系列发布了什么
该公告描述的是一个协同工作的感知与行动栈,而非寄望于用单一模型解决所有机器人问题。
MiniCPM-RobotManip 被定位为通用视觉-语言-动作模型,通常简称为 VLA。VLA 接收视觉观测和语言指令,然后预测机器人可以执行的动作。
OpenBMB 表示,RobotManip 包含 15 亿个参数。这使其位于 VLA 领域相对紧凑的一端,不过仅凭参数量无法判断内存占用、响应时间或任务成功率。
RobotManip 似乎专为操控而设计,也就是涉及与物体接触的一系列实体任务。这些任务可能包括抓取物品、移动物品、准确放置物品、打开容器,或连续完成多个操作。
MiniCPM-RobotTrack 解决的是另一项需求。它旨在当选定目标移动、相机改变位置或其他物体进入视野时,持续识别并锁定该目标。
跟踪功能值得作为独立组件存在,因为机器人控制所需的远不止偶尔进行一次图像识别。在机械臂、相机、目标及周围人员持续移动的过程中,操控系统必须始终保持对物体身份的识别。
第三个组件 PhyAI 是一个推理框架。推理是指在实时相机画面和语音指令等新输入上运行已训练模型的过程。
OpenBMB 将 PhyAI 描述为帮助机器人理解、记忆和行动的一层。这种表述说明,该系统关注的是持久状态和控制执行,而不仅仅是孤立的模型预测。
这种区别在实体系统中至关重要。一个模型可能在某一帧画面中正确识别出杯子,却仍会因为控制循环反应过慢而无法抓住它。
机器人还需要记住已经发生的事情。否则,它可能会重复动作、在多步骤任务中忘记当前进度,或在环境发生变化后继续使用过时的估计结果。
将操控、目标跟踪和推理划分为多个具名组件,为开发者提供了若干切入点。团队可以先在不允许任何实体移动的情况下测试跟踪功能,也可以先在仿真环境中评估操控策略,再将其接入硬件。
然而,最初发布的社交媒体公告仍留下了一些尚未解决的重要实施问题。公告本身并未明确支持哪些机器人平台、相机配置、控制频率、训练数据集或基准测试协议。
“开放”一词也需要在技术上加以准确界定。一个完整的发布可以包括权重、源代码、训练方案、评测脚本、数据集文档,以及允许预期用途的许可证。
这些内容并不能相互替代。可下载的权重支持实验,而可复现的训练与评测材料则让研究人员能够探究模型为何会呈现所报告的行为。
因此,最稳妥的解读应当相对克制。OpenBMB 推出了一个具身 AI 模型系列,其中包含紧凑型操控模型、跟踪模型和专用推理框架。
该系列能否成为可复用的机器人平台,取决于围绕这三个组件发布的成果和证据。这份公告开启了评估过程,而不是为其画上句号。
为什么 15 亿参数的机器人模型改变了竞争压力
MiniCPM-Robot 正在向那些认为实用 VLA 系统必须从更大模型和更重型计算基础设施起步的团队施加压力。
15 亿参数这一数字构成了最清晰的差异化亮点。在使用相似数值格式的情况下,小型模型通常比大型模型需要更少的内存,不过架构和量化方式会改变最终需求。
这可以扩大能够在机器人本地附近运行推理的设备范围。本地执行既能减少对远程连接的依赖,也能将传感器数据保留在部署环境内部。
但这两项优势都不会自动实现。小型模型处理图像的速度仍可能过慢,可能因中间状态消耗大量内存,或需要目标机器人并未配备的加速器。
它真正产生的竞争效应,在于改变了买家和开发者首先提出的问题。他们不必再问最大的模型是否表现最好,而可以转而询问:什么样的最小模型能在其硬件上实现可接受的可靠性?
Hugging Face 通过 SmolVLA建立了一个清晰的参照点。这是一款于 2025 年发布、拥有 4.5 亿参数的开放模型。其开发者面向消费级硬件进行设计,并使用公共社区数据集训练了该模型。
Hugging Face 表示,SmolVLA 支持异步推理,即将模型计算与动作执行分离。该项目报告称,在同步和异步测试中,两者的成功率相近,但异步运行时完成任务的速度更快。
这些结果说明了为什么模型规模必须与系统设计相结合。当运行时能够避免推理延迟反复中断机器人运动时,紧凑型策略才会变得更加实用。
OpenVLA 提供了另一个历史参照。其开放 VLA 研究推出了一个使用 97 万次机器人演示训练的 70 亿参数模型。
OpenVLA 的研究人员报告了该模型在 29 项任务和多种机器人形态上的结果。他们的工作帮助开放 VLA 模型成为封闭式机器人策略之外值得认真考虑的替代方案。
从参数量来看,MiniCPM-RobotManip 要小得多。这并不意味着它速度更快、准确性更高或更容易适配,但确实使效率成为比较的核心。
NVIDIA 通过其 GR00T 架构采用了不同的策略。GR00T N1 将用于推理的视觉语言系统与生成连续动作的扩散 Transformer 相结合。
NVIDIA 围绕该模型配套提供仿真、合成数据生成、加速运行时软件和专用计算硬件。因此,其整体方案涵盖的内容远不止一个可下载的模型检查点。
因此,OpenBMB 对 NVIDIA 形成的压力是间接的。一个紧凑的开放技术栈可以检验:部分开发者是否能在不采用庞大供应商专属工具链的情况下实现实用性能。
对于构建通用操控策略的研究团队而言,这种压力则更加直接。他们现在不仅要说明成功率,还必须解释部署成本、适配工作量、推理延迟以及支持的硬件。
更小的模型也可以缩短迭代时间。由于不同安装环境中的相机位置、夹具、物体和控制接口各不相同,机器人团队经常需要重新训练或微调策略。
更快的实验速度可能比基准测试中的微弱领先更重要。如果一个团队能在大型模型完成一次实验所需的时间内测试五种配置,就能更快获得实践证据。
最有力的竞争主张并不是“最小的模型获胜”,而是更小的模型能够达到特定任务所需的可靠性门槛,同时更易于运行和适配。
仅凭公告,OpenBMB 尚未证明这一结论。但它已经让所有更大型的机器人模型更难回避这个问题。
同样的压力也延伸到了企业买家。他们需要比较完整的部署要求,而不能将模型规模视为能力的替代指标。
仓库运营商关心的是每个班次的故障次数、恢复时间、支持的物体、集成工作量以及安全控制措施。实验室则可能更关心可复现性、修改权限以及对多种机械臂的支持。
评估这些系统的开发者需要有序记录模型卡、实验、硬件配置和故障视频。随着版本发布和评测结果不断变化,一个可搜索的工程知识库可以让这些细节始终保持关联。
因此,OpenBMB 的紧凑型模型改变了举证责任。大型系统必须证明其额外资源投入物有所值,而 MiniCPM-RobotManip 则必须证明效率提升并未掩盖脆弱的行为表现。
真正的机制在于观察、记忆与行动之间的循环
只有当场景发生变化时,其组件仍能维持快速、稳定的控制循环,MiniCPM-Robot 才能取得成功。
VLA 模型通常被描述为一条从图像和指令直接通向动作的路径。而真实的机器人运行过程更具循环性。
机器人观察场景、估计当前状态、选择动作、执行一部分动作,然后再次观察。每个循环都可能发现物体发生了移动、抓取出现了滑脱,或其他人员改变了工作空间。
RobotManip 负责观测与动作之间的决策。RobotTrack 可以在不断变化的画面中维持目标身份,而 PhyAI 则负责协调推理与状态。
当每个组件都有明确的接口约定时,这种拆分方式会有所帮助。跟踪系统可以提供物体位置和身份信息,而策略模型则专注于选择下一步动作。
但这也可能带来集成风险。错误可能从一个组件传递到下一个组件,而每次传递都会增加延迟或造成信息损失。
假设用户要求机器人把一个瓶子放进箱子里。系统必须识别出用户指定的瓶子、定位箱子、规划抓取动作,并在移动过程中持续监控这两个物体。
如果 RobotTrack 短暂地切换到了一个相似的瓶子,RobotManip 可能会收到一个置信度很高但实际错误的目标。如果记忆层保留的是旧位置,机器人就可能基于已经不复存在的状态采取行动。
因此,运行时必须判断信息何时失效。它还需要一种机制,以便在置信度下降时停止动作、重新观察并选择更安全的行动。
这些机制不像精心制作的演示视频那样显眼,但它们决定了系统能否在受控拍摄环境之外正常工作。
Physical Intelligence 的开放世界 VLA展现了泛化挑战的规模。其 π0.5 研究结合了来自多种机器人的数据、网络来源、语义预测和底层动作。
研究人员在全新的家庭环境中演示了长时程任务,包括清洁训练期间从未见过的环境。与孤立的抓取放置试验相比,此类任务能更深入地测试记忆、恢复和动作排序能力。
Qwen-RobotManip 进一步推进了数据层面的探索。其机器人操控报告描述了一个约 38,100 小时的预训练语料库,该语料库由开放数据集和人类视频汇集而成。
Qwen 团队表示,他们在异构来源之间对齐了表征、运动和行为。报告还介绍了在多个真实机器人平台上的验证,以及旨在衡量分布外行为的测试。
这些项目阐明了 OpenBMB MiniCPM-Robot 具身 AI 模型系列所面临的挑战。架构效率固然重要,但模型还需要丰富多样的物理经验和可信的评估。
当场景中包含移动目标时,跟踪或许能提供有用的优势。传统的操控数据集通常侧重于桌面任务,其中物体在机器人接触之前会保持静止。
专用跟踪模型可以支持移动机器人、移动摄像头、物品交接以及与人共享的环境。这些场景要求系统持续更新对目标的估计。
然而,跟踪并不等同于理解意图。跟随一个人的手,并不能让机器人知道此人是在递出物体、伸手拿取物体,还是要求机器人等待。
记忆也存在类似的区别。存储过去的观察结果,与在选择下一步动作时正确使用它们并不是一回事。
一个实用的记忆系统必须保留任务进度、相关物体状态、先前的失败情况以及最新验证过的场景。它还必须丢弃不再适用的信息。
因此,“理解、记忆和行动”是一项工程议程,而非已经得到验证的成果。每个术语都需要可衡量的定义。
理解能力可以通过在改变措辞后执行指令来评估。记忆能力可以通过暂时隐藏物体或中断多步骤任务来测试。
动作质量需要通过物理指标来衡量。这些指标可以包括任务成功率、碰撞率、完成时间、受干扰后的恢复能力,以及多次重复试验中的表现。
PhyAI 之所以具有战略重要性,是因为运行时决定了这些能力相互作用的频率。如果控制循环在场景已经发生变化后才更新,那么再出色的动作预测器也无法弥补这一缺陷。
开发者应考察 PhyAI 是否支持异步执行、批处理、量化模型、多路摄像头流和明确的安全停止机制。他们还应关注日志记录功能,确保能够将每个动作与触发该动作的观察结果和指令关联起来。
在调试物理故障时,这种追踪记录至关重要。团队需要知道究竟是跟踪器丢失了物体、策略选择了错误的动作,还是控制器未能执行命令。
这正是三部分发布相比单一检查点更具潜力的地方。如果这些组件能够公开可检查的状态,MiniCPM-Robot 就会更容易诊断和扩展。
如果它们作为不透明模块运行,并且硬件支持有限,那么新增的这些名称只会增加复杂性,而无法形成一个连贯的平台。感知、记忆和控制之间边界处的机制必须始终清晰可理解。
开源并不能消除机器人领域的证据缺口
这项公告作为发布通知是可信的,但其最强有力的能力主张仍有待验证,直至独立团队在实体机器人上复现这些结果。
社交媒体帖子会将复杂系统压缩成少数几项主张和演示片段。它们很少提供足以评估统计可靠性的信息。
一段操控视频只能表明某项任务至少成功发生过一次。它无法揭示失败了多少次、场景是否经过精心挑选,或录制之前使用了多少任务专用数据。
基准测试平均值也可能掩盖类似问题。两个模型可能使用不同的摄像头视角、动作空间、评估重置方式或成功定义。
机器人评估对硬件尤为敏感。使用某一种夹爪和摄像头布局进行测试的策略,在看似微小的机械改动后,行为可能会有所不同。
缺失的第一层信息是详细的模型卡。开发者需要了解模型架构、输入格式、输出表示、上下文限制、数值精度以及推荐的计算硬件。
他们还需要了解每个组件的许可证。代码、模型权重、数据集和第三方依赖项可能分别适用不同的条款。
缺失的第二层信息是训练披露。一份实用的报告应说明机器人数据的来源、规模、筛选方式和平衡情况。
数据多样性会直接影响模型能够识别和执行的内容。来自单一固定环境的数千次演示,无法提供与跨多种机器人形态的多样化任务同等有力的证据。
第三层是评估。MiniCPM-RobotManip 需要使用共享基准进行比较,在可行的情况下采用相同硬件,并清晰记录适配流程。
OpenVLA、SmolVLA、GR00T、π0.5 和 Qwen-RobotManip 使用不同的架构和训练资源。单纯的排行榜名次无法区分究竟是哪种设计选择带来了结果。
比较还需要涵盖多种类型的任务。基础操控可以衡量抓取和放置能力,而长时程测试则能揭示系统是否可以在连续多个动作中维持状态。
干扰测试同样重要。评估人员应移动物体、改变光照、调整指令、部分遮挡摄像头,并引入外观相似的目标。
RobotTrack 需要自己的证据。标准视频跟踪指标可以衡量视觉一致性,但机器人应用会产生普通跟踪基准无法捕捉的后果。
短暂的身份切换可能几乎不会改变平均跟踪分数,但同样的切换可能导致机器人伸向错误的物体。
PhyAI 需要运行时测量。相关数据包括端到端延迟、更新频率、内存使用量、加速器要求,以及某个组件停止响应时的行为。
能源消耗对于移动平台也可能很重要。即使模型能够装入内存,其耗电速度仍可能过快,无法满足预期部署需求。
开源访问有助于研究人员检查这些问题,但并不会自动解决它们。复现需要兼容的硬件、校准流程、数据集和时间。
15 亿参数的规模也可能引发错误预期。紧凑型语言模型在精心挑选的交互中可能表现出令人惊讶的能力,却可能在熟悉模式之外出现不可预测的失败。
物理错误的代价远高于不自然的文本。聊天窗口中的错误回答,与在人或易碎物体旁做出错误动作并不相同。
任何通用 VLA 都不应作为唯一的安全层。部署需要传统控制措施、工作空间限制、紧急停止、碰撞监控以及经过验证的回退行为。
OpenBMB 所说的“首个具身 AI 模型系列”也需要明确界定范围。它似乎是指该组织推出的首个此类系列,而不是全球首个开放具身模型。
此前已有多个项目发布了开放的机器人模型和工具。MiniCPM-Robot 是加入这场持续发展的浪潮,而非开创它。
公平的评估也应避免走向另一个极端。公告发布时缺乏完整的独立结果,并不意味着这些模型毫无价值。
早期发布通常需要经过社区测试,其优势才会显现。开放的产物可以更快暴露局限,并让研究人员加以改进。
正确的态度应当是有条件的。MiniCPM-Robot 值得关注,因为其组件结构和紧凑型操控模型针对的是真实存在的部署限制。
只有当这些主张在 OpenBMB 自身演示之外经受住反复测试后,它才值得信任。开源创造了接受这种审视的机会,而证据将决定最终结果。
MiniCPM-Robot 与主要具身 AI 路线的对比
核心竞争并非 OpenBMB 与某一家公司的对抗,而是紧凑型开放部署与数据密集型、基础设施密集型机器人策略之间的竞争。
OpenBMB 当前展现的路线始于一个相对较小的操控策略,并通过专用跟踪和推理框架对该策略加以补充。
Hugging Face 提供了最直接的紧凑型模型对比。SmolVLA 的参数量更小,仅为 4.5 亿,并与 LeRobot 的硬件、数据集和训练社区相连接。
其价值主张强调低门槛实验。开发者可以收集演示数据、微调策略,并在成本较低的机械臂上进行测试。
MiniCPM-Robot 必须说明其更大的 15 亿参数策略为何能带来优势。这种优势可能体现在指令理解、视觉推理、任务多样性或恢复能力上,但需要比较证据加以证明。
OpenVLA 代表了成熟的开放基础模型路线。其 70 亿参数规模和大型演示数据集,在模型容量与部署要求之间形成了不同的平衡。
OpenVLA 的影响力还来自可复现性和研究领域的广泛采用。新模型无法仅凭参数效率取代其地位。
NVIDIA 提供了一条集成式工业路线。其 GR00T 计划将机器人模型与仿真、合成数据、开发框架和加速硬件连接起来。
对于已经使用 NVIDIA 技术栈的团队,这种广度可以减少集成工作。但它也可能加深平台依赖,并使硬件假设更加突出。
Physical Intelligence 专注于跨机器人和真实环境的泛化。其工作强调异构数据和长时程行为,而非尽可能缩小模型规模。
Qwen-RobotManip 强调数据规模下的对齐。其报告认为,必须协调表征、运动和行为,异构来源才能共同训练出一个连贯的策略。
OpenBMB 无法通过更声势浩大的公告超越这些竞争路线。它需要明确 MiniCPM-Robot 能在哪些方面产生可衡量的实际优势。
最具潜力的目标是边缘部署,即在机器人附近或机器人本体上执行推理。紧凑型模型可以减少网络需求,并使控制循环更接近机器本身。
当摄像头观察家庭、工厂或实验室时,边缘执行可以改善隐私保护。它还可以在外部服务不可用时维持基本运行。
然而,本地执行并不等同于低延迟。图像编码器和动作解码器仍可能需要大量计算资源。
此次发布必须说明哪些处理器能够达到可用的控制频率。在桌面 GPU 上获得的结果,并不能证明其在嵌入式机器人计算机上的性能。
另一个潜在优势是模块化。当应用需要更强的操控能力或时间感知能力时,可以分别更新 RobotManip 和 RobotTrack。
只有在接口保持稳定的情况下,模块化才有帮助。否则,每次模型更新都可能需要重新进行集成和校准。
一个完整的 PhyAI 框架可以通过定义输入模式、状态管理、调度和硬件适配器来减少这种摩擦。公告中的这一部分最终可能比模型参数量更为重要。
基础设施往往决定了哪个研究模型能够转化为可用软件。团队需要部署脚本、监控、诊断、版本管理,以及安全回滚更新的方法。
OpenBMB 在以 MiniCPM 命名构建紧凑型多模态模型方面拥有经验。这一背景为高效的视觉语言处理提供了合理的基础。
然而,机器人动作生成带来了额外的限制。语言模型的质量并不会自动迁移到连续控制、具身适配或碰撞规避上。
因此,这场竞争将在两个层面展开。研究人员将比较基准测试,而开发者将比较让真实机器人完成可重复任务所需的时间。
第二场竞争可能产生不同的赢家。一个能力稍弱但文档清晰、工具可靠的策略,可能比一个能力更强但需要大量定制集成的策略创造更多价值。
MiniCPM-Robot 的模块化发布表明,OpenBMB 已经认识到这一现实。该公司现在需要将这三个已命名的组件整合为一个可测试的开发者体验。
三个信号将表明 MiniCPM-Robot 是否真正重要
接下来的证据应来自发布内容的完整性、独立硬件测试,以及可量化的跨环境泛化能力。
第一个信号是一套完整的公开成果。开发者应关注模型权重、源代码、评估脚本、许可证、模型卡以及详细的 PhyAI 文档。
训练信息同样重要。即使 OpenBMB 无法公开所有数据集,也可以披露数据类别、具身形态、任务分布、过滤方法和已知局限。
这一信号将有力证明,“开源”意味着不只是开放检查点。缺失评估代码或许可证不明确,将削弱可复现性和商业应用前景。
第二个信号是在多种实体机器人配置上进行独立测试。最有说服力的报告将同时包含成功和失败的试验,而不仅仅是经过剪辑的演示。
有价值的测试应比较控制频率、内存消耗、完成时间以及多次重复尝试的成功率。测试还应记录适配新硬件所需的每一个步骤。
RobotTrack 应接受涉及遮挡、外观相似的物体、移动摄像头以及刻意更换目标的测试。RobotManip 则应面对物体位置变化、语言表达改变、环境杂乱和操作中断等情况。
PhyAI 应作为端到端系统进行评估。开发者需要了解其调度和记忆能力究竟能否改善故障恢复,还是只增加了另一层集成工作。
来自一个实验室的结果可以开启验证。来自互不相关团队的重复结果则能提供更有力的证据。
第三个信号是超越发布演示的泛化能力。一个实用的具身模型必须能够应对训练示例中未被精确呈现的变化。
OpenBMB 应展示其在新物体、新背景、新摄像头角度、新指令和不同机器人具身形态上的表现。它还应说明哪些方面仍需要适配。
这一测试将决定 15 亿参数能否构成一个高效的通用策略,还是只能构成一个主要适用于狭窄场景的紧凑型策略。
强大的泛化结果将支持 OpenBMB MiniCPM-Robot 具身 AI 模型系列背后的核心论点。较弱的迁移能力则会使其更接近一个有价值的研究基础,但仍需要大量针对特定任务的训练。
竞争对手的回应将使比较更加清晰。Hugging Face 可以继续降低使用门槛,而 NVIDIA 可以进一步扩展其集成式模型与仿真技术栈。
Qwen 的数据规模策略为 OpenBMB 提出了另一项衡量标准。如果经过对齐的异构数据能够带来更好的泛化能力,MiniCPM-Robot 就必须说明其更小的设计如何通过架构、训练或运行时效率进行弥补。
开发者不应仅凭发布声明来选择机器人技术栈。应从一个范围明确的任务开始,定义所需的成功率,并记录每一种失败情况。
在光照、物体位置和语言发生变化的条件下测试同一任务。然后衡量在性能恢复之前,该策略需要多少新数据和工程工作。
OpenBMB MiniCPM-Robot 具身 AI 模型系列值得关注,因为它将操控、跟踪和推理视为相互关联的问题。其 15 亿参数的策略也始终聚焦于可部署的效率。
如今,决定性问题非常实际:独立团队能否让完整技术栈在并非由 OpenBMB 控制的硬件上可靠地理解、记忆和行动?下一份模型卡、代码库更新以及未经剪辑的评估,应当比任何精心制作的发布短片提供更多答案。


