top of page

MiniCPM-Robot 将 1.5B VLA 和 0.9B 跟踪器带入端侧机器人领域

ModelBest 和 OpenBMB 于 7 月 19 日发布了 MiniCPM-Robot,这是它们首个能够在物理世界中感知、决策和行动的开放模型家族。此次发布将一个拥有 15 亿参数的操作模型与一个拥有 9 亿参数的目标跟踪器相结合。

这种组合带来了一场比又一次基准竞赛更有趣的较量。MiniCPM-Robot 检验小型开放模型能否在不依赖大型服务器、专有访问计划或持续网络连接的情况下,实现实用的机器人行为。

该模型家族进入了一个由 Physical Intelligence 的 π0.5、Qwen-VLA 和 Google DeepMind 的 Gemini Robotics 模型等雄心勃勃的系统引领的领域。这些项目都致力于实现跨任务和机器的广泛泛化,但在规模、可用性和部署策略方面存在显著差异。

MiniCPM-Robot 选择了一条更聚焦的路线。它将操作与跟踪分离,重点关注紧凑模型、本地运行、内存效率和可复现部署。这种方法降低了一项门槛,但并未解决在精选测试之外可靠性如何这一更棘手的问题。

MiniCPM-Robot 将物理智能拆分为两个小型模型

核心变化并不只是 ModelBest 进入了机器人领域,而是它针对两种不同的物理任务发布了模型权重和实现代码。

第一个模型 MiniCPM-RobotManip 是一个拥有 15 亿参数的视觉-语言-动作模型。VLA 将视觉观察和语言指令转换为机器人可执行的动作。

ModelBest 将 RobotManip 描述为一种通用策略,即一套权重可以支持多种操作任务。其公开示例包括物体操作以及更长的动作序列,例如制作三明治。

据该公司介绍,RobotManip 基于 MiniCPM-V 4.6 构建。它将早期多模态系统的能力从理解图像和语言扩展到了预测物理动作。

第二个发布的模型 MiniCPM-RobotTrack 专注于移动目标跟踪。它能够理解自然语言指令、识别指定人员,并在应对障碍物和视觉干扰的同时生成移动指令。

RobotTrack 使用 MiniCPM4-0.5B 语言骨干模型,但完整策略包含 9 亿个参数。它将该骨干模型与视觉组件及导航控制流程相结合。

这种区分至关重要,因为操作和跟踪对模型提出了不同的要求。机械臂需要进行精确的物体交互,而移动跟踪器则必须随着人员和障碍物的移动持续更新。

ModelBest 并未宣称一个通用策略已经能够处理这两项任务,而是在同一模型家族下发布了专用系统。这使项目更容易接受审查,但也限制了其对统一物理智能的主张。

官方 MiniCPM-Robot 仓库包含检查点、推理代码、训练入口、评估脚本和部署指南。代码和模型权重均采用 Apache 2.0 许可证。

该仓库还介绍了一个名为 PhyAI 的配套推理框架。ModelBest 表示,其优化将 RobotManip 在 Nvidia H20 上的吞吐率从 10 赫兹提升至 37 赫兹。

这一数字适用于特定的软件和硬件配置,不应被视为适用于不同机器人、GPU 或控制系统的通用速度保证。

此次发布延续了 ModelBest 对本地使用小型模型的广泛关注。MiniCPM-Robot 将同样的设计理念应用于延迟、网络可用性和板载计算能力会直接影响行为的系统。

据其公告称,这是 ModelBest 首个公开发布的具身模型家族。据报道,该公司于 2026 年 1 月才成立专门的具身智能团队,距离此次发布仅数月时间。

如此短的开发周期值得关注,但也提高了对外部验证的要求。公开代码允许各方审查,而持续的真实世界测试将决定这些结果能否迁移到演示平台之外。

1.5B VLA 将记忆转化为效率问题

MiniCPM-RobotManip 的核心论点是,机器人无需反复处理此前的每一帧,也能保留有用的视觉历史信息。

许多机器人策略主要针对最新观察做出反应。这种设计可用于简单动作,但长时任务需要记住已完成的步骤、不断变化的物体位置和先前的指令。

RobotManip 将历史观察纳入流式上下文。流式推理会复用此前计算的信息,而不是在每次做出新决策时重新构建完整的视觉历史。

ModelBest 表示,通过传统的重复计算方式处理 60 个历史帧,每次决策需要进行 125 万亿次浮点运算。据称,其流式方法将这一数字降至 3.3 万亿次运算。

该公司还声称,RobotManip 最多可以保留一分钟的视觉上下文。根据其文档,在线处理成本与仅使用一个当前帧的反应式策略相当。

这些主张界定了该模型最具影响力的机制。如果机器人需要在不断扩展的视觉历史上反复消耗巨量算力,那么较小的参数量就没有那么重要。

该系统还将每帧从 256 个视觉 token 压缩至 64 个。token 是模型在对图像编码后处理的紧凑单元,因此较少的 token 通常可以减少计算量。

在使用 BF16 精度和单个输入帧的 Nvidia H100 上,ModelBest 报告称,每次决策的模型前向传播延迟为 120 毫秒。其列出的 π0.5 对应数据为 234 毫秒。

这一测量不包括自回归动作解码。因此,它只描述了完整控制循环的一部分,而不是从摄像头观察到物理运动之间的时间。

在提供的推理示例中,RobotManip 返回一个包含 30 个步骤、每步 80 个动作维度的数据块。动作分块使系统能够预测一个短序列,而不是每次只生成一个动作。

基准测试结果也同样具有特定适用范围。根据该仓库的数据,RobotManip 在 LIBERO 上得分 97.5,在 Calvin ABC-to-D 评估中得分 4.1。

在 RoboTwin2 上,它在简单设置和困难设置下分别取得 91.3 和 91.6 的成绩。在所列评估配置中,这些数字使其接近或超越了多个更大型的系统。

其最大的报告优势出现在 RMBench 上,该基准测试机器人操作中的上下文记忆能力。在 ModelBest 发布的对比中,RobotManip 得分 53.3,而 π0.5 得分为 10.4。

Physical Intelligence 设计 π0.5 的目标是实现开放世界泛化。其研究结合了机器人数据、网络信息、语义子任务预测,以及跨多种具身形态的异构训练。

这种更广泛的设计使 π0.5 成为一个重要的参考对象,但不应将这两个系统简化为单一分数的比较。它们的训练数据组合、评估设置、架构和预期部署环境各不相同。

RobotManip 也小于 ModelBest 对比中列出的、参数量超过 5B 的 Qwen-VLA 系统。Qwen-VLA 研究通过具身感知条件控制,统一了操作、导航和轨迹预测。

Qwen 报告了其在真实机器人、模拟器、导航任务和动态环境中的结果。相比之下,MiniCPM-RobotManip 强调紧凑型操作、视觉历史和可公开下载的权重。

因此,真正的较量并不是 15 亿参数对阵 50 亿参数,而是专注效率与更广泛统一物理任务和机器人形态的尝试之间的较量。

RobotManip 的结果在已披露的基准测试范围内支持了其效率主张,但并不能证明这一更小型的模型在所有具身形态、环境或长时程任务中都能媲美更大型的竞争对手。

MiniCPM-RobotTrack 将较量转移到机器人端侧

RobotTrack 提供了更具体的部署案例,因为它在市售四足机器人上运行了完整的纯视觉跟踪循环。

ModelBest 在配备 16GB 内存 Jetson Orin NX 的 Unitree Go2 EDU 上验证了该模型。文档记载的配置还使用了 Intel RealSense D435i 摄像头。

该模型处理摄像头输入、识别语言指定的目标、预测航点,并发送经过速率限制的移动指令。ModelBest 报告称,该系统能够以每秒五帧以上的速度稳定运行。

其披露的端到端延迟约为 180 毫秒。与 RobotManip 的局部延迟测量不同,该数字涵盖了部署文档中描述的更完整的感知和控制流程。

该系统在本地运行,无需云端连接。这使其设计适用于停车场、电梯、工业建筑和可能失去网络连接的户外区域。

本地运行也减少了将图像发送至远程服务所带来的延迟和不确定性,但并不会自动确保系统的隐私性、安全性或可靠性。

RobotTrack 使用基于 DAgger 的数据流程,DAgger 是 Dataset Aggregation 的缩写。该技术让策略在环境中行动、暴露其错误,并将修正后的示例添加到后续训练轮次中。

ModelBest 表示,其流程专门针对快速转弯、短暂遮挡、目标交叉和拥挤路口等困难事件。自动检查和人工审核会剔除无效交互和异常轨迹。

这一点非常重要,因为常规演示往往无法充分呈现失败情况。一个跟踪模型可能看起来表现良好,直到两个人交叉而过,或选定目标短暂消失在障碍物后方。

该公司在 EVT-Bench 的三个类别上评估了 RobotTrack。这些类别涵盖标准目标跟踪、干扰目标造成的干扰,以及目标存在歧义的情况。

评估指标包括成功率、跟踪率和碰撞率。成功率和跟踪率越高越好,而碰撞率则越低越好。

RobotTrack 在标准跟踪中的跟踪率达到 89.8%。在干扰目标跟踪和歧义条件下,其跟踪率分别为 73.4% 和 80.4%。

在 ModelBest 对比的开放权重系统中,RobotTrack 在标准跟踪的全部三项已报告指标上领先。它在干扰目标场景下的成功率和跟踪率也领先于表中列出的开放模型。

在这些特定对比之外,情况则更为复杂。Qwen-RobotNav 的标准跟踪率为 90.0%,略高于 RobotTrack,但其权重并未开放。

RobotTrack 在干扰目标跟踪中的碰撞率也达到 13.6%,高于 OmTrackVLA 所列的 11.3%,这一点在任何物理部署中都值得重视。

在歧义条件下,RobotTrack 的碰撞率为 9.0%。在同一张公开表格中,OmTrackVLA 的碰撞率为 7.6%。

这些结果清晰地展现了其中的权衡。RobotTrack 兼具体积小巧、权重开放和本地运行等优势,但并未在每一项与安全相关的指标上占据领先地位。

该仓库的真实机器人配置默认使用 dry-run 模式,从而阻止移动指令传送至机器人。文档要求操作人员在启用实时控制前验证延迟、摄像头和紧急停止功能。

这种谨慎至关重要。一个在视觉上令人信服的跟随演示,并不能证明其能够在儿童、工人、车辆、楼梯或陌生机械周围安全运行。

开放权重对封闭的机器人访问模式形成压力

MiniCPM-Robot 对竞争对手形成的压力来自可检查性和部署便利性,而非已经证实的通用机器人能力。

Google DeepMind 同样将本地机器人技术作为重要方向。Gemini Robotics On-Device 能够遵循语言指令并执行灵巧操作,无需依赖网络连接。

Google 表示,开发者只需提供 50 到 100 次演示,即可使其端侧模型适应新任务。该公司已经展示了叠衣服、拉开袋子拉链和倾倒调味汁等任务。

然而,初期访问仅通过可信测试者计划和 SDK 开放。ModelBest 则提供可下载的检查点和代码,为独立开发者提供了不同的起点。

开放访问使实验室能够检查输入、修改控制逻辑、分析延迟、复现评估并测试故障情形。它还有助于规模较小的机器人团队避免依赖远程模型提供商。

这种自由并不能消除基础设施要求。RobotManip 的文档环境要求使用 Python 3.10、PyTorch 2.6 和 CUDA 12.4。

RobotTrack 评估需要模拟器资源和额外的视觉模型,包括 DINOv3 和 SigLIP。其 Go2 部署涉及 TensorRT、ROS 2、Jetson 软件、摄像头以及针对特定硬件的配置。

该项目虽然开放,但对于缺乏经验的用户而言并非开箱即用。机器人技术仍需要大量集成工作,而普通语言模型演示基本掩盖了这些工作。

开放权重也会转移责任。开发者可以修改模型,或将其部署到不受支持的环境中,而原始团队不会审查由此产生的行为。

这使得文档、许可、安全约束和可复现测试变得尤为重要。仓库默认采用空运行模式,这是一个合理的起点,但并非完整的安全系统。

对于成熟的机器人实验室,MiniCPM-Robot 提供了另一个可供研究的基线。对于规模较小的团队,其价值可能在于缩短从下载权重到开展可监测物理测试的路径。

此次发布还表明,机器人本地推理正在成为更广泛的趋势。云端模型能够提供充足的算力,但网络延迟和中断与持续的物理控制存在冲突。

近期的一篇具身运行时论文将这一部署问题描述为由特定于模型的 Python 技术栈、后端和机器人集成组成的碎片化集合。物理控制还要求优先考虑延迟,并以单批次方式执行。

MiniCPM-Robot 并未解决全行业的碎片化问题。它相互独立的环境、依赖项和部署路径实际上恰恰说明,仍有大量集成工作尚待完成。

尽管如此,该项目让更多相关工作进入了公众视野。研究人员不仅可以检查检查点,还能了解其周围的推理、数据、评估和部署选择。

这种透明度是此次发布对竞争格局施加的最强压力。封闭系统如今面临一个更明确的问题:哪些优势足以证明限制访问或不公开实现细节是合理的?

已发布的基准测试仍留下重大疑问

此次发布具有足够的可信度,值得测试,但现有证据尚不足以支持对可靠通用机器人的广泛结论。

大多数引人注目的结果均来自 ModelBest 自己的仓库和公告。它们尚未经过多个实验室、不同机器人本体和非受控环境的独立复现。

基准测试分数也可能掩盖评估设置上的显著差异。被标记为通用模型的系统可能使用单个检查点,而专用模型则接受了针对更狭窄任务设计的训练。

硬件测量同样需要谨慎看待。RobotManip 的延迟对比使用 H100 且不包括动作解码,而 RobotTrack 的端到端结果则来自基于 Jetson 的四足机器人技术栈。

这两个数字都无法说明模型在普通笔记本电脑上的性能。它们也没有揭示能耗、散热限制、持续运行能力或软件故障后的恢复情况。

RobotManip 最突出的结果是 53.3 的 RMBench 分数,这支持了流式历史记录能够带来帮助的说法。然而,这一绝对数值也表明仍有相当大的改进空间。

机器人在执行较长的家庭或工业流程时,必须能够从中断、物体错位、抓取失败和人为干预中恢复。记忆基准只能覆盖这一问题的一部分。

三明治演示为此次发布提供了一个具体场景。但它无法证明模型在不同厨房、物体布局、照明条件、工具或意外变化下的任务完成率。

RobotTrack 也存在类似的差距。在电梯或停车区域跟随选定人员能够体现其在网络连接较弱时的韧性,但部署安全所需要的远不只是持续锁定目标。

在已发布的三类 RobotTrack 测试中,碰撞率均不为零。干扰目标场景中报告的最高碰撞率为 13.6%。

这一数字的实际意义取决于基准测试对碰撞的定义和回合设计。操作人员不应将这一百分比直接等同于真实建筑中的预期事故率。

该公司还宣称 RobotTrack 是同类产品中首个完全本地化、仅依赖视觉且采用自然语言的跟踪模型。这一定位取决于对产品类别的定义,应被视为该公司的主张。

任何公开发布都无法彻底杜绝滥用。本地跟踪器可以用于巡检和辅助,但类似能力也会引发与监控、同意以及在不知情旁观者周围运行有关的担忧。

视觉跟踪还会继承其摄像头和编码器的弱点。光线不足、反射表面、相似衣着、遮挡和摄像头受阻都可能影响目标识别。

部署指南中提到了紧急停止装置和现场操作人员。这些控制措施揭示了当前机器人技术的一个重要事实:模型智能无法取代操作安全保障。

RobotManip 还通过记忆机制引入了另一个尚未解决的问题。保留视觉上下文可以改善任务连续性,但更长的上下文也可能保留早期产生的误解。

如果系统错误识别了某个物体或指令,后续动作可能会在这一错误基础上继续累积。因此,对高效记忆的评估还需同时考察纠错和遗忘行为。

中文发布报道称,该公司于 1 月组建了具身智能团队。快速执行令人鼓舞,但真正的成熟仍需要反复测试和现场反馈。

正确的解读既不是否定,也不是全盘接受。MiniCPM-Robot 提供了足够多的材料,供开发者测试其主张,而下一阶段的证据应来自这些外部测试。

三个信号将表明 MiniCPM-Robot 是否真正重要

下一阶段取决于可复现性、硬件覆盖范围,以及持续物理部署所提供的证据。

第一个信号是独立复现基准测试。研究人员应使用公开的检查点、脚本和评估设置重新运行 RobotManip 和 RobotTrack。

如果能够复现已发布的数字,将增强 ModelBest 关于效率的论据。较大的偏差则可能表明存在隐藏假设、脆弱依赖项或报告不完整的问题。

独立测试不应只包含最终平均值。逐任务结果、失败回合、延迟分布、碰撞类型和恢复行为将揭示模型在哪些情况下会失效。

第二个信号是能否支持初始硬件和基准环境之外的平台。目前,RobotTrack 最明确的部署路径是 Unitree Go2 EDU 和 Jetson Orin NX。

更广泛的发布应证明模型在不同摄像头、计算模块、移动底盘和环境条件下都能表现出可预测的行为。RobotManip 同样需要提供其在更多机械臂和控制格式上的证据。

成功移植将表明这些紧凑模型具备可迁移的部署价值。移植困难则可能意味着,大部分成果依赖于围绕特定硬件进行的系统调优。

第三个信号是开放开发能否带来有用的改进。这包括社区训练方案、经过验证的检查点、安全测试、集成方案以及针对故障情形的文档化修复。

仅有仓库活跃度是不够的。Stars 和 forks 衡量的是关注度,而合并的贡献和可复现部署才能表明项目是否正在成为共享基础设施。

竞争对手的反应也将在这三个信号中提供另一个有用的参照。Qwen-VLA 采用更大的统一模型,而 π0.5 则专注于复杂家庭任务中的开放世界泛化能力。

Google 的端侧计划表明,本地推理并非小众偏好。竞争的关键在于哪条路线能够将访问便利性、泛化能力、延迟和物理可靠性结合起来。

MiniCPM-Robot 目前在访问便利性和紧凑性方面的优势最为明确。该公司报告的证据也初步显示了其在记忆效率、跟踪和部分操作基准上的潜力。

其最薄弱之处是缺乏广泛的独立验证。参数规模或开放许可都无法取代模型在不断变化的环境中、陌生机器人上的反复成功。

评估该项目的开发者应从模拟或空运行模式开始。在启用运动之前,他们应记录延迟、目标丢失、碰撞、动作错误和恢复尝试。

团队还应区分模型前向推理性能与完整系统性能。摄像头、编码器、网络、控制限制、执行器和紧急系统都会影响真实行为。

此次发布之所以重要,是因为它将一个机器人技术主张转变成了外部人员可以检查的对象。它能否产生持久影响,将取决于这些外部人员能够复现、扩展和安全部署哪些成果。

MiniCPM-Robot 的 1.5B VLA 和 0.9B 跟踪器使小型开放模型成为具身 AI 领域中具有可信度的参与者。但它们尚未使紧凑型通用机器人成为一个已经解决的工程问题。

现在真正有用的是一个实际问题:独立团队能否复现这些结果、揭示故障情形,并使相同的模型在不同机器上安全运行?

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page