Black Forest Labs FLUX 3 Action 以开放机器人权重挑战 Nvidia
Black Forest Labs 于 9 月 23 日发布 FLUX 3 Action,将一款拥有开放权重、70 亿参数的模型直接带入通用机器人控制的竞争。该公司表示,尽管其参数规模小于 Nvidia 的竞品 Cosmos 3 Nano policy,该模型仍在一项重要模拟基准测试中领先。
这一比较赋予了此次发布重要意义。Black Forest Labs FLUX 3 Action 并非只是为另一场演示改造的图像生成器。它可同时预测视频和机器人动作,再将视觉观察与自然语言指令转化为一系列物理命令。
初步结果看起来颇具前景,但距离通用机器人技术的突破仍有差距。领先分数来自模拟桌面任务,而一项小规模外部硬件测试仅进行了 30 次尝试。开放权重也附带许可条件、显著的计算需求,以及面向所有部署者明确规定的安全责任。
Black Forest Labs FLUX 3 Action 改变机器人竞争格局
重要变化在于,一家知名视觉 AI 开发商同时发布了可用的机器人权重,以及适配这些权重所需的代码。
FLUX 3 Action 是一种世界动作模型(WAM),可在同一架构内预测未来视觉状态和机器人命令。它接收摄像头画面、机器人的当前状态和一条文本指令,随后生成下一段动作以及预测的视频帧。
Black Forest Labs 发布了三个主要组件。基础仓库包含经过动作预训练的模型和共享编码器。独立的 DROID 与 SO-101 检查点则提供了适配两种成熟机器人配置的策略。
DROID 是一个大型机器人操作数据集,基于众多环境中的真实世界演示构建。发布的 DROID 策略面向带有三个摄像头视角的 Franka 机器人配置。SO-101 版本则针对一种更小、更低成本的机械臂,该机械臂常与 Hugging Face 的 LeRobot 框架配合使用。
该模型拥有 70 亿参数。根据已发布的模型文档,一次 DROID 推理调用会返回 32 个动作,覆盖约两秒的运动。
这一动作时间跨度很重要,因为机器人控制器必须反复进行观察、规划和行动。更长且有用的预测窗口能够减少完整模型的运行频率。不过,当计划启动后环境发生变化时,较长的动作片段也可能放大误差。
此次发布包含完整微调、参数高效适配、推理、检查点转换和评估工具。开发者可以从基础模型开始,将其适配至其他机器人,或运行已准备好的策略之一。
这不只是发布一张模型卡和一段演示视频。公开的推理仓库包含数据准备、分布式训练、检查点管理、导出工具和特定机器人的示例。
该公司与 Nvidia 和 Hugging Face 共同开发了这一版本。这种合作让竞争格局变得更复杂。Nvidia 帮助实现了该模型,并提供了大部分硬件栈;但其 Cosmos 策略同时也是最重要的开放基准竞争对手。
FLUX 3 Action 源自规模更大的 FLUX 3 项目。Black Forest Labs 最初凭借图像生成建立声誉,其最新架构则将这一视觉基础延伸至视频、音频和动作预测。
这种联系并非表面文章。视频模型必须估计物体如何移动、碰撞、变形并随时间作出响应。机器人策略需要相关信息,但还必须选择能达成预期结果的命令。
Black Forest Labs 押注于将这两个问题置于同一个共享模型之中。如今,这一押注已有可下载的权重、可用的检查点,以及供其他团队测试的基准结果。
更小的模型如今领跑 RoboLab-120
FLUX 3 Action 最有力的早期主张,是在 RoboLab-120 上取得 42.92% 的成功率,而 Nvidia 规模更大的 Cosmos3-Nano-Policy 为 36.8%。
RoboLab-120 是一项包含 120 个桌面操作任务的模拟基准测试。每项策略都需在多个难度等级中应对视觉、程序性和关系性挑战。
示例包括识别正确物体、理解空间关系,以及完成多阶段指令。该基准测试在 Nvidia Isaac Sim 中运行,采用 DROID 风格的 Franka 机器人设置。
RoboLab 论文描述了一套能够生成逼真场景和任务的系统,而不会将测试绑定至某一种模型架构。RoboLab-120 对每项任务进行十次试验,因此形成了比短演示集更大的评估样本。
Black Forest Labs 报告称,其经过 DROID 调优的模型实现了 42.92% 的总体成功率。据称,OASIS WAM 得分为 39.0%,而 Nvidia 的 Cosmos3-Nano-Policy 在默认语言设置下录得 36.8%。
在同一比较中,Physical Intelligence 的 π0.5 达到 28.0%。DreamZero 得分为 25.7%,而 Nvidia 更小的 Cosmos3-Edge-Policy 达到 22.9%。
这些数字让 FLUX 3 Action 成为已发布比较中的当前领先者。但这并不意味着它能可靠完成大多数任务。42.92% 的成功率仍意味着超过一半的评估尝试失败。
参数规模的比较同样值得关注。FLUX 3 Action 使用 70 亿参数,而 Cosmos 3 Nano 使用 160 亿参数。这让 Black Forest Labs 的较小模型在所报告的排行榜上领先 6.12 个百分点。
参数数量并不直接衡量成本、延迟或智能水平。架构、精度、内存数据移动、采样步数和编码器开销都会影响实际部署性能。
Black Forest Labs 还提供了数种推理变体。基础策略采用四步带引导的去噪。另一检查点移除了外部引导,而经步骤蒸馏的版本则可一步生成结果。
该公司报告称,在测试过的硬件配置中,其推理速度快于 Cosmos 3 Nano。具体优势取决于检查点、数值精度和 GPU。
这些优化针对了机器人领域的一项现实约束。一个能规划出令人印象深刻动作、却反应过慢的模型,无法从运动、干扰或感知错误中恢复。
不过,标题中的基准结果仍需放在具体背景下理解。RoboLab 评估的是模拟操作,而非人与人周围不可预测的实际工作。模拟可以标准化比较,但无法呈现每一种传感器错误、机械故障、碰撞或环境变化。
这一基准测试也出自 Nvidia 的机器人研究技术栈。这并不会使结果无效,但也让独立复现尤其有价值。
此前一项与 Cosmos 3 有关的公开问题曾报告,复现部分已发布 RoboLab 结果存在困难。相关的Cosmos 报告展示了不同指令具体程度下的分数,说明基准结果如何取决于测试配置。
对买家和开发者而言,正确的解读应当谨慎但仍有意义。FLUX 3 Action 使用更小的模型确立了可信的基准地位。独立团队现在必须确定,这一优势是否能在不同硬件、指令和物理环境中得以维持。
为什么联合视频与动作预测很重要
Black Forest Labs 将机器人控制视为一种视觉预测问题,其中的动作嵌入在同一不断演化的场景内。
传统视觉语言动作模型将视觉输入和语言指令直接连接至机器人命令。世界动作模型则增加了对所观察世界应如何变化的显式预测。
FLUX 3 Action 对视频和动作 token 进行联合去噪。去噪意味着系统从带噪的候选输出开始,逐步将其细化为连贯的预测。
该模型采用带有两条同步输出流的扩散 Transformer。一条流表示未来视觉帧,另一条表示与这些时刻相关联的机器人动作。
对于每个训练样本,两条流共享相同的噪声等级。这一设计促使模型将被命令的运动与其预期视觉结果联系起来。
冻结的视频自动编码器将画面转换为紧凑表征。冻结的 Qwen3-VL-4B 编码器处理文本指令。可训练的动作模型则将这些信号与机器人状态结合。
对于 DROID 策略,三个摄像头视角会被排列为一个视觉画布。系统还会接收关节位置和夹爪状态。它返回 32 条命令,每条包含七个关节目标和一个夹爪值。
这不同于先生成视频,再让独立控制器模仿它。视频和动作序列从同一次模型推理中产生,并在时间上保持对齐。
这一机制为 Black Forest Labs 从生成式媒体进入物理 AI 提供了一条合理路径。视频训练让模型接触运动、接触、物体恒存性以及因果关系。机器人数据则教会它特定机器如何影响这些场景。
该公司此前与 mimic 的 FLUX-mimic 合作已提供预览。该系统将 FLUX 3 视觉主干与 mimic 的机器人技术专长相结合,其中包括围绕工业操作的工作。
FLUX 3 Action 将这一理念扩展为公开权重和可复用的适配工具。在该公司的实验中,它覆盖的也不仅仅是工业机械臂。
Black Forest Labs 报告称,已针对两款电子游戏和一架室内无人机训练了不同版本。游戏策略在不同驾驶环境中使用同一组权重,并由文本说明标识当前运行的游戏。
在无人机实验中,模型接收一个 256 × 256 的机载摄像头视图,并生成四个控制值。其训练集包含 800 次在 Isaac Sim 中创建的脚本化飞行。
该公司表示,这架无人机能够在重新布置的房间中导航,并遵循与训练语句并不完全一致的改述指令。这些结果是开发者的演示,而非标准化的独立评估。
即便如此,它们仍说明了这一架构主张。只要每种具身形式获得合适的输入和输出头,一个共享模型就能为机械臂、无人机或虚拟车辆表示命令。
这并不意味着该模型可以在所有场景中通用互换。每种机器的摄像头、动作维度、单位、时序和安全限制都不同。适配仍需要能够代表目标机体和任务的数据。
其主要好处在于可复用的视觉基础。开发者可能不必为每台新机器从头训练场景理解能力,而能将更多训练投入到机器人的观察和控制上。
这种做法类似于重塑语言和图像软件的基础模型战略。机器人领域面临更严峻的考验,因为错误输出可能损坏硬件或伤害人员。
模型预测的视频还提供了另一项潜在优势。工程师可以检查模型预期将发生什么,而不仅是它发送的数值命令。这种视觉预测或许有助于调试,但并非正式的安全保证。
开放权重并不意味着机器人技术不受限制
FLUX 3 Action 可供检查与适配,但其许可证、硬件需求和部署安全措施限制了“开放”在实践中的含义。
Black Forest Labs 将此次发布称为开放权重,而非完全开源。模型参数可获取,相关的推理和训练代码也已公开。权重采用 FLUX Kommunity License,软件仓库的部分内容则采用传统的开源许可证。
该模型许可证允许符合条件的用户进行非商业使用以及部分商业使用。规模更大的组织,或不符合这些条件的部署,可能需要另行签订协议。
这一差异对于评估长期依赖风险的机器人团队至关重要。研究实验室可以使用这些权重开展实验,而商业制造商则必须审查其拟议用途是否符合资格。
模型的资源需求构成了另一道边界。根据已发布的硬件指南,DROID checkpoint 在 Nvidia H200 上以 bfloat16 运行时需要约 32 GB GPU 内存。
FP8 量化和文本编码器卸载可让系统适配 24 GB 显卡。量化通过降低数值精度来节省内存并提升速度,而卸载则将模型的一部分从主 GPU 移出。
与一些前沿模型相比,这一需求较为易于满足,但它并非轻量级边缘推理。投入生产的机器人可能仍需要附近的 GPU 服务器、昂贵的机载计算机,或经过精心设计的通信链路。
延迟只是运营层面的一个问题。该策略输出的目标是关节位置,但并不强制执行关节速度、力、碰撞或工作空间限制。
模型卡明确要求部署者在应用层添加这些控制措施。它建议进行模拟器验证、启用机器人安全限制、保持人工监督,并提供易于触及的硬件停止装置。
这些警告揭示了学习型策略与完整机器人控制系统之间的差异。工厂部署还需要状态监控、紧急行为、故障检测、访问控制、维护流程和责任边界。
动作块带来了额外的控制问题。FLUX 3 Action 可以在一次预测中返回 32 条指令。控制器必须决定,在观察环境并再次规划之前,要执行其中多少条。
当现实世界按预期运行时,执行完整序列可以提高效率。当物体移动、抓握打滑,或有人进入工作空间时,更早重新规划会更有帮助。
SO-101 示例反映了这一权衡。它的控制循环会从更长的预测序列中执行 32 个动作,丢弃其余部分,然后再次规划。
开发者还必须保留与每个 checkpoint 相关的摄像头顺序、归一化方式、关节单位、时序和状态约定。混用这些细节可能产生看似合理但实际上错误的输出。
这正是为何可下载的权重并不会消除机器人工程工作。它们只是将一部分工作从学习策略转向集成、验证和安全约束执行。
对于企业买家而言,最有用的问题不是模型是否开放,而是完整系统在组织的实际运行条件下是否仍可测试、可维护且安全。
与 Nvidia 的比较真实存在,但并不完整
FLUX 3 Action 对 Nvidia 的模型战略形成压力,但此次发布也高度依赖 Nvidia 的基准测试、仿真工具和计算平台。
最直接的竞争比较是 FLUX 3 Action 与 Cosmos3-Nano-Policy。两者都会预测未来视觉状态和动作,都提供易于获取的权重,也都面向通用机器人操作。
Black Forest Labs 报告称,其以更少的参数取得了更好的 RoboLab 表现。它还声称在多款受测 GPU 上实现了更高的推理速度。
这一组合很重要,因为机器人开发者往往面临能力、响应时间和内存之间的三重约束。能够提升任务成功率的较小模型,或许可以在不牺牲行为表现的前提下降低基础设施需求。
然而,模型规模本身并不能证明部署效率。FLUX 3 Action 包含冻结的视觉自编码器和文本编码器。完整的内存与延迟表现取决于这些组件的运行方式。
checkpoint 的选择也会改变比较结果。四步推理可以保持质量,但需要更多计算资源。单步 checkpoint 更快,但可能会牺牲部分成功率。
Nvidia 仍是此次发布的核心。RoboLab 运行于 Isaac Sim,公布的推理测试使用 Nvidia GPU,该模型也是在 Nvidia 支持下构建的。
Black Forest Labs 还是 Nvidia 更广泛开放模型合作的一员。这种关系更像是在共享平台内展开竞争,而非简单的挑战者攻击既有领导者。
Hugging Face 也扮演着另一项重要角色。其 LeRobot 框架将机器人数据集、策略和硬件集成打包,使研究人员能够更一致地复现工作流程。
FLUX 3 Action 的 SO-101 checkpoint 附带已保存的预处理与归一化信息。这减少了将策略从代码仓库迁移到实体机械臂时常见的一类错误。
更广泛的竞争格局包括 Physical Intelligence 的 π 模型、Nvidia GR00T、DreamZero、OpenVLA、OASIS 以及其他视觉-语言-动作系统。它们在训练数据、模型架构、开放程度和支持硬件方面各有不同选择。
有些专注于直接动作预测。另一些则加入世界建模或规划组件。一些发布了权重,但仍对商业使用或训练数据施加限制。
FLUX 3 Action 的独特定位结合了生成式视频预训练、联合未来帧预测、机器人动作和公开适配工具。其基准领先表现强化了这一组合,但并未终结架构路线之争。
直接动作策略可以更小、更简单,因为它不预测视频。世界动作模型则会投入计算资源来表示可能的未来场景,这或许能改善物理推理,但也会增加延迟。
决定性证据将来自在相同数据、硬件、安全约束和真实任务下开展的受控比较。公开排行榜很少能覆盖整个系统。
尽管如此,此次发布仍改变了预期。机器人团队现在可以追问:为何一个更大或封闭的模型,在相关基准上反而不如一个可获取的 70 亿参数替代方案?
竞争对手必须以更强的结果、更快的部署、更广泛的具身支持、更清晰的许可证,或真实部署案例的证据作出回应。这种压力比排行榜名次本身更具影响力。
开发者与买家接下来应关注什么
接下来的三项信号是独立复现、更广泛的真实机器人测试,以及在新机器上持续开展的适配。
第一项信号是复现 RoboLab-120 的结果。独立团队应在固定版本、记录完整的提示词和相同评估设置下运行已发布的 checkpoint。
若复现得分接近 42.92%,将增强 FLUX 3 Action 拥有真实基准优势的说法。若出现较大偏差,则意味着结果可能对配置、软件版本或未公开细节敏感。
复现不应只涵盖一个 checkpoint。基础版、指导蒸馏版、步骤蒸馏版、bfloat16 和 FP8 变体在速度、内存使用与任务成功率之间有不同权衡。
最有价值的报告将公开完整的硬件细节和失败分布。总体成功率可能掩盖模型在复杂流程、空间关系或模糊指令上的薄弱之处。
第二项信号是更大规模的真实机器人评估。报道引用的一项第三方测试涉及十项 DROID 任务,每项尝试三次,并使用了一条 Franka 机械臂。
据报道,FLUX 3 Action 在 30 次尝试中完成了 28 次。Cosmos 3 Nano 完成 27 次,DreamZero 完成 20 次,π0.5 完成 13 次。
这些结果提供了令人鼓舞的外部证据,但 30 次试验对于得出部署结论而言仍然太少。多一次失败就会实质性改变百分比。
未来测试应包含数百次试验、陌生物体、光照变化、摄像头扰动、变化的工作台面以及人为中断。它们还应记录干预和不安全动作,而不只是最终任务完成情况。
当一项策略能在不同团队维护的实体场地和硬件上保持优势时,其在仿真中的成功才更有说服力。若领先优势消失,模型可能正在受益于与基准的对齐。
第三项信号是对真正新型具身形态的适配。Black Forest Labs 提供了基础模型、完整微调支持以及参数高效的 SO-101 工作流程。
开发者应关注新机器人需要多少任务专属数据与计算资源。一个有用的基础模型应当降低适配负担,而非仅仅将其转移。
最有力的证据将来自外部团队将模型适配到不同机械臂、移动操作机器人、无人机或工业工具。这些项目应将训练时间、数据量、可靠性和控制延迟与既有策略进行比较。
许可证将塑造这种采用。研究人员现在可以探索该模型,但商业用户必须确定 FLUX Kommunity 条款是否适合其组织和部署场景。
硬件经济性同样重要。24 GB 的推理路径扩大了可及性,但可靠的生产运行还包括冗余容量、监控、控制硬件和安全系统。
开展这些评估的开发者需要严谨记录提示词、checkpoints、摄像头布局、数据集和失败案例。可搜索的工程知识库可以帮助团队在不同实验之间保留这些背景信息。
Black Forest Labs FLUX 3 Action 通过将清晰的技术机制与公开权重和可衡量的结果相结合,赢得了关注。它尚未证明通用机器人智能,其当前基准得分也仍留有很大的失败空间。
眼前的机会是开展实际实验。团队可以检查代码,在没有机器人的情况下运行录制观测数据,并在接触实体硬件之前于仿真中评估 checkpoint。
更困难的问题随之而来:开发者能否复现其领先表现,将它迁移到陌生机器,并在环境不再符合基准条件时维持安全行为?
这些结果将决定 FLUX 3 Action 会成为广泛使用的机器人基础模型,还是仅作为一个令人印象深刻的参考点。就目前而言,它最重要的贡献,是为该领域提供了一个可供测试的具体、可检查模型。



