Black Forest Labs FLUX 3 Action défie Nvidia avec des poids ouverts pour robots
Black Forest Labs a lancé FLUX 3 Action le 23 septembre, faisant entrer directement dans la course au contrôle robotique généraliste un modèle ouvert de 7 milliards de paramètres. L’entreprise affirme que son modèle domine un important benchmark de simulation malgré un nombre de paramètres inférieur à celui de la politique concurrente Cosmos 3 Nano de Nvidia.
Cette comparaison donne toute son importance à cette sortie. Black Forest Labs FLUX 3 Action n’est pas simplement un générateur d’images adapté à une autre démonstration. Il prédit simultanément la vidéo et les actions du robot, puis transforme les observations visuelles et les instructions en langage naturel en une séquence de commandes physiques.
Les premiers résultats paraissent prometteurs, mais ils restent plus limités qu’une percée générale en robotique. Le meilleur score provient de tâches simulées sur table, tandis qu’un petit test matériel externe n’a compté que 30 essais. Les poids ouverts sont également soumis à des conditions de licence, à d’importantes exigences de calcul et à des responsabilités de sécurité explicites pour toute personne qui les déploie.
Black Forest Labs FLUX 3 Action change la compétition en robotique
Le changement important est qu’un acteur majeur de l’IA visuelle a publié à la fois des poids exploitables pour robots et le code nécessaire pour les adapter.
FLUX 3 Action est un world action model, ou WAM, qui prédit les futurs états visuels et les commandes robotiques au sein d’une même architecture. Il accepte des images de caméra, l’état actuel du robot et une instruction textuelle. Il produit ensuite le prochain segment d’actions ainsi que les images vidéo prédites.
Black Forest Labs a publié trois composants principaux. Le dépôt de base contient le modèle préentraîné sur les actions et des encodeurs partagés. Des checkpoints DROID et SO-101 distincts fournissent des politiques adaptées à deux configurations robotiques établies.
DROID est un vaste jeu de données de manipulation robotique construit à partir de démonstrations réelles dans de nombreux environnements. La politique DROID publiée cible une configuration de robot Franka avec trois vues caméra. La version SO-101 cible un bras robotique plus petit et moins coûteux, couramment utilisé avec le framework LeRobot de Hugging Face.
Le modèle compte 7 milliards de paramètres. Selon la documentation du modèle, un appel d’inférence DROID renvoie 32 actions couvrant environ deux secondes de mouvement.
Cet horizon d’action est important, car les contrôleurs robotiques doivent observer, planifier et agir de façon répétée. Une fenêtre de prédiction utile plus longue peut réduire la fréquence à laquelle le modèle complet doit s’exécuter. Toutefois, des segments d’action plus longs peuvent également amplifier les erreurs lorsque l’environnement change après le début d’un plan.
La sortie comprend des outils complets de fine-tuning, d’adaptation efficace en paramètres, d’inférence, de conversion de checkpoints et d’évaluation. Les développeurs peuvent partir du modèle de base, l’adapter à un autre robot ou exécuter l’une des politiques préparées.
Cela va au-delà de la publication d’une fiche modèle et d’une vidéo de démonstration. Le dépôt d’inférence public comprend la préparation des données, l’entraînement distribué, la gestion des checkpoints, des outils d’exportation et des exemples spécifiques à des robots.
L’entreprise a développé cette sortie avec Nvidia et Hugging Face. Cette coopération complique la lecture concurrentielle. Nvidia a contribué à rendre le modèle possible et fournit une grande partie de la pile matérielle, alors que sa politique Cosmos constitue aussi le principal rival sur les benchmarks ouverts.
FLUX 3 Action est issu du programme FLUX 3 plus vaste. Black Forest Labs a initialement bâti sa réputation autour de la génération d’images. Sa dernière architecture étend cette base visuelle à la prédiction de vidéos, d’audio et d’actions.
Le lien n’est pas superficiel. Un modèle vidéo doit estimer comment les objets se déplacent, entrent en collision, se déforment et réagissent au fil du temps. Une politique robotique a besoin d’informations connexes, mais elle doit aussi sélectionner les commandes qui produisent un résultat souhaité.
Black Forest Labs parie que ces deux problèmes doivent appartenir à un même modèle partagé. Ce pari dispose désormais de poids téléchargeables, de checkpoints fonctionnels et de résultats de benchmark que d’autres équipes peuvent tester.
Un modèle plus petit prend désormais la tête de RoboLab-120
La principale affirmation initiale de FLUX 3 Action est un taux de réussite de 42,92 % sur RoboLab-120, contre 36,8 % pour le plus grand Cosmos3-Nano-Policy de Nvidia.
RoboLab-120 est un benchmark de simulation comprenant 120 tâches de manipulation sur table. Chaque politique y affronte des défis visuels, procéduraux et relationnels à plusieurs niveaux de difficulté.
Les exemples incluent l’identification du bon objet, la compréhension des relations spatiales et l’exécution d’instructions en plusieurs étapes. Le benchmark fonctionne dans Nvidia Isaac Sim avec une configuration de robot Franka de type DROID.
L’article RoboLab décrit un système permettant de générer des scènes et des tâches réalistes sans lier le test à une seule architecture de modèle. RoboLab-120 utilise dix essais par tâche, produisant un ensemble d’évaluation plus vaste qu’une courte série de démonstrations.
Black Forest Labs indique que son modèle ajusté sur DROID a atteint 42,92 % de réussite globale. OASIS WAM aurait obtenu 39,0 %, tandis que Cosmos3-Nano-Policy de Nvidia a enregistré 36,8 % avec le réglage linguistique par défaut.
Le π0.5 de Physical Intelligence a atteint 28,0 % dans la même comparaison. DreamZero a obtenu 25,7 %, tandis que le plus petit Cosmos3-Edge-Policy de Nvidia a atteint 22,9 %.
Ces chiffres font de FLUX 3 Action le leader actuel de la comparaison publiée. Ils ne signifient pas qu’il accomplit la plupart des tâches de manière fiable. Un taux de réussite de 42,92 % représente encore un échec dans plus de la moitié des tentatives évaluées.
La comparaison des paramètres est également notable. FLUX 3 Action utilise 7 milliards de paramètres, tandis que Cosmos 3 Nano en utilise 16 milliards. Cela donne à Black Forest Labs un modèle plus petit avec une avance de 6,12 points de pourcentage au classement publié.
Le nombre de paramètres ne mesure pas directement le coût, la latence ou l’intelligence. L’architecture, la précision, les transferts mémoire, les étapes d’échantillonnage et la surcharge des encodeurs influencent tous les performances réelles en déploiement.
Black Forest Labs propose aussi plusieurs variantes d’inférence. La politique de base utilise quatre étapes de débruitage avec guidage. Un autre checkpoint supprime le guidage externe, tandis qu’une version distillée par étapes produit des résultats en une étape.
L’entreprise indique une inférence plus rapide que Cosmos 3 Nano sur les configurations matérielles testées. L’avantage précis varie selon le checkpoint, la précision numérique et le GPU.
Ces optimisations répondent à une contrainte réelle de la robotique. Un modèle qui planifie des actions impressionnantes mais réagit trop lentement ne peut pas se remettre d’un mouvement, d’une interférence ou d’erreurs de perception.
Le benchmark mis en avant exige toutefois du contexte. RoboLab évalue la manipulation simulée, et non un travail imprévisible à proximité de personnes. La simulation peut standardiser les comparaisons, mais elle ne peut représenter toutes les erreurs de capteurs, pannes mécaniques, collisions ou modifications de l’environnement.
Le benchmark est également issu de la pile de recherche robotique de Nvidia. Cela n’invalide pas les résultats, mais rend leur reproduction indépendante particulièrement précieuse.
Un ticket public concernant Cosmos 3 a précédemment fait état de difficultés à reproduire certains résultats RoboLab publiés. Le rapport Cosmos sous-jacent présente des scores selon différents niveaux de précision des instructions, illustrant la dépendance des résultats de benchmark à la configuration de test.
Pour les acheteurs et les développeurs, l’interprétation correcte est limitée mais significative. FLUX 3 Action a établi une position crédible sur les benchmarks avec un modèle plus petit. Des équipes indépendantes doivent désormais déterminer si cet avantage se maintient sur différents matériels, avec différentes instructions et dans différents environnements physiques.
Pourquoi la prédiction conjointe de vidéo et d’action est importante
Black Forest Labs traite le contrôle robotique comme un problème de prédiction visuelle, où les actions sont intégrées à la même scène en évolution.
Les modèles traditionnels vision-langage-action relient directement l’entrée visuelle et les instructions linguistiques aux commandes robotiques. Un world action model ajoute une prédiction explicite de la manière dont le monde observé devrait évoluer.
FLUX 3 Action débruite conjointement des jetons vidéo et d’action. Le débruitage signifie que le système commence avec des sorties candidates bruitées et les affine progressivement en une prédiction cohérente.
Le modèle utilise un transformer de diffusion avec deux flux de sortie synchronisés. Un flux représente les futures images visuelles. L’autre représente les actions robotiques associées à ces instants.
Les deux flux partagent le même niveau de bruit pour chaque échantillon d’entraînement. Cette conception encourage le modèle à relier un mouvement commandé à sa conséquence visuelle attendue.
Un autoencodeur vidéo figé convertit les images en une représentation compacte. Un encodeur Qwen3-VL-4B figé traite l’instruction textuelle. Le modèle d’action entraînable combine ces signaux avec l’état du robot.
Pour la politique DROID, trois vues caméra sont disposées sur une seule toile visuelle. Le système reçoit également les positions des articulations et l’état de la pince. Il renvoie 32 commandes, chacune contenant sept cibles articulaires et une valeur de pince.
Cela diffère de la génération d’une vidéo suivie d’une demande à un contrôleur distinct de l’imiter. Les séquences vidéo et d’actions émergent du même passage du modèle et restent alignées dans le temps.
Ce mécanisme offre à Black Forest Labs une voie plausible de la génération de médias vers l’IA physique. L’entraînement vidéo expose un modèle au mouvement, au contact, à la permanence des objets et aux relations de cause à effet. Les données robotiques lui apprennent ensuite comment des machines particulières peuvent influencer ces scènes.
La précédente collaboration FLUX-mimic de l’entreprise en donnait un aperçu. Ce système reliait le socle visuel FLUX 3 à l’expertise robotique de mimic, notamment autour de la manipulation industrielle.
FLUX 3 Action étend cette idée à des poids publics et à des outils d’adaptation réutilisables. Il couvre également davantage que les bras industriels dans les expérimentations de l’entreprise.
Black Forest Labs indique avoir entraîné des versions pour deux jeux vidéo et un drone en intérieur. La politique de jeu utilisait le même ensemble de poids dans des environnements de conduite distincts, avec une légende textuelle identifiant le jeu actif.
Pour l’expérience de drone, le modèle recevait une vue de caméra embarquée de 256 par 256 et générait quatre valeurs de contrôle. Son jeu d’entraînement contenait 800 vols scénarisés créés dans Isaac Sim.
L’entreprise affirme que le drone a navigué dans des pièces réaménagées et suivi des instructions reformulées qui ne correspondaient pas exactement à ses phrases d’entraînement. Ces résultats sont des démonstrations du développeur, et non une évaluation indépendante standardisée.
Ils illustrent néanmoins l’affirmation architecturale. Un modèle partagé peut représenter des commandes pour un bras robotique, un drone ou un véhicule virtuel lorsque chaque incarnation reçoit des entrées et des têtes de sortie adaptées.
Cela ne rend pas le modèle universellement interchangeable. Chaque machine possède des caméras, des dimensions d’action, des unités, des cadences et des limites de sécurité différents. L’adaptation exige toujours des données représentant le corps et la tâche visés.
Le principal avantage est une base visuelle réutilisable. Les développeurs n’auront peut-être pas à entraîner la compréhension des scènes depuis zéro pour chaque nouvelle machine. Ils peuvent concentrer davantage d’efforts d’entraînement sur les observations et les contrôles du robot.
Cette approche rappelle la stratégie des modèles de fondation qui a remodelé les logiciels de langage et d’image. La robotique pose un test plus difficile, car des sorties erronées peuvent endommager du matériel ou blesser des personnes.
La vidéo prédite par le modèle offre un autre avantage possible. Les ingénieurs peuvent examiner ce que le modèle prévoit qu’il va se produire, et non seulement la commande numérique qu’il envoie. Cette prévision visuelle peut aider au débogage, bien qu’elle ne constitue pas une garantie formelle de sécurité.
Des poids ouverts ne signifient pas une robotique sans restrictions
FLUX 3 Action est inspectable et adaptable, mais sa licence, ses exigences matérielles et ses garde-fous de déploiement limitent ce que signifie réellement « ouvert » en pratique.
Black Forest Labs qualifie cette sortie de poids ouverts plutôt que de logiciel entièrement open source. Les paramètres du modèle sont disponibles, et le code d’inférence et d’entraînement associé est public. Les poids sont distribués sous la FLUX Kommunity License, tandis que certaines parties du dépôt logiciel utilisent une licence open source conventionnelle.
La licence du modèle autorise l’usage non commercial ainsi que certains usages commerciaux par des utilisateurs admissibles. Les grandes organisations ou les déploiements ne respectant pas ces conditions peuvent nécessiter un accord distinct.
Cette distinction compte pour les équipes de robotique qui évaluent les risques de dépendance à long terme. Un laboratoire de recherche peut expérimenter avec les poids, tandis qu’un fabricant commercial doit vérifier si son usage envisagé est admissible.
Les besoins en ressources du modèle constituent une autre limite. Le checkpoint DROID utilise environ 32 Go de mémoire GPU en bfloat16 sur une Nvidia H200, selon les recommandations matérielles publiées.
La quantification FP8 et le déchargement de l’encodeur de texte peuvent faire fonctionner le système sur une carte de 24 Go. La quantification réduit la précision numérique afin d’économiser de la mémoire et d’améliorer la vitesse, tandis que le déchargement déplace une partie du modèle hors du GPU principal.
Cette exigence reste accessible par rapport à certains modèles de pointe, mais il ne s’agit pas d’une inférence légère en périphérie. Un robot de production peut encore nécessiter un serveur GPU à proximité, un ordinateur embarqué coûteux ou une architecture de communication soigneusement conçue.
La latence n’est qu’une préoccupation opérationnelle parmi d’autres. La politique produit des positions cibles pour les articulations, mais n’impose pas de limites de vitesse articulaire, de force, de collision ou d’espace de travail.
La fiche du modèle indique explicitement aux déployeurs d’ajouter ces contrôles au niveau de l’application. Elle recommande une validation en simulateur, des limites de sécurité actives sur le robot, une supervision humaine et un arrêt matériel accessible.
Ces avertissements révèlent la différence entre une politique apprise et un système complet de contrôle robotique. Un déploiement en usine exige également une surveillance de l’état, des comportements d’urgence, une détection des défaillances, un contrôle des accès, des procédures de maintenance et des limites de responsabilité.
Les blocs d’actions posent une question supplémentaire de contrôle. FLUX 3 Action peut renvoyer 32 commandes dans une seule prédiction. Un contrôleur doit décider combien en exécuter avant d’observer de nouveau l’environnement et de planifier à nouveau.
Exécuter toute la séquence peut améliorer l’efficacité lorsque le monde se comporte comme prévu. Replanifier plus tôt peut aider lorsque des objets bougent, qu’une prise glisse ou qu’une personne entre dans l’espace de travail.
L’exemple SO-101 illustre ce compromis. Sa boucle de contrôle exécute 32 actions issues d’une séquence prédite plus longue, élimine le reste, puis planifie de nouveau.
Les développeurs doivent également préserver l’ordre des caméras, la normalisation, les unités articulaires, la temporisation et les conventions d’état associés à chaque checkpoint. Mélanger ces détails peut générer des sorties plausibles, mais incorrectes.
C’est pourquoi des poids téléchargeables n’éliminent pas le travail d’ingénierie robotique. Ils déplacent une partie du travail, de l’apprentissage d’une politique vers l’intégration, la vérification et l’application des règles de sécurité.
Pour les acheteurs en entreprise, la question la plus utile n’est pas de savoir si le modèle est ouvert. Il s’agit de déterminer si le système complet reste testable, maintenable et sûr dans les conditions opérationnelles réelles de l’organisation.
La comparaison avec Nvidia est réelle, mais incomplète
FLUX 3 Action met sous pression la stratégie de modèles de Nvidia, mais cette sortie dépend aussi fortement des benchmarks, des outils de simulation et de la plateforme informatique de Nvidia.
La comparaison concurrentielle la plus évidente oppose FLUX 3 Action à Cosmos3-Nano-Policy. Les deux prédisent des états visuels futurs et des actions, proposent des poids accessibles et ciblent la manipulation robotique générale.
Black Forest Labs rapporte de meilleures performances sur RoboLab avec moins de paramètres. L’entreprise revendique aussi une vitesse d’inférence supérieure sur plusieurs GPU testés.
Cette combinaison est importante, car les développeurs de robots font souvent face à une contrainte à trois dimensions : capacité, temps de réponse et mémoire. Un modèle plus petit qui améliore la réussite des tâches pourrait réduire les besoins en infrastructure sans accepter un comportement moins performant.
Toutefois, la taille du modèle seule ne démontre pas l’efficacité du déploiement. FLUX 3 Action inclut un autoencodeur visuel figé et un encodeur de texte. Le profil complet de mémoire et de latence dépend de l’exécution de ces composants.
Le choix du checkpoint modifie également la comparaison. Une inférence en quatre étapes peut préserver la qualité tout en demandant davantage de calcul. Un checkpoint en une étape est plus rapide, mais peut sacrifier une partie du taux de réussite.
Nvidia reste au cœur de cette sortie. RoboLab fonctionne dans Isaac Sim, les tests d’inférence rapportés utilisent des GPU Nvidia, et le modèle a été développé avec le soutien de Nvidia.
Black Forest Labs est également membre de la collaboration plus large de Nvidia autour des modèles ouverts. Cette relation ressemble davantage à une concurrence au sein d’une plateforme partagée qu’à un simple challenger s’attaquant à un acteur établi.
Hugging Face joue un autre rôle important. Son framework LeRobot organise des jeux de données robotiques, des politiques et des intégrations matérielles afin que les chercheurs puissent reproduire les flux de travail de façon plus cohérente.
Le checkpoint SO-101 de FLUX 3 Action arrive avec des informations sauvegardées de prétraitement et de normalisation. Cela réduit une source fréquente d’erreurs lors du transfert d’une politique entre un dépôt et un bras physique.
Le paysage concurrentiel plus large inclut les modèles π de Physical Intelligence, Nvidia GR00T, DreamZero, OpenVLA, OASIS et d’autres systèmes vision-langage-action. Chacun fait des choix différents concernant les données d’entraînement, l’architecture des modèles, l’ouverture et le matériel pris en charge.
Certains se concentrent sur la prédiction directe d’actions. D’autres ajoutent des composants de modélisation du monde ou de planification. Plusieurs publient des poids tout en conservant des restrictions sur l’usage commercial ou les données d’entraînement.
La position distinctive de FLUX 3 Action associe le préentraînement sur vidéo générative, la prédiction conjointe de futures images et d’actions robotiques, ainsi que des outils publics d’adaptation. Son avance dans les benchmarks renforce cet ensemble, mais ne tranche pas le débat architectural.
Une politique d’action directe peut être plus petite et plus simple, car elle ne prédit pas de vidéo. Un modèle d’action du monde consacre du calcul à représenter des scènes futures possibles, ce qui peut améliorer le raisonnement physique, mais aussi accroître la latence.
Les preuves décisives viendront de comparaisons contrôlées utilisant les mêmes données, le même matériel, les mêmes contraintes de sécurité et les mêmes tâches réelles. Les classements publics capturent rarement l’ensemble de ce système.
Cette sortie modifie néanmoins les attentes. Les équipes de robotique peuvent désormais se demander pourquoi un modèle plus grand ou fermé obtient de moins bons résultats qu’une alternative disponible de 7 milliards de paramètres sur un benchmark pertinent.
Les concurrents doivent répondre par de meilleurs résultats, un déploiement plus rapide, une prise en charge plus large des incarnations robotiques, des licences plus claires ou des preuves issues d’installations réelles. Cette pression est plus importante que la seule position au classement.
Ce que les développeurs et les acheteurs devraient surveiller ensuite
Les trois prochains signaux sont la reproduction indépendante, des tests plus larges sur des robots réels et une adaptation durable à de nouvelles machines.
Le premier signal sera la reproduction du résultat RoboLab-120. Des équipes indépendantes devraient exécuter le checkpoint publié avec des versions figées, des prompts documentés et des paramètres d’évaluation identiques.
Un score reproduit proche de 42,92 % renforcerait l’affirmation selon laquelle FLUX 3 Action possède un véritable avantage sur ce benchmark. Des écarts importants indiqueraient une sensibilité à la configuration, aux versions logicielles ou à des détails non publiés.
La reproduction devrait inclure plusieurs checkpoints. Les variantes base, distillée par guidage, distillée par étapes, bfloat16 et FP8 arbitrent différemment entre vitesse, consommation mémoire et réussite des tâches.
Les rapports les plus utiles publieront les détails complets du matériel et la distribution des échecs. Un taux de réussite global peut masquer des faiblesses sur des procédures complexes, des relations spatiales ou des instructions vagues.
Le deuxième signal sera une évaluation plus large sur des robots réels. Un test tiers cité dans la couverture impliquait dix tâches DROID, trois tentatives chacune et un bras Franka.
FLUX 3 Action aurait terminé 28 tentatives sur 30. Cosmos 3 Nano en aurait terminé 27, DreamZero 20 et π0.5 13.
Ces résultats constituent des preuves externes encourageantes, mais 30 essais restent trop peu nombreux pour tirer des conclusions de déploiement. Un échec supplémentaire modifierait sensiblement le pourcentage.
Les futurs tests devraient inclure des centaines d’essais, des objets inconnus, des changements d’éclairage, des perturbations de caméra, des surfaces de travail déplacées et des interruptions humaines. Ils devraient également documenter les interventions et les mouvements dangereux, et pas seulement l’achèvement final des tâches.
La réussite en simulation devient plus convaincante lorsqu’une politique conserve son avantage sur différents sites physiques et avec du matériel entretenu par des équipes différentes. Si cette avance disparaît, le modèle pourrait bénéficier d’un alignement avec le benchmark.
Le troisième signal sera l’adaptation à des incarnations réellement nouvelles. Black Forest Labs fournit un modèle de base, une prise en charge complète du fine-tuning et un flux de travail SO-101 efficace en paramètres.
Les développeurs devraient surveiller la quantité de données et de calcul spécifiques à une tâche dont un nouveau robot a besoin. Un modèle fondamental utile devrait réduire le coût de l’adaptation, et non simplement le déplacer.
Les preuves les plus solides viendraient d’équipes externes adaptant le modèle à différents bras, manipulateurs mobiles, drones ou outils industriels. Ces projets devraient comparer le temps d’entraînement, le volume de données, la fiabilité et la latence de contrôle avec des politiques établies.
Les licences façonneront cette adoption. Les chercheurs peuvent explorer le modèle dès maintenant, mais les utilisateurs commerciaux doivent déterminer si les conditions de FLUX Kommunity conviennent à leur organisation et à leur déploiement.
L’économie matérielle comptera également. Un chemin d’inférence à 24 Go élargit l’accès, mais une exploitation de production fiable inclut une capacité de réserve, la surveillance, le matériel de contrôle et les systèmes de sécurité.
Les développeurs menant ces évaluations ont besoin de registres rigoureux des prompts, checkpoints, dispositions des caméras, jeux de données et échecs. Une base de connaissances d’ingénierie consultable peut aider les équipes à préserver ce contexte d’une expérience à l’autre.
Black Forest Labs FLUX 3 Action a attiré l’attention en reliant un mécanisme technique clair à des poids publics et à des résultats mesurables. Il n’a pas démontré une intelligence robotique généraliste, et son score actuel sur les benchmarks laisse une marge importante aux échecs.
L’opportunité immédiate est l’expérimentation pratique. Les équipes peuvent inspecter le code, exécuter des observations enregistrées sans robot et évaluer le checkpoint en simulation avant d’approcher du matériel physique.
La question la plus difficile vient ensuite. Les développeurs peuvent-ils reproduire cette avance, la transférer vers des machines inconnues et maintenir un comportement sûr lorsque l’environnement cesse de correspondre au benchmark ?
Ces résultats détermineront si FLUX 3 Action devient une base robotique largement utilisée ou demeure un point de référence impressionnant. Pour l’instant, sa contribution la plus importante consiste à offrir au secteur un modèle concret et inspectable à tester.



