top of page

Black Forest Labs FLUX 3 Action desafía a Nvidia con pesos abiertos para robots

hace 3 horas
14 min de lectura

Black Forest Labs lanzó FLUX 3 Action el 23 de septiembre, incorporando directamente a la carrera por el control robótico de propósito general un modelo de 7.000 millones de parámetros con pesos abiertos. La empresa afirma que su modelo lidera un destacado benchmark de simulación pese a utilizar menos parámetros que la política competidora Cosmos 3 Nano de Nvidia.

Esa comparación da relevancia al lanzamiento. Black Forest Labs FLUX 3 Action no es simplemente un generador de imágenes adaptado para otra demostración. Predice conjuntamente vídeo y acciones de robots, y convierte observaciones visuales e instrucciones en lenguaje natural en una secuencia de comandos físicos.

Los resultados iniciales parecen prometedores, pero siguen siendo más acotados que un avance general en robótica. La puntuación líder procede de tareas simuladas sobre mesa, mientras que una pequeña prueba externa de hardware utilizó solo 30 intentos. Los pesos abiertos también incluyen condiciones de licencia, requisitos informáticos considerables y responsabilidades de seguridad explícitas para quien los implemente.

Black Forest Labs FLUX 3 Action cambia la competencia en robótica

El cambio importante es que un destacado desarrollador de IA visual ha publicado tanto pesos robóticos utilizables como el código necesario para adaptarlos.

FLUX 3 Action es un modelo de acciones del mundo, o WAM, que predice estados visuales futuros y comandos robóticos dentro de una misma arquitectura. Acepta fotogramas de cámara, el estado actual del robot y una instrucción de texto. Después produce el siguiente bloque de acciones junto con los fotogramas de vídeo previstos.

Black Forest Labs publicó tres componentes principales. El repositorio base contiene el modelo preentrenado para acciones y codificadores compartidos. Puntos de control DROID y SO-101 independientes proporcionan políticas adaptadas a dos configuraciones robóticas consolidadas.

DROID es un gran conjunto de datos de manipulación robótica construido a partir de demostraciones reales en numerosos entornos. La política DROID publicada se orienta a una configuración de robot Franka con tres vistas de cámara. La versión SO-101 se dirige a un brazo robótico más pequeño y de menor coste, usado habitualmente con el marco LeRobot de Hugging Face.

El modelo tiene 7.000 millones de parámetros. Según la documentación del modelo publicada, una llamada de inferencia DROID devuelve 32 acciones que cubren alrededor de dos segundos de movimiento.

Ese horizonte de acciones importa porque los controladores robóticos deben observar, planificar y actuar de forma repetida. Una ventana de predicción útil más larga puede reducir la frecuencia con la que debe ejecutarse el modelo completo. Sin embargo, bloques de acciones más largos también pueden amplificar los errores cuando el entorno cambia después de que se inicie un plan.

El lanzamiento incluye herramientas de ajuste fino completo, adaptación eficiente en parámetros, inferencia, conversión de puntos de control y evaluación. Los desarrolladores pueden empezar con el modelo base, adaptarlo a otro robot o ejecutar una de las políticas preparadas.

Esto va más allá de publicar una tarjeta de modelo y un vídeo de demostración. El repositorio de inferencia público incluye preparación de datos, entrenamiento distribuido, gestión de puntos de control, herramientas de exportación y ejemplos específicos para robots.

La empresa desarrolló el lanzamiento junto con Nvidia y Hugging Face. Esa cooperación complica el enfoque competitivo. Nvidia ayudó a hacer posible el modelo y proporciona buena parte de la pila de hardware; sin embargo, su política Cosmos es también el rival abierto más importante en el benchmark.

FLUX 3 Action surgió del programa más amplio FLUX 3. Black Forest Labs construyó originalmente su reputación en torno a la generación de imágenes. Su arquitectura más reciente extiende esa base visual a la predicción de vídeo, audio y acciones.

La conexión no es superficial. Un modelo de vídeo debe estimar cómo se mueven, chocan, se deforman y reaccionan los objetos con el tiempo. Una política robótica necesita información relacionada, pero también debe seleccionar comandos que produzcan un resultado deseado.

Black Forest Labs apuesta por que ambos problemas pertenecen a un mismo modelo compartido. Esa apuesta cuenta ahora con pesos descargables, puntos de control funcionales y resultados de benchmark que otros equipos pueden probar.

Un modelo más pequeño lidera ahora RoboLab-120

La afirmación inicial más sólida de FLUX 3 Action es una tasa de éxito del 42,92 por ciento en RoboLab-120, frente al 36,8 por ciento de Cosmos3-Nano-Policy, de mayor tamaño, de Nvidia.

RoboLab-120 es un benchmark de simulación que contiene 120 tareas de manipulación sobre mesa. Cada política afronta desafíos visuales, procedimentales y relacionales en varios niveles de dificultad.

Los ejemplos incluyen identificar el objeto correcto, comprender relaciones espaciales y completar instrucciones de varias etapas. El benchmark se ejecuta en Nvidia Isaac Sim con una configuración de robot Franka de estilo DROID.

El artículo de RoboLab describe un sistema para generar escenas y tareas realistas sin vincular la prueba a una sola arquitectura de modelo. RoboLab-120 utiliza diez ensayos por tarea, lo que produce un conjunto de evaluación más amplio que una breve recopilación de demostraciones.

Black Forest Labs informa de que su modelo ajustado con DROID alcanzó un 42,92 por ciento de éxito global. Según los informes, OASIS WAM obtuvo un 39,0 por ciento, mientras que Cosmos3-Nano-Policy de Nvidia registró un 36,8 por ciento con la configuración de idioma predeterminada.

π0.5 de Physical Intelligence alcanzó un 28,0 por ciento en la misma comparación. DreamZero obtuvo un 25,7 por ciento, mientras que la política más pequeña Cosmos3-Edge-Policy de Nvidia llegó al 22,9 por ciento.

Estas cifras convierten a FLUX 3 Action en el líder actual de la comparación publicada. No significan que complete la mayoría de las tareas de forma fiable. Una tasa de éxito del 42,92 por ciento sigue representando fallos en más de la mitad de los intentos evaluados.

La comparación de parámetros también es destacable. FLUX 3 Action utiliza 7.000 millones de parámetros, mientras que Cosmos 3 Nano utiliza 16.000 millones. Esto otorga a Black Forest Labs un modelo más pequeño con una ventaja de 6,12 puntos porcentuales en la clasificación comunicada.

El número de parámetros no mide directamente el coste, la latencia ni la inteligencia. La arquitectura, la precisión, el movimiento de memoria, los pasos de muestreo y la sobrecarga de los codificadores afectan al rendimiento real durante el despliegue.

Black Forest Labs también ofrece varias variantes de inferencia. La política base utiliza cuatro pasos de eliminación de ruido con guía. Otro punto de control elimina la guía externa, mientras que una versión destilada por pasos produce resultados en un solo paso.

La empresa informa de una inferencia más rápida que Cosmos 3 Nano en las configuraciones de hardware probadas. La ventaja precisa varía según el punto de control, la precisión numérica y la GPU.

Estas optimizaciones abordan una limitación real de la robótica. Un modelo que planifica acciones impresionantes pero responde demasiado lentamente no puede recuperarse del movimiento, las interferencias ni los errores de percepción.

Aun así, el benchmark principal requiere contexto. RoboLab evalúa manipulación simulada, no trabajo impredecible cerca de personas. La simulación puede estandarizar las comparaciones, pero no puede representar todos los errores de sensores, fallos mecánicos, colisiones o cambios ambientales.

El benchmark también surgió de la pila de investigación robótica de Nvidia. Eso no invalida los resultados, pero hace especialmente valiosa la reproducción independiente.

Un problema público relacionado con Cosmos 3 informó previamente de dificultades para reproducir algunos resultados publicados de RoboLab. El informe de Cosmos subyacente presenta puntuaciones en distintos niveles de especificidad de las instrucciones, lo que ilustra cómo los resultados del benchmark dependen de la configuración de la prueba.

Para compradores y desarrolladores, la interpretación correcta es limitada pero significativa. FLUX 3 Action ha establecido una posición creíble en el benchmark utilizando un modelo más pequeño. Los equipos independientes deben determinar ahora si esa ventaja se mantiene con distinto hardware, instrucciones y entornos físicos.

Por qué importa la predicción conjunta de vídeo y acciones

Black Forest Labs aborda el control robótico como un problema de predicción visual con acciones integradas dentro de la misma escena en evolución.

Los modelos tradicionales de visión-lenguaje-acción conectan directamente la entrada visual y las instrucciones lingüísticas con los comandos robóticos. Un modelo de acciones del mundo añade una predicción explícita de cómo debería cambiar el mundo observado.

FLUX 3 Action elimina ruido de forma conjunta de tokens de vídeo y de acciones. La eliminación de ruido significa que el sistema empieza con resultados candidatos ruidosos y los refina iterativamente hasta obtener una predicción coherente.

El modelo utiliza un transformador de difusión con dos flujos de salida sincronizados. Un flujo representa futuros fotogramas visuales. El otro representa las acciones robóticas asociadas a esos momentos.

Ambos flujos comparten el mismo nivel de ruido para cada muestra de entrenamiento. Este diseño anima al modelo a conectar un movimiento ordenado con su consecuencia visual esperada.

Un autoencoder de vídeo congelado convierte los fotogramas en una representación compacta. Un codificador Qwen3-VL-4B congelado procesa la instrucción de texto. El modelo de acciones entrenable combina esas señales con el estado del robot.

Para la política DROID, tres vistas de cámara se organizan en un único lienzo visual. El sistema también recibe las posiciones de las articulaciones y el estado de la pinza. Devuelve 32 comandos, cada uno con siete objetivos articulares y un valor de pinza.

Esto difiere de generar un vídeo y pedir a un controlador independiente que lo imite. Las secuencias de vídeo y acciones surgen del mismo pase del modelo y se mantienen alineadas temporalmente.

El mecanismo ofrece a Black Forest Labs una ruta plausible desde los medios generativos hacia la IA física. El entrenamiento con vídeo expone un modelo al movimiento, el contacto, la permanencia de los objetos y la relación causa-efecto. Después, los datos robóticos le enseñan cómo determinadas máquinas pueden influir en esas escenas.

La colaboración anterior FLUX-mimic de la empresa ofreció un adelanto. Ese sistema conectaba la base visual de FLUX 3 con la experiencia en robótica de mimic, incluido trabajo en torno a la manipulación industrial.

FLUX 3 Action amplía la idea mediante pesos públicos y herramientas de adaptación reutilizables. En los experimentos de la empresa, también abarca más que brazos industriales.

Black Forest Labs informa de versiones entrenadas para dos videojuegos y un dron de interiores. La política para videojuegos utilizó un conjunto de pesos en entornos de conducción distintos, con un texto descriptivo que identificaba el juego activo.

Para el experimento con drones, el modelo recibió una vista de cámara a bordo de 256 por 256 y generó cuatro valores de control. Su conjunto de entrenamiento contenía 800 vuelos programados creados en Isaac Sim.

La empresa afirma que el dron navegó por habitaciones reorganizadas y siguió instrucciones parafraseadas que no coincidían exactamente con sus frases de entrenamiento. Estos resultados son demostraciones del desarrollador, no una evaluación independiente estandarizada.

Aun así, ilustran la afirmación arquitectónica. Un modelo compartido puede representar comandos para un brazo robótico, un dron o un vehículo virtual cuando cada encarnación recibe entradas y cabezales de salida adecuados.

Esto no hace que el modelo sea universalmente intercambiable. Cada máquina tiene cámaras, dimensiones de acción, unidades, tiempos y límites de seguridad distintos. La adaptación sigue requiriendo datos que representen el cuerpo y la tarea objetivo.

El principal beneficio es una base visual reutilizable. Es posible que los desarrolladores no necesiten entrenar la comprensión de escenas desde cero para cada máquina nueva. Pueden concentrar un mayor esfuerzo de entrenamiento en las observaciones y controles del robot.

Este enfoque se asemeja a la estrategia de modelos fundacionales que transformó el software de lenguaje e imágenes. La robótica supone una prueba más difícil porque los resultados erróneos pueden dañar hardware o lesionar a personas.

El vídeo predicho por el modelo ofrece otra posible ventaja. Los ingenieros pueden inspeccionar lo que el modelo espera que ocurra, no solo el comando numérico que envía. Esa previsión visual puede facilitar la depuración, aunque no constituye una garantía formal de seguridad.

Los pesos abiertos no implican una robótica sin restricciones

FLUX 3 Action es inspectable y adaptable, pero su licencia, exigencias de hardware y salvaguardas de despliegue limitan lo que “abierto” significa en la práctica.

Black Forest Labs describe el lanzamiento como pesos abiertos, en lugar de código abierto por completo. Los parámetros del modelo están disponibles y el código asociado de inferencia y entrenamiento es público. Los pesos utilizan la FLUX Kommunity License, mientras que partes del repositorio de software usan una licencia convencional de código abierto.

La licencia del modelo permite usos no comerciales y ciertos usos comerciales por parte de usuarios que cumplan los requisitos. Las organizaciones más grandes o los despliegues que queden fuera de esas condiciones podrían necesitar un acuerdo independiente.

Esta distinción importa para los equipos de robótica que evalúan el riesgo de dependencia a largo plazo. Un laboratorio de investigación puede experimentar con los pesos, mientras que un fabricante comercial debe examinar si su uso previsto reúne los requisitos.

Los requisitos de recursos del modelo establecen otro límite. El checkpoint DROID utiliza alrededor de 32 GB de memoria GPU en bfloat16 en una Nvidia H200, según la guía de hardware publicada.

La cuantización FP8 y la descarga del codificador de texto pueden permitir ejecutar el sistema en una tarjeta de 24 GB. La cuantización reduce la precisión numérica para ahorrar memoria y mejorar la velocidad, mientras que la descarga desplaza parte del modelo fuera de la GPU principal.

Este requisito es accesible en comparación con algunos modelos de frontera, pero no equivale a una inferencia ligera en el borde. Un robot de producción aún puede necesitar un servidor GPU cercano, un costoso ordenador integrado o una ruta de comunicación cuidadosamente diseñada.

La latencia es solo una preocupación operativa. La política genera posiciones objetivo de las articulaciones, pero no impone límites de velocidad articular, fuerza, colisión ni espacio de trabajo.

La ficha del modelo indica explícitamente a quienes lo desplieguen que añadan esos controles en el nivel de aplicación. Recomienda validación en simulador, límites de seguridad activos en el robot, supervisión humana y una parada física accesible.

Estas advertencias exponen la diferencia entre una política aprendida y un sistema completo de control robótico. Un despliegue en fábrica también necesita supervisión de estado, comportamiento de emergencia, detección de fallos, control de acceso, procedimientos de mantenimiento y límites claros de responsabilidad.

Los bloques de acciones plantean una cuestión adicional de control. FLUX 3 Action puede devolver 32 comandos en una sola predicción. Un controlador debe decidir cuántos ejecutar antes de observar el entorno y planificar de nuevo.

Ejecutar la secuencia completa puede mejorar la eficiencia cuando el mundo se comporta como se espera. Replanificar antes puede ayudar cuando se mueven objetos, falla un agarre o una persona entra en el espacio de trabajo.

El ejemplo de SO-101 refleja esta disyuntiva. Su bucle de control ejecuta 32 acciones de una secuencia predicha más larga, descarta el resto y vuelve a planificar.

Los desarrolladores también deben conservar el orden de las cámaras, la normalización, las unidades articulares, la temporización y las convenciones de estado asociadas con cada checkpoint. Mezclar estos detalles puede producir resultados aparentemente plausibles pero incorrectos.

Por eso, los pesos descargables no eliminan la ingeniería robótica. Desplazan parte del trabajo desde el aprendizaje de una política hacia la integración, la verificación y la aplicación de medidas de seguridad.

Para los compradores empresariales, la pregunta más útil no es si el modelo es abierto. Es si el sistema completo sigue siendo comprobable, mantenible y seguro bajo las condiciones operativas reales de la organización.

La comparación con Nvidia es real, pero incompleta

FLUX 3 Action presiona la estrategia de modelos de Nvidia, aunque el lanzamiento también depende en gran medida del benchmark, las herramientas de simulación y la plataforma informática de Nvidia.

La comparación competitiva más clara enfrenta a FLUX 3 Action con Cosmos3-Nano-Policy. Ambos predicen estados visuales y acciones futuros, ambos ofrecen pesos accesibles y ambos se dirigen a la manipulación robótica general.

Black Forest Labs informa de un mejor rendimiento en RoboLab con menos parámetros. También afirma una mayor velocidad de inferencia en varias GPU evaluadas.

Esta combinación importa porque los desarrolladores de robots suelen enfrentarse a una restricción triple entre capacidad, tiempo de respuesta y memoria. Un modelo más pequeño que mejore el éxito de las tareas podría reducir las exigencias de infraestructura sin aceptar un comportamiento más débil.

Sin embargo, el tamaño del modelo por sí solo no demuestra eficiencia de despliegue. FLUX 3 Action incluye un autoencoder visual congelado y un codificador de texto. El perfil completo de memoria y latencia depende de cómo se ejecuten esos componentes.

La elección del checkpoint también cambia la comparación. La inferencia de cuatro pasos puede preservar la calidad mientras exige más cómputo. Un checkpoint de un solo paso es más rápido, pero podría sacrificar parte del éxito.

Nvidia sigue siendo central para el lanzamiento. RoboLab se ejecuta en Isaac Sim, las pruebas de inferencia reportadas usan GPU Nvidia y el modelo se desarrolló con apoyo de Nvidia.

Black Forest Labs también es miembro de la colaboración más amplia de Nvidia en modelos abiertos. La relación se parece más a una competencia dentro de una plataforma compartida que a un simple aspirante que ataca a un actor establecido.

Hugging Face cumple otra función importante. Su marco LeRobot empaqueta conjuntos de datos robóticos, políticas e integraciones de hardware para que los investigadores puedan reproducir flujos de trabajo con mayor consistencia.

El checkpoint SO-101 de FLUX 3 Action incluye información guardada de preprocesamiento y normalización. Eso reduce una fuente común de errores al trasladar una política entre un repositorio y un brazo físico.

El panorama competitivo más amplio incluye los modelos π de Physical Intelligence, Nvidia GR00T, DreamZero, OpenVLA, OASIS y otros sistemas de visión-lenguaje-acción. Cada uno toma decisiones diferentes sobre datos de entrenamiento, arquitectura del modelo, apertura y hardware compatible.

Algunos se centran en la predicción directa de acciones. Otros añaden componentes de modelado del mundo o planificación. Varios publican pesos, pero mantienen restricciones sobre el uso comercial o los datos de entrenamiento.

La posición distintiva de FLUX 3 Action combina preentrenamiento generativo de vídeo, predicción conjunta de fotogramas futuros, acciones robóticas y herramientas públicas de adaptación. Su liderazgo en benchmarks refuerza ese conjunto, pero no resuelve el debate arquitectónico.

Una política de acción directa puede ser más pequeña y sencilla porque no predice vídeo. Un modelo de acción mundial dedica cómputo a representar posibles escenas futuras, lo que podría mejorar el razonamiento físico, pero también aumentar la latencia.

La evidencia decisiva provendrá de comparaciones controladas con los mismos datos, hardware, restricciones de seguridad y tareas del mundo real. Las tablas de clasificación públicas rara vez capturan todo ese sistema.

No obstante, el lanzamiento cambia las expectativas. Los equipos de robótica ahora pueden preguntarse por qué un modelo más grande o cerrado rinde peor que una alternativa disponible de 7.000 millones de parámetros en un benchmark relevante.

Los competidores deben responder con mejores resultados, despliegues más rápidos, soporte para más tipos de robots, licencias más claras o evidencia de instalaciones reales. Esa presión es más relevante que la posición en la tabla de clasificación por sí sola.

Qué deberían observar ahora desarrolladores y compradores

Las tres próximas señales son la reproducción independiente, pruebas más amplias con robots reales y una adaptación sostenida a nuevas máquinas.

La primera señal es la reproducción del resultado de RoboLab-120. Los equipos independientes deberían ejecutar el checkpoint publicado con versiones fijadas, prompts documentados y configuraciones de evaluación idénticas.

Una puntuación reproducida cercana al 42,92 por ciento reforzaría la afirmación de que FLUX 3 Action tiene una ventaja real en el benchmark. Grandes desviaciones indicarían sensibilidad a la configuración, las versiones de software o detalles no publicados.

La reproducción debería incluir más de un checkpoint. Las variantes base, destilada con guidance, destilada por pasos, bfloat16 y FP8 equilibran de forma distinta velocidad, uso de memoria y éxito de tareas.

Los informes más útiles publicarán detalles completos del hardware y distribuciones de fallos. Una tasa de éxito global puede ocultar debilidades en procedimientos complejos, relaciones espaciales o instrucciones ambiguas.

La segunda señal es una evaluación más amplia con robots reales. Una prueba de terceros citada en la cobertura incluyó diez tareas DROID, tres intentos por tarea y un brazo Franka.

Según los informes, FLUX 3 Action completó 28 de 30 intentos. Cosmos 3 Nano completó 27, DreamZero completó 20 y π0.5 completó 13.

Estos resultados ofrecen evidencia externa alentadora, pero 30 pruebas siguen siendo demasiado pocas para extraer conclusiones de despliegue. Un fallo adicional cambiaría materialmente el porcentaje.

Las pruebas futuras deberían incluir cientos de ensayos, objetos desconocidos, cambios de iluminación, perturbaciones de cámara, superficies de trabajo desplazadas e interrupciones humanas. También deberían documentar intervenciones y movimientos inseguros, no solo la finalización final de las tareas.

El éxito en simulación se vuelve más convincente cuando una política conserva su ventaja en instalaciones físicas y hardware mantenido por equipos diferentes. Si la ventaja desaparece, el modelo podría estar beneficiándose de la alineación con el benchmark.

La tercera señal es la adaptación a robots realmente nuevos. Black Forest Labs proporciona un modelo base, soporte para ajuste fino completo y un flujo de trabajo SO-101 eficiente en parámetros.

Los desarrolladores deberían observar cuántos datos y cuánto cómputo específicos de la tarea requiere un robot nuevo. Un modelo fundacional útil debería reducir la carga de adaptación, no limitarse a trasladarla.

La evidencia más sólida procederá de equipos externos que adapten el modelo a distintos brazos, manipuladores móviles, drones o herramientas industriales. Esos proyectos deberían comparar tiempo de entrenamiento, volumen de datos, fiabilidad y latencia de control frente a políticas consolidadas.

La licencia condicionará esa adopción. Los investigadores pueden explorar el modelo ahora, pero los usuarios comerciales deben determinar si los términos de FLUX Kommunity encajan con su organización y despliegue.

La economía del hardware también importará. Una vía de inferencia de 24 GB amplía el acceso, pero una operación de producción fiable incluye capacidad de reserva, supervisión, hardware de control y sistemas de seguridad.

Los desarrolladores que trabajen en estas evaluaciones necesitan registros rigurosos de prompts, checkpoints, disposiciones de cámaras, conjuntos de datos y fallos. Una base de conocimiento de ingeniería con capacidad de búsqueda puede ayudar a los equipos a preservar ese contexto entre experimentos.

Black Forest Labs FLUX 3 Action ha ganado atención al conectar un mecanismo técnico claro con pesos públicos y resultados medibles. No ha establecido una inteligencia robótica de propósito general, y su puntuación actual en el benchmark deja un margen considerable para el fallo.

La oportunidad inmediata es la experimentación práctica. Los equipos pueden inspeccionar el código, ejecutar observaciones grabadas sin un robot y evaluar el checkpoint en simulación antes de acercarse al hardware físico.

La pregunta más difícil llega después. ¿Pueden los desarrolladores reproducir la ventaja, transferirla a máquinas desconocidas y mantener un comportamiento seguro cuando el entorno deja de coincidir con el benchmark?

Esos resultados determinarán si FLUX 3 Action se convierte en una base robótica ampliamente utilizada o sigue siendo un punto de referencia impresionante. Por ahora, su contribución más importante es ofrecer al campo un modelo concreto e inspeccionable que poner a prueba.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page