top of page

Black Forest Labs lanza FLUX 3, pero su promesa de vídeo de 20 segundos aún necesita una prueba en el mundo real

Black Forest Labs ha lanzado FLUX 3 en acceso anticipado, con la promesa de clips de vídeo de hasta 20 segundos con audio generado en la misma pasada. Esa duración importa, pero la apuesta mayor importa más. La empresa quiere que una sola arquitectura aprenda imágenes, vídeo, audio y acciones físicas de forma conjunta.

El lanzamiento sitúa a Black Forest Labs en competencia directa con Google, OpenAI, Runway, Kling, Seedance y otros desarrolladores de modelos de vídeo. Estas empresas ya compiten en calidad visual, precisión de los prompts, consistencia de personajes, sonido y distribución. FLUX 3 debe demostrar que unificar estas capacidades produce mejores resultados que combinar sistemas especializados.

La empresa ha publicado demostraciones prometedoras y puntuaciones preliminares de preferencia. Sin embargo, el acceso anticipado es limitado, el uso en producción está generalmente restringido y la metodología completa de los benchmarks sigue sin estar disponible. Por tanto, FLUX 3 se entiende mejor como un adelanto técnicamente ambicioso, no como una clasificación definitiva del mercado de generación de vídeo.

Black Forest Labs incorpora vídeo y audio a FLUX 3

FLUX 3 amplía la familia FLUX desde la generación de imágenes hacia un modelo compartido para medios visuales, sonido y predicción de acciones.

Black Forest Labs anunció FLUX 3 el 23 de julio de 2026. Según el lanzamiento de FLUX 3 de la empresa, el modelo aprende de imágenes, vídeos y audio dentro de una arquitectura subyacente única.

El modelo puede generar vídeo con audio nativo a partir de un prompt de texto. El audio nativo implica que el sonido se crea como parte del proceso de generación, en lugar de añadirse posteriormente mediante un modelo de sonido independiente.

Black Forest Labs afirma que una generación puede durar hasta 20 segundos. Es tiempo suficiente para sostener un clip social completo, un anuncio breve o varias acciones conectadas sin requerir una ampliación inmediata.

El modelo también acepta referencias visuales. Un usuario puede proporcionar una imagen inicial, una imagen de referencia o un vídeo existente para guiar el resultado.

Sus flujos de trabajo de vídeo anunciados incluyen:

  • Generación de texto a vídeo con audio.

  • Animación de imagen a vídeo a partir de un fotograma inicial.

  • Vídeo guiado por imagen mediante una referencia visual.

  • Transformación de vídeo a vídeo.

  • Continuación a partir de una secuencia existente de vídeo y audio.

  • Transiciones de fotograma clave a vídeo entre momentos seleccionados.

  • Generación de diálogos multilingües.

  • Encadenamiento de clips individuales en secuencias más largas y de múltiples planos.

Estos modos abordan distintas partes de un flujo de producción real. Un diseñador podría animar la imagen de un producto, mientras que un cineasta podría preservar a un personaje a través de varias escenas.

La distinción entre una salida única de 20 segundos y una secuencia de múltiples planos es importante. FLUX 3 genera hasta 20 segundos en una sola pasada, mientras que las secuencias más largas requieren clips encadenados.

El encadenamiento ofrece a un agente automatizado o a un sistema de edición una forma de construir una pieza más larga. No garantiza una continuidad perfecta en cada transición.

Black Forest Labs afirma que las referencias visuales pueden ayudar a preservar personajes entre escenas. La empresa aún no ha publicado mediciones independientes sobre la consistencia de identidad durante varios minutos.

FLUX 3 Video está disponible mediante un programa de acceso anticipado con acceso restringido. FLUX 3 Action, una versión de predicción de acciones orientada a la robótica, también está entrando en pruebas seleccionadas.

FLUX 3 Image llegará en las próximas semanas, según el plan de lanzamiento anunciado. La empresa también pretende ofrecer APIs, pesos de modelo privados y un modelo FLUX 3 Dev de pesos abiertos más adelante en 2026.

Este despliegue separa el anuncio de la disponibilidad generalizada. La mayoría de los creadores aún no puede comparar el sistema en condiciones normales de producción.

Aun así, el cambio es considerable. Black Forest Labs inició la línea FLUX como un proyecto de generación de imágenes. Ahora presenta a la misma familia como base para sonido, movimiento, edición, simulación y control de robots.

Por qué un modelo multimodal único es la verdadera apuesta de FLUX 3

La afirmación central de FLUX 3 no es el vídeo más largo. Es que varios tipos de medios se vuelven más útiles cuando se condicionan mutuamente durante el entrenamiento.

Black Forest Labs construyó FLUX 3 sobre Self-Flow, su marco para alinear la generación y la comprensión multimodales. Una modalidad es una forma de información, como texto, imágenes, audio o vídeo.

Las cadenas de producción de medios tradicionales suelen dividir esas formas entre modelos independientes. Un modelo produce imágenes, otro crea movimiento y un tercero aporta diálogo o efectos.

Esa separación puede introducir contradicciones visibles y audibles. Un vaso puede golpear una mesa antes de que llegue el sonido del impacto. La boca de un hablante puede moverse de forma distinta al diálogo generado.

El entrenamiento conjunto proporciona al sistema acceso a varias descripciones del mismo acontecimiento. El vídeo transmite movimiento, el audio transmite temporización y las imágenes fijas aportan una estructura espacial detallada.

La investigación sobre Self-Flow de la empresa describe un método de flow matching autosupervisado. El flow matching entrena un modelo para transformar una distribución simple en datos estructurados mediante una trayectoria continua aprendida.

“Autosupervisado” significa que las señales de entrenamiento pueden derivarse de los propios datos, en lugar de depender por completo de etiquetas humanas. Esto puede hacer que el entrenamiento multimodal a gran escala sea más escalable.

Black Forest Labs afirma que amplió ese método con una cantidad sustancialmente mayor de datos y recursos computacionales. FLUX 3 se entrenó entonces con datos de imagen, vídeo y audio al mismo tiempo.

El beneficio previsto es la restricción mutua. Un movimiento debería corresponderse con un sonido esperado, mientras que un fotograma posterior debería seguir de forma plausible a uno anterior.

Este mecanismo también explica el interés de la empresa por la predicción de acciones. Un modelo de vídeo aprende qué suele ocurrir después de que un objeto se mueve, cae, se dobla o colisiona.

Un modelo de acciones plantea una pregunta relacionada. Predice cómo cambia el entorno después de que un robot realiza un movimiento específico.

Black Forest Labs sostiene que la generación de contenido y el comportamiento robótico no requieren bases completamente independientes. En su lugar, un backbone de vídeo preentrenado puede convertirse en el punto de partida de un modelo de acciones especializado.

La empresa trabajó con mimic robotics para desarrollar FLUX-mimic. Ese sistema combina el backbone de FLUX 3 con entrenamiento para la manipulación robótica diestra.

Según las empresas, FLUX-mimic puede adaptarse a determinadas tareas de manipulación con tan solo 30 minutos de datos de robot. Los enfoques anteriores supuestamente requerían 30 horas o más.

Audi ha probado el modelo en la manipulación de materiales blandos en entornos de producción. Estas tareas resultan difíciles para la automatización convencional porque los materiales flexibles no mantienen una forma fija.

Estas afirmaciones tienen más consecuencias que un vídeo de demostración pulido. Si el enfoque se generaliza, Black Forest Labs podrá vender una sola base para herramientas creativas, plataformas de simulación y automatización física.

Sin embargo, los resultados de pruebas robóticas seleccionadas no establecen una fiabilidad generalizada. Objetos, cámaras, condiciones de iluminación y distribuciones de fábrica diferentes pueden modificar el rendimiento.

La empresa no ha publicado suficientes detalles técnicos para determinar cuánto conocimiento se comparte realmente entre las modalidades. Tampoco está claro qué componentes requieren entrenamiento adicional específico para cada tarea.

Por tanto, el mecanismo es creíble, pero aún incompleto. FLUX 3 ofrece a Black Forest Labs una dirección de investigación coherente, mientras que el acceso anticipado proporciona el terreno de pruebas necesario para validarla.

El audio nativo aumenta la presión sobre las herramientas de vídeo especializadas

FLUX 3 obliga a las plataformas de vídeo a competir en escenas completas, no en imágenes en movimiento silenciosas.

El audio nativo ha pasado rápidamente de ser una función inusual a un requisito competitivo. OpenAI describió Sora 2 como un modelo combinado de vídeo y audio con diálogo, efectos de sonido y paisajes sonoros de fondo.

Su lanzamiento de Sora 2 también puso énfasis en el comportamiento físico y las instrucciones que abarcan múltiples planos. Estos objetivos coinciden directamente con las principales afirmaciones de FLUX 3.

Google ha integrado Veo en un ecosistema más amplio de creación y empresa. Sus herramientas se extienden por la aplicación Gemini, YouTube, Flow, Google Vids, Vertex AI y una API.

La actualización de Veo 3.1 de Google destacó las imágenes de referencia, la salida vertical, la consistencia de personajes, diálogos más ricos y el escalado a alta resolución. La distribución proporciona a Google una ventaja que la calidad bruta del modelo no puede eliminar.

Runway aborda el mercado desde el software creativo profesional. Gen-4.5 pone el foco en la calidad del movimiento, la adherencia a los prompts, el comportamiento físico y el control creativo detallado.

Runway también ofrece a los creadores un espacio de trabajo consolidado para generar, transformar y organizar material audiovisual. Su modelo Gen-4.5 admite controles de imagen a vídeo, fotogramas clave y vídeo a vídeo.

FLUX 3 entra en este mercado con tres propuestas competitivas distintas. Ofrece generación más larga en una sola pasada, sonido nativo y una base multimodal capaz de extenderse a la acción física.

El límite de 20 segundos es fácil de comercializar porque es concreto. Sin embargo, la duración por sí sola no determina si un clip es utilizable.

Una generación más larga da al modelo más oportunidades de perder la identidad de un personaje, alterar la ropa, mover objetos de forma inesperada o romper la relación de causa y efecto. Un clip coherente de ocho segundos puede ser más valioso que uno inestable de 20 segundos.

El audio introduce otra capa de evaluación. Los espectadores detectan errores de sincronización labial, efectos mal colocados, acústica de sala poco natural y cambios en la voz de un hablante.

El diálogo multilingüe eleva aún más las expectativas. La pronunciación correcta es solo un requisito. La temporización, la emoción, la identidad del hablante y el movimiento de la boca también deben mantenerse alineados.

Black Forest Labs informa de comparaciones preliminares de preferencia humana basadas en clips de 10 segundos, a 720p y con audio. La empresa afirma que FLUX 3 fue preferido frente a Grok Imagine Video en hasta el 69% de las comparaciones.

Informa de tasas de preferencia del 60% frente a Kling v3 Pro, del 52% frente a Seedance 2.0 y del 52% frente a Gemini Omni Flash. También informa de un 77% frente a Runway Gen-4.5 y un 93% frente a Luma Ray 3.2.

Estas cifras ofrecen una señal inicial, pero no resuelven la comparación. Black Forest Labs describe las evaluaciones como preliminares y afirma que tanto el modelo como el sistema de pruebas siguen en desarrollo.

La expresión “hasta” también exige cautela. Puede referirse al subconjunto de pruebas más favorable, en lugar de a un resultado uniforme entre prompts, estilos y categorías de salida.

La empresa aún no ha publicado el conjunto completo de prompts, el procedimiento de muestreo, las instrucciones para evaluadores, las tasas de fallos ni los intervalos de confianza. Sin esos materiales, los lectores no pueden reproducir los hallazgos.

Los competidores también optimizan para objetivos distintos. Runway se centra en gran medida en el control de producción, mientras que Google combina capacidades de modelo con distribución para consumidores y empresas.

Por tanto, FLUX 3 presiona a las herramientas especializadas en el plano de la arquitectura. Plantea si una base unificada puede llegar a igualar sus características individuales más sólidas y, al mismo tiempo, simplificar todo el flujo de trabajo.

Es un desafío mayor que ganar una prueba de preferencia. También tarda mucho más en demostrarse.

Lo que los primeros resultados de FLUX 3 no muestran

El acceso anticipado limita tanto la evidencia disponible para externos como las afirmaciones que los compradores responsables deberían aceptar.

Black Forest Labs califica abiertamente sus evaluaciones publicadas como preliminares. Planea publicar resultados de benchmarks y metodología más completos junto con una disponibilidad más amplia.

Hasta que eso ocurra, varias preguntas básicas siguen sin respuesta. La empresa no ha revelado el número de parámetros del modelo, la composición de los datos de entrenamiento, la velocidad de inferencia ni los requisitos de computación.

No ha proporcionado tasas completas de fallos para las generaciones de 20 segundos. Las comparaciones públicas utilizaron clips de 10 segundos a 720p, aunque la duración máxima es una afirmación central del lanzamiento.

Esa diferencia importa. La consistencia temporal suele volverse más difícil a medida que una secuencia se alarga. Los resultados a 10 segundos no describen automáticamente el rendimiento a 20 segundos.

La estructura de acceso anticipado crea limitaciones adicionales. Según los términos del programa de la empresa, el acceso puede ser limitado, revocable y distribuido por lotes.

A menos que Black Forest Labs acuerde lo contrario por escrito, los modelos tempranos son para evaluación, pruebas y desarrollo. Por lo general, los participantes no pueden utilizarlos en entornos de producción ni en aplicaciones para usuarios finales a gran escala.

Los términos también indican que los modelos pueden producir resultados inexactos, inseguros, de baja calidad o inesperados. Pueden ser inestables, modificarse o retirarse sin previo aviso.

Las entradas y salidas enviadas a través del programa pueden utilizarse para operar, evaluar y mejorar los modelos. Por ello, las organizaciones que manejan material confidencial deben evaluar si el programa se ajusta a sus normas de datos.

Los participantes también están sujetos a obligaciones de confidencialidad. Esto reduce la cantidad de críticas públicas, pruebas independientes y resultados representativos que pueden surgir durante la fase restringida.

Una demostración seleccionada por la empresa suele destacar las generaciones exitosas. Los equipos de producción necesitan saber con qué frecuencia falla un sistema, cuántos reintentos requiere y si los fallos siguen patrones previsibles.

También necesitarán controles prácticos. Un flujo de trabajo profesional requiere personajes reproducibles, elecciones de cámara, detalles de producto, tipografía, diálogo y elementos de marca.

FLUX 3 afirma tener fortaleza en tipografía y diseño animado. Esto resulta prometedor para publicidad, contenido explicativo y activos para redes sociales, donde un texto incorrecto puede dejar un clip inutilizable.

Sin embargo, una “tipografía sólida” no especifica una tasa de error. Tampoco muestra si el texto pequeño se mantiene estable mientras se mueve la cámara o el objeto.

La seguridad plantea otra área sin resolver. El diálogo nativo puede favorecer la narración, pero también facilita la producción de suplantaciones y contenido engañoso.

Los sistemas de vídeo necesitan señales de procedencia, controles de semejanza, filtrado de contenido y formas de rastrear resultados abusivos. OpenAI, por ejemplo, ha descrito marcas de agua visibles, metadatos C2PA, análisis de audio y controles de consentimiento para su sistema de vídeo.

Black Forest Labs afirma que realizará pruebas de seguridad durante el acceso anticipado. Su anuncio no proporciona una descripción pública comparable de las salvaguardas de FLUX 3.

El acceso a pesos abiertos hará que esta cuestión sea más compleja. El despliegue local puede mejorar la privacidad, la latencia y la personalización, pero los pesos descargables también pueden debilitar la aplicación centralizada de las normas.

Las licencias importarán tanto como el acceso técnico. La empresa ha prometido una base multimodal de pesos abiertos, pero “pesos abiertos” no significa automáticamente uso comercial sin restricciones.

Los desarrolladores deberían esperar la licencia real de FLUX 3 Dev antes de planificar redistribución, ajuste fino comercial o despliegue integrado. Las versiones anteriores de FLUX utilizaron distintos acuerdos de acceso y licencia.

La conclusión adecuada es acotada. Black Forest Labs ha mostrado un sistema multimodal serio con una hoja de ruta ambiciosa. Aún no ha mostrado un producto de producción completo con liderazgo verificado de forma independiente.

La estrategia de Black Forest se extiende más allá del vídeo creativo

Black Forest Labs utiliza los medios generativos como primer mercado para una plataforma más amplia de inteligencia visual.

El lenguaje de lanzamiento de la empresa conecta repetidamente la creación de vídeo con la simulación, el uso de ordenadores y la robótica. Este planteamiento revela dónde espera que surja el valor a largo plazo.

La generación creativa proporciona abundante material de entrenamiento y demanda comercial inmediata. Los usuarios pueden inspeccionar los resultados rápidamente, identificar fallos y aportar comentarios sobre sus preferencias.

La robótica plantea un problema más difícil. Un error visual generado puede arruinar un clip, mientras que un error de predicción de acciones puede dañar equipos o interrumpir la producción.

Aun así, ambos campos requieren que los modelos representen el movimiento y las consecuencias físicas. Un sistema debe anticipar qué sucede cuando una mano tira de una tela, una herramienta se mueve o dos objetos chocan.

FLUX-mimic es la prueba más clara de esta tesis de una base compartida. El modelo utiliza la base de vídeo de FLUX 3 y añade entrenamiento especializado para la manipulación robótica.

Black Forest Labs afirma que este enfoque reduce la cantidad de datos robóticos específicos de cada tarea necesarios para la adaptación. mimic robotics aporta experiencia práctica de despliegue y datos de máquinas físicas.

Audi proporciona un entorno de pruebas industrial. Los materiales flexibles son un objetivo exigente porque su forma cambia durante la manipulación.

Si FLUX-mimic funciona de forma fiable fuera de demostraciones cuidadosamente seleccionadas, la colaboración reforzaría el argumento a favor de representaciones compartidas de vídeo y acción. También diferenciaría a FLUX 3 de los sistemas centrados únicamente en medios.

El resultado podría crear un ciclo de desarrollo útil. Los datos de vídeo enseñan patrones físicos amplios, mientras que las interacciones robóticas aportan ejemplos de acción y consecuencia.

Sin embargo, transferir conocimiento visual a un control seguro sigue siendo difícil. Un modelo que predice un fotograma plausible no necesariamente es lo bastante preciso para dirigir una máquina.

Los sistemas robóticos también requieren respuestas en tiempo real, incertidumbre calibrada y límites estrictos de seguridad. Una latencia aceptable para la generación de vídeo puede ser inaceptable en una planta de fabricación.

Esto crea la tensión central del artículo. La arquitectura unificada promete mayor reutilización, pero cada mercado objetivo exige una fiabilidad especializada.

Las aplicaciones creativas toleran muestreo repetido y selección manual. La robótica a menudo requiere una respuesta correcta en el primer intento.

Black Forest Labs parece reconocer esa diferencia. FLUX 3 Action se presenta mediante asociaciones selectas de investigación y comerciales, no a través de una interfaz de consumo sin restricciones.

La oferta prevista de pesos privados también podría servir a organizaciones que requieren menor latencia o procesamiento local. Una versión de pesos abiertos daría a los investigadores más margen para inspeccionar y adaptar la base.

La ruta de la empresa contrasta con plataformas que se concentran principalmente en productos creativos terminados. Google puede distribuir Veo mediante servicios existentes, mientras que Runway ofrece un entorno de producción maduro.

Black Forest Labs, en cambio, quiere convertirse en un proveedor de modelos subyacentes. Su tecnología puede aparecer dentro de aplicaciones creativas, plataformas para desarrolladores, sistemas empresariales y productos especializados de IA física.

Esa estrategia depende de socios. Según se informa, Canva, Krea, Picsart, Burda y Magnific están probando FLUX 3, lo que ofrece a la empresa varias vías para integrarse en flujos de trabajo establecidos.

Los socios pueden convertir las capacidades del modelo en herramientas utilizables. También controlan cuántos usuarios se encuentran con la tecnología y qué comentarios regresan al desarrollador.

Para los equipos que evalúan FLUX 3, la calidad del modelo no debería ser la única preocupación. La fiabilidad de la API, las licencias, los controles de seguridad, las opciones de despliegue y la integración con socios determinarán si la arquitectura se convierte en infraestructura.

Por tanto, la hoja de ruta de Black Forest es más grande que un lanzamiento de vídeo. FLUX 3 es la primera prueba pública de si una base visual puede respaldar tanto contenido como acción sin volverse mediocre en cada ámbito.

Tres señales decidirán si FLUX 3 cumple

La divulgación de benchmarks, el acceso a producción y los resultados independientes de los socios determinarán si el lanzamiento de FLUX 3 se convierte en algo más que un adelanto impresionante.

La primera señal es la prometida publicación de la metodología completa de los benchmarks. Black Forest Labs debe revelar los prompts, los procedimientos de los evaluadores, los ajustes de muestreo, las condiciones de comparación y el rendimiento durante toda la ventana de 20 segundos.

Los investigadores independientes deberían poder reproducir la tendencia general de sus puntuaciones de preferencia reportadas. Si pueden hacerlo, el desafío de la empresa a los modelos de vídeo establecidos se volverá mucho más sólido.

Si los resultados se debilitan bajo pruebas neutrales, el lanzamiento parecerá más una evidencia temprana cuidadosamente seleccionada. Ese resultado no volvería irrelevante a FLUX 3, pero limitaría su afirmación de liderazgo.

La segunda señal es el camino desde el acceso anticipado hasta un uso de producción fiable. Los desarrolladores necesitan APIs estables, latencia predecible, documentación, controles de seguridad y términos comerciales claros.

El lanzamiento de FLUX 3 Image mostrará si el entrenamiento compartido ofrece beneficios consistentes en otro tipo importante de resultado. Los pesos privados y FLUX 3 Dev revelarán la definición práctica de apertura de la empresa.

Observe atentamente la licencia. La posibilidad de inspeccionar los pesos es distinta del permiso para modificarlos, redistribuirlos o utilizarlos comercialmente.

La tercera señal es el rendimiento dentro de los flujos de trabajo de los socios. Canva, Krea, Picsart y otras plataformas creativas pueden revelar problemas que las demostraciones controladas pasan por alto.

Audi y mimic robotics ofrecen un punto de validación aún más exigente. Una predicción de acciones fiable a partir de datos robóticos limitados respaldaría la afirmación de que el aprendizaje de vídeo se transfiere a tareas físicas.

La incapacidad de generalizar entre tareas debilitaría la tesis de la base compartida. Sugeriría que el entrenamiento especializado sigue soportando la mayor parte de la carga práctica.

Los creadores también deberían comparar flujos de trabajo completos, no clips aislados. Las preguntas relevantes incluyen tasas de reintento, continuidad, editabilidad, precisión del sonido y el tiempo necesario para alcanzar un resultado aceptable.

Los desarrolladores deberían probar cómo las imágenes de referencia influyen en la identidad y el estilo a lo largo de varias escenas conectadas. Los compradores empresariales deberían examinar el manejo de datos, las garantías de acceso y las restricciones de despliegue antes de cargar activos sensibles.

FLUX 3 merece atención porque reúne varios problemas difíciles en un solo modelo y ofrece una explicación técnica clara para hacerlo. Su generación de vídeo de 20 segundos proporciona a esa estrategia un titular accesible.

La prueba más profunda es si la arquitectura produce beneficios fiables una vez que se abran las puertas. Black Forest Labs ha establecido la afirmación. Los usuarios más amplios, los benchmarks independientes y los despliegues reales deben ahora establecer su valor.

Durante los próximos meses, compare la metodología publicada con los resultados prácticos. Luego plantee una pregunta práctica: ¿FLUX 3 reduce la cantidad de modelos y pasos de edición que necesita su flujo de trabajo, o simplemente desplaza esas complicaciones detrás de una sola interfaz?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

​Añade una barra de búsqueda a tu cerebro

Solo tienes que preguntarle a remio

Recuérdalo todo

No organices nada

bottom of page