El benchmark de Qwen-Image-2.1 sitúa primero a los pesos abiertos, aunque el puesto general se mantiene en el 18.º
Qwen-Image-2.1 alcanzó el primer puesto entre los modelos de pesos abiertos en dos pruebas de Artificial Analysis, pese a ocupar el puesto 18.º general en ambas clasificaciones. El resultado del benchmark de Qwen-Image-2.1 supone una victoria destacada para Alibaba tanto en generación de texto a imagen como en edición de imágenes basada en instrucciones.
Artificial Analysis afirma que desplegó localmente los pesos publicados para su evaluación. Ese detalle diferencia a Qwen-Image-2.1 de los servicios alojados, cuyos proveedores controlan el modelo, la infraestructura y el flujo de salida.
Sin embargo, el resultado no convierte a Qwen-Image-2.1 en el mejor modelo de imágenes disponible. Los sistemas propietarios siguen ocupando las primeras 17 posiciones en ambas listas generales. La verdadera competencia enfrenta a los pesos de modelos accesibles con los servicios cerrados que continúan liderando en calidad absoluta.
El benchmark de Qwen-Image-2.1 produjo dos victorias distintas
Qwen-Image-2.1 lidera su categoría de pesos abiertos en dos tareas diferentes, pero su posición general muestra cuánto terreno queda por recorrer.
Artificial Analysis informó de los resultados en una evaluación local del 30 de septiembre. La organización de pruebas indicó que ejecutó Qwen-Image-2.1 en su propia infraestructura, en lugar de depender de una API controlada por su creador.
En AA-Image-T2I v2.0, Qwen-Image-2.1 registra una puntuación Elo de 1.034, con un intervalo del 95 por ciento reportado entre 1.024 y 1.044. El modelo acumuló 5.286 muestras de evaluación en la instantánea de la clasificación disponible el 2 de octubre.
Esa puntuación lo sitúa en el puesto 18.º de la clasificación completa de texto a imagen. Ocupa el primer puesto cuando la misma clasificación se filtra para mostrar modelos con pesos descargables.
Ideogram 4.0 Quality ocupa el segundo lugar en ese grupo de pesos abiertos. Su puntuación es de 1.011, con un intervalo entre 1.004 y 1.018 en 12.176 muestras.
Las estimaciones puntuales otorgan a Qwen-Image-2.1 una ventaja de 23 puntos. Los intervalos de confianza reportados tampoco se solapan, lo que aporta evidencia más sólida que una simple diferencia de un puesto en la clasificación.
La evaluación de texto a imagen mide la capacidad de generar una imagen nueva a partir de una instrucción escrita. Abarca tareas como publicidad, imágenes de productos, arquitectura, diagramas, entretenimiento y contenido para creadores.
El resultado de edición de imágenes es cercano, pero menos concluyente. Qwen-Image-2.1 obtiene 1.074 puntos, con un intervalo reportado entre 1.065 y 1.083 en 5.536 muestras.
Esa puntuación vuelve a situarlo en el puesto 18.º general. También convierte al modelo en la entrada de pesos abiertos mejor clasificada en la clasificación de edición.
HunyuanImage 3.0 Instruct de Tencent le sigue con 1.066 puntos. Su intervalo reportado va de 1.057 a 1.075 en 5.221 muestras.
Por tanto, Qwen aventaja a HunyuanImage por ocho puntos en la estimación mostrada. Sin embargo, sus intervalos se solapan considerablemente, y Artificial Analysis asigna a ambos modelos un posible rango de clasificación de pesos abiertos que abarca el primer y segundo puesto.
La interpretación responsable es limitada. Qwen-Image-2.1 posee actualmente la puntuación mostrada más alta, pero la prueba de edición no establece una diferencia de calidad inequívoca frente a HunyuanImage.
Ambos resultados siguen siendo relevantes porque la generación y la edición plantean exigencias técnicas diferentes. Un modelo puede componer escenas atractivas y, al mismo tiempo, tener dificultades para preservar identidades, diseños o áreas intactas durante una edición.
Qwen-Image-2.1 rinde de forma competitiva en ambos modos dentro de una única versión descargable. Esa combinación, más que cualquiera de las puntuaciones individuales, hace que el resultado sea más relevante para los desarrolladores.
Por qué importa ser primero entre los pesos abiertos
El benchmark desplaza el debate sobre los pesos abiertos desde la disponibilidad básica hacia un rendimiento creíble en flujos de trabajo visuales completos.
Alibaba lanzó Qwen-Image-2.1 el 20 de septiembre. La empresa lo describe como un modelo unificado para generación de imágenes, edición de imágenes y producción de imágenes transparentes.
Su componente de generación visual contiene 7.000 millones de parámetros y 32 capas de transformador de difusión de flujo único. Un transformador de difusión utiliza atención al estilo transformer mientras convierte iterativamente ruido en la imagen solicitada.
La cifra de 7.000 millones se aplica específicamente a ese componente visual. No debe interpretarse como el tamaño total de todos los componentes de apoyo necesarios para el flujo de trabajo.
Según el lanzamiento oficial de Qwen, el modelo puede usar hasta diez imágenes de referencia. También acepta círculos, anotaciones dibujadas y máscaras para edición localizada.
Esos controles abordan trabajos prácticos de producción. Un minorista podría preservar un producto mientras cambia su fondo, iluminación o accesorios circundantes. Un diseñador podría aislar un objeto sobre transparencia sin reconstruir manualmente el recurso.
El modelo también genera imágenes RGBA, que incluyen un canal de transparencia junto con datos de color rojo, verde y azul. Esto convierte los fondos transparentes en una salida nativa, en vez de requerir un paso de eliminación independiente.
El despliegue local cambia el modelo operativo en torno a esas capacidades. Los equipos pueden inspeccionar los archivos, elegir su infraestructura y crear flujos de trabajo sin enviar cada entrada a un endpoint remoto de generación.
Esto importa cuando las imágenes de origen contienen productos no lanzados, materiales de campaña, información de clientes o recursos internos de diseño. La ejecución local no resuelve automáticamente la gobernanza, pero amplía la superficie de control disponible.
Los pesos descargables también permiten a los desarrolladores probar cuantización, optimización de memoria, programaciones de inferencia personalizadas y adaptadores específicos para tareas. Pueden medir las concesiones en su propio hardware y con sus propias instrucciones.
Un servicio propietario alojado suele ofrecer menos control sobre esas capas. El proveedor selecciona la revisión del modelo, el sistema de seguridad, la infraestructura y la interfaz compatible.
La contrapartida es la responsabilidad operativa. Un modelo descargable sigue requiriendo hardware adecuado, software compatible, almacenamiento, supervisión y personal capaz de mantener el despliegue.
La tarjeta pública del modelo de Qwen incluye una opción de descarga a CPU para reducir la presión de memoria del acelerador. La descarga mueve componentes seleccionados entre la memoria del sistema y el acelerador durante la inferencia.
Esta técnica amplía la compatibilidad de hardware, pero puede aumentar la latencia. Las organizaciones más pequeñas aún deben evaluar si el control local justifica el trabajo adicional de ingeniería.
El lanzamiento también utiliza el Acuerdo de Licencia de Investigación de Qwen. Por eso, “pesos abiertos” es más preciso que tratar el modelo como software de código abierto sin restricciones.
Pesos abiertos significa que los parámetros entrenados están disponibles para su descarga bajo los términos de licencia indicados. El código abierto normalmente implica derechos más amplios y acceso a los materiales completos de desarrollo.
La terminología importa para la planificación comercial. Un modelo puede desplegarse localmente sin conceder todos los derechos que los desarrolladores asocian con una licencia de software permisiva.
Artificial Analysis identifica Qwen-Image-2.1 mediante un enlace de pesos descargables, en lugar de una API alojada por su creador. Por tanto, el benchmark prueba el artefacto que los desarrolladores pueden obtener, no solo un servicio de marca.
Esto hace que el resultado sea relevante para equipos que eligen entre infraestructura visual local y APIs de imágenes cerradas. Les aporta evidencia independiente de que el acceso ya no exige aceptar una calidad de nivel inferior.
El puesto 18.º general aún impide una afirmación más amplia. Qwen-Image-2.1 reduce la brecha práctica, pero no elimina la ventaja de calidad medida que mantienen los sistemas propietarios.
Qwen-Image-2.1 frente a Ideogram 4.0 cambia la competencia de generación
Qwen-Image-2.1 cuenta ahora con la ventaja medida más clara en generación entre los modelos descargables, lo que presiona directamente al lanzamiento centrado en calidad de Ideogram.
La comparación entre Qwen-Image-2.1 e Ideogram 4.0 es la más clara de las dos competiciones del benchmark. Ambos modelos publican pesos descargables y compiten por flujos de trabajo creativos centrados en generación.
Ideogram 4.0 Quality registra una puntuación Elo de 1.011. Qwen-Image-2.1 alcanza 1.034 bajo el mismo marco AA-Image-T2I v2.0.
Esa diferencia refleja preferencias humanas entre resultados emparejados. No mide corrección factual, seguimiento de instrucciones, tipografía o atractivo visual como puntuaciones aisladas.
Artificial Analysis calcula sus calificaciones a partir de comparaciones a ciegas. Los evaluadores ven imágenes competidoras sin saber qué sistema creó cada una y luego seleccionan el resultado que prefieren.
Su actual metodología de benchmark utiliza diez categorías prácticas. Estas abarcan desde comercio minorista y publicidad hasta arquitectura, trabajo del conocimiento, diseño de interfaces y contenido social.
La organización actualiza su conjunto de instrucciones mensualmente. Esto reduce la dependencia de una colección fija de forma permanente, aunque ningún conjunto finito de instrucciones puede representar todas las tareas de producción.
El benchmark también ancla sus modelos abiertos y cerrados en una escala general compartida. Ese diseño permite que el liderazgo de pesos abiertos de Qwen coexista con su posición 18.ª.
Esta distinción es importante para los compradores. “Mejor modelo de pesos abiertos” responde a una cuestión de despliegue, mientras que “mejor modelo en general” responde a una cuestión más amplia de calidad.
Una organización que requiera pesos descargables podría situar a Qwen en primer lugar de su lista corta. Otro comprador centrado únicamente en la máxima calidad del benchmark sigue teniendo 17 opciones mejor clasificadas.
Ideogram también sigue siendo competitivo. Su rango de confianza termina en 1.018, mientras que el de Qwen comienza en 1.024, aunque los resultados del benchmark pueden cambiar a medida que lleguen más comparaciones.
Los recuentos de muestras difieren considerablemente. Ideogram 4.0 Quality tiene más del doble de muestras registradas, lo que proporciona a su estimación un intervalo más estrecho.
Las 5.286 muestras de Qwen aún superan el requisito publicado por Artificial Analysis para un modelo clasificado. La organización afirma que los modelos actuales necesitan al menos 500 apariciones en la arena para recibir una posición en la clasificación.
El resultado de generación no establece que Qwen gane en todas las categorías. El Elo general de un modelo combina preferencias de tareas variadas, y los usuarios pueden ponderar esas tareas de forma diferente.
Un equipo de marketing puede preocuparse principalmente por tipografía legible, fidelidad de marca y control del diseño. Un artista conceptual podría priorizar textura, composición y variedad estilística.
Qwen destaca mejoras en tipografía, retratos y texturas detalladas. Estas afirmaciones proceden de Alibaba y deben probarse con material real del proyecto antes de adoptar el modelo.
La compatibilidad del modelo con múltiples referencias añade otra dimensión que una única puntuación general no puede captar. El trabajo intensivo en referencias puede depender más de la consistencia que de una calidad visual sin restricciones.
Un equipo de producto podría proporcionar varias fotografías de un mismo artículo y solicitar nuevas composiciones preservando su apariencia. El resultado debe mantener la forma, el etiquetado y los detalles reconocibles.
Ese escenario combina generación con preservación de identidad. Ilustra por qué una clasificación general debe iniciar la evaluación, no finalizarla.
No obstante, el resultado cambia la base competitiva. Ideogram ya no posee la principal puntuación mostrada de texto a imagen entre los lanzamientos de pesos abiertos en este benchmark.
Qwen pasa a ser ahora el objetivo de comparación para el próximo modelo descargable de generación. Un nuevo participante debe superar 1.034 y demostrar además que la ventaja se mantiene con votaciones adicionales.
Los proveedores propietarios enfrentan una forma distinta de presión. No necesitan responder porque Qwen ocupa el puesto 18.º, pero deben justificar mantener cerrados el despliegue y el control del modelo.
A medida que aumenta la calidad de los modelos con pesos abiertos, los compradores pueden exigir beneficios más claros a los sistemas alojados. Esos beneficios podrían incluir mayor calidad de salida, menor carga operativa, generación más rápida o controles empresariales más sólidos.
El benchmark no determina qué paquete genera el menor coste total. Evalúa la preferencia por los resultados, no la adquisición de hardware, el trabajo de mantenimiento ni la integración de flujos de trabajo.
Aun así, el componente visual compacto de Qwen plantea una propuesta atractiva. Combina una calidad general respetable con un control que los proveedores cerrados normalmente no ofrecen.
La ventaja de edición sobre HunyuanImage es real, pero limitada
Qwen-Image-2.1 ostenta la mayor puntuación de edición mostrada entre los pesos abiertos, aunque la incertidumbre estadística mantiene a HunyuanImage 3.0 Instruct al alcance.
La edición de imágenes suele ser menos permisiva que la generación desde cero. El modelo debe modificar la región solicitada mientras conserva todo aquello que la instrucción deja intacto.
Artificial Analysis prueba cambios de objetos, nueva iluminación, restauración, reencuadre, preservación de identidad, tipografía y ediciones basadas en razonamiento. Cada solicitud incluye una imagen de entrada y una instrucción escrita.
Esta estructura se parece más al trabajo real de posproducción que pedirle a un modelo que cree una imagen no relacionada. Pequeños cambios no deseados pueden volver inutilizable un resultado que, de otro modo, sería atractivo.
Qwen-Image-2.1 registra 1.074 puntos en esta prueba. HunyuanImage 3.0 Instruct registra 1.066, lo que sitúa a los modelos en primer y segundo lugar entre las entradas de pesos abiertos.
La diferencia de ocho puntos merece atención porque ambos modelos utilizan miles de resultados evaluados. Sin embargo, los intervalos se solapan entre 1.065 y 1.075.
Ese solapamiento significa que el orden mostrado puede cambiar a medida que lleguen más preferencias. También implica que los lectores deben evitar convertir el resultado en una afirmación generalizada de superioridad.
El diseño unificado de Qwen sigue aportándole valor estratégico. Los desarrolladores pueden utilizar un único pipeline para la generación inicial y la edición posterior, en vez de mantener modelos no relacionados.
Un equipo creativo podría generar una escena de producto, sustituir un objeto, corregir texto visible y exportar el sujeto con transparencia. En teoría, un modelo puede cubrir toda esa cadena.
La ventaja es la consistencia y la simplicidad de integración. El riesgo es que un modelo generalista no lidere frente a sistemas especializados en cada etapa.
HunyuanImage 3.0 Instruct sigue siendo el rival inmediato más fuerte en la categoría de edición con pesos abiertos. Su puntuación reportada es estadísticamente cercana al resultado actual de Qwen.
Por tanto, el modelo de Tencent ofrece la prueba de presión adecuada. Si Qwen mantiene su ventaja a medida que aumentan ambos recuentos de muestras, el resultado será más convincente.
La competencia también muestra que los desarrolladores chinos de modelos ocupan ahora las dos primeras posiciones en esta comparación de edición con pesos abiertos. Alibaba y Tencent persiguen modelos visuales accesibles junto con productos alojados.
No se trata simplemente de una historia geográfica. Refleja una estrategia de desarrollo que utiliza lanzamientos descargables para acelerar la experimentación, las integraciones y la optimización de la comunidad.
Las comunidades locales suelen producir versiones cuantizadas poco después de un lanzamiento. La cuantización reduce la precisión numérica para disminuir los requisitos de memoria, normalmente con cierto riesgo para la calidad.
Los flujos de trabajo de la comunidad también pueden añadir programadores alternativos, adaptadores e interfaces de aplicación. Esos cambios facilitan la adopción, pero complican las comparaciones con la configuración original evaluada.
Artificial Analysis afirma que alojó Qwen-Image-2.1 localmente. Por tanto, los lectores deben distinguir su configuración medida de las versiones comunitarias muy modificadas.
Una compilación cuantizada que se ejecute en hardware de consumo podría comportarse de forma distinta al modelo evaluado. La latencia, el consumo de memoria y la calidad de imagen pueden variar.
La documentación del modelo oficial admite generación de texto a imagen, edición y varias dimensiones de imagen. Su flujo de trabajo de ejemplo utiliza 40 pasos de inferencia.
Los pasos de inferencia son etapas repetidas de eliminación de ruido empleadas para construir la imagen final. Más pasos pueden aumentar el tiempo de procesamiento sin garantizar mejoras de calidad proporcionales.
La misma documentación muestra resultados de hasta aproximadamente dimensiones 2K en varias relaciones de aspecto. Las necesidades reales de memoria dependen de la resolución, la precisión, la descarga de memoria y los componentes de apoyo.
Estos detalles de implementación importan porque un líder en edición que no cabe en el hardware de un equipo no es automáticamente la mejor opción operativa.
Los desarrolladores deberían reproducir varias tareas de alto valor antes de comprometerse. Entre las pruebas útiles se incluyen cambios que preserven la identidad, sustitución exacta de texto, consistencia de producto, máscaras y composición con múltiples referencias.
También deberían repetir los prompts con varias semillas aleatorias. Un modelo que ocasionalmente produce un resultado excelente puede seguir sin cumplir un requisito de fiabilidad para producción.
La posición de Qwen en el benchmark justifica una evaluación seria. No elimina la necesidad de dicha evaluación, especialmente mientras Hunyuan se mantenga dentro del rango de incertidumbre reportado.
Lo que las clasificaciones no demuestran
Las tablas de clasificación miden la preferencia humana bajo una prueba definida, no la calidad universal, la fiabilidad en producción, la idoneidad legal ni la eficiencia operativa.
Elo es una medida relativa. Una puntuación depende de los modelos, resultados, prompts y votos incluidos en el grupo de comparación.
El número 1.034 no tiene significado por sí solo fuera de este benchmark. Su valor procede de la posición de Qwen frente a otros modelos evaluados bajo el mismo sistema.
Artificial Analysis combina votos de un panel reclutado con votos públicos históricos aptos. Aplica filtros y utiliza estimación Bradley-Terry antes de presentar el resultado en una escala similar a Elo.
Ese proceso es más informativo que un creador seleccionando sus mejores ejemplos. Aun así, depende de preferencias humanas, que pueden variar según la audiencia y el caso de uso.
La tabla de clasificación también cambia con el tiempo. Entran nuevos modelos, se acumulan más muestras y los conjuntos de prompts reciben actualizaciones.
Qwen-Image-2.1 ocupa el puesto 18 en ambas listas generales de la instantánea del 2 de octubre. Esas cifras deben tratarse como posiciones fechadas, no como etiquetas permanentes.
La ventaja en texto a imagen parece más sólida porque los intervalos de confianza no se solapan con Ideogram 4.0 Quality. La ventaja en edición exige más cautela porque Qwen y Hunyuan se solapan.
Ninguno de los resultados demuestra precisión de los prompts en todos los idiomas. Tampoco establece una ortografía consistente, resultados comerciales seguros ni cumplimiento de los requisitos de marca.
Qwen afirma que el modelo mejora la tipografía, la preservación de identidad y el detalle visual. Son afirmaciones del creador hasta que un equipo las valide frente a sus propios criterios de aceptación.
La revisión de licencias plantea otro requisito independiente. Los pesos descargables no eliminan las obligaciones establecidas en el Qwen Research License Agreement.
Las organizaciones deberían examinar los usos permitidos, las condiciones de distribución y cualquier restricción antes de implementar el modelo comercialmente. Una tabla de clasificación no puede responder a esas cuestiones legales.
La transparencia sobre los datos de entrenamiento también queda fuera de la clasificación mostrada. Una gran calidad de salida no identifica la procedencia completa de los datos utilizados durante el desarrollo.
La seguridad del contenido es otra dimensión ausente. Los equipos pueden necesitar salvaguardas frente a la suplantación de identidad, contenido prohibido, personajes protegidos por copyright o activos de marca no autorizados.
La implementación local transfiere más responsabilidad al operador. La organización debe diseñar sus propios controles de acceso, registros, moderación y prácticas de retención.
Los proveedores cerrados suelen incluir algunos de esos sistemas con el servicio. Los usuarios pueden ganar comodidad mientras ceden visibilidad y control sobre la implementación.
La eficiencia del hardware también requiere una medición independiente. Qwen describe su arquitectura como compacta, pero un componente visual de 7.000 millones de parámetros sigue requiriendo una capacidad de cálculo considerable.
El codificador de texto auxiliar y otros elementos del pipeline añaden requisitos de memoria y procesamiento. El número de parámetros visuales por sí solo no puede predecir el coste de implementación.
El tiempo de generación es sensible a la resolución, la precisión, los pasos de inferencia, la optimización y el tipo de acelerador. Una cifra de latencia publicada no se generalizaría a todas esas opciones.
La ausencia de una API del creador en la tabla de clasificación añade otra consideración. Los equipos que deseen Qwen-Image-2.1 deben actualmente organizar la implementación mediante las herramientas de modelos disponibles o infraestructura de terceros.
Eso puede atraer a desarrolladores que buscan control. Puede disuadir a compradores que desean un endpoint gestionado, garantías de servicio y soporte consolidado.
Por tanto, la mejor elección depende de las restricciones. Un estudio de diseño, un grupo de investigación, una empresa regulada y una aplicación de consumo pueden llegar a conclusiones distintas a partir de las mismas puntuaciones.
El benchmark ofrece una señal creíble de que los pesos abiertos son competitivos por debajo de la frontera absoluta. No establece que la implementación local sea automáticamente más sencilla o segura.
Tampoco elimina la brecha general. Diecisiete modelos siguen por delante de Qwen-Image-2.1 en cada tabla de clasificación completa.
Esa posición es la tensión central de la historia. Los pesos abiertos tienen un nuevo líder, mientras los modelos propietarios siguen definiendo el techo medido.
Tres señales mostrarán si la ventaja de Qwen perdura
La próxima prueba será determinar si Qwen conserva su posición a medida que crecen los votos, se expanden las implementaciones reales y llegan nuevos competidores de pesos abiertos.
La primera señal es la estabilidad de la tabla de clasificación. El resultado de texto a imagen de Qwen ya muestra una separación estadística más clara respecto a su rival más cercano de pesos abiertos.
Su ventaja en edición sigue siendo vulnerable porque el intervalo de confianza se solapa con HunyuanImage 3.0 Instruct. Más comparaciones reforzarán el orden o lo eliminarán.
Una ventaja estable en generación reforzaría la afirmación de Alibaba de que un modelo unificado más pequeño puede equilibrar calidad y eficiencia. Un orden de edición invertido reduciría el alcance de la historia actual.
La segunda señal es el rendimiento local reproducible. Los desarrolladores deberían observar pruebas estandarizadas en aceleradores comunes, niveles de precisión y configuraciones de memoria.
Las cuantizaciones de la comunidad ampliarán el acceso al hardware, pero sus resultados deben compararse con los pesos originales. Un menor uso de memoria solo importa cuando la calidad sigue siendo aceptable.
Los informes de producción también deberían examinar la consistencia entre intentos repetidos. Las atractivas imágenes de muestra no pueden sustituir texto fiable, identidad, geometría y edición localizada.
La evidencia de un uso fiable en hardware de consumo y estaciones de trabajo reforzaría el caso de los pesos abiertos. Altas exigencias de memoria o flujos de trabajo frágiles lo debilitarían.
La tercera señal es la próxima respuesta competitiva. Ideogram, Tencent, Black Forest Labs y otros desarrolladores tienen ahora un objetivo claro en Artificial Analysis.
Un rival puede responder con un lanzamiento de pesos abiertos con mayor puntuación, una licencia más permisiva, una implementación más sencilla o controles especializados más sólidos.
Los proveedores cerrados pueden responder de otra manera. Pueden ampliar la brecha de calidad o facilitar la integración y la gobernanza de los servicios alojados.
La posición de Qwen importará más si obliga a ambos grupos a mejorar. Un resultado aislado de primer lugar es menos importante que un cambio duradero en las expectativas de los compradores.
Para los desarrolladores, el siguiente paso práctico es sencillo. Prueben Qwen-Image-2.1 con los prompts exactos, imágenes de origen y casos de fallo que definen su flujo de trabajo.
Compárenlo con Ideogram 4.0 para generación y HunyuanImage 3.0 Instruct para edición. Mantengan a los líderes propietarios en la evaluación cuando los pesos descargables no sean obligatorios.
Registren las tasas de fallos junto con los resultados preferidos. Hagan seguimiento de cambios no deseados, errores de texto, deriva de identidad, tiempo de procesamiento, uso de memoria y esfuerzo de corrección humana.
El benchmark de Qwen-Image-2.1 ya ha establecido una conclusión defendible. Alibaba proporciona ahora el modelo de pesos abiertos mejor clasificado en ambas pruebas de imágenes de Artificial Analysis.
La conclusión más amplia sigue abierta. ¿El control local llegará a ser lo suficientemente competitivo como para compensar la ventaja final de calidad de los sistemas cerrados?
Los equipos que desarrollan flujos de trabajo de imagen deberían responder a esa pregunta con su propio material, no solo con un titular. Las próximas actualizaciones de las clasificaciones mostrarán si el doble liderazgo de Qwen se mantiene.



