top of page

Los resultados de Arena de Qwen-Image-2.1 lo sitúan primero entre los modelos abiertos, pero no primero en general

hace 2 días
14 min de lectura

Los resultados de Arena de Qwen-Image-2.1 sitúan al nuevo modelo de Alibaba en primer lugar entre los modelos abiertos tanto en edición de imágenes como en generación de texto a imagen. Ese doble liderazgo llegó pocos días después de su lanzamiento del 20 de septiembre, lo que dio a Qwen un debut público inusualmente sólido.

El titular necesita un matiz importante. Qwen-Image-2.1 ocupa el puesto 16 en general en edición de imágenes y el 17 en generación de texto a imagen. Los sistemas propietarios de OpenAI, Google, Microsoft, Meta, xAI y otros siguen ocupando la mayoría de las posiciones por encima de él.

La comparación más significativa se sitúa cerca del límite de la edición de imágenes. Qwen-Image-2.1 obtuvo 1.367 puntos, solo tres menos que el modelo de alta fidelidad GPT-Image-1.5 de OpenAI, con 1.370. Sin embargo, el resultado de Qwen sigue siendo preliminar, tiene un margen de incertidumbre más amplio y procede de muchos menos votos.

No se trata simplemente de otro modelo que encabeza un filtro de modelos abiertos. Qwen ha acercado un sistema descargable a un producto propietario consolidado en una prueba de preferencias humanas. Sin embargo, su restrictiva licencia de investigación hace que la expresión "código abierto" sea más compleja de lo que sugiere la etiqueta de la clasificación.

Qué cambió en las dos clasificaciones de Arena

Qwen-Image-2.1 tomó la posición líder entre los modelos abiertos en dos tablas independientes de Arena, pero ninguno de los resultados lo convierte en el mejor modelo de imágenes en general.

En la tabla de edición de una sola imagen de Arena, el modelo registró una puntuación de 1.367 con un margen de incertidumbre de más o menos nueve puntos. Ocupó la posición 16 entre los 56 modelos listados en la instantánea del 21 de septiembre.

Esa puntuación lo convirtió en el modelo mejor clasificado bajo el filtro de código abierto de Arena. Hunyuan Image 3.0 Instruct de Tencent le siguió con 1.302, mientras que el anterior Qwen Image Edit alcanzó 1.241. Por lo tanto, Qwen-Image-2.1 aventajó a su rival abierto más cercano por 65 puntos en esa instantánea.

La comparación con el modelo de edición anterior de Qwen es aún más amplia. Su puntuación de 1.367 superó a Qwen Image Edit por 126 puntos, aunque sus totales de votos y períodos de evaluación difieren considerablemente. Esa diferencia hace que la comparación sea informativa, pero no una medición controlada del progreso arquitectónico.

La clasificación general cuenta una historia más contenida. GPT-Image-2.5 Sunburst de OpenAI lideró la tabla con 1.526, seguido por otra variante de GPT-Image-2.5 con 1.482. Qwen-Image-2.1 se mantuvo a 159 puntos del líder.

Aun así, su cercanía a un modelo consolidado de OpenAI merece atención. GPT-Image-1.5 high-fidelity ocupó el puesto 15 con 1.370, dejando una diferencia de solo tres puntos. Sus márgenes de incertidumbre mostrados se solapan, por lo que ese orden no debe considerarse una diferencia concluyente de calidad.

La tabla de edición de imágenes también mostró un importante desequilibrio de evidencia. Qwen-Image-2.1 había recibido 4.841 votos, frente a los 589.013 de GPT-Image-1.5 high-fidelity. Arena etiquetó el resultado de Qwen como preliminar.

Qwen también lideró el campo de modelos abiertos para la generación de texto a imagen. Obtuvo 1.228 puntos con un margen de incertidumbre de más o menos 11 puntos y ocupó el puesto 17 entre 79 modelos. Su resultado se basó en 2.843 votos.

La tabla de texto a imagen situó a GPT-Image-2.5 Sunburst de OpenAI en primer lugar con 1.423. OpenAI, Microsoft, xAI, Reve, Meta, Google, ByteDance y el modelo propietario Qwen de Alibaba ocuparon posiciones por encima del lanzamiento descargable de Qwen.

La afirmación de lanzamiento de Alibaba identifica correctamente a Qwen-Image-2.1 como el principal modelo abierto en ambas tablas. No debe interpretarse como una afirmación de que el modelo encabeza alguna de las dos clasificaciones sin filtrar.

Esa distinción importa porque "primero entre los modelos abiertos" y "primero en general" responden a preguntas distintas. Lo primero mide la competencia dentro de un campo restringido. Lo segundo refleja cómo se compara el modelo con todos los sistemas disponibles para evaluación.

Por qué el doble liderazgo presiona a los competidores abiertos

La clasificación de Qwen-Image-2.1 en Arena eleva las expectativas para los modelos descargables que antes competían mediante la especialización o menores barreras de despliegue.

Su objetivo de presión más cercano no es OpenAI. Es el grupo de modelos de imágenes abiertos y de pesos abiertos de Tencent, Black Forest Labs, ByteDance y los propios lanzamientos anteriores de Qwen. Esos sistemas se enfrentan ahora a una referencia pública más alta en dos tareas.

En edición de imágenes, Hunyuan Image 3.0 Instruct ocupó el segundo lugar dentro del filtro abierto de Arena con 1.302. Qwen Image Edit y su revisión 2511 le siguieron con 1.241 y 1.235. Las variantes Flux 2 Dev y Klein de Black Forest Labs se situaron más abajo.

Qwen-Image-2.1 hace más que superar a esos modelos en una sola tabla. Lidera las clasificaciones filtradas tanto para creación como para edición. Esa amplitud desafía a los competidores que mantienen distintos modelos o flujos de trabajo para ambas tareas.

La competencia de texto a imagen presenta un panorama más concurrido. Los modelos Cosmos3 de Nvidia, Hunyuan Image 3.0, las variantes Flux, el modelo abierto de Ideogram y los lanzamientos anteriores de Qwen aparecen todos en la tabla. Qwen-Image-2.1 entró por encima de ellos y además maneja ediciones.

Esa combinación genera presión a nivel de flujo de trabajo. Los desarrolladores pueden usar una familia de modelos para la generación inicial, cambios basados en instrucciones, composición con múltiples referencias y salida transparente. Menos cambios de modelo pueden simplificar la experimentación local y el diseño de aplicaciones.

El lanzamiento también llegó con soporte inmediato del ecosistema. Qwen afirma que Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V y ModelScope admitían el modelo desde su lanzamiento. Esas integraciones reducen el retraso entre la publicación de los pesos y la obtención de comentarios útiles de la comunidad.

El soporte desde el primer día no garantiza la adopción. Sí garantiza que los desarrolladores independientes puedan empezar a probar el modelo mediante interfaces conocidas. Los lanzamientos rivales sin una integración comparable pueden perder atención antes de que sus diferencias de calidad queden claras.

Por tanto, la inversión competitiva es más limitada que una simple victoria de lo abierto frente a lo cerrado. Qwen no ha desplazado a los líderes propietarios. Ha hecho que la principal opción abierta sea más unificada y ha acercado su puntuación de edición a la de un modelo propietario más antiguo.

Esa combinación cambia lo que los usuarios pueden esperar razonablemente de un lanzamiento de pesos abiertos. Una generación sólida por sí sola ya no es suficiente. Un modelo competitivo necesita cada vez más edición, control de referencias, servicio eficiente y soporte fiable en las herramientas habituales.

La nueva posición de Qwen también puede presionar los propios servicios comerciales de imágenes de Alibaba. Arena lista los modelos propietarios de Qwen por separado del lanzamiento descargable. En generación de texto a imagen, Qwen Image 3.0 Pro se mantuvo por delante con 1.254, frente a los 1.228 de Qwen-Image-2.1.

La diferencia interna es relativamente pequeña, pero los productos atienden necesidades de despliegue distintas. Un modelo propietario alojado enfatiza el acceso gestionado. Un modelo descargable enfatiza el control, la experimentación y la capacidad de operar dentro de los límites de la licencia.

Para los desarrolladores de modelos abiertos, la respuesta obligada es clara. Necesitan una calidad de edición más sólida, una cobertura de tareas más amplia o licencias que ofrezcan menos restricciones comerciales. Igualar solo la puntuación mostrada abordaría una parte de ese desafío.

Los resultados de Arena de Qwen-Image-2.1 reducen una brecha propietaria

La diferencia de tres puntos con GPT-Image-1.5 es llamativa, pero no constituye una prueba estadística de que un modelo abierto haya igualado a OpenAI.

Arena mide la preferencia humana mediante enfrentamientos anónimos lado a lado. Los usuarios envían prompts, reciben resultados de dos modelos no identificados y eligen el resultado que prefieren. Los nombres de los modelos aparecen después de la votación.

Este sistema captura cualidades que los benchmarks fijos pueden pasar por alto. Los votantes humanos pueden reaccionar al seguimiento de instrucciones, el atractivo visual, la precisión del texto, la preservación de identidad y si una edición resulta útil. Los prompts también reflejan intereses reales de los usuarios en lugar de un conjunto de pruebas estático.

Arena explica sus enfrentamientos anónimos de modelos como un proceso público de evaluación impulsado por votos de usuarios. Ese diseño hace que las tablas sean relevantes para la percepción práctica, pero no convierte cada diferencia de puntuación en una clasificación firme.

La puntuación de edición de Qwen-Image-2.1 fue de 1.367 más o menos nueve puntos. GPT-Image-1.5 high-fidelity obtuvo 1.370 más o menos tres. El rango de clasificación mostrado de Qwen se extendía del puesto 14 al 17, mientras que el modelo de OpenAI iba del 14 al 16.

Esos rangos superpuestos socavan cualquier afirmación definitiva sobre cuál modelo es mejor. Una diferencia nominal de tres puntos es menor que el intervalo de incertidumbre mostrado de Qwen. El resultado actual respalda una proximidad competitiva, no una equivalencia.

El volumen de votos hace que la cautela sea aún más importante. Qwen tenía 4.841 votos de edición, mientras que la comparación de OpenAI tenía 589.013. La muestra más grande no hace automáticamente que cada resultado de OpenAI sea mejor, pero sí hace que su posición sea mucho más madura.

La misma cuestión afecta al resultado de texto a imagen. La puntuación de 1.228 de Qwen tenía un margen de incertidumbre de más o menos 11 puntos y procedía de 2.843 votos. Su rango estimado de clasificación cubría las posiciones 15 a 17.

Las posiciones preliminares pueden cambiar a medida que el modelo se enfrenta a más oponentes, tipos de prompts y preferencias de usuarios. Los primeros votantes también pueden probar un nuevo lanzamiento con prompts inspirados en sus fortalezas promocionadas. El tráfico posterior suele ser más variado.

Las clasificaciones de Arena también dependen del conjunto de modelos disponibles. Qwen es primero entre los modelos clasificados bajo el filtro de código abierto, no primero frente a toda definición imaginable de modelo descargable. Las decisiones de clasificación y licencia dan forma a ese subconjunto.

Incluso con esos límites, el resultado tiene importancia estratégica. Qwen-Image-2.1 debutó cerca de un modelo propietario con cientos de miles de votos registrados. Eso da a los desarrolladores una razón concreta para evaluarlo en lugar de descartarlo como una alternativa local de menor calidad.

El resultado es especialmente relevante para equipos que necesitan flujos de trabajo privados y repetibles. Un modelo descargable puede mantener imágenes, prompts y referencias dentro de una infraestructura controlada por el operador. Los servicios propietarios pueden ofrecer ventajas diferentes, incluida la capacidad gestionada y las interfaces maduras.

La puntuación de Arena no puede decidir entre esos modelos de despliegue. Indica que la diferencia visible de calidad se ha reducido en un sistema público de preferencias. El coste operativo, la latencia, los controles de seguridad, las licencias y la fiabilidad específica del dominio todavía requieren pruebas separadas.

Un diseño unificado de 7B explica el desafío más amplio

Qwen-Image-2.1 combina la creación y edición de imágenes dentro de un generador visual de 7.000 millones de parámetros, en lugar de tratarlas como modos de producto no relacionados.

Según el repositorio del modelo de Qwen, el componente de generación visual contiene 32 capas de transformadores de difusión de flujo único. Un transformador de difusión convierte iterativamente el ruido en una imagen mientras condiciona cada paso con entradas de texto y visuales.

El sistema utiliza Qwen3-VL 8B como codificador de texto e imágenes. Este componente convierte las instrucciones y las imágenes de referencia en una representación compartida que guía la generación. Un autoencoder independiente gestiona las imágenes de color normales y la transparencia RGBA nativa.

Qwen afirma que el modelo admite generación de texto a imagen, edición de una sola imagen y composición con hasta 10 imágenes de referencia. También puede aceptar círculos, anotaciones pintadas o máscaras para identificar objetivos locales de edición.

Esos controles abordan problemas prácticos de edición de imágenes. Un minorista podría combinar un producto, un modelo, ropa y accesorios de referencias separadas. Un diseñador podría aislar un objeto, sustituir su fondo y preservar píxeles transparentes para trabajos de composición posteriores.

Los ejemplos oficiales incluyen una imagen grupal compuesta a partir de seis referencias de retratos y un atuendo creado con cinco entradas independientes. Ilustran el flujo de trabajo prometido, pero siguen siendo ejemplos seleccionados por el creador del modelo.

Los usuarios independientes aún deben probar la consistencia de identidad en ángulos difíciles, escenas concurridas, texto pequeño y revisiones repetidas. Un modelo puede producir una primera edición impresionante y, aun así, desviarse tras varios cambios. La puntuación de una sola batalla de Arena no puede revelar por completo ese comportamiento.

La transparencia nativa es otra distinción práctica. La mayoría de los generadores de imágenes producen una imagen rectangular plana, incluso cuando se les pide un objeto aislado. Qwen-Image-2.1 puede generar imágenes RGBA, donde el canal alfa almacena la transparencia junto al color.

Esta función puede reducir el trabajo de eliminación de fondos para stickers, recursos de interfaz, recortes de productos y composición de imágenes. Qwen también afirma que el modelo puede editar capas transparentes y extraer sujetos de fotografías.

La arquitectura utiliza atención de granularidad mixta y reutilización de caché de valores clave de prefijo. En términos simples, el modelo puede reutilizar representaciones de instrucciones e imágenes de referencia durante los pasos de eliminación de ruido. Esto evita recalcular repetidamente la misma información de condicionamiento.

Qwen recomienda 40 pasos de inferencia e indica tamaños de salida nativos cercanos a la resolución 2K. Las formas compatibles incluyen formatos cuadrados, verticales, horizontales y panorámicos. Estas especificaciones hacen que el modelo sea más relevante para experimentos orientados a producción que una demostración de investigación limitada.

La historia más amplia de implementación también importa. El lanzamiento incluyó pipelines para Diffusers y ComfyUI, dos puntos de entrada habituales para desarrolladores y creadores visuales. La compatibilidad de serving llegó mediante vLLM-Omni y SGLang, incluidas opciones de caché, paralelismo y descarga de memoria.

Estas herramientas circundantes ayudan a explicar por qué el lanzamiento recibió atención inmediata. Un modelo de imágenes de código abierto es más útil cuando las personas pueden cargarlo, adaptar flujos de trabajo y comparar resultados sin construir una pila de inferencia desde cero.

Sin embargo, la etiqueta 7B no describe el requisito completo de recursos. El generador visual de Qwen funciona con un codificador visión-lenguaje 8B independiente y un autoencoder. El consumo real de memoria depende de la precisión, la descarga, la resolución y la pila de software seleccionada.

Por lo tanto, el núcleo visual compacto respalda un argumento de eficiencia, pero no una afirmación universal sobre una implementación económica. Los equipos deberían comparar el pipeline completo en su propio hardware, utilizando las resoluciones y cantidades de referencias que requieren sus aplicaciones.

La edición de imágenes de Qwen también depende de la reescritura de prompts. El proyecto ofrece checkpoints Qwen3.5-VL 9B independientes que amplían instrucciones breves para la generación y edición. Los mejores prompts pueden mejorar el resultado, pero añaden otro componente al flujo de trabajo.

Esta modularidad crea una disyuntiva. Los desarrolladores obtienen control sobre la reescritura, la inferencia y el serving, pero también gestionan más modelos y dependencias. Las herramientas propietarias alojadas normalmente ocultan esas decisiones tras una única interfaz.

Lo que el titular sobre modelos abiertos no muestra

La mayor advertencia no es la clasificación general. Es la brecha entre la etiqueta de código abierto de Arena y los derechos de uso reales de Qwen-Image-2.1.

Qwen describe el lanzamiento como de código abierto, y Arena lo sitúa bajo el filtro de código abierto. Sin embargo, el modelo utiliza la Qwen Research License en lugar de una licencia permisiva como Apache 2.0.

La licencia de investigación concede derechos para usar, reproducir, modificar y distribuir los materiales con fines no comerciales. El uso comercial requiere una licencia independiente de Qwen.

Esa restricción importa para las empresas que evalúan el modelo para productos destinados a clientes, sistemas de marketing, servicios de diseño u operaciones comerciales internas. El acceso de descarga no concede automáticamente el derecho a implementar el modelo en esos contextos.

La licencia también exige atribución durante la redistribución. Los productos que utilicen materiales o salidas de Qwen para entrenar otro modelo distribuido deben mostrar una redacción específica. El acuerdo incluye restricciones adicionales relativas a denominación, litigios y terminación.

Estas condiciones no eliminan el valor técnico del lanzamiento. Investigadores, evaluadores y creadores no comerciales aún pueden inspeccionar y ejecutar los pesos conforme al acuerdo. El modelo también puede aportar evidencia valiosa sobre las capacidades de los sistemas de imágenes descargables.

Aun así, "código abierto" normalmente implica más que pesos visibles y código ejecutable. La definición de IA de Open Source Initiative enfatiza las libertades de usar, estudiar, modificar y compartir un sistema. Una restricción no comercial limita una de esas libertades centrales.

Las entradas anteriores de Qwen Image Edit en Arena usan Apache 2.0, según el tablero. Por tanto, Qwen-Image-2.1 mejora la puntuación pública mientras adopta una licencia más restrictiva. Es un cambio material para los desarrolladores, no una nota legal al pie.

Las categorías de licencias también pueden distorsionar las comparaciones competitivas. El filtro abierto de Arena agrupa modelos con licencias permisivas junto a modelos limitados a investigación o uso no comercial. Su disponibilidad práctica difiere considerablemente.

Una startup no puede tratar Qwen-Image-2.1 como una dependencia con licencia Apache sin obtener permiso por separado. Un laboratorio académico puede enfrentar menos obstáculos. Ambos usuarios ven el mismo modelo bajo el mismo filtro de clasificación.

La propia puntuación conlleva otra advertencia. La posición de Qwen era preliminar, basada en varios miles de votos y acompañada por un rango de incertidumbre más amplio que el de competidores consolidados. La clasificación necesita tiempo para estabilizarse.

La preferencia en Arena también mide lo que gusta a los votantes, no todas las dimensiones que requiere una empresa. No certifica directamente el riesgo de copyright, el comportamiento de seguridad, la procedencia de las salidas, el rendimiento demográfico ni la consistencia en un conjunto de datos privado.

Los tableros públicos tampoco establecen la eficiencia de serving. Un modelo puede ganar votos visuales y, aun así, seguir siendo difícil de operar bajo objetivos estrictos de latencia. Su salida nativa 2K y sus flujos de trabajo con múltiples referencias pueden exigir mucha memoria y tiempo de procesamiento.

Las afirmaciones sobre preservación de identidad requieren una cautela similar. Qwen afirma que el modelo preserva personas y productos entre ediciones, pero las demostraciones seleccionadas no pueden establecer fiabilidad para cada rostro, ángulo o condición de iluminación. Las pruebas independientes siguen siendo necesarias.

Por tanto, una lectura responsable es más limitada que el titular promocional. Qwen-Image-2.1 es el modelo clasificado como abierto con mayor puntuación en dos instantáneas de Arena. Su posición exacta es preliminar y su licencia restringe el uso comercial.

Esa lectura sigue dejando a Qwen con un resultado notable. Simplemente separa tres preguntas que el lenguaje de marketing tiende a fusionar: si los pesos están disponibles, si la calidad es competitiva y si los derechos de implementación se ajustan a un producto comercial.

Qué observar después del debut de Qwen-Image-2.1 en Arena

Tres señales determinarán si este debut se convierte en una ventaja duradera: puntuaciones estables en Arena, pruebas independientes de flujos de trabajo y un acceso comercial más claro.

Primero, observe el recuento de votos y el rango de incertidumbre. Qwen-Image-2.1 necesita sustancialmente más batallas en ambas clasificaciones. Una puntuación estable tras una votación más amplia reforzaría la afirmación de que su rendimiento se generaliza más allá del interés de la semana de lanzamiento.

El número importante no es solo su clasificación nominal. Su intervalo de incertidumbre debería estrecharse a medida que se acumulen los votos. El modelo también debería mantenerse por delante de Hunyuan, Flux, Cosmos, Ideogram y futuros lanzamientos abiertos en condiciones comparables.

El movimiento frente a modelos propietarios merece una lectura cuidadosa. Si Qwen se mantiene cerca de GPT-Image-1.5 después de decenas de miles de batallas, la proximidad actual parecerá más duradera. Una caída mostraría que la diferencia de tres puntos era una instantánea temprana.

Segundo, los evaluadores independientes deberían examinar ediciones repetidas en lugar de imágenes de muestra aisladas. Las pruebas útiles deberían incluir tipografía, identidad de producto, rostros, recursos transparentes, composición con múltiples sujetos y varias revisiones secuenciales.

También deberían informar de las configuraciones completas de hardware. La resolución, la precisión, la descarga de modelos, la reescritura de prompts y el número de imágenes de referencia pueden modificar el uso de memoria y la latencia. Los resultados sin esos detalles aportan poca orientación para decisiones de implementación.

Tercero, los desarrolladores deberían seguir la política de licencias de Qwen. Un acuerdo comercial ampliamente disponible, términos más permisivos o una variante posterior con licencia Apache ampliarían el impacto práctico del modelo. La continuidad de los límites no comerciales mantendría muchos usos empresariales sujetos a negociaciones independientes.

Los competidores también influirán en el veredicto. La posición de Qwen puede caer incluso si su propia puntuación se mantiene estable, porque nuevos lanzamientos pueden situarse por encima. Flux, Hunyuan, Nvidia, Ideogram y otros equipos tienen ahora un objetivo visible.

Para los desarrolladores, el siguiente paso sensato es una evaluación directa, no la veneración de clasificaciones. Pruebe la edición de imágenes de Qwen con sus imágenes de referencia más difíciles y compare flujos de trabajo completos. Incluya calidad de salida, tasas de fallos, uso de memoria, latencia y compatibilidad de licencia.

Para los compradores empresariales, los resultados de Qwen-Image-2.1 en Arena justifican una revisión técnica, no una decisión de compra automática. Confirme los derechos comerciales antes de crear un producto dependiente. Considere la puntuación actual como evidencia de potencial, no como una garantía.

Para los creadores, el flujo de trabajo unificado del modelo y la compatibilidad con transparencia son las razones inmediatas más sólidas para probarlo. La clasificación ofrece la invitación. Sus propios prompts, recursos y proceso de revisión proporcionarán la respuesta.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page