top of page

I risultati Arena di Qwen-Image-2.1 lo collocano al primo posto tra i modelli aperti, non al primo posto assoluto

2 giorni fa
Tempo di lettura: 13 min

I risultati Arena di Qwen-Image-2.1 collocano il nuovo modello di Alibaba al primo posto tra i modelli aperti sia nel fotoritocco sia nella generazione da testo a immagine. Questo doppio primato è arrivato pochi giorni dopo il lancio del 20 settembre, offrendo a Qwen un debutto pubblico insolitamente forte.

Il titolo richiede un'importante precisazione. Qwen-Image-2.1 si classifica al 16° posto assoluto per il fotoritocco e al 17° per la generazione da testo a immagine. I sistemi proprietari di OpenAI, Google, Microsoft, Meta, xAI e altri occupano ancora gran parte delle posizioni sopra di esso.

Il confronto più significativo si trova vicino alla soglia del fotoritocco. Qwen-Image-2.1 ha ottenuto 1.367 punti, solo tre in meno del modello GPT-Image-1.5 high-fidelity di OpenAI, a quota 1.370. Tuttavia, il risultato di Qwen resta preliminare, presenta un intervallo di incertezza più ampio e deriva da un numero di voti molto inferiore.

Non si tratta semplicemente di un altro modello in testa a un filtro per modelli aperti. Qwen ha portato un sistema scaricabile vicino a un prodotto proprietario consolidato in un test di preferenza umana. Eppure, la sua restrittiva licenza di ricerca rende l'espressione "open source" più complessa di quanto suggerisca l'etichetta della classifica.

Cosa è cambiato nelle due classifiche Arena

Qwen-Image-2.1 ha conquistato la posizione di vertice tra i modelli aperti in due classifiche Arena distinte, ma nessuno dei due risultati lo rende il miglior modello di immagini in assoluto.

Nella classifica Arena per il fotoritocco di una singola immagine, il modello ha registrato un punteggio di 1.367 con un intervallo di incertezza di più o meno nove punti. Nello snapshot del 21 settembre occupava la 16ª posizione tra i 56 modelli elencati.

Quel punteggio lo ha reso il modello con la posizione più alta secondo il filtro open source di Arena. Hunyuan Image 3.0 Instruct di Tencent seguiva con 1.302 punti, mentre il precedente Qwen Image Edit arrivava a 1.241. Qwen-Image-2.1 guidava quindi il più vicino rivale aperto di 65 punti in quello snapshot.

Il confronto con il precedente modello di editing di Qwen è ancora più netto. Il suo punteggio di 1.367 superava Qwen Image Edit di 126 punti, sebbene i loro totali di voti e i periodi di valutazione differiscano sostanzialmente. Questa differenza rende il confronto informativo, ma non una misurazione controllata dei progressi architetturali.

La classifica generale racconta una storia più contenuta. GPT-Image-2.5 Sunburst di OpenAI guidava la classifica con 1.526 punti, seguito da un'altra variante di GPT-Image-2.5 a 1.482. Qwen-Image-2.1 restava 159 punti dietro al leader.

Ciononostante, la sua vicinanza a un modello OpenAI consolidato merita attenzione. GPT-Image-1.5 high-fidelity si classificava al 15° posto con 1.370 punti, lasciando uno scarto di soli tre punti. I rispettivi intervalli di incertezza visualizzati si sovrappongono, quindi quell'ordine non dovrebbe essere considerato una differenza qualitativa conclusiva.

La classifica del fotoritocco mostrava anche un forte squilibrio nelle evidenze. Qwen-Image-2.1 aveva ricevuto 4.841 voti, contro i 589.013 di GPT-Image-1.5 high-fidelity. Arena ha etichettato il risultato di Qwen come preliminare.

Qwen guidava inoltre il gruppo dei modelli aperti nella generazione da testo a immagine. Ha ottenuto 1.228 punti con un intervallo di incertezza di più o meno 11 punti e si è classificato al 17° posto tra 79 modelli. Il suo risultato si basava su 2.843 voti.

La classifica text-to-image collocava GPT-Image-2.5 Sunburst di OpenAI al primo posto con 1.423 punti. OpenAI, Microsoft, xAI, Reve, Meta, Google, ByteDance e il modello Qwen proprietario di Alibaba occupavano posizioni superiori alla versione scaricabile di Qwen.

L'affermazione di lancio di Alibaba identifica correttamente Qwen-Image-2.1 come il principale modello aperto in entrambe le classifiche. Non dovrebbe essere interpretata come l'affermazione che il modello sia in cima a una delle due classifiche non filtrate.

Questa distinzione conta perché "primo tra i modelli aperti" e "primo in assoluto" rispondono a domande diverse. Il primo misura la competizione in un campo ristretto. Il secondo riflette il confronto del modello con ogni sistema disponibile per la valutazione.

Perché il doppio primato mette sotto pressione i concorrenti aperti

La posizione di Qwen-Image-2.1 in Arena alza le aspettative per i modelli scaricabili che in precedenza competevano grazie alla specializzazione o a minori barriere di distribuzione.

Il suo bersaglio competitivo più immediato non è OpenAI. È il gruppo di modelli di immagini aperti e a pesi aperti di Tencent, Black Forest Labs, ByteDance e delle precedenti versioni di Qwen. Questi sistemi devono ora confrontarsi con un benchmark pubblico più elevato in due attività.

Nel fotoritocco, Hunyuan Image 3.0 Instruct si è classificato secondo nel filtro aperto di Arena con 1.302 punti. Qwen Image Edit e la sua revisione 2511 seguivano con 1.241 e 1.235 punti. Flux 2 Dev e le varianti Klein di Black Forest Labs si trovavano più in basso.

Qwen-Image-2.1 non si limita a superare questi modelli in una sola classifica. Guida le graduatorie filtrate sia per la creazione sia per l'editing. Questa ampiezza mette alla prova i concorrenti che mantengono modelli o flussi di lavoro distinti per le due attività.

La competizione text-to-image offre un quadro più affollato. I modelli Cosmos3 di Nvidia, Hunyuan Image 3.0, le varianti Flux, il modello aperto di Ideogram e le precedenti versioni di Qwen compaiono tutti nella classifica. Qwen-Image-2.1 è entrato sopra di loro gestendo al contempo le modifiche.

Questa combinazione crea pressione a livello di flusso di lavoro. Gli sviluppatori possono utilizzare una sola famiglia di modelli per la generazione iniziale, le modifiche basate su istruzioni, la composizione con riferimenti multipli e l'output trasparente. Ridurre i cambi di modello può semplificare la sperimentazione locale e la progettazione delle applicazioni.

Il rilascio è arrivato anche con un supporto immediato dell'ecosistema. Qwen afferma che Diffusers, ComfyUI, vLLM-Omni, SGLang, LightX2V e ModelScope supportavano il modello fin dal lancio. Queste integrazioni riducono il ritardo tra la pubblicazione dei pesi e l'ottenimento di feedback utili dalla comunità.

Il supporto dal primo giorno non garantisce l'adozione. Garantisce però che gli sviluppatori indipendenti possano iniziare a testare il modello tramite interfacce familiari. I rilasci concorrenti privi di un'integrazione comparabile possono perdere attenzione prima che le loro differenze qualitative diventino chiare.

Il ribaltamento competitivo è quindi più circoscritto di una semplice vittoria tra aperto e chiuso. Qwen non ha soppiantato i leader proprietari. Ha reso più unificata la principale opzione aperta e ha avvicinato il suo punteggio di editing a quello di un modello proprietario meno recente.

Questa combinazione cambia ciò che gli utenti possono ragionevolmente aspettarsi da un rilascio a pesi aperti. Una generazione di qualità non basta più. Un modello competitivo necessita sempre più di editing, controllo dei riferimenti, serving efficiente e supporto affidabile nei tool comuni.

La nuova posizione di Qwen potrebbe anche mettere sotto pressione i servizi commerciali di immagini di Alibaba. Arena elenca i modelli Qwen proprietari separatamente dalla versione scaricabile. Nella generazione da testo a immagine, Qwen Image 3.0 Pro restava avanti con 1.254 punti, contro i 1.228 di Qwen-Image-2.1.

Il divario interno è relativamente ridotto, ma i prodotti rispondono a esigenze di distribuzione diverse. Un modello proprietario ospitato privilegia l'accesso gestito. Un modello scaricabile privilegia il controllo, la sperimentazione e la possibilità di operare entro i limiti della licenza.

Per gli sviluppatori di modelli aperti, la risposta richiesta è chiara. Servono una qualità di editing più forte, una copertura più ampia delle attività o licenze con minori restrizioni commerciali. Eguagliare solo il punteggio visualizzato affronterebbe una sola parte della sfida.

I risultati Arena di Qwen-Image-2.1 riducono un divario proprietario

Il divario di tre punti con GPT-Image-1.5 è sorprendente, ma non è una prova statistica che un modello aperto abbia eguagliato OpenAI.

Arena misura la preferenza umana attraverso confronti anonimi affiancati. Gli utenti inviano prompt, ricevono output da due modelli non identificati e scelgono il risultato che preferiscono. I nomi dei modelli appaiono dopo il voto.

Questo sistema coglie qualità che i benchmark fissi possono non rilevare. I votanti umani possono reagire al rispetto delle istruzioni, all'attrattiva visiva, all'accuratezza del testo, alla conservazione dell'identità e all'utilità percepita di una modifica. I prompt riflettono inoltre interessi reali degli utenti anziché un set di test statico.

Arena descrive le sue sfide anonime tra modelli come un processo di valutazione pubblico alimentato dai voti degli utenti. Questo approccio rende le classifiche rilevanti per la percezione pratica, ma non trasforma ogni differenza di punteggio in una graduatoria certa.

Il punteggio di editing di Qwen-Image-2.1 era 1.367 più o meno nove punti. GPT-Image-1.5 high-fidelity ha ottenuto 1.370 più o meno tre punti. L'intervallo di posizione visualizzato per Qwen andava dal 14° al 17° posto, mentre il modello OpenAI oscillava dal 14° al 16°.

Questi intervalli sovrapposti indeboliscono qualsiasi affermazione definitiva su quale modello sia migliore. Una differenza nominale di tre punti è inferiore all'intervallo di incertezza visualizzato per Qwen. Il risultato attuale sostiene una prossimità competitiva, non l'equivalenza.

Il volume di voti rende la cautela ancora più importante. Qwen aveva 4.841 voti nel fotoritocco, mentre il confronto OpenAI ne aveva 589.013. Il campione più ampio non rende automaticamente migliore ogni output di OpenAI, ma rende la sua posizione molto più consolidata.

La stessa questione riguarda il risultato text-to-image. Il punteggio di 1.228 di Qwen aveva un intervallo di incertezza di più o meno 11 punti e derivava da 2.843 voti. Il suo intervallo di posizione stimato copriva dal 15° al 17° posto.

Le posizioni preliminari possono cambiare quando il modello incontra più avversari, tipi di prompt e preferenze degli utenti. I primi votanti possono inoltre testare un nuovo rilascio con prompt ispirati ai suoi punti di forza promossi. Il traffico successivo spesso diventa più vario.

Le classifiche Arena dipendono anche dal gruppo di modelli disponibile. Qwen è primo tra i modelli classificati dal filtro open source, non primo rispetto a ogni possibile definizione di modello scaricabile. Le scelte di classificazione e licenza determinano quel sottoinsieme.

Anche con questi limiti, il risultato è strategicamente significativo. Qwen-Image-2.1 è arrivato vicino a un modello proprietario con centinaia di migliaia di voti registrati. Ciò offre agli sviluppatori una ragione concreta per valutarlo, anziché liquidarlo come un'alternativa locale di qualità inferiore.

Il risultato è particolarmente rilevante per i team che necessitano di flussi di lavoro privati e ripetibili. Un modello scaricabile può mantenere immagini, prompt e riferimenti all'interno di un'infrastruttura controllata dall'operatore. I servizi proprietari possono offrire vantaggi diversi, tra cui capacità gestita e interfacce mature.

Il punteggio Arena non può decidere tra questi modelli di distribuzione. Indica che il compromesso qualitativo visibile si è ridotto in un sistema pubblico di preferenza. Costi operativi, latenza, controlli di sicurezza, licenze e affidabilità specifica per dominio richiedono ancora test separati.

Un design unificato da 7B spiega la sfida più ampia

Qwen-Image-2.1 combina la creazione e il fotoritocco di immagini all'interno di un generatore visivo da 7 miliardi di parametri, invece di trattarli come modalità di prodotto scollegate.

Secondo il repository del modello di Qwen, il componente di generazione visiva contiene 32 livelli di diffusion transformer a flusso singolo. Un diffusion transformer converte iterativamente il rumore in un'immagine condizionando ogni passaggio su input testuali e visivi.

Il sistema utilizza Qwen3-VL 8B come encoder di testo e immagini. Questo componente trasforma istruzioni e immagini di riferimento in una rappresentazione condivisa che guida la generazione. Un autoencoder separato gestisce le normali immagini a colori e la trasparenza RGBA nativa.

Qwen afferma che il modello supporta la generazione da testo a immagine, l'editing di una singola immagine e la composizione con fino a 10 immagini di riferimento. Può inoltre accettare cerchi, annotazioni dipinte o maschere per identificare gli obiettivi di modifica locali.

Questi controlli affrontano problemi pratici di fotoritocco. Un rivenditore potrebbe combinare un prodotto, una modella, abbigliamento e accessori da riferimenti separati. Un designer potrebbe isolare un oggetto, sostituirne lo sfondo e preservare i pixel trasparenti per il successivo lavoro di impaginazione.

Gli esempi ufficiali includono un'immagine di gruppo composta a partire da sei ritratti di riferimento e un outfit creato da cinque input distinti. Illustrano il workflow promesso, ma restano esempi selezionati dal creatore del modello.

Gli utenti indipendenti devono ancora testare la coerenza dell'identità con angolazioni difficili, scene affollate, testo piccolo e revisioni ripetute. Un modello può produrre una prima modifica impressionante, per poi perdere coerenza dopo diversi cambiamenti. Il punteggio di una singola sfida di Arena non può rivelare pienamente questo comportamento.

La trasparenza nativa è un'altra distinzione pratica. La maggior parte dei generatori di immagini produce un'immagine rettangolare piatta, anche quando riceve il prompt per un oggetto isolato. Qwen-Image-2.1 può generare immagini RGBA, nelle quali il canale alpha conserva la trasparenza insieme al colore.

Questa funzione può ridurre il lavoro di rimozione dello sfondo per sticker, risorse dell'interfaccia, ritagli di prodotto e compositing. Qwen afferma inoltre che il modello può modificare livelli trasparenti ed estrarre soggetti dalle fotografie.

L'architettura utilizza attenzione a granularità mista e riuso della cache chiave-valore del prefisso. In termini semplici, il modello può riutilizzare le rappresentazioni delle istruzioni e delle immagini di riferimento nei passaggi di denoising. In questo modo evita di ricalcolare ripetutamente le stesse informazioni di condizionamento.

Qwen raccomanda 40 passaggi di inferenza e indica dimensioni di output native attorno alla risoluzione 2K. I formati supportati includono quadrato, verticale, orizzontale e widescreen. Queste specifiche rendono il modello più pertinente per esperimenti orientati alla produzione rispetto a una demo di ricerca limitata.

Conta anche la più ampia storia di distribuzione. Il lancio ha incluso pipeline per Diffusers e ComfyUI, due punti di ingresso comuni per sviluppatori e creatori visivi. Il supporto al serving è arrivato tramite vLLM-Omni e SGLang, incluse opzioni per caching, parallelismo e offloading della memoria.

Questo tooling circostante aiuta a spiegare perché il rilascio abbia attirato subito attenzione. Un modello di immagini open source è più utile quando le persone possono caricarlo, adattare i workflow e confrontare i risultati senza costruire da zero uno stack di inferenza.

Tuttavia, l'etichetta 7B non descrive il fabbisogno completo di risorse. Il generatore visivo di Qwen funziona con un encoder vision-language separato da 8B e un autoencoder. Il consumo effettivo di memoria dipende da precisione, offloading, risoluzione e stack software selezionato.

Il nucleo visivo compatto sostiene quindi un argomento di efficienza, ma non un'affermazione universale sulla convenienza del deployment. I team dovrebbero eseguire benchmark dell'intera pipeline sul proprio hardware, usando le risoluzioni e il numero di riferimenti richiesti dalle loro applicazioni.

L'editing delle immagini Qwen dipende anche dalla riscrittura dei prompt. Il progetto offre checkpoint Qwen3.5-VL 9B separati, che espandono istruzioni brevi per generazione ed editing. Prompt migliori possono migliorare l'output, ma aggiungono un altro componente al workflow.

Questa modularità crea un compromesso. Gli sviluppatori ottengono controllo su riscrittura, inferenza e serving, ma devono anche gestire più modelli e dipendenze. Gli strumenti proprietari in hosting di solito nascondono queste scelte dietro un'unica interfaccia.

Cosa non mostra il titolo sui modelli aperti

La principale riserva non riguarda la posizione complessiva. Riguarda la distanza tra l'etichetta open-source di Arena e gli effettivi diritti d'uso di Qwen-Image-2.1.

Qwen descrive il rilascio come open source e Arena lo colloca nel filtro open-source. Tuttavia, il modello utilizza la Qwen Research License anziché una licenza permissiva come Apache 2.0.

La licenza di ricerca concede i diritti di utilizzare, riprodurre, modificare e distribuire i materiali per scopi non commerciali. L'uso commerciale richiede una licenza separata da Qwen.

Questa restrizione conta per le aziende che valutano il modello per prodotti destinati ai clienti, sistemi di marketing, servizi di design o operazioni commerciali interne. L'accesso al download non concede automaticamente il diritto di distribuire il modello in questi contesti.

La licenza richiede inoltre l'attribuzione durante la ridistribuzione. I prodotti che usano materiali o output di Qwen per addestrare un altro modello distribuito devono mostrare una formulazione specificata. L'accordo include ulteriori restrizioni relative a denominazione, contenziosi e cessazione.

Questi termini non cancellano il valore tecnico del rilascio. Ricercatori, valutatori e creatori non commerciali possono comunque ispezionare ed eseguire i pesi in base all'accordo. Il modello può inoltre fornire prove preziose sulle capacità dei sistemi di immagini scaricabili.

Tuttavia, "open source" normalmente implica più che pesi visibili e codice eseguibile. La definizione AI dell'Open Source Initiative sottolinea le libertà di usare, studiare, modificare e condividere un sistema. Una restrizione non commerciale limita una di queste libertà centrali.

Le precedenti voci Qwen Image Edit su Arena usano Apache 2.0, secondo la classifica. Qwen-Image-2.1 migliora quindi il punteggio pubblico passando a una licenza più restrittiva. Si tratta di un cambiamento sostanziale per gli sviluppatori, non di una nota legale marginale.

Anche le categorie di licenza possono distorcere i confronti competitivi. Il filtro open di Arena raggruppa modelli con licenze permissive insieme a modelli limitati alla ricerca o all'uso non commerciale. La loro disponibilità pratica differisce notevolmente.

Una startup non può trattare Qwen-Image-2.1 come una dipendenza con licenza Apache senza ottenere un'autorizzazione separata. Un laboratorio accademico può incontrare meno ostacoli. Entrambi gli utenti vedono lo stesso modello con lo stesso filtro della classifica.

Anche il punteggio stesso presenta un'altra riserva. La posizione di Qwen era preliminare, basata su diverse migliaia di voti e accompagnata da un intervallo di incertezza più ampio rispetto ai concorrenti consolidati. La classifica ha bisogno di tempo per stabilizzarsi.

La preferenza su Arena misura inoltre ciò che piace ai votanti, non ogni dimensione richiesta da un'impresa. Non certifica direttamente il rischio di copyright, il comportamento di sicurezza, la provenienza dell'output, le prestazioni demografiche o la coerenza su un dataset privato.

Le classifiche pubbliche non stabiliscono nemmeno l'efficienza del serving. Un modello può vincere i voti per la qualità visiva e restare comunque difficile da gestire con obiettivi di latenza rigorosi. L'output nativo 2K e i workflow con più riferimenti possono richiedere memoria e tempo di elaborazione considerevoli.

Le affermazioni sulla preservazione dell'identità richiedono una cautela analoga. Qwen afferma che il modello conserva persone e prodotti attraverso le modifiche, ma le dimostrazioni selezionate non possono stabilire l'affidabilità per ogni volto, angolazione o condizione di illuminazione. Restano necessari test indipendenti.

Una lettura responsabile è quindi più circoscritta del titolo promozionale. Qwen-Image-2.1 è il modello classificato come open con il punteggio più alto in due istantanee di Arena. La sua posizione esatta è preliminare e la sua licenza limita l'uso commerciale.

Questa interpretazione lascia comunque a Qwen un risultato degno di nota. Semplicemente separa tre questioni che il linguaggio di marketing tende a fondere: se i pesi sono disponibili, se la qualità è competitiva e se i diritti di deployment sono adatti a un prodotto commerciale.

Cosa osservare dopo il debutto di Qwen-Image-2.1 su Arena

Tre segnali determineranno se questo debutto si trasformerà in un vantaggio duraturo: punteggi Arena stabili, test indipendenti dei workflow e un accesso commerciale più chiaro.

Per prima cosa, osservate il numero di voti e l'intervallo di incertezza. Qwen-Image-2.1 necessita di molte più sfide su entrambe le classifiche. Un punteggio stabile dopo votazioni più ampie rafforzerebbe l'affermazione che le sue prestazioni si generalizzano oltre l'interesse della settimana di lancio.

Il numero importante non è soltanto la sua posizione nominale. Il suo intervallo di incertezza dovrebbe restringersi man mano che i voti aumentano. Il modello dovrebbe inoltre restare davanti a Hunyuan, Flux, Cosmos, Ideogram e alle future release open in condizioni comparabili.

I movimenti rispetto ai modelli proprietari meritano una lettura attenta. Se Qwen resterà vicino a GPT-Image-1.5 dopo decine di migliaia di sfide, l'attuale prossimità apparirà più duratura. Un calo mostrerebbe che il divario di tre punti era un'istantanea iniziale.

In secondo luogo, i tester indipendenti dovrebbero esaminare modifiche ripetute anziché immagini isolate da vetrina. Le prove utili dovrebbero includere tipografia, identità del prodotto, volti, risorse trasparenti, composizione con più soggetti e diverse revisioni sequenziali.

Dovrebbero inoltre riportare le configurazioni hardware complete. Risoluzione, precisione, offloading del modello, riscrittura dei prompt e numero di immagini di riferimento possono modificare uso della memoria e latenza. Risultati privi di questi dettagli offrono poche indicazioni per le decisioni di deployment.

In terzo luogo, gli sviluppatori dovrebbero osservare la politica di licenza di Qwen. Un accordo commerciale ampiamente disponibile, termini più permissivi o una successiva variante con licenza Apache amplierebbero l'impatto pratico del modello. Limiti non commerciali persistenti manterrebbero molti utilizzi aziendali dietro negoziazioni separate.

Anche i concorrenti influenzeranno il verdetto. La posizione di Qwen può scendere anche se il suo punteggio resta stabile, perché nuove release potrebbero collocarsi sopra di essa. Flux, Hunyuan, Nvidia, Ideogram e altri team hanno ora un obiettivo visibile.

Per gli sviluppatori, il passo successivo sensato è una valutazione diretta anziché l'adorazione delle classifiche. Testate l'editing di immagini Qwen con le vostre immagini di riferimento più difficili e confrontate i workflow completi. Includete qualità dell'output, tassi di errore, uso della memoria, latenza e compatibilità della licenza.

Per gli acquirenti aziendali, i risultati Arena di Qwen-Image-2.1 giustificano una revisione tecnica, non una decisione automatica di acquisto. Confermate i diritti commerciali prima di costruire un prodotto dipendente dal modello. Considerate il punteggio attuale come prova di potenziale, non come garanzia.

Per i creatori, il workflow unificato del modello e il supporto alla trasparenza sono le ragioni immediate più forti per provarlo. La classifica offre l'invito. I vostri prompt, asset e processo di revisione forniranno la risposta.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page