Alibaba afferma che Qwen eguaglia Claude, alzando la posta per Anthropic e Google
Alibaba afferma che Qwen3.8-Max può rivaleggiare con Claude dopo aver completato un compito di ricerca autonoma in cinque giorni, intensificando la corsa ai modelli tra Anthropic e Google. Questa affermazione colloca un sistema cinese accanto ai principali modelli americani nel lavoro di lunga durata, non soltanto nelle brevi domande dei benchmark. Eppure, i test di Alibaba non possono stabilire se Qwen offra prestazioni altrettanto affidabili nei normali vincoli aziendali.
L'annuncio conta perché Qwen sta diventando qualcosa di più della risposta di Alibaba a un chatbot. L'azienda sta sviluppando modelli, software agent, servizi cloud e chip come un unico stack connesso. Qwen3.8-Max è progettato per pianificare, usare strumenti, elaborare feedback e continuare a lavorare su incarichi complessi con una supervisione limitata.
Claude rimane il bersaglio più evidente. Anthropic ha posto la programmazione e il lavoro prolungato al computer al centro dell'identità di Claude, mentre Google sta collegando Gemini a un'enorme presenza nel cloud e nella produttività. Alibaba sostiene ora che questa capacità non appartiene più esclusivamente ai laboratori americani.
Questa tesi ha un peso strategico, ma la parità nei benchmark non è parità operativa. Limiti di tempo, budget di token, strumenti e regole di valutazione diversi possono produrre risultati drasticamente differenti. Il vero test è se Qwen riesca a completare lavoro utile con costi, velocità e tassi di errore prevedibili.
Cosa ha effettivamente rilasciato Alibaba
Qwen3.8 sposta la proposta di Alibaba dal rispondere a domande difficili al completare incarichi estesi.
Alibaba ha presentato Qwen3.8 come una famiglia di modelli pensata per programmazione, lavoro professionale, ricerca e compiti agent a lungo orizzonte. Un compito a lungo orizzonte richiede al modello di mantenere un piano attraverso molte azioni, chiamate a strumenti, osservazioni e correzioni.
Il repository ufficiale di Qwen3.8 afferma che il modello migliora la pianificazione autonoma e la gestione del feedback ambientale. Supporta inoltre uno sforzo di ragionamento regolabile, consentendo agli sviluppatori di controllare quanta elaborazione il modello applichi prima di rispondere.
Questo posizionamento è importante. La maggior parte delle valutazioni AI più familiari presenta un prompt circoscritto e si aspetta una sola risposta. Un agent riceve un obiettivo più ampio, sceglie azioni intermedie, esamina i risultati e rivede il proprio approccio quando qualcosa fallisce.
Secondo Alibaba, un esperimento interno ha richiesto a Qwen3.8-Max di ricostruire gli esperimenti di un articolo di ricerca matematica. Il modello avrebbe lavorato per circa 125 ore senza intervento umano, proponendo poi miglioramenti al lavoro originale.
Un altro compito mostrato riguardava la progettazione di chip. Questi esempi intendono dimostrare resistenza e coordinamento, non soltanto richiamo fattuale. Somigliano anche agli incarichi complessi che Anthropic ha utilizzato per presentare Claude come un sistema per il lavoro della conoscenza serio.
Alibaba descrive Qwen3.8-Max come il modello più potente della famiglia. L'azienda ha inoltre rilasciato Qwen3.8-2.4T-A95B, un modello mixture-of-experts a pesi aperti con 2,4 trilioni di parametri totali e 95 miliardi attivati per ciascun token.
Un modello mixture-of-experts instrada ogni input attraverso una porzione selezionata della rete. Questo design può offrire una capacità totale molto ampia senza attivare ogni parametro a ogni passaggio.
Il rilascio aperto distingue la strategia di Qwen da un approccio puramente basato su API chiuse. Gli sviluppatori possono ispezionare, adattare e gestire i pesi rilasciati secondo i termini di licenza applicabili. Qwen3.8-Max è disponibile anche tramite i servizi Alibaba e formati API compatibili.
Il precedente rilascio Qwen3-Max di Alibaba mostrava già questa direzione. La sua panoramica ufficiale del modello descriveva un modello con oltre un trilione di parametri, addestrato su 36 trilioni di token. Enfatizzava programmazione, uso di strumenti, contesto lungo e prestazioni agent.
Qwen3.8 spinge questa strategia oltre. Alibaba avanza un'affermazione specifica sull'esecuzione prolungata, l'area in cui i modelli premium competono sempre più per la domanda aziendale.
Il confronto principale con Claude, pertanto, si basa su qualcosa di più di una singola posizione in classifica. Alibaba vuole che gli sviluppatori credano che Qwen possa ricevere un progetto consistente e continuare a progredire senza un salvataggio umano costante.
Questo è l'esatto cambiamento alla base della notizia. Un fornitore cinese di modelli non sostiene più soltanto che il suo sistema risponde alle stesse domande. Sostiene che il sistema possa svolgere la stessa categoria di lavoro.
Perché gli agent di lunga durata cambiano la concorrenza
La competizione riguarda ora il completamento affidabile dei compiti, esercitando una pressione diretta sulle strategie enterprise di Anthropic e Google.
Anthropic ha costruito gran parte del recente slancio di Claude attorno allo sviluppo software e al lavoro basato sul computer. Claude può ispezionare repository, modificare file, eseguire comandi, analizzare errori e proseguire attraverso compiti di programmazione in più passaggi quando è collegato a un harness agent.
Google affronta lo stesso mercato con i modelli Gemini, Google Cloud, Workspace e infrastrutture per sviluppatori. Il suo vantaggio è la distribuzione attraverso strumenti che le aziende già utilizzano, dai documenti e dalle email alle piattaforme dati e ai servizi cloud.
Alibaba offre una combinazione diversa. Controlla una grande piattaforma cloud cinese, sviluppa modelli Qwen, fornisce software per il lavoro e investe nella propria infrastruttura AI. Questo le offre diverse strade per trasformare le capacità dei modelli in utilizzo ricorrente.
Ecco perché il confronto tra Anthropic e Google conta più di una vittoria isolata in un benchmark. Tutte e tre le aziende vogliono che i loro modelli diventino il livello di ragionamento all'interno dello sviluppo software, della ricerca, dei flussi di lavoro d'ufficio e delle operazioni aziendali.
Un modello che lavora per minuti può assistere in un compito. Un modello che opera in modo affidabile per ore o giorni può assumersi la responsabilità di una parte significativa di un progetto. Questa differenza cambia ciò che le aziende potrebbero automatizzare.
Si consideri uno sviluppatore che chiede a un agent di aggiornare un'applicazione matura. Il lavoro può richiedere la lettura di centinaia di file, l'individuazione delle dipendenze, la modifica del codice, l'esecuzione dei test, la tracciatura dei guasti e la preparazione della documentazione. Il successo dipende dalla conservazione del contesto nell'intera sequenza.
Il lavoro di ricerca crea esigenze simili. Un agent potrebbe dover trovare articoli, riprodurre calcoli, confrontare metodi, documentare prove contrastanti e rivedere un rapporto. Una prima risposta fluida ha poco valore se il processo devia silenziosamente dopo diverse ore.
Questi flussi di lavoro premiano la persistenza, ma la persistenza moltiplica anche i rischi. Un'ipotesi errata formulata all'inizio può contaminare decine di passaggi successivi. Un'esecuzione più lunga crea più opportunità per problemi di sicurezza, elaborazione sprecata e output convincente ma errato.
Questa tensione dà rilievo all'annuncio di Alibaba. Se Qwen offre tassi di completamento simili a Claude in vincoli reali, gli acquirenti ottengono un altro fornitore credibile di sistemi agent. Se raggiunge risultati impressionanti solo grazie a budget di test insolitamente generosi, il confronto si indebolisce.
La pressione competitiva è immediata per Anthropic perché Alibaba cita Claude come riferimento di capacità. Anche Google subisce pressione, perché Gemini compete per gli stessi flussi di lavoro enterprise e la stessa spesa cloud.
La disponibilità di pesi aperti aggiunge un'altra dimensione. Alcune organizzazioni desiderano eseguire i modelli nella propria infrastruttura, personalizzarne il comportamento o mantenere un maggiore controllo sui dati sensibili. Un modello Qwen che si avvicina alle prestazioni dei modelli chiusi può rendere questa opzione più pratica.
Gli sviluppatori devono comunque confrontare requisiti di deployment, controlli di governance, sicurezza e supporto. I pesi aperti non producono automaticamente un sistema più semplice o più sicuro. Ampliano però la gamma di scelte tecniche e commerciali.
Per i knowledge worker, lo sviluppo importante non è una nuova interfaccia chat. È la possibilità che diverse famiglie di modelli possano gestire corpi estesi di materiale e produrre risultati verificabili.
Questo rende l'organizzazione delle fonti sempre più importante. Un flusso di lavoro di knowledge blending può mantenere accessibile il materiale interno mentre i team valutano gli output di modelli diversi. Il modello può cambiare, mentre il contesto operativo dell'organizzazione resta sotto il suo controllo.
Il primato di Anthropic e Google ora affronta lo stack completo di Alibaba
Alibaba sfida i leader americani con una strategia coordinata di modelli, cloud, software e semiconduttori.
La competizione principale contrappone Alibaba al primato dei modelli Anthropic e Google nel lavoro agent di lunga durata. Claude e Gemini restano prodotti separati di aziende separate, ma insieme definiscono gran parte del punto di riferimento americano che Alibaba vuole sfidare.
Anthropic offre un business di modelli focalizzato, una forte adozione tra gli sviluppatori e una reputazione incentrata su compiti impegnativi di ragionamento e programmazione. Google offre profondità nella ricerca, infrastruttura globale, distribuzione presso i consumatori e consolidate relazioni enterprise.
La risposta di Alibaba è l'integrazione verticale. L'azienda può collegare Qwen ad Alibaba Cloud, prodotti per il lavoro, servizi per i consumatori e infrastrutture di calcolo sviluppate internamente. Ogni livello può rafforzare gli altri.
Questo approccio full-stack è diventato più chiaro prima dell'arrivo di Qwen3.8. A maggio, Alibaba ha annunciato Qwen3.7-Max insieme a nuovi sistemi cloud e al suo processore AI Zhenwu M890.
Alibaba ha dichiarato che un test interno ha fatto lavorare Qwen3.7-Max per 35 ore consecutive, effettuare più di 1.000 chiamate a strumenti e sviluppare un kernel di calcolo. L'azienda ha affermato che tale output superava la versione del produttore del chip, sebbene il risultato non sia stato verificato in modo indipendente.
Lo stesso annuncio sull'infrastruttura agent descriveva un server contenente 128 acceleratori AI. Alibaba ha inoltre affermato che il chip Zhenwu M890 dispone di 144 GB di memoria on-chip e offre prestazioni triple rispetto al predecessore.
Queste cifre mostrano dove Alibaba ritiene che il mercato sia diretto. Gli agent generano una domanda irregolare e prolungata perché chiamano ripetutamente modelli, recuperano informazioni, eseguono strumenti e ispezionano output. Servire questi carichi di lavoro richiede più dell'addestramento di un modello capace.
Un fornitore verticalmente integrato può ottimizzare insieme hardware, software di inferenza, comportamento del modello e pianificazione cloud. Può inoltre usare la domanda di modelli per sostenere la crescita del cloud, mentre i clienti cloud forniscono carichi di lavoro che migliorano i prodotti agent.
Anthropic segue un modello infrastrutturale più orientato alle partnership. Google controlla già i propri acceleratori e la piattaforma cloud, risultando strutturalmente più vicina ad Alibaba. La differenza chiave è che Alibaba può ottimizzare per il mercato cinese e i vincoli hardware.
I controlli americani sulle esportazioni hanno limitato l'accesso cinese ad alcuni chip avanzati. Questa pressione ha incoraggiato le aziende cinesi a migliorare l'efficienza dei modelli, diversificare l'hardware e sviluppare alternative locali nei semiconduttori.
I rilasci dei modelli Alibaba trasmettono quindi due messaggi. Il primo riguarda la capacità: Qwen può competere con i sistemi leader. Il secondo riguarda la resilienza: Alibaba può fornire uno stack AI sempre più completo senza dipendere da ogni livello tecnologico americano.
Questo non significa che gli stack siano equivalenti. Anthropic e Google beneficiano di vaste comunità internazionali di sviluppatori, regioni cloud globali, programmi enterprise maturi e integrazioni con software ampiamente adottato.
Alibaba affronta inoltre la difficoltà di conquistare fiducia al di fuori del proprio mercato interno. Gli acquirenti aziendali esaminano residenza dei dati, conformità, supporto, rischio di approvvigionamento ed esposizione geopolitica insieme alle prestazioni nei benchmark.
All'interno della Cina, tuttavia, la distribuzione di Alibaba può trasformare rapidamente il progresso tecnico in utilizzo. Clienti cloud, commercianti, sviluppatori e utenti in ambito lavorativo operano già all'interno di parti della sua rete aziendale.
Il risultato è una competizione su due livelli. I laboratori di modelli competono su punteggi di coding e ragionamento, mentre i gruppi tecnologici competono su chi riesce a distribuire tali capacità su larga scala.
Alibaba non deve superare ogni configurazione di Claude o Gemini per cambiare il mercato. Deve diventare abbastanza credibile da spingere gli sviluppatori a testare Qwen, le imprese a negoziare tra fornitori e i concorrenti a rispondere al ritmo dei suoi rilasci.
Questa è già una forma di pressione. La frontiera diventa più difficile da definire quando diversi sistemi possono risolvere compiti simili in condizioni operative differenti.
Cosa non mostrano i titoli sui benchmark
L'affermazione di Alibaba resta provvisoria perché le classifiche dei modelli possono ribaltarsi quando i valutatori modificano i limiti di tempo, token e strumenti.
Un benchmark è un test standardizzato pensato per rendere comparabili i sistemi. I benchmark per agenti sono più difficili da interpretare perché il risultato del modello dipende dall'harness che lo circonda, dagli strumenti consentiti, dal budget di ragionamento e dal tempo di esecuzione.
Secondo quanto riportato, i materiali di lancio di Alibaba prevedevano per alcuni test di coding un timeout di cinque ore. PaperBench, che misura i tentativi di riprodurre ricerche sull'IA, consentiva ad alcune esecuzioni di proseguire fino a 12 ore.
Una valutazione indipendente discussa in una analisi dei benchmark ha utilizzato un limite di tempo reale compreso tra 45 e 60 minuti. Con questo vincolo più restrittivo, secondo quanto riportato, Qwen3.8-Max si è collocato a metà del gruppo testato nella sua configurazione più potente.
Entrambi gli esiti possono riflettere comportamenti reali. Un modello a cui viene concesso più tempo può ispezionare file aggiuntivi, tentare più correzioni e recuperare da errori precedenti. Questo non rende il risultato non valido, ma cambia la domanda a cui si sta rispondendo.
Un test di cinque ore chiede se il modello possa alla fine risolvere il compito con un'ampia disponibilità di esecuzione. Un test di un'ora chiede se possa produrre valore entro una tipica scadenza operativa.
I budget di token creano lo stesso problema. I modelli di ragionamento possono generare grandi quantità di elaborazione nascosta o intermedia prima di restituire una risposta finale. Budget più elevati possono migliorare l'accuratezza, ma aumentano anche latenza e consumo di risorse.
Un modello può quindi apparire efficiente in base alle sue condizioni di accesso pubblico, ma diventare costoso durante tentativi ripetuti e ad alta intensità di ragionamento. La misura significativa è spesso il costo totale per risultato accettato, comprese le esecuzioni fallite e la revisione umana.
Anche la progettazione del benchmark influisce sui risultati. Un modello di coding potrebbe funzionare bene quando riceve una struttura di repository familiare, un insieme specifico di strumenti o un valutatore allineato al suo addestramento. Le prestazioni possono diminuire quando l'ambiente cambia.
Le tabelle dei fornitori aggiungono un'altra incertezza. Un'azienda controlla la versione del modello testata, il formato del prompt, l'impostazione di ragionamento, i parametri di campionamento e talvolta la configurazione di confronto. Piccole scelte metodologiche possono alterare risultati ravvicinati.
L'affermazione di Alibaba dovrebbe quindi essere letta con precisione. L'azienda sostiene che Qwen3.8-Max raggiunga capacità paragonabili a Claude in test selezionati e dimostrazioni estese. Non ha dimostrato una parità universale in coding, ricerca, sicurezza, velocità o affidabilità in produzione.
I test indipendenti possono ridurre questa incertezza, ma non eliminarla. Le classifiche pubbliche comprimono molti comportamenti in un singolo punteggio, mentre le distribuzioni reali dipendono da compiti specifici e dalla tolleranza agli errori.
Un agente per l'assistenza clienti deve seguire le policy ed evitare azioni non autorizzate. Un agente di coding deve preservare i test e proteggere le credenziali. Un agente di ricerca deve distinguere le prove dalle inferenze e mantenere citazioni utilizzabili.
Il miglior modello per un flusso di lavoro può essere una scelta scadente per un altro. Le aziende dovrebbero costruire valutazioni a partire da compiti rappresentativi, quindi misurare qualità di completamento, tempo trascorso, utilizzo delle risorse e intervento umano richiesto.
L'esempio di ricerca da 125 ore illustra sia la promessa sia la preoccupazione. Un lavoro autonomo sostenuto sembra impressionante, tuttavia cinque giorni offrono anche enorme spazio per costose deviazioni. Gli acquirenti devono sapere con quale frequenza il sistema riesce e come i revisori individuano errori nascosti.
C'è anche una questione di sicurezza. Ogni chiamata aggiuntiva a uno strumento crea un'ulteriore opportunità di modifiche indesiderate o esposizione di informazioni sensibili. Gli agenti a lunga esecuzione necessitano di confini di autorizzazione, log, checkpoint e regole di arresto.
Queste limitazioni non cancellano il risultato di Alibaba. Chiariscono ciò che resta da dimostrare. Qwen è entrato nella stessa categoria di conversazione di Claude, ma l'esito dipende ora da prove operative.
Perché Alibaba può sostenere la corsa all'IA
I ricavi cloud e la spesa infrastrutturale di Alibaba mostrano che Qwen è legato a una grande strategia commerciale, non a una campagna di ricerca temporanea.
Lo sviluppo di modelli su questa scala richiede investimenti continui in chip, data center, networking, energia e ingegneria. I risultati finanziari di Alibaba indicano che il management è disposto ad assorbire pressioni a breve termine per espandere tali capacità.
Per il trimestre da aprile a giugno 2026, Alibaba ha riferito che l'utile è diminuito del 75 percento rispetto all'anno precedente. I ricavi sono aumentati del 9 percento, mentre i ricavi dai servizi cloud e di calcolo per l'IA sono saliti del 45 percento.
Anche le spese in conto capitale sono aumentate del 75 percento, raggiungendo 67,7 miliardi di yuan. Alibaba ha dichiarato che la spesa rifletteva capacità di calcolo aggiuntiva, la domanda prevista di agenti e costi più elevati dei componenti.
I risultati trimestrali forniscono un contesto essenziale per Qwen3.8-Max. Alibaba sta investendo sulla teoria secondo cui gli agenti IA guideranno un consumo cloud sostenuto.
Questa teoria rende i modelli a lunga esecuzione commercialmente attraenti. Un agente che opera attraverso centinaia di passaggi genera una domanda di inferenza molto maggiore rispetto a un chatbot che risponde a un solo prompt. Se i clienti adottano questi flussi di lavoro, Alibaba può guadagnare sia dall'accesso ai modelli sia dall'infrastruttura sottostante.
La strategia spiega anche perché l'azienda enfatizza il completamento dei compiti. Il prestigio dei benchmark aiuta, ma il lavoro finito in ambito ingegneristico, di ricerca e d'ufficio sostiene una motivazione commerciale più chiara per i clienti cloud.
Alibaba si era in precedenza impegnata a destinare almeno 380 miliardi di yuan a infrastrutture cloud e IA nell'arco di tre anni. Ha inoltre fissato l'obiettivo di superare i 100 miliardi di dollari di ricavi annuali da IA e cloud entro cinque anni.
Queste ambizioni collocano Qwen all'interno di una più ampia competizione di capitali. Anthropic dipende da importanti partnership infrastrutturali e dal sostegno degli investitori. Google può finanziare Gemini attraverso una delle più grandi attività pubblicitarie e cloud del mondo.
La competizione tra Anthropic e Google non è quindi mai stata puramente tecnica. L'accesso a capacità di calcolo, clienti, distribuzione e liquidità determina quanto rapidamente ciascun laboratorio possa migliorare i modelli e trasformarli in prodotti.
Alibaba possiede tali risorse su scala considerevole. La sua sfida è convertirle in servizi IA affidabili senza lasciare che i costi infrastrutturali travolgano i rendimenti.
Gli ultimi risultati rivelano questa tensione. La domanda di cloud IA sta crescendo, ma gli investimenti più elevati stanno riducendo l'utile. Il management deve fare in modo che i carichi di lavoro di Qwen diventino sufficientemente durevoli da giustificare anni di spesa.
L'adozione aziendale determinerà se questo calcolo funziona. Le grandi organizzazioni raramente sostituiscono un modello sulla base di un singolo grafico del giorno di lancio. Testano sicurezza, gestione dei dati, disponibilità, impegno di integrazione e prestazioni su compiti interni.
Anche gli sviluppatori valuteranno l'esperienza circostante. La compatibilità API riduce l'attrito nel passaggio, ma documentazione, osservabilità, supporto degli strumenti e gestione degli errori influenzano la permanenza di un modello in produzione.
I modelli aperti possono ampliare la portata di Qwen oltre i servizi ospitati di Alibaba. L'azienda ha rilasciato ad agosto i pesi del modello Qwen3.8 da 2,4 trilioni di parametri, seguiti da un modello più piccolo da 27 miliardi di parametri.
Questa gamma consente percorsi di adozione diversi. I grandi operatori possono esaminare il sistema ad alta capacità, mentre i team più piccoli possono sperimentare modelli che richiedono meno risorse.
Una base di conoscenza ingegneristica può inoltre ridurre la dipendenza da un singolo fornitore. I team possono preservare documentazione e contesto di progetto, quindi testare diversi modelli sullo stesso materiale interno.
Questo conta perché la leadership dei modelli cambia rapidamente. Un flusso di lavoro costruito interamente attorno all'interfaccia unica di un fornitore può diventare costoso da migrare. Un flusso di lavoro con dati controllati e valutazioni chiare può assorbire più facilmente gli spostamenti competitivi.
L'impegno finanziario di Alibaba suggerisce che Qwen resterà uno dei sistemi che forzano tali cambiamenti. Anche se il confronto con Claude si dimostrasse troppo ampio, l'azienda dispone delle risorse e degli incentivi commerciali per continuare a ridurre il divario.
Tre segnali che metteranno alla prova l'affermazione di Alibaba su Claude
Il prossimo verdetto dovrebbe arrivare da test comparabili sugli agenti, dall'adozione in produzione e dalle risposte dirette di Anthropic o Google.
Il primo segnale è una valutazione indipendente in condizioni equivalenti. Qwen3.8-Max, Claude e Gemini necessitano degli stessi compiti, strumenti, limiti di tempo, quote di token e policy di ripetizione.
Questo è il modo più rapido per testare l'affermazione centrale di Alibaba. Se Qwen rimane vicino a Claude in carichi di lavoro di coding e ricerca controllati, l'affermazione di parità acquista credibilità. Se la sua posizione cala drasticamente con limiti più restrittivi, la narrativa del lancio si indebolisce.
I valutatori dovrebbero pubblicare più dei semplici tassi di successo. Dovrebbero riportare tempo trascorso, chiamate al modello, token totali, categorie di fallimento e numero di compiti che richiedono intervento umano.
Le assegnazioni a lunga esecuzione necessitano soprattutto di un'analisi dei checkpoint. Un modello che completa il compito finale dopo ripetute deviazioni errate è diverso da uno che segue un piano stabile. Entrambi potrebbero ricevere lo stesso esito positivo.
Il secondo segnale è un'adozione sostenuta in produzione. Alibaba deve dimostrare che le organizzazioni utilizzano gli agenti Qwen per lavori ricorrenti, non soltanto per dimostrazioni controllate.
Prove utili includerebbero modifiche software completate, flussi di lavoro di ricerca, processi d'ufficio e operazioni di supporto. I casi più solidi comunicheranno requisiti di revisione, tassi di errore e risparmi di tempo misurabili.
I ricavi cloud offrono un altro indicatore di adozione. Una crescita continua del cloud IA suggerirebbe che i clienti stanno passando dalle prove dei modelli a carichi di lavoro che consumano infrastrutture significative.
Gli investitori dovrebbero comunque separare la domanda cloud generale dall'adozione specifica di Qwen. Progetti di addestramento, archiviazione e inferenza convenzionale possono aumentare i ricavi senza dimostrare che gli agenti a lungo orizzonte funzionino in modo affidabile.
Il terzo segnale è una risposta competitiva. Anthropic può rafforzare la propria posizione migliorando il completamento dei compiti di Claude, i controlli di sicurezza o l'efficienza. Google può rispondere attraverso aggiornamenti di Gemini e una più profonda integrazione con i suoi prodotti cloud e di produttività.
Una risposta non deve necessariamente menzionare Alibaba direttamente. Nuovi benchmark sugli agenti, esecuzioni autonome più lunghe, tassi di fallimento inferiori o controlli aziendali più ampi indicherebbero dove si sta muovendo la competizione.
È qui che diventa visibile la pressione tra Anthropic e Google. Quando i leader modificano le priorità di prodotto dopo il rilascio di un rivale, il rivale ha influenzato il mercato ancora prima di vincere un benchmark definitivo.
Gli sviluppatori dovrebbero osservare se i framework per agenti rendono più facile sostituire i modelli. Qwen supporta formati API comuni e popolari strumenti di distribuzione, il che può ridurre il costo di eseguire test affiancati.
Le imprese dovrebbero inoltre osservare le funzionalità di governance. Autorizzazioni, registri di audit, limiti di esecuzione e porte di approvazione umana conteranno di più man mano che gli agenti restano attivi per periodi più lunghi.
La dimensione Stati Uniti-Cina resterà presente, soprattutto per quanto riguarda chip, accesso ai modelli e norme sui dati. Tuttavia, considerare questa storia soltanto come una competizione nazionale farebbe perdere di vista la questione pratica che devono affrontare gli acquirenti.
La domanda immediata è se un’altra famiglia di modelli sia in grado di gestire lavori rilevanti con un’affidabilità accettabile. Alibaba afferma che Qwen rientra ora in questo insieme da valutare. Spetterà alle prove indipendenti stabilire con quale frequenza questa affermazione regga.
Per gli sviluppatori, il passo successivo è concreto. Selezionate diversi progetti rappresentativi, stabilite vincoli identici e confrontate i risultati accettati anziché demo curate. Includete attività che richiedano il recupero da file mancanti, ipotesi errate ed errori degli strumenti.
Per i knowledge worker, conservate le fonti e le decisioni alla base di ogni esecuzione prolungata. Una risposta lunga senza una traccia di revisione è più difficile da considerare affidabile di un risultato più breve con evidenze trasparenti.
Alibaba ha reso la competizione tra Anthropic e Google più affollata e più difficile da riassumere con una sola classifica. Qwen3.8-Max deve ora trasformare un’affermazione ambiziosa in un lavoro ripetibile.
I test indipendenti riprodurranno i risultati di Alibaba quando tempo, strumenti e budget di ragionamento saranno equivalenti? Sarà questa risposta, non il titolo dell’annuncio, a mostrare se l’equilibrio dell’IA è davvero cambiato.



