Alibaba presenta il suo più grande modello di IA, ma la scala non è il vero banco di prova
Alibaba ha portato Qwen3.8-Max su Google News con un numero impressionante: 2,4 trilioni di parametri, più del doppio rispetto al precedente modello di punta. L'azienda descrive l'anteprima come il suo modello più grande finora e afferma che si posiziona dietro soltanto a Fable 5 di Anthropic. Questo confronto trasforma il lancio di un prodotto in una sfida diretta all'idea che i laboratori americani occupino ancora una categoria tecnica separata.
Il conteggio dei parametri attira l'attenzione, ma non decide la competizione. Alibaba non ha accompagnato la propria affermazione sul ranking con una tabella completa di benchmark pubblici, una model card dettagliata o una valutazione riproducibile in modo indipendente. Qwen3.8-Max arriva quindi al tempo stesso come traguardo tecnico e come argomentazione ancora incompleta.
La gara più importante è Alibaba contro Anthropic, non la Cina contro l'intero Stati Uniti. Anthropic ha costruito la propria posizione attorno a prestazioni di frontiera affidabili in programmazione, ragionamento e attività agentiche di lunga durata. Alibaba sostiene che un modello cinese possa entrare nella stessa fascia di prestazioni, supportando al contempo una strategia di distribuzione più ampia.
Questa affermazione conta per sviluppatori e acquirenti aziendali anche prima che tutti i benchmark siano disponibili. Un'alternativa credibile cambia le negoziazioni con i fornitori, la pianificazione dei deployment e le ipotesi su dove nascano i modelli di frontiera. Solleva inoltre una domanda più difficile: una scala enorme del modello si traduce in un lavoro affidabile al di fuori di una dimostrazione controllata?
Alibaba ha messo 2,4 trilioni di parametri dietro il suo momento su Google News
Qwen3.8-Max cambia la conversazione competitiva perché Alibaba lo presenta come un sistema di frontiera, non come un'alternativa regionale.
Alibaba ha presentato in anteprima Qwen3.8-Max durante la World Artificial Intelligence Conference di Shanghai nel luglio 2026. L'anteprima è diventata disponibile tramite prodotti Alibaba, tra cui Token Plan, Qoder e QoderWork, offrendo a utenti selezionati un primo percorso per testarlo.
Il sistema contiene 2,4 trilioni di parametri totali, secondo Alibaba. I parametri sono i valori interni regolati durante l'addestramento, anche se il loro numero complessivo non misura direttamente intelligenza o affidabilità. L'enorme quantità rende comunque Qwen3.8-Max uno dei più grandi modelli linguistici annunciati.
Il modello usa un'architettura mixture-of-experts, o MoE. Questo design instrada ogni richiesta attraverso una parte selezionata della rete invece di attivare ogni parametro. Alibaba attiva, secondo quanto riportato, circa 95 miliardi di parametri durante l'inferenza, rendendo la dimensione totale meno intimidatoria dal punto di vista computazionale di quanto appaia inizialmente.
L'architettura aiuta anche a spiegare perché i confronti tra parametri richiedono cautela. Un modello denso attiva l'intera rete per ogni richiesta, mentre un sistema MoE attiva esperti selezionati. Confrontare soltanto i parametri totali può nascondere differenze nei dati di addestramento, nel calcolo attivo, nel design dell'inferenza e nella qualità del post-addestramento.
Qwen3.8-Max è inoltre multimodale. Alibaba afferma che può elaborare testo, immagini, video e documenti attraverso un unico modello. Questo rende il lancio più ampio di un semplice esercizio di scalabilità testuale e lo colloca nel mercato degli agenti per il lavoro.
Il nuovo modello segue Qwen3-Max, che Alibaba ha introdotto nel settembre 2025 con oltre un trilione di parametri. Alibaba ha dichiarato che quel modello precedente era stato addestrato su 36 trilioni di token, mentre il suo sistema di addestramento MoE aveva migliorato l'utilizzo dell'hardware del 30 percento rispetto a Qwen2.5-Max.
I risultati di Qwen3-Max pubblicati da Alibaba includevano un punteggio di 69,6 su SWE-bench Verified e di 74,8 su Tau2-Bench. SWE-bench Verified valuta se un modello riesca a risolvere problemi software reali, mentre Tau2-Bench testa l'uso di strumenti in interazioni simulate.
Questi dati non si trasferiscono automaticamente a Qwen3.8-Max. Mostrano tuttavia che Alibaba puntava già alla programmazione e al comportamento agentico prima di aumentare la scala del modello. Qwen3.8-Max estende questa strategia al lavoro professionale multimodale.
Le prime coperture hanno descritto il nuovo sistema come un'anteprima, anziché come una release pienamente documentata. Un resoconto sull'anteprima del modello ha riferito che Alibaba prevedeva di rilasciare i pesi in un secondo momento. Questa distinzione conta, perché l'accesso tramite un prodotto ospitato non consente lo stesso livello di scrutinio di pesi scaricabili e documentazione tecnica completa.
Per questo il titolo su Google News racconta soltanto metà della storia. Alibaba ha divulgato informazioni sufficienti per stabilire la scala e il mercato previsto. Non ha ancora divulgato abbastanza per definire con la stessa sicurezza la posizione del modello.
Il lancio mette sotto pressione il premio di frontiera di Anthropic
Alibaba non deve superare Anthropic ovunque per indebolire l'ipotesi che le prestazioni di frontiera appartengano a un ristretto club americano.
Anthropic è l'avversario più evidente perché Alibaba l'ha scelta come punto di riferimento. L'azienda afferma che Qwen3.8-Max si colloca dietro soltanto a Fable 5, il principale modello di Anthropic nel confronto. Alibaba chiede quindi agli acquirenti di considerare Qwen come un quasi pari, non semplicemente come un sostituto a costo inferiore.
Questa impostazione mette pressione su Anthropic in tre modi. Innanzitutto, riduce la distanza di capacità percepita tra le due aziende. In secondo luogo, offre agli sviluppatori globali un'altra famiglia di modelli per flussi di lavoro di programmazione e agenti. In terzo luogo, sposta una parte della decisione d'acquisto dalle prestazioni assolute verso il controllo sul deployment.
Anthropic conserva ancora vantaggi importanti. Dispone di una piattaforma per sviluppatori consolidata, di un vasto utilizzo in produzione e di una reputazione costruita attorno alla sicurezza dei modelli. I clienti aziendali valutano inoltre supporto, uptime, controlli di sicurezza e qualità delle integrazioni, non soltanto i punteggi dei benchmark.
Alibaba porta un insieme diverso di risorse. Gestisce il più grande provider cloud della Cina, serve una consistente base aziendale e può distribuire Qwen tramite prodotti cloud, di coding, commerciali e consumer. Questa distribuzione può trasformare i miglioramenti del modello in utilizzo senza attendere un ecosistema indipendente di applicazioni.
Il contrasto strategico è particolarmente evidente nella programmazione. Un modello di coding diventa più prezioso quando può ispezionare repository, chiamare strumenti, eseguire test e mantenere decisioni lungo molti passaggi. Una risposta impressionante dice poco sulla capacità del modello di completare un lungo compito di ingegneria.
Qwen3.8-Max punta a questo flusso di lavoro attraverso Qoder, l'ambiente di coding di Alibaba. Se il modello funziona con continuità al suo interno, Alibaba può raccogliere feedback da sessioni di sviluppo reali e migliorare il sistema attorno a schemi concreti di fallimento. Il prodotto diventa parte del ciclo di addestramento e distribuzione.
Anthropic ha perseguito un'opportunità analoga attraverso strumenti di coding agentico. Questo rende la competizione più precisa di una discussione generale sulla leadership nazionale nell'IA. Entrambe le aziende vogliono che i propri modelli diventino il livello di ragionamento interno al lavoro professionale sul software.
Alibaba ha inoltre un incentivo a competere sull'accessibilità. Gli sviluppatori cinesi di modelli hanno attirato attenzione rilasciando pesi aperti, supportando interfacce comuni e riducendo le barriere al deployment. Queste scelte possono contare più di un ristretto vantaggio nei benchmark per le aziende che richiedono controllo locale.
L'ecosistema Qwen ha già una portata significativa. Forbes aveva precedentemente riferito che Alibaba contava oltre 90.000 utenti aziendali per i servizi Qwen e aveva descritto l'azienda come un campione cinese dell'IA. La sua analisi dei modelli aperti rilevava inoltre che gli sviluppatori cinesi stavano usando la distribuzione aperta per costruire influenza globale.
Un modello quasi di frontiera con deployment flessibile dà agli acquirenti leva negoziale anche quando alla fine scelgono Anthropic. I team di procurement possono confrontare i provider, testare la portabilità dei carichi di lavoro e resistere alla progettazione di ogni flusso attorno a un solo endpoint proprietario.
Ciò non significa che una migrazione immediata sia probabile. Cambiare modello può modificare qualità dell'output, comportamento di sicurezza, chiamate agli strumenti e requisiti dei prompt. Le aziende necessitano inoltre di una revisione legale prima di inviare dati sensibili a un nuovo provider.
La pressione immediata è quindi commerciale e strategica. Anthropic deve dimostrare perché le sue prestazioni, affidabilità e governance giustifichino la sua posizione. Alibaba deve dimostrare che la sua scala produce risultati coerenti, non soltanto una specifica d'impatto.
Qwen3.8-Max usa la scala per sfidare la gerarchia della frontiera
Il meccanismo centrale è la scala sparsa: Alibaba può costruire una rete da 2,4 trilioni di parametri senza attivare l'intero modello per ogni richiesta.
Un modello mixture-of-experts contiene sottoreti specializzate, solitamente chiamate esperti. Un sistema di instradamento seleziona un gruppo limitato di tali esperti per ogni token. Questo consente alla rete di disporre di maggiore capacità appresa senza sostenere l'intero costo di inferenza di un modello denso.
Questa architettura non è esclusiva di Alibaba. La sua importanza in questo caso deriva da quanto aggressivamente Alibaba l'abbia scalata. Qwen3.8-Max combina, secondo quanto riportato, 2,4 trilioni di parametri totali con circa 95 miliardi di parametri attivi durante l'inferenza.
Questo rapporto consente ad Alibaba di promuovere una scala totale straordinaria mantenendo ogni risposta entro un intervallo computazionale più gestibile. Non rende però l'inferenza economica di per sé. Memoria, comunicazione tra acceleratori, lunghezza del contesto e domanda di serving determinano ancora il costo finale.
La scala sparsa può inoltre creare complicazioni tecniche. Il router deve distribuire il lavoro in modo efficiente tra gli esperti, e tali esperti devono apprendere specializzazioni utili. Un routing inefficace può lasciare alcuni componenti sovraccarichi mentre altri contribuiscono poco.
Alibaba ha dedicato diverse generazioni di Qwen a questo problema. La documentazione di Qwen3-Max descriveva una loss di bilanciamento del carico sul batch globale, che incoraggia un uso più uniforme degli esperti durante l'addestramento. Descriveva inoltre un sistema di pipeline progettato per migliorare l'efficienza dell'addestramento su grandi cluster hardware.
L'azienda afferma che Qwen3.8-Max si concentra sulla programmazione e sulle attività professionali dei coworker. In questo contesto, cowork indica un sistema di IA che svolge lavoro in più passaggi accanto a una persona, invece di produrre una sola risposta isolata. Tali attività possono includere l'esame di file, l'uso di strumenti software, la revisione di piani e il controllo dei risultati.
L'input multimodale amplia questi flussi di lavoro. Uno sviluppatore potrebbe chiedere a un modello di ispezionare un'immagine di design, leggere una specifica, analizzare codice sorgente e preparare un piano di implementazione. Un analista aziendale potrebbe combinare documenti, grafici e materiale registrato in un'unica attività.
Questi esempi sono applicazioni plausibili, non prove di prestazioni affidabili. Il modello deve mantenere il contesto, scegliere correttamente gli strumenti e riprendersi dagli errori. Deve inoltre distinguere le istruzioni dai contenuti non affidabili presenti nei documenti.
Il meccanismo di scala aiuta Alibaba a competere, ma non elimina i vincoli hardware della Cina. I controlli sulle esportazioni hanno limitato l'accesso ad alcuni chip avanzati per l'IA, costringendo i laboratori cinesi a estrarre maggiore valore dal calcolo disponibile. Architetture efficienti, sistemi di addestramento ottimizzati e distribuzione aperta sono diventati risposte strategiche.
Una rassegna sull'IA tra Stati Uniti e Cina ha identificato il calcolo come un importante motore del progresso dei modelli e un vantaggio americano persistente. Questo vincolo rende notevole la dimensione del modello di Alibaba, anche se la sola dimensione rivela poco sull'hardware, la durata dell'addestramento o l'efficienza che vi sono dietro.
Anche il più ampio mercato cinese dei modelli conta. DeepSeek ha dimostrato che un laboratorio cinese poteva costringere i concorrenti globali a reagire attraverso efficienza e accesso aperto. Da allora Moonshot AI e Z.ai hanno aggiunto modelli capaci, incentrati su ragionamento, programmazione e agenti.
Secondo quanto riferito, Kimi K3 di Moonshot dispone di 2,8 trilioni di parametri, superando Qwen3.8-Max per numero totale. La forte domanda ha costretto Moonshot a sospendere i nuovi abbonamenti dopo che la capacità si è saturata. L'episodio ha mostrato che uno sviluppo di modelli di successo non garantisce un'infrastruttura di erogazione adeguata.
Un rapporto sulla capacità dell'IA ha citato l'analista di Omdia Lian Jye Su, secondo cui Kimi K3 imponeva forti requisiti di calcolo. Questa esperienza offre ad Alibaba un avvertimento: disponibilità e throughput sostenuto possono diventare limiti competitivi anche quando un modello attrae utenti.
La narrazione di google news sostiene che la Cina stia colmando il divario perché i suoi modelli stanno diventando più grandi e più capaci. Un'interpretazione più solida è che gli sviluppatori cinesi competano ora attraverso diversi meccanismi coordinati: architetture sparse, cicli di rilascio aggressivi, distribuzione aperta e minori barriere di implementazione.
L'affermazione di Alibaba sulle dimensioni è quindi un segnale della capacità ingegneristica accumulata. Il vero meccanismo è la capacità dell'azienda di addestrare, servire, distribuire e perfezionare il modello attraverso una vasta rete cloud e di prodotti.
Cosa Non Dimostra l'Affermato Valore di 2,4 Trilioni di Parametri
Alibaba ha consolidato Qwen3.8-Max come un serio candidato tra i modelli, ma non ha dimostrato l'intera classifica delle prestazioni promossa attorno all'anteprima.
La maggiore incertezza riguarda la trasparenza della valutazione. L'affermazione di Alibaba secondo cui il modello è inferiore soltanto a Fable 5 non dispone di una tabella completa di benchmark pubblici con punteggi, prompt, impostazioni dei concorrenti e metodologia di test. Senza questi dettagli, i ricercatori esterni non possono riprodurre la classifica.
Le classifiche dei modelli dipendono fortemente dalle scelte di valutazione. Un sistema può eccellere nelle domande scientifiche ma restare indietro nella programmazione. Può funzionare bene nei test a turno singolo, ma perdere il contesto durante un'esecuzione prolungata di un agente.
Anche i nomi dei benchmark possono nascondere differenze di implementazione. Permessi degli strumenti, impostazioni di campionamento, limiti di contesto, tentativi ripetuti e scaffolding degli agenti influenzano tutti i risultati. Un confronto equo richiede condizioni allineate e una divulgazione chiara.
L'etichetta di anteprima crea un'altra limitazione. I fornitori modificano spesso un modello tra l'anteprima e il rilascio generale. Questi cambiamenti possono migliorare il comportamento, ma possono anche rendere difficile confrontare le prime valutazioni con il sistema finale.
La disponibilità attraverso i prodotti Alibaba offre ai tester un accesso utile, ma l'accesso ospitato non rivela i pesi sottostanti. I ricercatori non possono ispezionare pienamente l'architettura, valutare l'implementazione locale o verificare il modello di attivazione dichiarato soltanto tramite l'endpoint.
Il piano di Alibaba di rilasciare i pesi affronterebbe parte di questa lacuna. I pesi aperti consentono a ricercatori e aziende di eseguire il modello in condizioni indipendenti. Non rivelano i dati di addestramento né riproducono il processo di addestramento originale, quindi non equivalgono a una piena apertura.
I requisiti di implementazione sollevano un'altra questione. Un modello che attiva circa 95 miliardi di parametri rimane considerevole. Eseguirlo localmente richiederebbe infrastrutture specializzate, quantizzazione o servizio distribuito, in particolare quando i carichi di lavoro utilizzano contesti lunghi o input multimodali.
I pesi aperti avvantaggerebbero quindi più i fornitori cloud e le organizzazioni ben attrezzate che gli utenti desktop occasionali. Le varianti Qwen più piccole restano più realistiche per la sperimentazione locale. L'effetto più ampio del modello di punta potrebbe derivare da metodi di fine-tuning, modelli distillati e servizi ospitati.
Anche la valutazione della sicurezza richiede attenzione. Gli agenti multimodali possono incontrare istruzioni malevole incorporate in documenti, immagini e siti web. Un modello che utilizza strumenti deve resistere a tali istruzioni, mantenendo al contempo un accesso utile a materiale legittimo.
La governance dei dati complica l'adozione internazionale. Le aziende devono considerare dove vengono elaborati i prompt, come vengono conservati i log, quali informazioni addestrano i sistemi futuri e quali norme nazionali si applicano. La capacità tecnica non può rispondere a queste domande.
I critici si interrogano anche sul fatto che la convergenza nei benchmark rifletta una qualità di produzione equivalente. Un modello può eguagliare un leader nei test pubblici pur restando meno affidabile per richieste insolite, sessioni lunghe o attività definite in modo impreciso. Questi fallimenti emergono soltanto con un uso prolungato.
La discussione pubblica su Qwen3.8-Max include già segnalazioni di cicli di ragionamento durante i primi test. Tali aneddoti possono individuare possibili problemi, ma non stabiliscono un modello generale di fallimento. Sono necessari test riproducibili su molte attività.
Viceversa, nemmeno dimostrazioni ben rifinite stabiliscono un'affidabilità generale. Un fornitore può selezionare attività riuscite, modificare una presentazione o utilizzare scaffolding privato. Gli acquirenti dovrebbero considerare sia le demo entusiaste sia i fallimenti isolati come punti di partenza per la valutazione.
I precedenti risultati di Alibaba con Qwen3-Max-Thinking illustrano il quadro misto. L'azienda ha riportato punteggi competitivi in conoscenza, ragionamento, ricerca, programmazione e uso degli strumenti. Ha inoltre riportato risultati più deboli rispetto ad alcuni concorrenti in specifici test su agenti e contesti lunghi.
Questa variazione è normale. Nessun modello domina ogni carico di lavoro e le classifiche aggregate comprimono differenze significative. Un'azienda che sceglie tra Qwen e Anthropic dovrebbe testare le attività che determinano il reale valore aziendale.
Per i team software, tali attività potrebbero includere la correzione di codice interno, la revisione di pull request, la chiamata di strumenti privati e il rispetto delle convenzioni del repository. Per gli analisti, potrebbero includere l'estrazione di affermazioni dai documenti, la riconciliazione di fonti in conflitto e la produzione di sintesi verificabili.
Latenza, recupero dagli errori e coerenza meritano lo stesso peso dell'accuratezza. Un modello che risolve una volta un'attività difficile ma fallisce in modo imprevedibile può costare più da supervisionare di un'alternativa leggermente meno capace.
I progressi dei modelli cinesi esistono anche nel contesto di una più ampia disputa politica e di sicurezza. Alcuni governi e aziende considerano i servizi di IA cinesi alla luce di preoccupazioni relative all'accesso ai dati, alla censura e alla dipendenza dalla catena di fornitura. Queste preoccupazioni possono limitare l'adozione indipendentemente dalla qualità del modello.
Allo stesso tempo, liquidare Qwen soltanto per la sua origine ne oscurerebbe l'influenza tecnica e commerciale. Gli sviluppatori possono studiare i rilasci aperti, confrontare le scelte architetturali e usare la pressione competitiva per chiedere condizioni migliori a ogni fornitore.
La conclusione corretta è più circoscritta rispetto alla narrazione di google news. Alibaba ha prodotto un modello la cui scala, portata multimodale e distribuzione giustificano una valutazione seria. La sua posizione dichiarata nella gerarchia globale resta un'affermazione aziendale in attesa di prove più complete.
Tre Segnali Mostreranno Se Alibaba Ha Colmato il Divario
La fase successiva sarà decisa da test indipendenti, da un rilascio di pesi aperti e da prove che Alibaba possa gestire una domanda reale sostenuta.
Il primo segnale è un rilascio tecnico completo. Alibaba deve pubblicare una scheda del modello contenente dettagli sull'architettura, limiti di contesto, test di sicurezza, impostazioni dei benchmark e limitazioni note. Il rilascio dei pesi promessi renderebbe la divulgazione più preziosa.
Se ciò accadrà, ricercatori indipendenti potranno testare Qwen3.8-Max con harness e carichi di lavoro standardizzati. Risultati che riproducano la classifica di Alibaba rafforzerebbero l'affermazione che il divario con la frontiera si è ridotto. Discrepanze rilevanti la indebolirebbero.
Il secondo segnale è la prestazione in attività di programmazione e agenti di lunga durata. I benchmark a turno singolo restano utili, ma i carichi di lavoro aziendali più preziosi coinvolgono pianificazione, strumenti, file e correzioni ripetute. L'affidabilità su molti passaggi distinguerà un assistente capace da un agente affidabile.
Gli sviluppatori dovrebbero osservare valutazioni in stile SWE-bench, test di uso degli strumenti e prove controllate su repository. Dovrebbero inoltre esaminare i tassi di completamento, le azioni non necessarie, il recupero dagli errori degli strumenti e la quantità di supervisione umana richiesta.
Questo segnale mette direttamente alla prova il terreno competitivo scelto da Alibaba rispetto ad Anthropic. Se Qwen3.8-Max eguaglierà Anthropic nel lavoro professionale prolungato, il mercato acquisirà una seconda opzione credibile. Se perderà coerenza durante sessioni più lunghe, il suo numero di parametri diventerà meno importante dal punto di vista commerciale.
Il terzo segnale è l'adozione in produzione senza un collasso della capacità. Alibaba deve dimostrare di poter servire il modello in modo affidabile su Qoder, Model Studio e altri prodotti mentre la domanda cresce. Latenza, disponibilità, accesso regionale e limiti di frequenza conteranno tutti.
L'esperienza di Moonshot con Kimi K3 mostra perché questo test non può essere considerato ordinario. La domanda ha sopraffatto la capacità poco dopo il lancio, costringendo l'azienda a limitare i nuovi abbonamenti. Un modello non può mettere pressione sui fornitori consolidati se i clienti non possono fare affidamento sull'accesso.
Alibaba dispone di maggiori risorse cloud rispetto a una startup, ma Qwen3.8-Max è anch'esso esigente. Gli input multimodali e i flussi di lavoro degli agenti possono consumare più calcolo di brevi richieste in chat. L'implementazione reale rivelerà se l'attivazione sparsa compensi sufficientemente tali richieste.
I dati di mercato più ampi sostengono l'idea che prezzo e controllo dell'implementazione stiano diventando centrali. Un recente confronto tra modelli ha collocato i principali sistemi cinesi a pochi punti di benchmark dai leader americani, rilevando al contempo differenze di costo sostanziali in alcuni scenari.
Tali confronti variano in base al carico di lavoro e al fornitore, quindi non dovrebbero trasformarsi in affermazioni universali. Mostrano però perché le prestazioni vicine alla frontiera possano avere un'influenza sproporzionata. Un modello non deve classificarsi al primo posto per rimodellare le decisioni di acquisto.
La risposta competitiva offrirà ulteriore contesto. Anthropic può difendere la propria posizione attraverso modelli più forti, agenti migliori, controlli di sicurezza più chiari e servizi aziendali più affidabili. Anche OpenAI, Google, DeepSeek, Moonshot e Z.ai continueranno a modificare il punto di riferimento.
Alibaba affronta un compito altrettanto impegnativo. Deve trasformare un annuncio di rilievo in capacità riproducibile, implementazione accessibile e continuo miglioramento del modello. Ogni requisito mette alla prova una parte diversa della strategia dell'azienda.
Per gli sviluppatori, la risposta pratica è creare ora un set di valutazione specifico per il carico di lavoro. Includete attività difficili, attività ordinarie, sessioni lunghe, guasti degli strumenti e vincoli relativi ai dati sensibili. Testate i cambiamenti del modello rispetto a quel set invece di fare affidamento su un'unica classifica pubblica.
Gli acquirenti aziendali dovrebbero preservare la portabilità ove possibile. Formati API comuni, sistemi di recupero modulari e log di valutazione indipendenti dal fornitore riducono il costo del confronto tra modelli. Impediscono inoltre che una scelta iniziale diventi una dipendenza permanente.
I knowledge worker dovrebbero osservare come questi sistemi gestiscono prove eterogenee. I modelli multimodali possono raccogliere informazioni da più formati, ma input più ampi non garantiscono un giudizio migliore. Il tracciamento delle fonti e la verifica restano necessari quando gli output del modello influenzano le decisioni.
L'arrivo di Alibaba nelle notizie di google merita quindi attenzione, ma il titolo non dovrebbe diventare il verdetto. Qwen3.8-Max ha ampliato la scala e l'ambizione dello sforzo cinese sui modelli di frontiera. Le prove necessarie per classificarlo stanno ancora arrivando.
Nei prossimi mesi, osservate se Alibaba rilascerà i pesi promessi, supererà test indipendenti sugli agenti e servirà una domanda crescente senza restrizioni significative. Questi tre risultati ci diranno più del titolo sui 2,4 trilioni di parametri. Se coincideranno, Anthropic si troverà di fronte a un quasi pari con un modello di distribuzione diverso. In caso contrario, Qwen3.8-Max resterà un'anteprima impressionante le cui affermazioni più ambiziose hanno superato la verifica pubblica.



