Alibaba e DeepSeek ridisegnano la corsa all'AI con modelli potenti e meno costosi
- Aisha Washington

- 4 ago
- Tempo di lettura: 14 min
Alibaba e DeepSeek hanno portato modelli AI cinesi meno costosi sulle prime pagine di Google News, nonostante i laboratori occidentali mantengano un lieve vantaggio nei benchmark più impegnativi. Il confronto ora ruota attorno alla necessità per i clienti di ottenere il punteggio più alto oppure un modello capace che possano permettersi di distribuire su larga scala.
DeepSeek ha portato questa domanda all'attenzione pubblica con V3 e con il modello R1, incentrato sul ragionamento. Alibaba ha risposto con Qwen2.5-Max, rilasciato durante le festività del Capodanno lunare del 2025 e posizionato direttamente contro DeepSeek-V3, GPT-4o e Llama 3.1 di Meta.
I rilasci non hanno stabilito un vincitore definitivo. Hanno evidenziato un cambiamento nel modo in cui il mercato valuta i sistemi AI. OpenAI, Anthropic, Google e Meta devono ora affrontare rivali che competono attraverso efficienza, pesi dei modelli accessibili e cicli di rilascio rapidi, non soltanto tramite la leadership nei benchmark.
Cosa ha portato Alibaba e DeepSeek su Google News
L'evento importante non è stato un modello che ne ha sconfitto un altro. È stata l'improvvisa accelerazione di una competizione su costi e prestazioni nell'intero settore AI cinese.
DeepSeek ha rilasciato V3 nel dicembre 2024, seguito da R1 il 20 gennaio 2025. R1 è un modello di ragionamento, ossia assegna ulteriore capacità di calcolo per affrontare problemi in più passaggi prima di produrre una risposta.
L'azienda ha dichiarato che R1 offriva prestazioni comparabili a o1 di OpenAI in diversi test di matematica, programmazione e ragionamento. DeepSeek ha inoltre rilasciato i pesi del modello con licenza MIT, consentendo agli sviluppatori di modificare e commercializzare il software con relativamente poche restrizioni.
Queste affermazioni hanno attirato l'attenzione perché DeepSeek ha descritto un processo di sviluppo insolitamente efficiente. Il rapporto tecnico su V3 ha registrato 2,788 milioni di ore GPU H800 per il processo di addestramento finale del modello.
Questa cifra non rappresentava il budget completo di ricerca di DeepSeek. Escludeva gli esperimenti precedenti, la ricerca sull'architettura, il lavoro sui dati, gli stipendi e gli investimenti in infrastrutture. Considerarla come il costo totale della creazione di R1 rappresenterebbe quindi in modo inesatto quanto dichiarato dall'azienda.
La distinzione è importante perché la cifra più bassa è diventata centrale nella narrazione di Google News. Ha incoraggiato la conclusione semplificata secondo cui DeepSeek avesse riprodotto l'intera capacità di un importante laboratorio americano con un budget complessivo minimo.
Le prove supportano una conclusione più circoscritta. DeepSeek ha progettato un'esecuzione finale di addestramento altamente efficiente, poi ha usato quella base per realizzare un sistema di ragionamento competitivo. Questo resta significativo senza trasformare una stima contabile in un confronto completo dei costi aziendali.
L'approccio tecnico di DeepSeek combinava diverse misure di efficienza. Un modello mixture-of-experts attiva soltanto un sottoinsieme dei suoi parametri per ciascun token, riducendo il calcolo necessario per ogni risposta.
L'azienda ha inoltre usato la multi-head latent attention, una tecnica progettata per comprimere le informazioni memorizzate durante l'inferenza. Il processo di addestramento si è basato su calcoli FP8 a precisione ridotta e su interventi ingegneristici volti a ridurre l'overhead di comunicazione tra le GPU.
Alibaba ha risposto il 28 gennaio 2025, annunciando Qwen2.5-Max e la sua disponibilità tramite Alibaba Cloud. L'azienda ha dichiarato di avere preaddestrato il modello mixture-of-experts su oltre 20 trilioni di token.
Alibaba ha posto DeepSeek al centro del confronto. I suoi risultati benchmark di Qwen affermavano che Qwen2.5-Max superava DeepSeek-V3 su Arena-Hard, LiveBench, LiveCodeBench e GPQA-Diamond.
Ogni benchmark misura una porzione limitata delle prestazioni. LiveCodeBench testa le capacità di programmazione, mentre GPQA-Diamond utilizza difficili quesiti scientifici. Arena-Hard tenta di approssimare le preferenze umane attraverso una valutazione comparativa.
I risultati di Alibaba collocavano inoltre Qwen2.5-Max accanto a GPT-4o e Claude 3.5 Sonnet. Tuttavia, i grafici dei benchmark pubblicati dallo sviluppatore di un modello sono affermazioni aziendali, non giudizi indipendenti che coprono ogni carico di lavoro in produzione.
La tempistica ha amplificato il segnale competitivo. Alibaba ha fatto l'annuncio il primo giorno del Capodanno lunare, quando gran parte della Cina era in vacanza.
Un resoconto dell'epoca ha interpretato questa tempistica come prova della pressione creata dalla rapida ascesa di DeepSeek. ByteDance, Baidu, Tencent e altre aziende tecnologiche cinesi stavano anch'esse aggiornando i modelli o modificando le proprie strategie commerciali.
Alibaba non stava semplicemente rispondendo a un rivale americano. Stava difendendo la propria posizione contro un laboratorio di ricerca nazionale più piccolo che aveva reso l'efficienza parte della storia del prodotto.
Questo cambiamento ha creato la tensione centrale dell'articolo. La corsa all'AI era stata presentata come una competizione per il più grande cluster di calcolo e il miglior risultato nei benchmark. DeepSeek e Alibaba hanno mostrato che l'efficienza ingegneristica e la distribuzione potevano essere altrettanto determinanti.
La sfida dei costi raggiunge ora i laboratori AI occidentali
OpenAI, Anthropic, Google e Meta subiscono pressioni perché la leadership nei benchmark non garantisce più che i clienti accettino un sovrapprezzo per ogni attività.
La prima ondata dell'AI generativa ha premiato la capacità pura. Le aziende spesso selezionavano un unico modello leader perché la differenza tra una risposta utile e una inaffidabile era sostanziale.
Questo calcolo cambia man mano che i modelli concorrenti convergono. Un'azienda che gestisce richieste di assistenza, classifica documenti, redige contenuti di routine o estrae campi dai moduli potrebbe non aver bisogno del più potente sistema di ragionamento disponibile.
Ha bisogno di un modello che superi costantemente una soglia di accuratezza. Quando diversi prodotti oltrepassano quella soglia, tempo di risposta, controllo del deployment ed efficienza operativa acquistano peso nella decisione.
È qui che i modelli cinesi hanno stabilito una posizione credibile. DeepSeek e Alibaba non devono superare ogni modello occidentale in ogni benchmark per influenzare il mercato. Devono diventare abbastanza validi per un'ampia quota dei carichi di lavoro commerciali.
Il routing dei modelli rafforza questo effetto. Il routing è un metodo di produzione che invia ogni richiesta a un modello selezionato in base alla sua difficoltà, sensibilità o velocità richiesta.
Un'azienda potrebbe riservare un modello chiuso leader per la programmazione complessa o l'analisi in più passaggi. La stessa azienda può indirizzare il lavoro di classificazione e sintesi a un sistema open-weight meno costoso.
Questa architettura indebolisce le ipotesi del vincitore che prende tutto. Passare tra API di modelli compatibili è più semplice che sostituire un motore di ricerca, un social network o un database aziendale.
I modelli open-weight aggiungono un'altra opzione. I pesi aperti sono parametri di modello scaricabili che consentono alle organizzazioni di gestire un sistema AI sulla propria infrastruttura, nel rispetto della relativa licenza.
L'hosting autonomo può ridurre la dipendenza da un singolo fornitore di API. Può anche mantenere materiale riservato nell'ambiente scelto dall'organizzazione, sebbene quest'ultima assuma quindi la responsabilità di sicurezza, monitoraggio e pianificazione della capacità.
Per gli sviluppatori, il cambiamento pratico è un maggiore potere negoziale. Un team può testare Qwen o DeepSeek rispetto a un modello chiuso usando le proprie attività, quindi decidere dove conta un'eventuale differenza di qualità.
Per gli acquirenti aziendali, il cambiamento rende gli approvvigionamenti più granulari. Invece di selezionare un fornitore per tutte le attività AI, gli acquirenti possono valutare sistemi separati per programmazione, servizio clienti, ricerca, analisi e lavoro sulla conoscenza interna.
Questo crea pressione diretta sui laboratori occidentali. OpenAI e Anthropic devono dimostrare perché i loro modelli meritano un sovrapprezzo in flussi di lavoro specifici. Google può combinare Gemini con la propria distribuzione cloud e di produttività, ma deve comunque difendere il valore di questa integrazione.
Meta occupa una posizione diversa perché ha promosso modelli Llama scaricabili. L'ascesa di Qwen e DeepSeek offre agli sviluppatori più scelte open-weight, aumentando la concorrenza all'interno del modello di distribuzione preferito da Meta.
Nvidia affronta un esito più complicato. Un addestramento efficiente può indebolire l'ipotesi che ogni progresso richieda un aumento altrettanto drastico della spesa computazionale.
Tuttavia, una più ampia adozione dei modelli può creare nuova domanda di inferenza. L'inferenza è il calcolo utilizzato quando un modello addestrato genera risposte, e un uso elevato in molte applicazioni può richiedere hardware sostanziale.
La pressione risultante non è quindi un semplice crollo della domanda di calcolo. È uno spostamento verso un esame più attento di ciò che produce ogni unità di calcolo.
Il rilascio di R1 da parte di DeepSeek ha reso questo esame insolitamente visibile. Il rilascio ufficiale del modello dell'azienda descriveva prestazioni comparabili a o1, reinforcement learning su larga scala e modelli distillati liberamente disponibili.
La distillazione trasferisce il comportamento da un modello più grande a uno più piccolo. Il sistema più piccolo può diventare più semplice da distribuire preservando parte della capacità di ragionamento del modello più grande.
Questi rilasci distillati hanno ampliato la sfida competitiva oltre un singolo modello di punta. Hanno offerto agli sviluppatori più dimensioni in grado di adattarsi a diversi limiti hardware e di latenza.
Ecco perché la storia è proseguita oltre il suo ciclo iniziale su Google News. DeepSeek ha cambiato le aspettative su ciò che un laboratorio indipendente poteva pubblicare. La risposta di Alibaba ha mostrato che un importante fornitore cloud considerava urgente questa sfida.
I modelli AI meno costosi cambiano la decisione di deployment
Il rovesciamento fondamentale è che il modello con il punteggio più alto può perdere il carico di lavoro quando un'alternativa leggermente più debole scala in modo più efficiente.
I benchmark restano utili, ma non riproducono l'intero ambiente operativo di un'organizzazione. Pochi punti percentuali in un test scientifico possono contare enormemente per l'assistenza alla ricerca e pochissimo per ordinare le email dei clienti.
Le differenze di qualità si accumulano anche durante lunghi flussi di lavoro degli agenti. Un agente AI è un software che usa un modello per pianificare e completare più azioni, spesso richiamando strumenti esterni.
Se ogni passaggio ha una piccola probabilità di fallimento, un flusso di lavoro composto da decine di passaggi può diventare inaffidabile. Il modello di ragionamento più forte può quindi giustificare il maggiore onere operativo per agenti di programmazione, analisi finanziaria o supporto a decisioni sensibili.
Le attività di routine seguono una logica diversa. Un servizio di classificazione che elabora milioni di richieste brevi beneficia di output prevedibili, risposte rapide e uso efficiente dell'hardware.
Questo produce un mercato a due livelli. I modelli di frontiera gestiscono attività in cui ogni unità aggiuntiva di affidabilità crea valore sostanziale. I modelli più accessibili competono per lavori ad alto volume, in cui prestazioni accettabili contano più dell'ultimo punto nei benchmark.
L'architettura di DeepSeek è stata progettata attorno a questa sfida di efficienza. Il suo sistema V3 conteneva 671 miliardi di parametri totali, ma ne attivava 37 miliardi per ciascun token.
Questa attivazione sparsa riduce il lavoro necessario per ogni previsione rispetto a un modello denso di dimensioni analoghe. Non rende gratuito il calcolo, e gestire un modello di questa scala richiede comunque un'infrastruttura importante.
Alibaba ha seguito una via mixture-of-experts correlata con Qwen2.5-Max. Il suo annuncio ha enfatizzato dati di preaddestramento estesi, fine-tuning supervisionato e reinforcement learning dal feedback umano.
Il fine-tuning supervisionato istruisce un modello preaddestrato usando esempi curati. Il reinforcement learning dal feedback umano modifica il comportamento usando segnali di preferenza derivati da valutazioni umane.
Entrambe le aziende hanno combinato addestramento su larga scala con metodi pensati per utilizzare il calcolo in modo più selettivo. Le loro strategie mettono in discussione l'idea che l'efficienza appartenga soltanto a sistemi più piccoli o meno capaci.
Il controllo dell’implementazione può contare quanto l’efficienza di calcolo. I pesi scaricabili consentono alle aziende di adattare i modelli alla terminologia specialistica, eseguire valutazioni internamente e scegliere dove vengono elaborati i loro dati.
Un ospedale, uno studio legale, una società di ingegneria o un ente pubblico possono attribuire valore a questo controllo anche quando un modello chiuso ottiene risultati migliori in una classifica pubblica. La decisione dipende dal carico di lavoro, dalle regole di governance e dalle competenze interne.
I pesi aperti non eliminano la dipendenza dai fornitori. Le organizzazioni dipendono comunque da hardware, framework di serving, strumenti di sicurezza e dipendenti in grado di gestire il sistema.
Devono inoltre monitorare le licenze dei modelli e l’origine dei dati di addestramento. Un modello scaricabile può introdurre questioni legali o di conformità che un contratto API potrebbe attribuire diversamente.
I knowledge worker sperimentano lo stesso compromesso su scala minore. Le persone passano sempre più spesso tra diversi sistemi di IA, perché ognuno presenta punti di forza, limiti e politiche sui dati differenti.
Questa frammentazione aumenta il valore di mantenere il materiale di origine organizzato indipendentemente da qualsiasi fornitore di modelli. Una base di conoscenza IA personale può preservare note e riferimenti mentre cambia il modello preferito.
Il meccanismo più ampio ricorda una precedente transizione nel cloud computing. Interfacce standard hanno reso l’infrastruttura più intercambiabile, mentre i servizi premium hanno continuato a competere attraverso affidabilità e integrazione.
I modelli di IA si stanno muovendo in quella direzione più rapidamente, perché gli sviluppatori possono confrontarne subito gli output. Gli strumenti di valutazione possono eseguire lo stesso set di prompt su diversi sistemi e misurare accuratezza, latenza e schemi di errore.
Alibaba e DeepSeek hanno contribuito a normalizzare questo approccio comparativo. Il lancio di un modello ora invita a porsi domande pratiche che vanno oltre chi occupa il primo posto.
Il sistema può essere eseguito nell’ambiente scelto dal cliente? Segue le istruzioni in modo affidabile? Come si comporta sui documenti del cliente? Quale monitoraggio richiede?
Queste domande spostano l’influenza verso acquirenti dotati di una valutazione rigorosa. Penalizzano inoltre i fornitori che si affidano a generiche affermazioni sui benchmark senza dimostrare risultati affidabili nelle applicazioni reali.
Il modello di IA più economico non vince automaticamente. Vince quando i suoi limiti esulano dai requisiti del carico di lavoro di destinazione.
Questa distinzione è centrale nella corsa attuale. Alibaba e DeepSeek stanno ampliando il numero di attività nelle quali gli acquirenti possono fare questa scelta.
Cosa non chiariscono le affermazioni di Alibaba e DeepSeek
Costi dichiarati inferiori e benchmark solidi non chiariscono la spesa totale per lo sviluppo, l’affidabilità nel mondo reale, la sicurezza o l’allineamento politico.
La prima incertezza riguarda la contabilità. La cifra di DeepSeek per V3, ampiamente ripetuta, copriva il tempo GPU dell’ultimo processo ufficiale di addestramento, sulla base di una tariffa oraria di noleggio ipotizzata.
Il rapporto tecnico escludeva esplicitamente la ricerca e gli esperimenti precedenti. Inoltre, non rappresentava il costo completo della creazione dell’azienda, dell’ottenimento dei dati, del reclutamento dei ricercatori o della gestione dell’infrastruttura.
Una valutazione tecnica osserva analogamente che la cifra era una stima legata all’esecuzione finale dell’addestramento. I confronti con l’intero budget di capitale di un’altra azienda sono quindi inaffidabili.
La seconda incertezza riguarda la selezione dei benchmark. Gli sviluppatori di modelli decidono quali test pubblicare, quali versioni concorrenti includere e come configurare la valutazione.
Ciò non rende i loro risultati privi di significato. Significa che gli acquirenti dovrebbero riprodurre i test importanti usando i propri prompt, lingue, formati di documento e criteri di errore.
Alibaba ha dichiarato che Qwen2.5-Max ha superato diversi modelli di rilievo in benchmark nominati. Non ha dimostrato che Qwen sia superiore in ogni repository di codice, sistema di ricerca aziendale o flusso di lavoro con agenti.
Il confronto di DeepSeek con o1 presenta lo stesso limite. R1 ha mostrato notevoli prestazioni di ragionamento, ma le prestazioni variano in base al problema, al prompt, all’accesso agli strumenti e al metodo di valutazione.
La terza incertezza riguarda la sicurezza. La distribuzione di pesi aperti offre controllo a chi implementa il modello, ma trasferisce anche maggiori responsabilità.
Un fornitore chiuso normalmente gestisce controlli centralizzati contro gli abusi e può aggiornarli nell’intero servizio. Un modello ospitato in proprio richiede all’organizzazione che lo implementa di progettare filtraggio, logging, controlli di accesso e risposta agli incidenti.
Questo onere è gestibile per un team di ingegneria esperto. È più difficile per le organizzazioni più piccole, attratte soprattutto da costi operativi inferiori.
La quarta preoccupazione riguarda privacy e sicurezza nazionale. Diversi governi e organizzazioni hanno limitato DeepSeek su dispositivi o reti ufficiali per timori relativi alla gestione dei dati e all’accesso da parte di soggetti stranieri.
Tali restrizioni non dimostrano che ogni implementazione locale sia insicura. Mostrano che il metodo di implementazione conta. Inviare prompt riservati a un servizio ospitato è diverso dall’eseguire pesi scaricabili in un ambiente controllato.
Gli acquirenti devono distinguere tra modello, applicazione e fornitore di hosting. Il dibattito pubblico spesso combina tutti e tre sotto un unico nome di prodotto.
L’allineamento politico presenta un ulteriore rischio. Un modello può offrire apertura tecnica pur mantenendo schemi di risposta plasmati dai suoi dati di addestramento e dalle regole di post-addestramento.
La ricerca ha rilevato che DeepSeek può rispondere in modo diverso su argomenti cinesi politicamente sensibili. Tale comportamento conta per il giornalismo, il lavoro accademico, l’analisi geopolitica e qualsiasi prodotto chiamato a rappresentare prospettive contrastanti.
Un modello scaricabile può essere modificato, ma l’hosting autonomo non elimina automaticamente i pregiudizi appresi. I test devono includere i domini di contenuto rilevanti per il cliente.
Esistono anche questioni di proprietà intellettuale. OpenAI ha dichiarato di stare indagando sulla possibilità che DeepSeek abbia usato gli output dei suoi modelli per addestrare sistemi concorrenti tramite distillazione.
L’accusa non ha stabilito pubblicamente alcuna condotta illecita. Ha evidenziato un conflitto irrisolto su come gli output dei modelli possano essere usati per riprodurne il comportamento, in particolare quando i termini di servizio limitano tale attività.
Un’inchiesta associata ha riportato preoccupazioni di funzionari statunitensi e di OpenAI, rilevando al contempo l’incertezza che circonda il processo di sviluppo di DeepSeek.
Anche i laboratori occidentali affrontano problemi di trasparenza. I modelli chiusi rivelano di solito meno informazioni sui dati di addestramento, sull’architettura e sui test interni rispetto ai progetti a pesi aperti.
Il confronto, quindi, non è tra sistemi cinesi trasparenti e sistemi americani completamente documentati. È un mercato nel quale ogni fornitore trattiene informazioni importanti per ragioni competitive, legali o di sicurezza.
La risposta sensata non è liquidare Alibaba e DeepSeek. I loro modelli hanno prodotto risultati abbastanza credibili da imporre una reazione competitiva.
Non è nemmeno prudente considerare grafici promozionali o una stima del calcolo di un’esecuzione finale come un audit completo. Restano necessarie valutazioni indipendenti, una segnalazione trasparente degli incidenti e test specifici per il carico di lavoro.
Questa visione scettica rafforza l’argomento centrale anziché indebolirlo. Modelli più economici possono ridefinire le aspettative degli acquirenti anche quando le loro affermazioni più ampie restano irrisolte.
L’effetto commerciale inizia quando gli acquirenti ritengono che un’alternativa meriti di essere testata. Alibaba e DeepSeek hanno già superato quella soglia.
Tre segnali decideranno la prossima fase
La prossima fase dipende dall’adozione reale, dall’affidabilità verificata degli agenti e dalla risposta dei fornitori occidentali di modelli.
Il primo segnale è l’uso continuativo in produzione. I conteggi dei download e le classifiche dei chatbot mostrano interesse, ma non rivelano se le aziende mantengono un modello dopo averlo testato.
Occorre osservare il consumo cloud, il traffico API ripetuto, le implementazioni aziendali in hosting autonomo e i casi di studio pubblicati relativi a carichi di lavoro ad alto volume. Un uso continuato sosterrebbe l’idea che i modelli cinesi stiano conquistando la domanda di IA di routine.
Un calo dopo la sperimentazione iniziale indebolirebbe tale conclusione. Suggerirebbe che difficoltà di integrazione, preoccupazioni di governance o output incoerenti superano il vantaggio in termini di efficienza.
Alibaba dispone qui di un vantaggio di distribuzione. Può offrire Qwen tramite una piattaforma cloud consolidata e collegare i modelli a storage, database e servizi aziendali.
DeepSeek ha un vantaggio diverso. La sua identità di ricerca e i rilasci permissivi hanno generato un notevole interesse degli sviluppatori al di fuori di un tradizionale canale di vendita aziendale.
Il secondo segnale è la prestazione indipendente su attività agentiche lunghe. I benchmark pubblici spesso valutano una risposta alla volta, mentre gli agenti in produzione devono mantenere il contesto e recuperare dagli errori lungo molte azioni.
Test che coinvolgono repository software, operazioni del browser, analisi dei dati e chiamate a strumenti mostreranno se un piccolo divario nei benchmark si trasforma in un grande divario di affidabilità nei flussi di lavoro estesi.
Se Qwen e DeepSeek si avvicineranno ai tassi di completamento dei principali modelli chiusi, il loro argomento sull’efficienza diventerà molto più forte. Potrebbero competere per prezioso lavoro di programmazione e automazione, non solo per l’elaborazione di testo di routine.
Se il divario si amplierà nelle attività lunghe, i laboratori occidentali potranno continuare a difendere un posizionamento premium attraverso l’affidabilità. I token economici contano meno quando i flussi di lavoro falliti richiedono riparazioni umane.
Il terzo segnale è la risposta di OpenAI, Anthropic, Google e Meta. Le risposte più chiare appariranno nell’efficienza dei modelli, nei rilasci a pesi aperti, nel packaging dei servizi e nell’integrazione dei prodotti.
I fornitori occidentali non devono imitare l’esatta strategia di DeepSeek. Possono usare modelli più piccoli, caching, sistemi specifici per attività o integrazione software più stretta per ridurre il costo effettivo del lavoro completato.
Google può collegare Gemini con ricerca, strumenti di produttività, Android e infrastruttura cloud. OpenAI e Anthropic possono competere attraverso ecosistemi per sviluppatori e prestazioni degli agenti. Meta può difendere la propria posizione nei modelli aperti attraverso Llama.
Un’ampia riduzione dell’attrito nell’implementazione confermerebbe che Alibaba e DeepSeek hanno cambiato il comportamento competitivo. Dimostrerebbe che l’efficienza è diventata un requisito di prodotto primario anziché una metrica ingegneristica secondaria.
Una reazione limitata suggerirebbe che i principali fornitori ritengono che gli acquirenti aziendali attribuiscano ancora maggiore valore alla massima capacità, alla governance e ai servizi integrati.
I lettori dovrebbero inoltre trattare con cautela le future affermazioni di Google News. Un titolo che dice che un modello ha sconfitto un altro spesso comprime un risultato ristretto di benchmark in un giudizio universale.
La domanda migliore è se il modello completa un carico di lavoro definito con accuratezza, latenza, governance e requisiti operativi accettabili. La risposta può variare da un’organizzazione all’altra.
Gli sviluppatori possono prepararsi costruendo set di valutazione indipendenti dal modello e documentando i casi di errore. Gli acquirenti aziendali possono separare le attività sensibili da quelle di routine prima di confrontare le opzioni di implementazione.
I knowledge worker possono conservare le proprie ricerche al di fuori di qualsiasi singolo chatbot, creando un sistema di conoscenza personale che rimane utile mentre cambiano le preferenze sui modelli.
Alibaba e DeepSeek non hanno posto fine alla corsa all’IA né stabilito un vantaggio permanente. Ne hanno cambiato il sistema di valutazione.
La massima intelligenza continua a contare per il lavoro più difficile. Efficienza, apertura e controllo ora determinano chi può servire tutto il resto.
La prossima volta che Alibaba, DeepSeek o un laboratorio occidentale dominerà Google News, guardate oltre la classifica. Chiedetevi se test indipendenti confermano il risultato, se i clienti mantengono il modello e se i concorrenti modificano i loro prodotti di conseguenza.
Questi tre segnali riveleranno se i modelli cinesi più economici stanno semplicemente attirando attenzione o stanno diventando gradualmente infrastruttura.


