top of page

L’impennata dei token di Meta rende Microsoft il suo discreto fornitore di AI

21 ago
Tempo di lettura: 13 min

Secondo quanto riportato, Meta consuma ogni settimana trilioni di token AI attraverso Microsoft, rendendo lo sviluppatore di Llama uno dei maggiori clienti di intelligenza artificiale di Azure.

Quel volume di token di Meta è notevole perché l’azienda ha trascorso anni a sviluppare i propri modelli, data center e una strategia AI a pesi aperti. Eppure continua a dipendere da un’infrastruttura che offre ai dipendenti accesso a modelli concorrenti di OpenAI, Anthropic e altri sviluppatori.

Microsoft beneficia di questa inversione. Non ha bisogno che ogni cliente si standardizzi su un modello Microsoft. Azure può generare ricavi ogni volta che le aziende confrontano modelli, eseguono agenti di coding o instradano carichi di lavoro attraverso la sua piattaforma gestita.

Il conflitto centrale è quindi più ampio di un singolo contratto cloud. Meta vuole il controllo del proprio stack AI, mentre i suoi dipendenti desiderano un accesso immediato al modello che gestisce meglio un determinato compito.

Il volume riportato dei token di Meta cambia la prospettiva

Secondo quanto riportato, Meta non sta usando Azure per un esperimento limitato. È diventata una grande consumatrice di modelli AI ospitati da Microsoft.

Un resoconto originale del 20 agosto 2026 affermava che Meta spende centinaia di milioni di dollari all’anno per l’accesso ai modelli tramite Azure. Il rapporto citava una persona a conoscenza della questione che ha chiesto di rimanere anonima.

Secondo quella fonte, Meta elabora ogni settimana trilioni di token attraverso la piattaforma. Un token è una piccola unità di testo che un modello AI legge o genera durante una richiesta.

Né Meta né Microsoft hanno commentato l’accordo riportato. Questo silenzio conta, perché le cifre principali restano attribuite a un’unica fonte anonima anziché a comunicazioni pubbliche delle aziende.

Il rapporto non identifica il volume settimanale esatto, i team Meta coinvolti o la combinazione di modelli. Non separa inoltre i token in input dall’output generato, dai contenuti memorizzati nella cache o dall’attività ripetuta degli agenti.

Queste distinzioni possono modificare materialmente il costo e il significato di qualsiasi totale di token. Un lungo flusso di lavoro di coding può consumare molti più token di quanto suggerisca la sua risposta visibile.

Gli agenti AI spesso ispezionano file, generano codice, testano modifiche e rivedono il proprio lavoro attraverso numerosi passaggi interni. Ogni passaggio può inviare ulteriore contesto a un modello.

Il volume riportato indica comunque un uso sostenuto in produzione, non sporadiche conversazioni con chatbot. Persino il limite inferiore implicito in “trilioni” rappresenta un numero immenso di interazioni con i modelli.

La tempistica si inserisce anche in un quadro più ampio all’interno di Meta. Resoconti precedenti descrivevano dipendenti che consumavano decine di trilioni di token al mese tramite strumenti AI interni.

Meta ha incoraggiato gli ingegneri a usare l’AI in modo intensivo, soprattutto per lo sviluppo software. Il coding rappresenta uno degli ambienti più evidenti in cui chiamate ripetute ai modelli possono accumularsi rapidamente.

L’azienda ha inoltre sperimentato sistemi interni che misurano l’uso di token da parte dei dipendenti. Un simile monitoraggio può incoraggiare l’adozione, ma può anche trasformare il consumo in un indicatore fuorviante della produttività.

Più token non significano necessariamente software migliore o consegne più rapide. Un agente configurato male può ispezionare ripetutamente lo stesso repository senza produrre lavoro utile.

Questa incertezza dovrebbe guidare il modo in cui i lettori interpretano la cifra dei token di Meta. Misura l’attività computazionale, non il valore aziendale.

La cifra modifica comunque il quadro competitivo. Meta non sta semplicemente costruendo un’alternativa ai fornitori di AI proprietaria. Sta anche acquistando un accesso sostanziale a tali fornitori attraverso Microsoft.

Questo crea la tensione centrale dell’articolo. L’azienda che persegue l’indipendenza a livello di infrastruttura e modelli necessita ancora di capacità esterna a livello applicativo.

Perché Meta ha ancora bisogno di modelli sviluppati altrove

La spesa riportata su Azure riflette un divario pratico tra possedere un modello AI e servire bene ogni flusso di lavoro dei dipendenti.

Meta sviluppa Llama, gestisce grandi cluster di calcolo e integra Meta AI nei suoi servizi rivolti ai consumatori. Nessuno di questi sforzi offre automaticamente a ogni ingegnere lo strumento migliore per ogni compito.

Gli assistenti di coding richiedono più di un valido modello fondazionale. Hanno bisogno di accesso ai repository, gestione di contesti lunghi, esecuzione di strumenti, controlli di sicurezza, gestione delle identità e disponibilità affidabile.

I dipendenti confrontano inoltre i modelli per pianificazione, debugging, ricerca e analisi di documenti. Un modello che funziona bene su un carico di lavoro può faticare su un altro.

Azure offre agli acquirenti aziendali un percorso gestito verso più famiglie di modelli. Microsoft ha posizionato la sua piattaforma Foundry attorno alla scelta dei modelli, anziché alla dipendenza esclusiva da un solo fornitore.

Durante la call relativa al terzo trimestre dell’esercizio fiscale 2026, Microsoft ha dichiarato che oltre 10.000 clienti avevano utilizzato più modelli su Foundry. Ha inoltre affermato che l’uso sia dei modelli Anthropic sia di quelli OpenAI era raddoppiato trimestre su trimestre.

Quelle osservazioni trimestrali mostrano perché Microsoft può trarre vantaggio anche quando i clienti sviluppano i propri modelli. Azure diventa il livello di controllo in cui le aziende testano, governano e consumano sistemi concorrenti.

La strategia interna di Meta sui modelli affronta un problema diverso. Llama offre all’azienda influenza sull’architettura dei modelli, sul deployment e sulla comunità di sviluppatori dei pesi aperti.

Un modello a pesi aperti distribuisce parametri addestrati che gli sviluppatori possono eseguire o personalizzare secondo la sua licenza. Non elimina il lavoro operativo necessario per il deployment aziendale.

Una grande azienda deve gestire capacità, latenza, permessi, confini dei dati e aggiornamenti dei modelli. Acquistare accesso gestito può essere più rapido che adattare sistemi interni per ogni modello emergente.

Questo compromesso diventa più importante quando le classifiche dei modelli AI cambiano rapidamente. I dipendenti possono preferire un modello per la generazione di codice e un altro per il ragionamento complesso.

Limitarli a Llama potrebbe ridurre la spesa esterna. Potrebbe anche rallentare i team le cui attività funzionano meglio con un altro modello.

Meta affronta quindi una classica decisione di piattaforma. Può ottimizzare il controllo interno, oppure preservare la scelta e accettare la dipendenza da un fornitore esterno.

La sua scelta riportata privilegia l’accesso. Meta sembra disposta a pagare Microsoft anziché imporre ogni flusso di lavoro sui propri modelli e sulla propria infrastruttura.

Questo non dimostra che Llama abbia fallito. Assistenti per i consumatori, sistemi di raccomandazione, prodotti pubblicitari e strumenti interni di coding hanno requisiti tecnici diversi.

La decisione suggerisce invece che proprietà e consumo dei modelli si siano separati. Un’azienda può creare una grande famiglia di modelli pur rimanendo una grande cliente dei propri concorrenti.

L’impennata dei token di Meta è uno dei risultati di questa separazione. I dipendenti di Meta possono usare qualunque modello la piattaforma gestita renda disponibile, anche quando queste scelte rafforzano il business AI di un’altra azienda.

Microsoft vince quando i clienti rifiutano di scegliere un solo modello

Il vantaggio di Microsoft non si limita al possesso di un modello vincente. Può trarre profitto dal rifiuto del mercato di convergere su uno solo.

L’avversario evidente in questa storia è la spinta di Meta verso l’indipendenza nell’AI contrapposta al ruolo di Microsoft come mercato di modelli difficile da evitare.

Meta vuole maggiore controllo su calcolo, modelli e distribuzione dei prodotti. Microsoft vuole che Azure resti il luogo in cui le imprese accedono e gestiscono quasi ogni modello di cui hanno bisogno.

Questi obiettivi non sono direttamente incompatibili. Diventano competitivi quando la domanda di Meta offre a Microsoft ricavi, dati di utilizzo e leva sulla distribuzione dell’AI aziendale.

Il catalogo di modelli di Microsoft comprende sistemi proprietari e a pesi aperti. I clienti possono instradare diversi carichi di lavoro attraverso una relazione cloud comune senza negoziare accordi infrastrutturali separati.

Questo approccio riduce il rischio strategico di puntare su un solo laboratorio. Se OpenAI perde un determinato benchmark o Anthropic diventa preferibile per il coding, Azure può continuare a servire il cliente.

Microsoft ha evidenziato questa ampiezza nella sua call sugli utili. L’azienda ha dichiarato che i clienti Foundry usavano modelli OpenAI, Anthropic, open-source e regionali.

Ha inoltre affermato che oltre 300 clienti erano sulla buona strada per elaborare più di un trilione di token durante l’anno. Il consumo settimanale riportato di Meta la collocherebbe molto oltre quella soglia annuale.

Le cifre non sono perfettamente comparabili. La dichiarazione pubblica di Microsoft si riferisce a clienti che raggiungono un parametro annuale, mentre il rapporto su Meta descrive l’attività settimanale complessiva.

Tuttavia, il contrasto illustra la possibile scala di Meta. Il suo carico di lavoro riportato la renderebbe una cliente insolitamente intensiva persino all’interno della crescente base aziendale di Microsoft.

Microsoft sviluppa anche i propri modelli MAI e adatta la tecnologia OpenAI per prodotti proprietari. Tuttavia Azure non richiede che questi sistemi vincano ogni confronto tecnico.

La piattaforma cloud consolida la propria posizione gestendo accesso, fatturazione, sicurezza e capacità. Questo ricorda la precedente competizione nel cloud, in cui i fornitori di infrastruttura traevano profitto da software che non possedevano.

Questa posizione mette sotto pressione Amazon e Google. Entrambe offrono cataloghi ampi di modelli, servizi AI gestiti e propri modelli fondazionali.

Amazon ha reso Anthropic centrale nella sua strategia, mentre Google combina Gemini con la sua piattaforma Vertex AI. Microsoft può replicare con una domanda dei clienti distribuita su diverse famiglie di modelli.

La presenza di Meta rafforza questa tesi perché non è un’acquirente aziendale convenzionale. È un’altra azienda tecnologica hyperscale con un’ampia infrastruttura interna.

Una decisione riportata di Meta di acquistare accesso ai modelli suggerisce che le piattaforme cloud conservino valore anche per aziende capaci di costruire enormi sistemi in proprio.

Microsoft può anche usare la domanda aggregata per giustificare più data center e acquisti di acceleratori. Un utilizzo più elevato migliora l’economia della capacità che altrimenti resterebbe costosa e sottoutilizzata.

Questo vantaggio comporta rischi. Microsoft deve mantenere disponibile capacità computazionale sufficiente, gestire i rapporti con i fornitori e impedire che l’accesso ai modelli diventi una commodity a basso margine.

Per ora, il consumo riportato di token di Meta sostiene la sua strategia di marketplace. Microsoft può vincere transazioni senza convincere Meta che un singolo modello controllato da Microsoft debba sostituire Llama.

L’indipendenza AI di Meta ha una costosa eccezione

L’inversione sta nel fatto che la scala di Meta non elimina la dipendenza esterna. Rende più prezioso l’accesso a ogni modello utile.

Meta ha costruito alcuni dei più grandi sistemi di addestramento AI al mondo. Il suo resoconto sull’infrastruttura descriveva decine di cluster AI al servizio di centinaia di team e migliaia di lavori di addestramento giornalieri.

Questa infrastruttura supporta sistemi di raccomandazione, pubblicità, prodotti generativi e sviluppo dei modelli. Meta aveva pianificato capacità equivalenti a centinaia di migliaia di GPU avanzate.

Queste risorse dovrebbero rendere Meta meno dipendente dai cloud esterni rispetto alla maggior parte delle aziende. Il rapporto su Azure mostra perché questa conclusione è troppo semplicistica.

Addestramento e inferenza sono carichi di lavoro diversi. L’addestramento crea o aggiorna un modello, mentre l’inferenza esegue un modello esistente per rispondere alle richieste.

Meta può possedere una notevole infrastruttura di addestramento pur acquistando accesso in inferenza a modelli che non controlla. Può inoltre ricorrere a capacità esterna quando l’offerta interna non riesce a soddisfare la domanda a breve termine.

Il crescente budget di Meta per l’AI aggiunge contesto. Secondo le più recenti previsioni di spesa, Meta ha stimato spese in conto capitale per il 2026 tra 130 e 145 miliardi di dollari.

L’investimento copre molto più dell’addestramento dei modelli. I data center richiedono networking, alimentazione, raffreddamento, storage e server, la cui implementazione richiede tempo.

L’accesso a modelli esterni può colmare il divario tra la domanda dei dipendenti e la capacità interna. Evita inoltre di dover aspettare che i modelli proprietari di Meta raggiungano ogni capacità specializzata.

Questo è il punto centrale dell’inversione. Un maggiore investimento interno non ha prodotto un ambiente chiuso e autosufficiente.

Al contrario, un’adozione aggressiva crea una domanda che una sola famiglia di modelli non può soddisfare. Meta diventa al tempo stesso concorrente e cliente nella stessa catena di fornitura dell’AI.

L’accordo ricorda una fase iniziale del cloud computing. Le grandi aziende tecnologiche costruivano infrastrutture interne, pur noleggiando capacità esterna per servizi specifici o picchi di domanda.

L’AI aggiunge un ulteriore livello, perché l’asset noleggiato include la capacità del modello, non soltanto i server. I dipendenti si preoccupano della qualità dell’output, dell’uso degli strumenti e dell’affidabilità, non della struttura proprietaria sottostante.

Questo crea una sfida organizzativa. Meta deve decidere se i token esterni siano un ponte temporaneo o un componente permanente del lavoro dei dipendenti.

Se l’utilizzo è temporaneo, modelli e infrastrutture interni dovrebbero infine assorbire una quota maggiore della domanda. Se persiste, Microsoft avrà assicurato un ruolo duraturo nelle operazioni AI di Meta.

La distinzione incide anche sul significato competitivo di Llama. Llama può restare influente senza diventare lo standard interno esclusivo di Meta.

I pesi aperti attraggono gli sviluppatori consentendo personalizzazione e deployment locale. I team interni possono comunque scegliere modelli proprietari ospitati quando questi consentono di risparmiare tempo.

Per sviluppatori e acquirenti enterprise, questo è un utile avvertimento contro l’idea che la strategia sui modelli sia una decisione legata a un unico fornitore. Le implementazioni reali coinvolgono sempre più spesso l’instradamento delle attività tra diversi sistemi.

Questo instradamento crea un problema di conoscenza a sé stante. I team devono preservare prompt, decisioni, valutazioni e output tra diversi strumenti.

Una base di conoscenza AI ricercabile può aiutare a organizzare questo contesto. Tuttavia, non può stabilire se la spesa sottostante per i modelli produca una produttività misurabile.

La risposta richiede risultati, non totali di token.

Cosa non dimostrano i numeri sui token

Migliaia di miliardi di token segnalano scala, ma non dimostrano che Meta stia ottenendo un valore proporzionale dalla propria spesa.

Le cifre principali restano non verificate da entrambe le aziende. Provengono da una persona non identificata a conoscenza di un accordo interno.

Meta e Microsoft hanno rifiutato di commentare, lasciando senza risposta diverse domande fondamentali. Nessuna delle due ha divulgato i modelli esatti, i termini negoziati, i carichi di lavoro o il periodo di misurazione.

Anche la contabilizzazione dei token può variare tra i sistemi. I fornitori possono conteggiare in modo diverso prompt, output, contesto in cache, risultati degli strumenti o ragionamento interno.

Un totale settimanale di token non può quindi essere tradotto direttamente in attività dei dipendenti. Non può neppure rivelare quanta parte del traffico abbia raggiunto sistemi di produzione.

Parte dell’utilizzo potrebbe provenire da valutazioni automatizzate. I team inviano abitualmente lo stesso prompt a più modelli per confrontare accuratezza, latenza e sicurezza.

Altro traffico potrebbe provenire da agenti di coding che leggono ripetutamente repository di grandi dimensioni. Questi sistemi possono generare enormi quantità di token svolgendo un’attività che un singolo ingegnere esamina una sola volta.

La cache complica ulteriormente il quadro. Un fornitore può riutilizzare contesto elaborato in precedenza, riducendo il lavoro computazionale anche quando il record di fatturazione continua a fare riferimento a grandi volumi di token.

Anche la dimensione del modello conta. Un modello più piccolo può elaborare token con meno calcolo rispetto a un modello di ragionamento di frontiera.

Le stime energetiche dovrebbero quindi restare prudenti. L’analisi sull’inferenza di Microsoft stessa spiega che l’energia per query dipende da modelli, hardware, software, data center e caratteristiche del carico di lavoro.

Quello studio ha stimato l’energia per un volume definito di query conversazionali. Non fornisce una conversione affidabile per il traffico riportato di Meta.

La cifra relativa ai costi comporta un’incertezza simile. I contratti enterprise possono includere capacità riservata, sconti, impegni e tariffe diverse per modelli diversi.

La spesa annuale di Meta e i token settimanali non dovrebbero essere divisi per ottenere un costo universale per token. Il risultato mescolerebbe modelli e termini contrattuali che non sono stati divulgati.

C’è anche una questione di produttività. Gli incentivi interni possono spingere i dipendenti a massimizzare l’utilizzo visibile senza massimizzare l’output utile.

Una classifica basata sui token rischia di premiare prompt lunghi e agenti inefficienti. Una valutazione migliore misurerebbe attività completate, codice accettato, tassi di difetti e tempo risparmiato.

Restano inoltre preoccupazioni in materia di sicurezza e governance. Inviare contesto aziendale a modelli esterni richiede autorizzazioni, controlli sui dati, registrazione e politiche di conservazione.

Azure può fornire un perimetro gestito, ma la gestione non elimina il rischio. Meta deve comunque decidere a quali repository e documenti ciascuno strumento può accedere.

La conclusione più solida è quindi più circoscritta rispetto al titolo. Secondo quanto riportato, Meta acquista capacità AI esterna su una scala immensa nonostante le proprie risorse interne.

La conclusione più debole sarebbe che il consumo di token dimostri la superiorità dei modelli Microsoft rispetto a Llama. Le prove disponibili non supportano tale affermazione.

Non dimostrano neppure che Meta intenda ridurre gli investimenti in Llama. Il suo utilizzo esterno può coesistere con il continuo sviluppo di modelli interni.

I lettori dovrebbero considerare la cifra riportata sui token di Meta come prova di dipendenza, non come prova di una sconfitta tecnica.

Tre segnali mostreranno se questa dipendenza durerà

La prossima fase sarà decisa dai risultati dei carichi di lavoro, dall’adozione interna dei modelli di Meta e dalla capacità di Microsoft di trasformare la crescita dei token in margini duraturi.

Il primo segnale è se Meta modificherà l’accesso dei dipendenti a modelli esterni. Nuovi budget, limiti o regole sui modelli predefiniti indicherebbero che il management considera il consumo incontrollato un problema finanziario.

Uno spostamento verso modelli interni rafforzerebbe l’argomento dell’indipendenza. Un accesso ampio e continuativo sosterrebbe la posizione di Microsoft sul mercato.

Il secondo segnale riguarda il prossimo lancio di modelli e infrastrutture di Meta. La domanda importante non è se Meta annuncerà un’altra release di Llama.

La misura utile è se i team interni sposteranno su di essa i carichi di lavoro di produzione. L’adozione all’interno di Meta mostrerebbe che l’azienda può trasformare l’investimento nei modelli in una sostituzione pratica.

Se i dipendenti continueranno a preferire sistemi concorrenti dopo una release importante, il rapporto riportato con Azure apparirà strutturale anziché temporaneo.

Il terzo segnale emergerà dalle informazioni finanziarie divulgate da Microsoft. Gli investitori dovrebbero monitorare la capacità AI, la crescita di Azure, i margini lordi e i riferimenti all’adozione multi-modello di Foundry.

Secondo le sue dichiarazioni pubbliche sugli utili, il tasso annualizzato dei ricavi AI di Microsoft ha superato 37 miliardi di dollari nel terzo trimestre fiscale. L’azienda ha inoltre riportato una rapida crescita dei token tra i grandi clienti Foundry.

Questi numeri sostengono la tesi della domanda, ma i costi infrastrutturali restano elevati. Microsoft deve acquistare acceleratori e costruire strutture prima che tutta quella capacità generi ricavi.

Un cliente come Meta può migliorare l’utilizzo della capacità. Tuttavia, un utilizzo intenso negoziato può continuare a mettere sotto pressione i margini se i costi di serving dei modelli diminuiscono più lentamente delle tariffe contrattuali.

Il rapporto mette quindi alla prova entrambe le aziende. Meta deve dimostrare che acquistare modelli esterni accelera il lavoro utile senza indebolire la propria strategia interna.

Microsoft deve dimostrare che servire migliaia di miliardi di token crea un’economia attraente, anziché una semplice attività impressionante.

Amazon, Google e fornitori specializzati di modelli influenzeranno entrambi gli esiti. Tariffe più basse o modelli migliori potrebbero spostare i carichi di lavoro di Meta lontano da Azure.

Microsoft può difendere la propria posizione tramite capacità, governance e ampiezza dell’offerta di modelli. Non può presumere che il modello preferito oggi resti tale il prossimo trimestre.

Per gli sviluppatori, la lezione pratica è che la scelta del modello resta fluida. I sistemi dovrebbero preservare le valutazioni e consentire ai carichi di lavoro di spostarsi senza ricostruire ogni processo circostante.

Anche gli acquirenti enterprise dovrebbero richiedere metriche basate sui risultati. Il volume di token è un input operativo, proprio come il tempo di calcolo o lo storage.

Le domande migliori riguardano velocità di consegna, qualità, affidabilità e ricavi. Un team dovrebbe sapere se un agente ha risolto un problema, non soltanto quanti token abbia consumato.

L’aumento riportato dei token di Meta rende visibile la scala dell’adozione aziendale dell’AI. Rivela anche quanto poche siano le informazioni pubbliche sul valore prodotto a quella scala.

Nei prossimi mesi, osservate i modelli predefiniti di Meta, le migrazioni dei carichi di lavoro interni e i margini cloud di Microsoft. Insieme, questi segnali mostreranno se Azure rappresenti per Meta un ponte o un livello permanente nel suo stack AI.

Se il vostro team sta ampliando l’uso dei modelli, iniziate a monitorare quali flussi di lavoro migliorano e quali producono soltanto più attività. Conservate il contesto di supporto, registrate le decisioni sui modelli e confrontate i risultati tra attività ripetute. Chiedetevi se ciascun sistema riduce i tempi di revisione, migliora la qualità o gestisce lavoro che in precedenza restava incompiuto. Questa disciplina conta più dell’inseguire un totale di token più elevato. Il consumo riportato di Meta offre una rara visione dell’adozione su scala estrema, ma non fornisce da solo un modello da seguire. Il vero parametro sarà capire se Meta trasformerà quei token in prodotti migliori riducendo al contempo la dipendenza dal concorrente che li fornisce.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page