Il rapporto sui costi di Epoch AI rileva che i prezzi dell'AI calano più rapidamente della legge di Moore
Epoch AI afferma che il costo per raggiungere un livello fisso di prestazioni AI è diminuito del 47% per trimestre dal 2023. Il nuovo rapporto sui costi di Epoch AI traduce questo ritmo in un calo annuo di 13 volte, molto più rapido dei miglioramenti storici dell'hardware informatico.
Questa conclusione non significa che ogni fattura relativa all'AI diminuisca nella stessa misura. Misura il modo meno costoso disponibile per raggiungere un punteggio definito in cinque benchmark che coprono matematica, scienze e giochi. La distinzione conta perché i modelli più recenti possono offrire risultati comparabili consumando meno risorse o utilizzando infrastrutture meno costose.
Il confronto con la legge di Moore resta comunque sorprendente. Il calcolo è diventato costantemente più economico nel corso dei decenni, contribuendo a rendere possibili personal computer, smartphone e servizi cloud. Epoch AI sostiene che i prezzi dell'AI corretti per le prestazioni stiano ora diminuendo sei volte più rapidamente del tasso storico del calcolo.
I beneficiari immediati sono gli sviluppatori e le organizzazioni che possono spostare i carichi di lavoro tra modelli. La pressione ricade su OpenAI, Anthropic, Google e servizi AI di terze parti che necessitano di ricavi ricorrenti. Un modello premium può conquistare un vantaggio, ma il suo beneficio economico potrebbe svanire nel giro di pochi mesi.
Questo crea la tensione centrale. Un'intelligenza più economica favorisce un'adozione più ampia, ma lo stesso calo indebolisce la fedeltà basata sul prezzo e comprime il valore del mero accesso ai modelli. L'attività duratura potrebbe collocarsi sopra il livello del modello, dove i prodotti mantengono contesto, integrazione nei flussi di lavoro, fiducia e dati proprietari.
Cosa ha effettivamente misurato il rapporto sui costi di Epoch AI
Epoch AI ha misurato il costo di un risultato, non semplicemente il prezzo pubblicizzato di un token AI.
L'organizzazione di ricerca ha pubblicato la sua analisi dei costi il 22 settembre 2026. I ricercatori Luke Emberson e David Roodman hanno esaminato prestazioni e costi dei modelli in cinque benchmark a partire dal 2023.
I benchmark riguardano domande difficili di matematica, scienze a livello post-laurea, scacchi e altri giochi di abilità. Epoch AI ha quindi stimato il percorso disponibile meno costoso per ciascun livello di prestazione raggiungibile in date diverse.
Questo confine è chiamato frontiera di Pareto. Rappresenta i modelli che offrono le migliori prestazioni disponibili per una determinata spesa. Un modello al di fuori di tale frontiera costa di più senza fornire un risultato migliore.
Il metodo tiene conto anche dei budget di ragionamento. Un modello di ragionamento può impiegare più token di output per considerare un problema, aumentando la probabilità di rispondere correttamente. Un semplice prezzo per token non rivela quindi il costo completo per portare a termine un'attività.
Epoch AI ha utilizzato trascrizioni di valutazione per stimare come le prestazioni cambino con diversi limiti di budget. L'approccio segue il lavoro del Center for AI Standards and Innovation federale, o CAISI. Produce una curva costo-prestazioni per ciascun modello invece di ridurre quel modello a un singolo prezzo pubblicizzato.
Questa distinzione diventa importante quando due modelli usano i token in modo diverso. Un modello con token meno costosi può generarne molti di più prima di completare un'attività. Il suo apparente vantaggio di prezzo può scomparire quando viene misurato dal quesito alla risposta corretta.
Nei cinque benchmark, Epoch AI ha calcolato una diminuzione media corretta per le prestazioni del 47% per trimestre. Ciò equivale approssimativamente a una riduzione di 13 volte in un anno, se la tendenza si compone.
Il ritmo variava a seconda del dominio. I prezzi sono diminuiti di circa il 39%-43% per trimestre nei rompicapi basati sui giochi. I benchmark matematici hanno mostrato cali più rapidi, di circa il 50%-52% per trimestre.
Un esempio illustra la portata del fenomeno senza fare affidamento sui listini dei token. Epoch AI ha confrontato due modelli OpenAI rilasciati a meno di 18 mesi di distanza. Secondo quanto riportato, il modello successivo ha raggiunto lo stesso punteggio GPQA Diamond con una spesa pari a circa un settecentoventicinquesimo di quella del modello precedente.
GPQA Diamond è un benchmark a scelta multipla progettato attorno a domande di livello post-laurea in fisica, chimica e biologia. Cattura un tipo impegnativo di ragionamento, ma non l'intera gamma del lavoro utile.
Il dato principale va quindi letto come un indice dei prezzi per capacità misurata. Non descrive i costi di addestramento, la spesa aziendale o la fattura di ogni cliente. Traccia quanto economicamente possa essere acquistato un risultato di benchmark dal modello disponibile più conveniente.
Questo risultato è inoltre coerente con evidenze precedenti. L'AI Index di Stanford ha rilevato un calo di oltre 280 volte nel costo delle prestazioni a livello GPT-3.5 tra novembre 2022 e ottobre 2024.
La rilevazione di Stanford ha utilizzato MMLU, un benchmark ampio sulle conoscenze, anziché l'intero insieme di curve costo-prestazioni di Epoch AI. Metodi diversi producono tassi diversi, ma entrambi indicano un calo insolitamente ripido.
La convergenza conta più di qualsiasi singola stima. Dataset indipendenti mostrano sempre più che capacità AI utili stanno diventando meno costose molto più rapidamente dell'hardware che le sostiene.
Perché i prezzi delle prestazioni AI stanno diminuendo così rapidamente
Il calo combina algoritmi migliori, modelli più piccoli ma capaci, hardware migliorato e un'intensa concorrenza tra fornitori.
La legge di Moore descrive la tendenza storica all'aumento della densità dei transistor nel tempo. L'espressione è anche associata alla diminuzione dei costi di calcolo, sebbene il numero di transistor e i prezzi per i clienti non siano misure identiche.
Epoch AI stima che i prezzi del calcolo siano diminuiti a un tasso composto di circa 1,51 volte all'anno tra il 1940 e il 2001. Il suo calo stimato dei prezzi delle prestazioni AI dal 2023 è di circa 13 volte all'anno.
La differenza esiste perché l'AI beneficia di più del progresso nei semiconduttori. Gli sviluppatori di modelli migliorano contemporaneamente architetture, metodi di addestramento, selezione dei dati, quantizzazione, software di inferenza e utilizzo dell'hardware.
La quantizzazione riduce la precisione numerica usata per archiviare ed eseguire un modello. Se applicata con attenzione, riduce i requisiti di memoria e calcolo preservando gran parte delle prestazioni utili del modello.
I sistemi mixture-of-experts offrono un'altra strada. Attivano solo porzioni selezionate di un modello per ciascun input, invece di usare ogni parametro. Questo design può aumentare la capacità senza richiedere l'intera rete per ogni richiesta.
La distillazione trasferisce comportamenti utili da un modello più grande a uno più piccolo. Il modello più piccolo può quindi gestire attività di routine con minore latenza e consumo di risorse. Le organizzazioni possono riservare i modelli più grandi ai problemi in cui la loro capacità aggiuntiva cambia il risultato.
La concorrenza amplifica questi progressi ingegneristici. I fornitori rilasciano ripetutamente modelli più piccoli progettati per avvicinarsi alle prestazioni dei precedenti modelli di punta. I modelli a pesi aperti consentono inoltre a host indipendenti di competere sull'efficienza del servizio.
Un articolo di ricerca del 2026 intitolato The Price of Progress è giunto a una conclusione più prudente utilizzando dati di Epoch AI e Artificial Analysis. Ha stimato cali annui da cinque a dieci volte per prestazioni comparabili nei benchmark.
Gli autori hanno attribuito il calo all'efficienza dell'hardware, ai miglioramenti algoritmici e alla concorrenza economica. Dopo aver tentato di separare gli effetti dell'hardware e del mercato, hanno stimato progressi annui di circa tre volte dovuti all'efficienza algoritmica.
Questa stima è inferiore al tasso principale di 13 volte di Epoch AI. Il divario non rende inutile nessuna delle due analisi. Mostra quanto fortemente il risultato dipenda da benchmark, soglie di prestazione, insiemi di modelli e definizioni della frontiera.
La metrica di Epoch AI favorisce il modello disponibile meno costoso a ciascun livello di capacità. Questo quadro presuppone un acquirente molto attivo che rivaluta regolarmente il mercato e passa al leader di costo del momento.
Le organizzazioni reali si comportano diversamente. Dedicano tempo a testare i modelli, riscrivere i prompt, verificare la sicurezza, aggiornare le valutazioni e rinegoziare i contratti. Questi costi di cambiamento impediscono a molti utenti di cogliere l'intero calo teorico.
Lo studio rileva inoltre che i prezzi diminuiscono più rapidamente subito dopo la prima comparsa di un livello di prestazione. Nei suoi cinque benchmark principali, le prestazioni prossime alla frontiera sono diventate inizialmente il 66% meno costose per trimestre.
Due anni dopo il debutto di un livello di prestazione, il calo trimestrale stimato è rallentato al 32%. Rappresenta comunque una rapida riduzione annuale, ma è meno spettacolare della corsa iniziale.
Epoch AI suggerisce che una nuova capacità ottenga temporaneamente un premio. I concorrenti la riproducono poi o vi si avvicinano, mentre il fornitore originario ottimizza i costi di servizio. Il premio si riduce man mano che la capacità diventa comune.
Questo schema spiega perché il calo aggregato possa superare la legge di Moore. Il mercato non attende una nuova generazione di chip. Sovrappone miglioramenti software, dei modelli, dell'infrastruttura e della concorrenza ai continui guadagni dell'hardware.
Spiega anche perché la tendenza possa persistere mentre le aziende AI spendono di più in data center. Addestrare il modello più forte e offrire una capacità consolidata sono attività economiche diverse.
I laboratori di frontiera possono investire risorse crescenti nella ricerca mentre i clienti pagano meno per le prestazioni di ieri. Il settore sta contemporaneamente rendendo la frontiera più costosa da creare e le capacità esistenti meno costose da consumare.
Un'intelligenza più economica mette sotto pressione i fornitori di modelli
I rapidi cali di prezzo trasformano la capacità grezza dei modelli in un prodotto soggetto a deprezzamento, con una finestra sempre più breve per rendimenti premium.
OpenAI, Anthropic, Google e altri sviluppatori di modelli competono per stabilire la frontiera delle prestazioni. Questa posizione attrae attenzione, prove aziendali e sviluppatori alla ricerca del sistema più forte disponibile.
I risultati di Epoch AI suggeriscono che questo vantaggio perda rapidamente valore economico. Nei cinque benchmark, i cali più rapidi sono apparsi attorno a livelli di prestazione raggiunti di recente. Il premio associato a un risultato di punta si è poi indebolito man mano che i concorrenti recuperavano terreno.
Questo crea un difficile problema di ricavi. Un laboratorio necessita di investimenti sostanziali per addestrare, valutare, proteggere e gestire un modello di frontiera. Eppure il prezzo che i clienti accettano per una capacità fissa può diminuire prima che quel modello abbia goduto di una lunga vita commerciale.
L'analisi giornalistica originale ha evidenziato la conseguente sfida per la fedeltà dei clienti. Se un modello comparabile diventa meno costoso nel giro di pochi mesi, gli acquirenti hanno motivo di mantenere disponibili delle alternative.
I servizi AI di terze parti affrontano una versione ancora più netta di questo problema. Un prodotto che si limita a rivendere l'accesso a un modello può essere sottoposto a concorrenza di prezzo da un altro servizio che utilizza un modello più recente.
I clienti potrebbero inoltre mettere in dubbio un impegno a lungo termine verso un singolo fornitore. Il modello preferito di oggi potrebbe perdere il proprio vantaggio dopo il prossimo ciclo di rilascio. Un'architettura fissa può trasformare il calo dei costi a monte in pressione alla migrazione.
La risposta del mercato è già visibile nella progettazione dei prodotti. I fornitori competono sempre più attraverso ambienti di coding, agenti, file system, connettori, memoria, controlli di sicurezza e opzioni di distribuzione.
Queste funzionalità creano valore che un benchmark non misura. Cambiare modello diventa più difficile quando il servizio circostante comprende autorizzazioni, terminologia, documenti e processo di revisione di un'azienda.
Anche l'affidabilità è importante. Un'impresa non trae vantaggio da una risposta più economica se quella risposta richiede una maggiore revisione umana. La metrica utile è il costo totale per completare un lavoro accettabile, inclusi errori e supervisione.
La latenza crea un'altra distinzione. Due modelli possono ottenere punteggi simili nei benchmark impiegando però tempi diversi per rispondere. I prodotti interattivi spesso attribuiscono più valore a una velocità prevedibile che a una piccola riduzione delle spese di inferenza.
Anche privacy e governance possono prevalere sul prezzo. Gli acquirenti devono sapere dove finiscono i dati, per quanto tempo i fornitori li conservano e se gli amministratori possono applicare regole di accesso.
Questi fattori offrono ai fornitori affermati difese contro una concorrenza basata esclusivamente sul prezzo. Interfacce familiari, integrazioni esistenti, approvazioni di sicurezza e contesto utente accumulato creano tutti costi pratici di migrazione.
Tuttavia, queste difese funzionano solo quando il prodotto offre valore oltre la scelta del modello. Un involucro leggero con prompt generici ha poca protezione quando diventano abbondanti sostituti capaci.
I servizi indipendenti più forti probabilmente tratteranno i modelli come infrastruttura sostituibile. Possono instradare le attività semplici verso sistemi efficienti e riservare le capacità premium ai lavori difficili.
Questo approccio richiede valutazione anziché fedeltà. Gli sviluppatori necessitano di test rappresentativi per i propri casi d'uso, inclusi qualità, latenza, tassi di errore e consumo di risorse end-to-end.
Cambia anche il modo in cui le organizzazioni dovrebbero considerare gli acquisti di IA. La domanda non è più quale singolo modello vinca ogni benchmark. La domanda è quale portafoglio offra risultati accettabili per attività diverse.
I prodotti ad alta intensità di conoscenza hanno un altro vantaggio. Un sistema che organizza le informazioni affidabili di un utente può mantenere valore anche quando il modello sottostante cambia. Il contesto accumulato appartiene al flusso di lavoro, non a una singola generazione di modelli.
È qui che una base di conoscenza IA può diventare più duratura del semplice accesso alla chat. Il suo valore deriva da recupero delle informazioni, organizzazione, autorizzazioni e continuità nel lavoro ripetuto.
La riduzione dei costi dei modelli può migliorare i margini di questi prodotti. Possono usare modelli più potenti senza aumentare i costi per i clienti, oppure applicare l'IA a più passaggi all'interno di un flusso di lavoro.
Lo stesso calo può danneggiare i servizi che competono principalmente sull'accesso. Man mano che l'intelligenza artificiale diventa più economica, la differenziazione si sposta verso contesto proprietario, esecuzione affidabile e risultati aziendali misurabili.
Cosa Non Dimostrano i Numeri
I cali di prezzo corretti per i benchmark sono prove reali, ma non costituiscono una misura universale di lavoro utile o affidabile.
Epoch AI dichiara direttamente diverse limitazioni. Il suo dataset principale copre circa tre anni, contiene combinazioni incomplete tra modelli e benchmark e include stime rumorose.
Si tratta di una finestra breve per confrontare l'IA con tecnologie misurate nell'arco di decenni. Calcolo, batterie, sequenziamento ed elettricità hanno inoltre prodotti, mercati e definizioni di prestazione differenti.
I confronti forniscono comunque una scala storica. Tuttavia, una risposta a un benchmark è meno standardizzata fisicamente di un'unità di elettricità o di capacità della batteria.
L'ottimizzazione per i benchmark presenta un'altra criticità. Gli sviluppatori possono addestrare modelli su attività che assomigliano a valutazioni popolari, intenzionalmente o indirettamente. Le prestazioni possono quindi migliorare più rapidamente nel test che in contesti reali sconosciuti.
Epoch AI definisce questo rischio benchmaxxing. Elementi casuali nei benchmark possono ridurre il riconoscimento e la memorizzazione, ma non possono eliminare ogni forma di contaminazione o ottimizzazione mirata.
Un punteggio elevato non garantisce neppure un lavoro affidabile. GPQA Diamond misura le risposte a difficili domande scientifiche. Non misura se un modello possa gestire un progetto, seguire le policy aziendali o evitare errori costosi.
Le linee guida di valutazione del NIST sottolineano che i confronti tra modelli dipendono dalle impostazioni delle attività, dagli strumenti, dai prompt, dai livelli di ragionamento, dal numero di campioni e dai metodi di valutazione. Piccole differenze di configurazione possono modificare sia le prestazioni sia la spesa.
Le valutazioni CAISI mostrano inoltre perché è importante la misurazione end-to-end. Un modello con tariffe per token inferiori può consumare più token, effettuare più chiamate agli strumenti o fallire più spesso. La sua spesa totale per attività può quindi superare quella di un rivale apparentemente costoso.
Anche gli utenti reali non cambiano modello con la stessa efficienza presunta dal metodo frontier di Epoch AI. La migrazione richiede test, lavoro di integrazione, revisione dei rischi e formazione del personale.
Un'azienda può ragionevolmente mantenere un fornitore più costoso perché soddisfa già i requisiti di sicurezza. Un'altra può valorizzare output stabili perché i cambiamenti interromperebbero flussi di lavoro automatizzati.
La domanda può assorbire parte dei risparmi. Quando un'attività di IA diventa più economica, gli sviluppatori spesso la eseguono più frequentemente, ampliano il contesto, richiedono più candidati o aggiungono fasi di verifica.
Questa è una versione dell'effetto Jevons. Una maggiore efficienza riduce il costo di ogni unità, ma il consumo totale può aumentare abbastanza da mantenere o incrementare la spesa complessiva.
I modelli di ragionamento rafforzano questo effetto. Un modello di base più efficiente può dedicare calcolo aggiuntivo al controllo di una risposta o all'esplorazione di alternative. Gli utenti ottengono risultati migliori senza necessariamente registrare un calo proporzionale dell'utilizzo totale.
Il rapporto non dimostra neppure che lo sviluppo frontier sia diventato economico. Addestrare un nuovo modello leader richiede risorse diverse rispetto al servire una capacità già nota.
I team di ricerca pagano esperimenti, lavoro specializzato, preparazione dei dati, valutazione e infrastruttura. Questi costi possono aumentare mentre l'inferenza per attività consolidate diventa drasticamente più economica.
Questa distinzione risolve un'apparente contraddizione. I fornitori di modelli possono annunciare enormi programmi infrastrutturali mentre il prezzo delle loro prestazioni, corretto per le capacità, continua a diminuire.
Il rapporto supporta quindi una conclusione circoscritta ma importante. Una capacità misurata comparabile è diventata molto più economica alla frontiera del mercato.
Non dimostra che ogni carico di lavoro migliori allo stesso ritmo. Non garantisce sicurezza, affidabilità, privacy, latenza o qualità dell'integrazione equivalenti.
Gli acquirenti dovrebbero trattare il tasso trimestrale del 47% come un segnale di mercato, non come una previsione di budget. La direzione appare ben supportata. Il ritmo esatto resta sensibile alle scelte di misurazione e al comportamento degli utenti.
Tre Segnali Che Metteranno alla Prova il Calo dei Costi dell'IA
La prossima prova sarà capire se i risparmi nei benchmark resistono al confronto con carichi di lavoro reali, economia dei fornitori e comportamenti quotidiani di migrazione.
Il primo segnale è il costo end-to-end delle attività, misurato in modo indipendente. Più valutazioni dovrebbero confrontare la spesa totale necessaria per completare con successo flussi di lavoro di programmazione, ricerca, assistenza clienti e documentazione.
Questi test richiedono set di attività stabili, strumenti controllati e soglie di qualità chiare. Dovrebbero includere tentativi ripetuti, token di ragionamento, chiamate agli strumenti, latenza e revisione umana.
Se queste misurazioni diminuiranno a un ritmo vicino alla stima di Epoch AI, le implicazioni commerciali del rapporto si rafforzeranno. Un calo molto più lento mostrerebbe che i risparmi nei benchmark sovrastimano i guadagni pratici.
Il secondo segnale riguarda i prezzi dei fornitori e il confezionamento dei prodotti. I fornitori di modelli possono rispondere alla diminuzione dei prezzi di inferenza riducendo le tariffe, aumentando le soglie di utilizzo o integrando le capacità in abbonamenti più ampi.
Possono inoltre proteggere i ricavi tramite piattaforme per agenti, controlli aziendali, archiviazione e strumenti proprietari. Queste aggiunte confermerebbero che la concorrenza si sta spostando oltre il modello di base.
Osservate con quale frequenza i fornitori sostituiscono funzionalità premium con accesso standard. Una rapida migrazione dall'esclusività dei prodotti di punta a modelli più piccoli sosterrebbe la conclusione di Epoch AI sui premi frontier effimeri.
Il terzo segnale è la migrazione dei clienti. Il calcolo frontier presuppone che gli acquirenti scelgano ripetutamente il modello capace più economico. I dati di adozione reali mostreranno se si comportano davvero in questo modo.
Gli sviluppatori potrebbero adottare sistemi di instradamento che inviano ogni attività al modello appropriato. Le imprese potrebbero richiedere clausole di portabilità e valutazioni standardizzate prima di assumere impegni a lungo termine.
In alternativa, flussi di lavoro integrati possono trattenere i clienti presso un unico fornitore nonostante ampie differenze di prezzo. Questo risultato indebolirebbe l'affermazione secondo cui la diminuzione dei prezzi delle prestazioni distrugge automaticamente la fedeltà ai fornitori.
I modelli a pesi aperti influenzeranno tutti e tre i segnali. Offrono agli host indipendenti maggiore libertà per ottimizzare il deployment e sfidare i fornitori chiusi sul costo. Trasferiscono inoltre più responsabilità per sicurezza, manutenzione e valutazione all'operatore.
Il risultato probabile non è una corsa uniforme verso la tariffa più bassa. I mercati dell'IA si separeranno in livelli.
A livello di modello, capacità comparabili dovrebbero continuare a subire pressioni sui prezzi. A livello applicativo, i fornitori competeranno attraverso contesto, proprietà del flusso di lavoro, fiducia e qualità dell'esecuzione.
Per gli sviluppatori, la risposta pratica è preservare l'opzionalità. Mantenete modulari le interfacce dei modelli, conservate set di valutazione e misurate il completamento riuscito delle attività anziché il solo consumo di token.
Anche gli acquirenti aziendali dovrebbero ridurre le proprie assunzioni sulla stabilità dei costi. Un contratto che oggi appare efficiente può diventare rapidamente non competitivo, anche quando il servizio sottostante resta capace.
I lavoratori della conoscenza dovrebbero aspettarsi che le funzionalità di IA si diffondano in più prodotti. Costi di inferenza inferiori rendono economici riepilogo, recupero delle informazioni, redazione, classificazione ed elaborazione in background in un numero maggiore di situazioni.
Il rapporto sui costi di Epoch AI non stabilisce quanto diventerà redditizio il settore. Mostra però che l'accesso a un livello fisso di intelligenza misurata sta perdendo scarsità a una velocità insolita.
La domanda per ogni prodotto di IA è ora concreta: se le capacità dei modelli diventano 13 volte più economiche in un anno, quale valore resta unico? I prodotti con contesto affidabile e flussi di lavoro dipendabili hanno una risposta. I servizi che vendono poco più dell'accesso al modello ne devono ancora trovare una.



