Gli agenti Codex di OpenAI ora dominano il suo utilizzo interno di token AI
OpenAI afferma che Codex genera oggi il 99,8% dei suoi token di output settimanali interni, un ribaltamento evidenziato da una recente notizia di Google News sulla spesa aziendale per l'IA.
Questa cifra non indica spesa, ricavi o produttività. Misura i token di output, ossia le unità di testo generate da un modello, all'interno dell'azienda che vende questa tecnologia. Ciononostante, coglie un cambiamento significativo nel modo in cui i dipendenti di OpenAI utilizzano l'IA.
Un tempo ChatGPT gestiva la maggior parte del lavoro interno con l'IA. Codex, un agente in grado di eseguire attività più lunghe e usare strumenti, domina ora le attività nei settori engineering, legale, finanza e recruiting.
La sfida importante non è più OpenAI contro un altro fornitore di modelli. È l'assistenza basata sulla chat contro il lavoro delegato agli agenti. Un chatbot risponde a una richiesta, mentre un agente può ispezionare file, chiamare strumenti, rivedere il proprio approccio e operare per minuti o ore.
OpenAI presenta questa transizione come prova che il lavoro produttivo si sta spostando verso gli agenti. La stessa transizione rende però il consumo di IA più difficile da prevedere, attribuire, proteggere e valutare.
Gli acquirenti aziendali si trovano quindi davanti a una domanda più netta di quanto suggerisca il titolo di Google News. Devono stabilire se l'aumento dell'uso di token rappresenti lavoro delegato di valore o un costoso ciclo che produce attività senza un risultato equivalente.
Cosa mostra realmente il cambiamento nei token di OpenAI
I dati interni di OpenAI mostrano un deciso cambiamento comportamentale, ma non dimostrano che ogni azienda otterrà gli stessi risultati.
OpenAI ha pubblicato la propria analisi il 12 agosto 2026. L'azienda ha esaminato l'attività di Codex tra clienti individuali, utenti organizzativi e la propria forza lavoro.
Fino ad agosto 2025, il dipendente medio di OpenAI indirizzava meno del 10% dei propri token verso Codex. In quel periodo ChatGPT rimaneva l'interfaccia predefinita per l'uso interno dell'IA.
L'equilibrio è cambiato quando Codex ha acquisito esecuzione più prolungata, modelli migliori e supporto per attività parallele. OpenAI afferma che il dipendente medio produce oggi oltre l'85% dei token di output tramite Codex.
Codex rappresenta il 99,8% dei token di output settimanali dell'intera azienda, secondo i dati sull'adozione degli agenti di OpenAI. La differenza tra queste due cifre è importante.
Il primo numero descrive la combinazione media delle attività su Codex e ChatGPT per dipendente. Il secondo riflette il totale dei token generati, fortemente influenzato dagli utenti intensivi di agenti.
Gli agenti generano naturalmente più token delle chat convenzionali. Leggono ripetutamente il contesto, pianificano azioni, ispezionano risultati, chiamano strumenti e rivedono il proprio lavoro.
Un singolo dipendente può anche eseguire più agenti contemporaneamente. Per questo la quota di token di output misura l'attività computazionale, non un conteggio diretto di lavoratori o incarichi completati.
Gli utenti interni più intensivi di OpenAI illustrano la differenza. Entro giugno 2026, i dipendenti al 99° percentile producevano regolarmente oltre 60 ore di turni di agenti Codex al giorno.
Questo numero non significa che una persona abbia lavorato per 60 ore. Riflette più agenti operativi in parallelo, mentre il loro operatore umano dirigeva o rivedeva il lavoro.
Anche le attività più lunghe sono diventate comuni tra gli utenti individuali campionati. Entro maggio 2026, l'80,6% aveva inviato almeno una richiesta a Codex che OpenAI stimava rappresentasse oltre 30 minuti di lavoro umano.
Un ulteriore 70,2% ha inviato una richiesta stimata oltre un'ora. Un altro 25,6% ha inviato almeno una richiesta stimata oltre otto ore.
Queste stime riguardano lo sforzo umano associato a un'attività, non necessariamente il tempo di esecuzione dell'agente o la quantità di lavoro eliminata. Anche il metodo di classificazione di OpenAI non può dimostrare che ogni risultato generato sia stato accettato o utile.
Persino con questi limiti, la direzione è chiara. Gli utenti chiedono all'IA di gestire unità di lavoro più grandi, invece di richiedere risposte isolate.
Un'interazione in chat potrebbe produrre un riepilogo, una bozza o uno snippet di codice. Un agente può esaminare un repository, modificare diversi file, eseguire test, interpretare gli errori e tentare correzioni.
La distinzione spiega perché l'attività IA aziendale può crescere molto più rapidamente del numero di dipendenti o del volume dei messaggi. Ogni lavoro delegato contiene diverse interazioni con il modello che rimangono nascoste dietro una singola richiesta dell'utente.
Questo è il ribaltamento centrale dell'evento. Il prompt visibile sta diventando una parte più piccola del lavoro, mentre l'esecuzione autonoma consuma una quota maggiore della capacità di calcolo.
Per le organizzazioni, questo cambia il significato dell'adozione dell'IA. Contare licenze e messaggi non descrive più quanto profondamente i modelli partecipino al lavoro operativo.
Cambia anche il confine del rischio. Un chatbot di solito propone una risposta, mentre un agente può eseguire azioni su sistemi connessi.
Questa autorità più ampia rende la progettazione delle autorizzazioni, i registri di audit, i punti di controllo della revisione e i controlli dei costi parte integrante della distribuzione. Non sono più dettagli amministrativi secondari.
Perché i segnali di Google News vanno oltre i chatbot
La notizia di Google News è rilevante perché i dati di OpenAI collegano la crescente domanda di token alla diffusione degli agenti oltre il software engineering.
Codex è nato come prodotto associato alla programmazione. Gli ingegneri sono stati i primi dipendenti a trasferire la maggior parte del proprio utilizzo di OpenAI da ChatGPT all'agente.
L'ingegnere medio di OpenAI ha superato quella soglia entro dicembre 2025. OpenAI afferma ora che l'ingegnere medio genera il 99% dei token di output tramite Codex anziché ChatGPT.
La transizione più rivelatrice è avvenuta altrove. I settori legale, finanza e recruiting sono passati a un utilizzo maggioritario di Codex intorno ad aprile 2026, dopo che gli ingegneri avevano già stabilito questo modello.
OpenAI riporta che il legale o recruiter medio genera oggi oltre l'85% dei token di output tramite Codex. Ciò non significa che questi dipendenti trascorrano la maggior parte della giornata programmando.
Codex è invece diventato un ambiente di esecuzione generale. Gli utenti non tecnici lo impiegano per automazione, analisi strutturata, trasformazione dei dati, debugging e strumenti interni.
La ripartizione professionale di OpenAI rafforza questa interpretazione. Oltre un quarto del lavoro Codex generato da dipendenti con funzioni aziendali rientrava nelle categorie engineering o coding.
Nella finanza e nelle operazioni aziendali, engineering o coding rappresentavano il 31% dell'output Codex classificato. Il lavoro della conoscenza rappresentava il 34%, mentre l'analisi finanziaria il 16%.
Per i dipendenti di prodotto, marketing e operazioni, il lavoro della conoscenza rappresentava il 51% dell'output classificato. Engineering o coding costituivano un ulteriore 25%.
Queste categorie suggeriscono che gli agenti stiano abbassando la barriera pratica tra la richiesta di lavoro tecnico e il tentativo di svolgerlo direttamente. Non dimostrano che gli specialisti non siano più necessari.
Un recruiter potrebbe chiedere a un agente di trasformare dati provenienti da diverse fonti in un flusso di lavoro interno. Un dipendente della finanza potrebbe fargli riconciliare file, creare un'analisi ripetibile o testare un piccolo strumento.
Il dipendente rimane responsabile del contesto, del giudizio, dell'autorizzazione e della revisione. Tuttavia, il percorso di esecuzione può includere codice senza richiedere un progetto software convenzionale.
L'adozione da parte dei non sviluppatori è cresciuta rapidamente in tutte e tre le popolazioni studiate da OpenAI. Da agosto 2025 ai primi di giugno 2026, gli utenti settimanali non sviluppatori sono aumentati di 137 volte tra gli utenti individuali.
OpenAI ha riportato un aumento di 189 volte tra gli utenti organizzativi e di 12 volte nella propria forza lavoro. Questi multipli partivano da basi diverse, quindi non devono essere confrontati come livelli di adozione equivalenti.
Ciononostante, supportano lo stesso risultato direzionale. L'uso degli agenti si sta espandendo oltre il pubblico tecnico che ha adottato per primo Codex.
Il modello si adatta anche al più ampio reporting aziendale di OpenAI. Il suo studio sull'utilizzo aziendale afferma che il volume dei messaggi ChatGPT è cresciuto di otto volte, mentre il consumo di token di ragionamento per organizzazione API è aumentato di circa 320 volte su base annua.
Quello studio precedente copriva più di Codex. Includeva l'uso aggregato dei prodotti aziendali di OpenAI e un sondaggio su 9.000 lavoratori di quasi 100 organizzazioni.
OpenAI ha inoltre riportato oltre un milione di clienti business e più di sette milioni di postazioni di lavoro. Quasi 200 organizzazioni avevano ciascuna elaborato oltre un trilione di token.
Nel complesso, queste cifre descrivono due curve di adozione. Il volume dei messaggi rivolti agli esseri umani sta aumentando, ma la capacità di calcolo all'interno di flussi di lavoro integrati e in più fasi cresce molto più rapidamente.
Ecco perché la chat sta diventando un'unità incompleta per misurare l'IA aziendale. Un messaggio può avviare una lunga sequenza di inferenza, recupero di informazioni, uso di strumenti, validazione e revisione.
Il cambiamento mette sotto pressione diversi gruppi contemporaneamente. I team finanziari devono prevedere consumi variabili. I team di sicurezza devono governare l'accesso ai sistemi. I manager devono decidere quale lavoro meriti capacità continuativa.
Anche i dipendenti affrontano una nuova forma di responsabilità operativa. Eseguire molti agenti può sembrare produttivo, ma l'attività parallela non equivale a lavoro completato e accettato.
Le organizzazioni avranno bisogno di evidenze condivise su ciò che è accaduto durante l'esecuzione di un agente. Una base di conoscenza IA ricercabile può preservare il contesto rilevante, ma non può sostituire autorizzazioni o valutazioni formali.
L'opportunità è reale. Gli agenti possono aiutare i lavoratori a superare confini tecnici e a completare attività che prima si bloccavano nella coda di un altro team.
La sfida gestionale è altrettanto reale. Le aziende devono individuare dove tale autonomia produca valore ripetibile e dove invece moltiplichi semplicemente le chiamate al modello.
L'assistenza in chat e l'esecuzione degli agenti seguono economie diverse
Gli agenti trasformano l'IA aziendale da un servizio principalmente regolato dal ritmo dell'utente in un carico di lavoro variabile, il cui consumo dipende dal comportamento di esecuzione.
La chat tradizionale impone un limite naturale all'attività. Una persona pone una domanda, attende una risposta, la valuta e decide se proseguire.
L'esecuzione degli agenti rimuove alcune di queste pause. Il sistema può scegliere l'azione successiva, riportare i risultati precedenti nel contesto e continuare finché non raggiunge una condizione di arresto.
Ogni ciclo può aggiungere token di input mentre l'agente rilegge istruzioni, file, risposte degli strumenti e la cronologia accumulata. I token di output catturano soltanto una parte di questo carico di lavoro totale.
Le attività lunghe incontrano anche diramazioni. Un agente può provare un'implementazione, ispezionare un errore, rivedere il proprio piano ed eseguire un altro test.
Questi tentativi possono essere produttivi, perché il lavoro reale raramente segue un piano perfetto al primo tentativo. Possono anche trasformarsi in spreco quando l'agente non dispone delle informazioni, dell'autorizzazione o della capacità necessarie per concludere.
Questo rende il modello più economico una risposta incompleta al controllo dei costi. Un modello meno capace potrebbe usare meno risorse per chiamata, ma richiedere più tentativi e più correzioni umane.
OpenAI sostiene questa tesi nella propria guida agli investimenti in IA. Raccomanda di misurare attività completate, tempo risparmiato, decisioni migliorate e flussi di lavoro pronti a scalare.
L'azienda afferma che il prezzo per milione di token è diminuito del 97% tra GPT-4 e GPT-5.4. Afferma inoltre che GPT-5.6 ha usato il 54% in meno di token di output su un indice di agenti per il coding e ha completato le attività il 57% più rapidamente.
Si tratta di risultati benchmark riportati da OpenAI, non di una garanzia per il carico di lavoro di ogni cliente. Il contesto, gli strumenti, i criteri di valutazione e i costi dei fallimenti di un'azienda possono modificare il risultato.
La riduzione dei costi unitari non riduce necessariamente la spesa totale. L’utilizzo può espandersi più rapidamente di quanto migliori l’efficienza, soprattutto quando gli agenti operano più a lungo e in contemporanea.
Questa dinamica assomiglia più al cloud computing che alle tradizionali licenze software. La domanda dipende dal comportamento in esecuzione, dalla progettazione del carico di lavoro, dalla selezione del modello, dalla dimensione del contesto e dalle esecuzioni ripetute.
Introduce anche un problema di misurazione. Un elevato numero di token può indicare automazione di valore, un incarico difficile, contesto non necessario, fallimenti ripetuti o un agente che non si arresta in modo efficiente.
La ricerca indipendente offre agli acquirenti un motivo per trattare il consumo con cautela. Un paper del 2026 che ha esaminato attività di programmazione ha rilevato che i carichi di lavoro agentici utilizzavano molti più token rispetto alla chat sul codice o al ragionamento sul codice.
I ricercatori hanno riportato differenze nei consumi fino a 1.000 volte nel loro contesto sperimentale. Le esecuzioni dello stesso compito variavano fino a 30 volte.
Un maggiore utilizzo di token non produceva con costanza una maggiore accuratezza. Le prestazioni spesso raggiungevano il picco a un livello intermedio e poi si appiattivano all’aumentare del consumo.
Lo studio ha inoltre rilevato che i modelli faticavano a prevedere le proprie necessità di token. Le correlazioni riportate raggiungevano solo 0,39 e le stime sottovalutavano sistematicamente l’uso effettivo.
Questi risultati provengono da uno specifico insieme di attività e modelli di programmazione. Non dovrebbero essere generalizzati come moltiplicatore universale per ogni agente enterprise.
Dimostrano però perché un semplice budget per prompt diventi inaffidabile. La stessa richiesta può produrre percorsi di esecuzione e fabbisogni di risorse sostanzialmente diversi.
La risposta enterprise è già visibile. A giugno 2026 OpenAI ha aggiunto alla sua Global Admin Console una vista consolidata del consumo di crediti di ChatGPT e Codex.
Gli amministratori possono esaminare l’utilizzo per utente, prodotto e modello. Possono inoltre impostare predefiniti per lo spazio di lavoro, limiti per gruppo e deroghe individuali attraverso gli strumenti di controllo della spesa dell’azienda.
Databricks ha introdotto controlli simili nel proprio Unity AI Gateway. Il sistema può imporre limiti, rilevare consumi fuori controllo e raccomandare modelli meno costosi per attività adatte.
Questo livello di controllo emergente rivela la direzione del mercato. Il solo accesso ai modelli sta diventando insufficiente per l’implementazione enterprise.
Le organizzazioni hanno bisogno di attribuzione, policy, valutazione e intervento attorno a questo accesso. Devono collegare il consumo a un team responsabile e a un processo aziendale definito.
L’unità di misura più solida non è quindi il token. È il risultato completato secondo requisiti concordati di qualità, rischio e revisione.
Per un agente di programmazione, potrebbe trattarsi di una modifica accettata che supera i test e la revisione di sicurezza. Per la finanza, potrebbe essere un report riconciliato con input tracciabili.
Per il recruiting, potrebbe essere un flusso di lavoro che riduce l’impegno amministrativo senza prendere decisioni non autorizzate sui candidati. Ogni risultato richiede prove diverse.
Questo modello economico favorisce i flussi di lavoro che si ripetono spesso e possono essere valutati con chiarezza. Penalizza i compiti vaghi il cui successo dipende da impressioni soggettive.
Il passaggio agli agenti non rende inutile la misurazione dei token. Trasforma i conteggi di token in un segnale operativo tra molti, anziché in un indicatore sostitutivo del valore aziendale.
Cosa i numeri dei token non dimostrano
Le clamorose cifre di adozione interna di OpenAI mostrano domanda e intensità, ma lasciano irrisolti gli esiti in termini di produttività, qualità e sicurezza.
Il primo limite è la selezione. OpenAI è lo sviluppatore di Codex, impiega persone a proprio agio con l’AI sperimentale e può offrire loro un supporto al prodotto insolitamente diretto.
La sua forza lavoro non è un campione rappresentativo di banche, ospedali, agenzie governative, produttori o piccole imprese. Queste organizzazioni operano con vincoli tecnici e normativi diversi.
OpenAI trae inoltre vantaggio quando i clienti interpretano un maggiore utilizzo come prova di un’adozione più profonda. I suoi dati meritano attenzione, ma i lettori dovrebbero distinguere il comportamento misurato dalla previsione più ampia dell’azienda.
Il secondo limite riguarda i token come metrica di successo. Il volume dell’output mostra che i modelli hanno generato testo o codice. Non rivela quanto gli utenti abbiano effettivamente conservato.
Un agente può produrre una grande patch che uno sviluppatore rifiuta. Può generare un’analisi che un dipendente riscrive oppure creare un’automazione che non raggiunge mai la produzione.
Le stime di OpenAI sui compiti di lunga durata comportano una cautela simile. Un compito classificato come otto ore di lavoro umano non fa automaticamente risparmiare otto ore.
L’utente potrebbe comunque dedicare tempo alla preparazione degli input, al monitoraggio dell’esecuzione, alla verifica delle fonti, alla risoluzione degli errori e all’integrazione del risultato. Parte del lavoro potrebbe non essere mai avvenuta senza l’agente.
Quell’output ampliato può comunque essere prezioso. Tuttavia, il lavoro evitato è solo un possibile beneficio e richiede una misurazione diretta.
Il terzo limite è l’affidabilità. I compiti più lunghi creano più occasioni per errori, ipotesi obsolete, scelte errate degli strumenti o errori iniziali che influenzano le fasi successive.
Gli agenti con accesso ai sistemi enterprise creano anche un perimetro di sicurezza più ampio. Una risposta difettosa è dannosa, ma un’azione non autorizzata può essere molto più difficile da annullare.
Le autorizzazioni dovrebbero quindi corrispondere al compito, non alla capacità massima dell’agente. Accesso in lettura, accesso in scrittura, comunicazione esterna e azioni irreversibili meritano controlli separati.
I team di sicurezza hanno inoltre bisogno di registri che colleghino una richiesta umana a ogni azione dello strumento. Senza questa catena, la risposta agli incidenti e la responsabilità diventano difficili.
Il monitoraggio dei costi può creare un’altra tensione. Le aziende hanno bisogno di visibilità sufficiente per identificare sprechi e credenziali compromesse, ma una sorveglianza dettagliata dei dipendenti può indebolire la fiducia.
Un amministratore potrebbe dover sapere che un flusso di lavoro richiama ripetutamente un modello costoso. Non ha necessariamente bisogno di accesso illimitato a contenuti sensibili.
Una buona governance separa, quando possibile, i metadati operativi dai contenuti aziendali. Definisce inoltre chi può ispezionare ciascun livello e in quali circostanze.
Il quarto limite riguarda la generalizzazione oltre la programmazione. Codex può assistere i non sviluppatori, ma i dati di OpenAI mostrano comunque programmazione e ingegneria come categorie principali.
Il lavoro tecnico strutturato offre una validazione relativamente chiara. I test possono essere eseguiti, i file possono essere confrontati e gli errori possono attivare un nuovo tentativo.
L’analisi legale, il supporto alle assunzioni, la strategia e l’interpretazione finanziaria contengono spesso requisiti più soggettivi. Gli errori possono persistere più a lungo perché la validazione automatizzata è più debole.
Questa differenza rende la valutazione dei risultati più importante man mano che gli agenti entrano nelle funzioni aziendali. Le imprese non dovrebbero presumere che la velocità di adozione equivalga alla preparazione.
Il sentimento pubblico si è già spostato verso questa distinzione. Un’analisi della spesa per l’AI pubblicata a luglio ha descritto una crescente resistenza al "tokenmaxxing", la pratica di considerare un consumo elevato come un traguardo.
L’analista di Moody's Vincent Gusdorf ha avvertito che l’AI può rendere facile creare lavoro di cui un’organizzazione non ha bisogno. Questa critica colpisce direttamente la debolezza dei segnali di status basati sui token.
Un consumo elevato può essere razionale quando un agente produce un risultato di valore. Diventa più difficile da difendere quando nessun responsabile può collegare l’attività a un risultato accettato.
La posizione scettica corretta non è che gli agenti siano soltanto chatbot inefficienti. I dati di adozione di OpenAI sono troppo consistenti per liquidarli in questo modo.
La conclusione più difendibile è più circoscritta. Gli agenti ampliano la quantità e la portata del lavoro che l’AI può tentare, mentre le prove sul valore enterprise effettivamente realizzato restano disomogenee.
Un’azienda dovrebbe quindi testare la tesi di OpenAI nel proprio ambiente. Ciò richiede baseline, set di valutazione, costi di revisione, tassi di fallimento e risultati misurabili.
Dovrebbe inoltre confrontare un flusso di lavoro agentico con alternative realistiche. Tali alternative includono l’esecuzione umana, il software convenzionale, un’interazione chat più breve e un modello più piccolo.
Solo allora i leader possono individuare se l’aumento dell’uso di token rappresenti leva o attrito. I rapporti interni di OpenAI non possono rispondere a questa domanda al loro posto.
Tre segnali che gli acquirenti enterprise dovrebbero osservare
La prossima fase sarà decisa dalla rendicontazione dei risultati, dalla fidelizzazione degli utenti non tecnici e dai controlli di sicurezza, non da un altro record nel conteggio dei token.
Il primo segnale è se i fornitori collegano il consumo degli agenti ai risultati aziendali completati. Le dashboard di utilizzo attualmente enfatizzano crediti, utenti, modelli e tendenze.
Queste viste aiutano gli amministratori a individuare una domanda inattesa. Tuttavia, non mostrano ancora se un flusso di lavoro abbia prodotto un risultato accettato.
Gli acquirenti dovrebbero cercare report collegati a modifiche di codice approvate, casi di supporto risolti, analisi completate o altri output specifici del dominio. Il costo per risultato accettato renderebbe i confronti più significativi.
Se i fornitori offriranno un’attribuzione credibile dei risultati, l’argomento di OpenAI diventerà più forte. Le imprese potrebbero finanziare flussi di lavoro ad alto consumo quando il valore risultante è visibile.
Se i report resteranno incentrati sui token e sul tempo stimato, lo scetticismo crescerà. Le organizzazioni faticheranno a separare il lavoro produttivo intensivo dal lavoro fallito intensivo.
Il secondo segnale è l’uso sostenuto di Codex al di fuori dell’ingegneria. OpenAI riporta una crescita notevole tra i dipendenti di legale, finanza, recruiting, marketing e operazioni.
La domanda successiva è se questi utenti continuino dopo la sperimentazione iniziale. La fidelizzazione conta più di un rapido aumento da una piccola base di partenza.
Le imprese dovrebbero osservare quali attività non tecniche diventano flussi di lavoro ripetibili. Dovrebbero inoltre monitorare quanto spesso gli specialisti debbano recuperare o ricostruire il lavoro generato dagli agenti.
L’uso continuato con qualità stabile sosterrebbe l’affermazione di OpenAI secondo cui gli agenti permettono ai dipendenti di superare i confini funzionali. Un calo della fidelizzazione suggerirebbe che il valore più forte resti concentrato nei team tecnici.
Il terzo segnale è la maturità dei controlli attorno all’azione degli agenti. I limiti di spesa stanno arrivando rapidamente, ma il costo rappresenta solo una parte del rischio operativo.
Le organizzazioni hanno inoltre bisogno di autorizzazioni a livello di compito, punti di controllo per l’approvazione, chiamate agli strumenti verificabili, isolamento delle credenziali e interruzione affidabile quando il comportamento esce dai confini definiti.
Queste salvaguardie devono funzionare su più modelli e strumenti. Le imprese raramente standardizzano per sempre ogni flusso di lavoro su un unico fornitore.
I progressi in questo ambito renderebbero più facile giustificare una delega più ampia, soprattutto nei settori regolamentati. Controlli deboli o frammentati rallenterebbero l’adozione indipendentemente dalla capacità del modello.
Questi tre segnali sono collegati. La rendicontazione dei risultati spiega perché un agente merita risorse. La fidelizzazione mostra se i dipendenti lo ritengono utile dopo che la novità svanisce.
Sicurezza e governance determinano se l’organizzazione può consentire a quell’agente di svolgere lavoro con conseguenze rilevanti. L’assenza di uno qualsiasi dei tre può impedire un’implementazione di successo.
Il titolo di Google News coglie un passaggio reale dalla chat agli agenti, ma la quota di token è solo l’inizio della storia. Non è il punteggio finale.
OpenAI ha mostrato che i suoi dipendenti delegano sempre più compiti lunghi e complessi a Codex. Non ha dimostrato che il 99,8% dei token di output fornisca una quota equivalente di valore organizzativo.
Prima di celebrare o limitare quel consumo, gli acquirenti enterprise dovrebbero porsi una domanda pratica: quali risultati completati sono diventati possibili e quali prove dimostrano che valevano il rischio?
Questa domanda offre una guida migliore del solo volume di token. Consente alle organizzazioni di ampliare i flussi di lavoro che funzionano, limitare quelli che deragliano e giudicare l’adozione degli agenti in base ai risultati anziché all’attività.



