top of page

AT&T riduce i costi dell'AI del 90% con il routing dei modelli e modelli aperti

21 ago
Tempo di lettura: 15 min

AT&T afferma di aver ridotto alcuni costi dell'intelligenza artificiale fino al 90%, pur elaborando in media 45 miliardi di token al giorno. L'affermazione che raggiunge i lettori di Google News è sorprendente, ma il meccanismo conta più della percentuale in evidenza.

L'azienda non ha trovato un unico modello più economico in grado di sostituire ogni sistema premium. Ha creato un gateway che seleziona modelli diversi in base alla difficoltà prevista, alla velocità, alla qualità e al costo di ciascuna richiesta.

Questo approccio mette in discussione l'ipotesi secondo cui le imprese dovrebbero standardizzarsi su un unico modello di frontiera di OpenAI, Anthropic, Google o un altro grande fornitore. AT&T combina invece sistemi commerciali con modelli aperti più piccoli addestrati per il lavoro nelle telecomunicazioni.

La strategia comporta un chiaro compromesso. La scelta del modello può ridurre la spesa per l'inferenza e la dipendenza da un solo fornitore. Crea anche un complesso livello operativo che deve valutare qualità, sicurezza, latenza e guasti su numerosi sistemi.

I risultati di AT&T restano dichiarati dall'azienda e le prove pubbliche non forniscono un audit indipendente completo. Tuttavia, la sua scala rende questo qualcosa di più di un altro esperimento aziendale sull'AI.

AT&T ha portato il suo router di modelli in produzione

Il cambiamento importante di AT&T non è semplicemente l'adozione di modelli aperti. Ha inserito la selezione dei modelli tra dipendenti, applicazioni e i modelli che rispondono alle loro richieste.

Andy Markus, Chief Data and AI Officer di AT&T, ha descritto la strategia in un post aziendale del 23 luglio dedicato all'economia dell'AI. Secondo quell'aggiornamento sui costi dell'AI, l'azienda elabora in media 45 miliardi di token al giorno.

Un token è una piccola unità di testo o dati elaborata da un modello. Il volume di token diventa una misura operativa utile perché la maggior parte dei servizi AI ospitati addebita costi in base al consumo di input e output.

Inviare ogni token al modello più capace sarebbe semplice. Sprecherebbe però costosa capacità di ragionamento per attività di routine come estrazione, classificazione, sintesi e preparazione dei dati.

L'AI Gateway proprietario di AT&T cerca di evitare questo spreco. Il gateway usa un routing consapevole della cache, che considera se esistano già informazioni riutilizzabili prima di scegliere un modello.

A ogni turno, il sistema bilancia la qualità prevista della risposta con velocità e costo. Può inoltre cambiare modello durante una conversazione multi-turno, anziché mantenere l'intera sessione con un unico fornitore.

Questa capacità a metà sessione è importante. Una conversazione può iniziare con una ricerca di base, passare a un'analisi specializzata della rete e concludersi con una raccomandazione complessa.

Un'assegnazione statica tratterebbe questi passaggi come un unico carico di lavoro. Il routing dinamico può inviarli a sistemi diversi in base ai loro requisiti.

AT&T afferma che questo processo ha ridotto i relativi costi dell'AI fino al 90% e sta già facendo risparmiare milioni. Queste dichiarazioni descrivono un uso in produzione, non un benchmark di laboratorio.

Tuttavia, AT&T non ha reso pubblico il denominatore alla base della cifra del 90%. Non ha divulgato la quota di traffico che riceve la riduzione massima né un confronto dettagliato della qualità.

L'affermazione va quindi letta come un risultato aziendale al limite superiore. Non dovrebbe essere considerata un risparmio garantito per ogni applicazione o impresa.

Anche con questo limite, il volume divulgato conferisce peso al risultato. Piccoli miglioramenti nel routing si accumulano quando un'azienda elabora decine di miliardi di token ogni giorno.

Il sistema riflette anche le precedenti scelte architetturali di AT&T. Ask AT&T inizialmente si basava sulla tecnologia di OpenAI, ma l'operatore lo ha progettato per supportare algoritmi di altre aziende.

Questa flessibilità era evidente quando Ask AT&T è stato lanciato nel 2023. L'assistente interno supportava programmazione, servizio clienti, traduzione, ricerca di documenti, ottimizzazione della rete e lavoro su software legacy.

L'attuale gateway di AT&T trasforma questa opzionalità in una politica operativa. Le applicazioni non devono più prendere autonomamente ogni decisione relativa ai modelli.

Il gateway diventa un punto di controllo per routing, caching, misurazione e governance. Può applicare regole coerenti anche quando i fornitori rilasciano nuovi modelli o modificano i termini dei loro servizi.

Ecco perché la notizia che appare attraverso Google News è più ampia di un annuncio di riduzione dei costi. AT&T tratta la selezione dei modelli come infrastruttura aziendale, anziché come un'impostazione dell'applicazione.

Perché il routing dei modelli cambia l'economia dell'AI aziendale

Il router sposta la competizione dalla ricerca di un unico modello universalmente superiore alla ricerca del modello meno costoso che soddisfi i requisiti di ciascuna attività.

L'adozione dell'AI nelle imprese spesso inizia con uno schema semplice. Un team sceglie un modello ospitato di punta, collega le informazioni aziendali e amplia l'accesso dopo un progetto pilota riuscito.

I costi diventano più difficili da prevedere quando l'uso va oltre i dipendenti che pongono domande occasionali. I flussi di lavoro automatizzati possono generare prompt ripetuti, contesti lunghi, chiamate a strumenti, tentativi ripetuti e output intermedi.

Gli agenti aumentano questa pressione perché una richiesta dell'utente può attivare molte chiamate al modello. Un flusso di lavoro potrebbe recuperare record, classificare documenti, creare un piano, chiamare strumenti software, ispezionare i risultati e rivedere la propria risposta.

L'utente vede un'unica attività completata. L'impresa paga ogni passaggio necessario per produrla.

Il router di AT&T affronta questo problema prima che avvenga il consumo. Cerca di selezionare il modello appropriato a ogni turno, invece di analizzare gli sprechi dopo l'arrivo di una fattura.

È paragonabile all'assegnazione del lavoro in un team eterogeneo. Le richieste di routine non richiedono sempre l'esperto più specializzato, mentre le decisioni difficili giustificano comunque un'escalation.

L'analogia ha dei limiti perché un router deve formulare automaticamente quel giudizio. Una decisione errata può produrre una risposta debole prima che qualcuno riconosca la necessità di un modello più potente.

AT&T afferma che il suo gateway stima la qualità prevista dell'output insieme a costo e velocità. Questa soglia di qualità è la componente centrale, anche se la percentuale di risparmio attira maggiore attenzione.

Un routing basato solo sul costo favorirebbe costantemente il modello più piccolo disponibile. Il routing in produzione deve invece identificare l'opzione meno costosa che rimanga accettabile per un'attività specifica.

Il sistema risultante può offrire alle imprese maggiore leva negoziale. Un'azienda in grado di spostare i carichi di lavoro tra fornitori subisce meno pressione ad accettare i limiti tecnici o i termini commerciali di un singolo venditore.

La strategia cambia anche il modo in cui vengono costruite le applicazioni. Gli sviluppatori possono richiedere una capacità o un livello di servizio senza vincolare permanentemente ogni funzionalità a un solo modello.

Questa astrazione può abbreviare le future migrazioni. Può anche consentire ai team di valutare un nuovo modello rispetto a categorie di carico di lavoro reali prima di concedergli un accesso più ampio.

L'approccio di AT&T assegna ai modelli di frontiera un ruolo più ristretto. Diventano destinazioni di escalation per richieste che richiedono un intenso ragionamento, anziché i motori predefiniti per ogni interazione.

Ciò non significa che i sistemi di frontiera perdano valore. Significa che il loro valore deve essere abbinato a lavori che i modelli più piccoli non possono completare in modo affidabile.

Osservatori indipendenti vedono l'approccio come parte di un più ampio schema aziendale. Roy Chua, principal di AvidThink, ha dichiarato a Mobile World Live che le imprese leader usano gateway di routing per controlli su costi, sicurezza, caching e audit.

Scott Raynovich, fondatore di Futuriom, ha sostenuto che i modelli aperti possono supportare dati aziendali proprietari senza lasciare le aziende dipendenti dai più costosi sistemi di frontiera.

Questi commenti supportano l'architettura, ma non convalidano indipendentemente il risparmio riportato da AT&T. La distinzione è importante perché architettura e risultati aziendali misurati sono questioni separate.

Il router concentra anche l'autorità. Chi controlla il gateway determina quali modelli ricevono traffico, quali soglie di qualità si applicano e come vengono gestiti i guasti.

Questa posizione sta diventando strategicamente preziosa. I fornitori di modelli competono sull'intelligenza, mentre i livelli di routing osservano la domanda tra applicazioni e fornitori.

Un router può apprendere quale modello offre buone prestazioni per programmazione, assistenza clienti, standard delle telecomunicazioni, analisi delle frodi o estrazione di documenti. Questa cronologia delle prestazioni diventa un utile dato operativo.

Per gli acquirenti aziendali, la lezione è pratica. I benchmark dei modelli da soli non possono spiegare l'economia di un programma AI in produzione.

La composizione del carico di lavoro conta altrettanto. Un'organizzazione deve sapere quali attività sono comuni, quali sono costose e quali richiedono realmente un ragionamento di livello frontiera.

I team hanno inoltre bisogno di criteri di valutazione tracciabili. Senza di essi, il routing può diventare un meccanismo opaco che scambia silenziosamente la qualità delle risposte con un minore consumo.

Un flusso di lavoro AI ricercabile può aiutare i team a conservare decisioni, evidenze e output. Questo registro diventa più importante quando diversi modelli contribuiscono a un unico processo.

La copertura di Google News può far apparire la cifra del 90% come un singolo progresso tecnico. Il metodo effettivo di AT&T è una disciplina continua che coinvolge classificazione, valutazione, caching e misurazione dei carichi di lavoro.

I modelli aperti per le telecomunicazioni offrono ad AT&T un'altra leva sui costi

Il routing riduce i consumi non necessari, mentre i modelli aperti specifici per il dominio offrono al router opzioni meno costose che comprendono terminologia e operazioni delle telecomunicazioni.

AT&T ha abbinato il suo gateway a OTel 2.0, una famiglia di modelli aperti adattata alle telecomunicazioni. L'azienda ha sviluppato i modelli con dati del settore e una combinazione di piattaforme di calcolo.

Un modello specifico per il dominio viene addestrato o adattato per un campo delimitato anziché per la conversazione generale. Il suo focus più ristretto può migliorare le prestazioni su vocabolario specializzato, documenti e domande operative.

Le telecomunicazioni rappresentano un test difficile. I modelli potrebbero dover interpretare standard tecnici, topologia di rete, telemetria delle apparecchiature, configurazioni radio e sistemi di più fornitori.

Un modello generale può discutere questi argomenti in termini ampi. Potrebbe comunque non avere la precisione necessaria per le operazioni di rete, dove una risposta plausibile ma errata può avere conseguenze gravi.

GSMA Intelligence sostiene che i modelli adattati al dominio possano essere più piccoli pur rimanendo competitivi nelle attività delle telecomunicazioni. La sua analisi di OTel presenta la strategia di AT&T come un'alternativa all'instradamento di ogni richiesta attraverso un modello generale di frontiera.

AT&T afferma di aver post-addestrato OTel 2.0 usando oltre 400 miliardi di token su GPU AMD. Il più ampio flusso di sviluppo ha elaborato approssimativamente mille miliardi di token.

Microsoft afferma che AT&T ha usato circa 530 GPU tramite Foundry Managed Compute. Questo totale comprendeva 430 GPU AMD Instinct MI300X e molteplici architetture hardware.

La pipeline di sviluppo dei modelli ha inoltre distribuito il lavoro tra diversi modelli aperti. Phi-4 di Microsoft ha gestito la preparazione dei dati e la generazione di dati sintetici, elaborando oltre 700 miliardi di token al mese.

Altri modelli hanno supportato attività di ragionamento e sviluppo. Ciò rispecchia la filosofia del gateway in produzione: un modello non deve dominare ogni fase.

Microsoft afferma che la generazione di dati con modelli aperti ha fatto risparmiare decine di milioni rispetto all'uso di modelli di frontiera per lo stesso lavoro di sviluppo. Si tratta di un confronto riportato da un partner, non di un audit finanziario neutrale.

Tuttavia, l’account Microsoft fornisce dettagli tecnici che vanno oltre il più breve annuncio di AT&T. Mostra che la scelta del modello e quella dell’hardware sono state trattate come decisioni correlate.

I modelli aperti possono essere eseguiti su infrastrutture dedicate, anziché soltanto tramite un’interfaccia di programmazione delle applicazioni controllata dal fornitore. Le aziende possono quindi valutare diverse combinazioni di modelli, acceleratori, cloud e sistemi on-premises.

Questa flessibilità sostiene il dichiarato interesse di AT&T per la sovranità. In questo contesto, sovranità significa controllare i flussi di dati, le scelte di distribuzione e le dipendenze dai fornitori.

Non significa che AT&T abbia eliminato la tecnologia esterna. Il progetto utilizza infrastruttura Microsoft, hardware AMD, dati GSMA e modelli sottostanti creati altrove.

La strategia si comprende meglio come dipendenza diversificata. AT&T sta cercando di evitare che un singolo modello, fornitore di chip, cloud o ambiente di sviluppo diventi insostituibile.

Questa posizione può migliorare il potere negoziale. Se l’azienda dimostra risultati comparabili su più piattaforme, il cambio di fornitore diventa più credibile durante le trattative di approvvigionamento.

I modelli aperti consentono inoltre un adattamento più profondo al dominio. AT&T può addestrarli su materiale telecom approvato e calibrare la valutazione su attività specifiche della rete.

GSMA afferma che il materiale di partenza iniziale includeva standard e documenti di settore. Tra i contributori figuravano organismi e progetti che coprono reti radio, interfacce, API e operazioni telecom.

La famiglia di modelli è destinata anche a un uso più ampio nel settore. Rendere l’output disponibile ad altri può incoraggiare test condivisi, estensioni e applicazioni specializzate.

Tuttavia, “open source” richiede un’interpretazione attenta nell’AI. Una release può fornire pesi e diritti d’uso senza rendere pubblici tutti i record di addestramento, le decisioni di filtraggio o i metodi di sviluppo.

Le organizzazioni che valutano OTel 2.0 devono esaminare la licenza effettiva, la documentazione, le informazioni divulgate sui dati e i requisiti di distribuzione. L’etichetta da sola non risponde alle questioni di governance.

Le dimensioni del flusso di lavoro di addestramento mostrano inoltre che aperto non significa gratuito. GPU dedicate, lavoro ingegneristico, controlli di sicurezza, valutazione e inferenza continua comportano tutti costi.

AT&T può giustificare questi investimenti perché opera su una scala insolita. Un’azienda più piccola potrebbe spendere di più per costruire e gestire un portafoglio di modelli di quanto risparmi attraverso il routing.

Questa differenza di scala limita l’imitazione diretta. L’idea trasferibile non è che ogni azienda debba addestrare un modello telecom.

La lezione più ampia consiste nel combinare la scelta del modello con evidenze specifiche per il carico di lavoro. Un’impresa dovrebbe utilizzare un modello aperto quando prestazioni nel dominio, controllo ed economia operativa giustificano la responsabilità aggiuntiva.

Il risparmio del 90% richiede comunque un audit della qualità

AT&T ha divulgato un meccanismo credibile e una sostanziale scala operativa, ma non ha pubblicato prove sufficienti per verificare indipendentemente il risultato principale.

La prima incertezza riguarda l’ambito. “Fino al 90%” descrive la maggiore riduzione riportata, non necessariamente la media dell’intero parco AI di AT&T.

Le divulgazioni pubbliche non identificano il mix di modelli di riferimento. Non mostrano neppure quanto traffico sia stato spostato verso modelli più piccoli, con quale frequenza il router abbia effettuato escalation o come i risparmi siano variati per applicazione.

La seconda incertezza riguarda la qualità. AT&T afferma che il routing non compromette la qualità, ma i lettori non possono esaminare soglie di accettazione a livello di attività né risultati di valutazione.

Questa omissione è significativa perché la qualità non è una sola misurazione. Un riepilogo per il servizio clienti, una raccomandazione di rete, una patch software e un avviso di frode richiedono ciascuno standard diversi.

Un router può ridurre la spesa media inviando più traffico a modelli più piccoli. Il risultato ha valore solo se tali modelli restano affidabili per il lavoro loro assegnato.

La valutazione deve inoltre rilevare i guasti rari. Un punteggio medio può nascondere un piccolo numero di errori costosi nelle operazioni di rete o nei flussi di lavoro regolamentati.

La revisione umana rimane importante. Quando Ask AT&T è stato lanciato, Markus ha dichiarato che gli esperti di dominio dovevano ancora verificare il codice generato e altri output rilevanti.

Il routing non elimina questo requisito. Aggiunge un’altra decisione che i team devono monitorare, poiché un’applicazione può comportarsi diversamente quando cambia il modello selezionato.

Il funzionamento consapevole della cache introduce preoccupazioni correlate. Riutilizzare calcoli precedenti può ridurre il consumo, ma le informazioni memorizzate nella cache devono rimanere aggiornate, correttamente circoscritte e protette.

Una risposta adatta a un dipendente o cliente non può essere riutilizzata automaticamente per un altro. Identità, autorizzazioni, area geografica e politiche di conservazione dei dati devono seguire la richiesta.

I team di sicurezza devono inoltre valutare ogni fornitore e modello connesso. Un sistema multi-modello crea più integrazioni, credenziali, registri, confini di policy e possibili modalità di guasto.

Il gateway può centralizzare questi controlli, ed è un vantaggio. Tuttavia, la centralizzazione rende anche il gateway un bersaglio di alto valore e una dipendenza critica.

Se la sua logica di classificazione fallisce, un’attività sensibile potrebbe raggiungere un modello non approvato. Se il servizio non è disponibile, molte applicazioni a valle possono fallire contemporaneamente.

La latenza presenta un altro compromesso. Il router deve ispezionare informazioni sufficienti per scegliere un modello e una valutazione complessa può ritardare la risposta.

La cache può compensare parte del ritardo, mentre i modelli più piccoli possono rispondere più rapidamente. Il risultato complessivo dipende dall’overhead del routing, dalla progettazione dell’applicazione e dal modello selezionato.

Anche la diversità dei fornitori crea lavoro operativo. I provider usano interfacce, limiti di contesto, formati di tool calling, controlli di sicurezza e calendari di aggiornamento diversi.

Un gateway può normalizzare una parte di questa variazione. Non può garantire che due modelli interpretino in modo identico ogni istruzione o formato di output strutturato.

Gli aggiornamenti dei modelli rendono il problema continuo. Un percorso che ha funzionato bene il mese scorso può diventare inferiore dopo che un provider modifica il comportamento o rilascia un sostituto.

AT&T deve quindi mantenere le valutazioni anziché certificare ogni percorso una sola volta. Le tracce di produzione dovrebbero rivelare tassi di errore, escalation, latenza e correzioni umane per carico di lavoro.

Le distribuzioni di modelli aperti aggiungono considerazioni sulla catena di fornitura. I team devono tracciare pesi, librerie, licenze, provenienza dei modelli e vulnerabilità nell’intero stack di serving.

La qualità dei dati è un altro vincolo. Un modello telecom addestrato su standard e materiale sintetico può comunque ereditare lacune, assunzioni obsolete o una copertura debole di apparecchiature insolite.

Un risultato in classifica offre prove utili, ma non riproduce ogni condizione di rete reale. Le valutazioni in produzione devono riflettere i dati, gli strumenti e le conseguenze operative di AT&T.

L’ultima incertezza è organizzativa. Un router tecnicamente valido non può correggere un flusso di lavoro poco chiaro o un’applicazione priva di responsabili identificabili.

I dirigenti di AT&T hanno enfatizzato flussi di lavoro end-to-end anziché attività AI isolate. Questa distinzione conta perché i risparmi locali possono svanire quando i dipendenti devono successivamente correggere output deboli.

Le aziende che considerano sistemi simili dovrebbero calcolare il costo totale del processo. La contabilità dovrebbe includere consumo dei modelli, infrastruttura, valutazioni, ingegneria, sicurezza, revisione e recupero dai guasti.

Dovrebbero inoltre confrontare i risultati completati, non solo i token. Una risposta più economica non è conveniente quando causa un’altra chiamata, un’altra esecuzione del modello o rilavorazioni manuali.

Nessuno di questi rischi smentisce il risultato di AT&T. Spiegano perché la percentuale riportata dovrebbe avviare un processo di due diligence anziché concluderlo.

Per i lettori di Google News, l’interpretazione responsabile è circoscritta. AT&T afferma che il suo gateway ha prodotto riduzioni fino al 90%, ma l’applicabilità più ampia resta non verificata.

Cosa osservare dopo la dichiarazione di AT&T sui costi dell’AI

Tre segnali mostreranno se AT&T ha costruito un’architettura enterprise ripetibile o documentato un insieme di carichi di lavoro insolitamente favorevole.

Il primo segnale è una scheda di valutazione di produzione più dettagliata. AT&T dovrebbe divulgare i risparmi medi per categorie di carico di lavoro, non solo la riduzione più elevata.

Una reportistica utile separerebbe assistenza clienti, coding, recupero documentale, analisi di rete, rilevamento delle frodi e flussi di lavoro autonomi. Ogni categoria ha una soglia di qualità e un profilo di modello diversi.

Una solida scheda di valutazione includerebbe tassi di escalation, latenza, tassi di errore e correzioni umane. Mostrerebbe inoltre se il consumo continua a crescere dopo la riduzione dei costi unitari.

Se i costi medi restano sotto controllo mentre il volume si espande, la tesi di AT&T sul routing dei modelli diventa più forte. Se i risparmi si concentrano in un piccolo gruppo di attività semplici, l’affermazione diventa meno trasferibile.

Il secondo segnale è una valutazione indipendente di OTel 2.0. Le classifiche di settore offrono un punto di partenza, ma gli operatori hanno bisogno di test legati a decisioni di rete reali.

I valutatori dovrebbero confrontare il modello con sistemi generali più grandi su interpretazione degli standard, analisi della topologia, ragionamento sulla telemetria, troubleshooting e uso degli strumenti.

Dovrebbero inoltre documentare dove il modello più piccolo fallisce. Un modello di dominio affidabile necessita di chiari confini di escalation, non soltanto di punteggi aggregati elevati.

L’adozione di OTel 2.0 al di fuori di AT&T aggiungerebbe un’altra forma di evidenza. Altri operatori possono verificare se i vantaggi riportati resistono in reti, fornitori, lingue e normative differenti.

Una distribuzione esterna significativa sosterrebbe l’argomentazione di AT&T secondo cui modelli aperti specializzati possono servire un settore. Un’adozione limitata suggerirebbe che l’economia dipende in larga misura dalla scala e dai dati interni di AT&T.

Il terzo segnale è il modo in cui reagiscono i fornitori di modelli frontier e infrastrutture. La strategia di AT&T li spinge a giustificare il consumo premium per ogni carico di lavoro.

I provider possono rispondere con modelli più piccoli, sistemi a minore latenza, cache più efficaci, routing automatizzato o contratti enterprise più prevedibili. Possono anche migliorare l’adattamento al dominio e le opzioni di distribuzione privata.

La concorrenza al livello del routing merita particolare attenzione. Aziende cloud, provider di modelli, gateway indipendenti e fornitori di software enterprise vogliono tutti influenzare la selezione dei modelli.

Se il routing diventa standardizzato, le imprese possono spostare i carichi di lavoro più liberamente. Se ogni piattaforma sviluppa un router proprietario, la dipendenza dai fornitori potrebbe semplicemente spostarsi verso l’alto.

Anche la diversità hardware sarà importante. L’uso da parte di AT&T di AMD e di altre architetture verifica se le imprese possano evitare di legare l’economia dell’AI a una sola roadmap di acceleratori.

Prestazioni coerenti tra hardware rafforzerebbero l’argomento della sovranità. Migrazioni difficili o supporto software disomogeneo esporrebbero il costo del mantenimento di tale flessibilità.

L’esperienza di AT&T offre inoltre agli acquirenti enterprise una checklist pratica. Possono iniziare misurando le richieste in base ad attività, rischio, latenza, qualità e risultato aziendale completato.

Successivamente, possono verificare se modelli più piccoli soddisfano carichi di lavoro definiti in modo ristretto. Solo allora dovrebbero introdurre il routing automatizzato tra opzioni approvate.

La governance deve arrivare prima del traffico su larga scala. I team hanno bisogno di controlli degli accessi, registri, gate di valutazione, regole di fallback, procedure di incidente e responsabili nominati per ogni percorso di produzione.

L’obiettivo non è massimizzare la quota di richieste gestite a basso costo. È minimizzare il costo del lavoro accettabile e completato.

Questa distinzione mantiene il router allineato ai risultati aziendali. Impedisce inoltre che un obiettivo di costo indebolisca silenziosamente il servizio clienti, l’affidabilità della rete o la fiducia dei dipendenti.

AT&T ha presentato uno degli esempi più chiari, nelle grandi imprese, di questa architettura. La combinazione di 45 miliardi di token giornalieri, routing dinamico e modelli specifici per il dominio merita attenzione.

L’azienda non ha dimostrato che ogni organizzazione possa riprodurre una riduzione del 90%. Ha mostrato perché, su scala di produzione, diventa difficile pagare un unico modello per gestire ogni attività.

La prossima fase dipenderà dalle prove, non da un altro titolo. Da osservare: i risparmi medi, la validazione esterna di OTel 2.0 e le risposte dei fornitori all’acquisto multi-modello.

Questi segnali determineranno se l’affermazione di Google News diventerà un modello operativo per il settore o resterà un risultato impressionante, plasmato dalla scala insolita di AT&T. I team aziendali dovrebbero iniziare subito a misurare il proprio mix di carichi di lavoro, prima di scegliere un router o addestrare un altro modello.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page