top of page

La distribuzione dell'alimentazione IA di Intel entra nel chip mentre l'alimentazione dei rack raggiunge i suoi limiti

6 giorni fa
Tempo di lettura: 16 min

Intel Foundry ha delineato una strategia di alimentazione multilivello, mentre i moderni package per acceleratori IA entrano nella fascia dei multi-kiloampere. L'azienda sostiene che cablaggi, condensatori e regolatori sulla scheda madre convenzionali non possano più sostenere una maggiore densità di calcolo attraverso soli cambiamenti incrementali.

Il nuovo documento sulla distribuzione dell'alimentazione collega diverse tecnologie che di solito ricevono attenzione separatamente. Tra queste figurano la distribuzione dell'alimentazione sul retro PowerVia, condensatori integrati, bridge chiplet avanzati e regolatori di tensione integrati.

Questa combinazione conta perché il problema dell'alimentazione ora si estende dalla distribuzione nel data center fino ai singoli transistor. NVIDIA, Google e Microsoft stanno promuovendo la distribuzione in corrente continua a 800 volt a livello di struttura. Intel si concentra sulle fasi finali, dove migliaia di ampere devono raggiungere una logica densamente integrata senza perdite o variazioni di tensione inaccettabili.

Il conflitto non riguarda più semplicemente prestazioni contro consumo di elettricità. I progettisti di chip devono decidere dove avviene la conversione della tensione, come l'alimentazione raggiunge ciascun die e come la carica immagazzinata risponde a carichi di lavoro improvvisi.

Intel non sostiene che una sola architettura risolva ogni caso. La sua posizione è più rilevante: la distribuzione dell'alimentazione nei data center IA è diventata un problema di progettazione dell'intero stack, in cui ogni livello influenza il successivo.

La distribuzione dell'alimentazione IA di Intel è ora un problema di stack

L'argomento centrale di Intel è che la distribuzione dell'alimentazione è diventata un limite diretto alle prestazioni utilizzabili degli acceleratori.

Un acceleratore IA opera a una bassa tensione di core pur consumando una potenza considerevole. Poiché la potenza elettrica è uguale alla tensione moltiplicata per la corrente, una tensione più bassa richiede una corrente più elevata per la stessa potenza erogata.

Intel afferma che gli attuali package per acceleratori richiedono già più kiloampere. Questa corrente deve attraversare un'area ristretta occupata da die di calcolo, memoria ad alta larghezza di banda, interconnessioni, componenti di raffreddamento e connessioni del package.

La sfida diventa più difficile durante rapidi cambiamenti del carico di lavoro. Ampie aree di un acceleratore possono passare da un'attività limitata a un'elaborazione intensa nel giro di pochi cicli di clock. Questa transizione crea un transitorio di corrente, ossia il carico richiede molta più corrente quasi immediatamente.

Una rete di distribuzione dell'alimentazione non può rispondere senza resistenza e ritardo. Il conseguente calo di tensione riduce la tensione disponibile ai transistor proprio quando l'attività aumenta. I progettisti compensano con margini di sicurezza, che forniscono tensione aggiuntiva per l'affidabilità ma consumano più energia.

Intel illustra questa pressione con un modello che confronta processori da 1 kilowatt e 5 kilowatt. Nel suo esempio da 1 kilowatt, il sistema richiede 1.252 watt all'ingresso del regolatore sulla scheda madre.

Nell'esempio da 5 kilowatt, l'input richiesto sale a 8.301 watt. Intel attribuisce il divario crescente alle perdite del regolatore, alle perdite resistive e alla potenza riservata per contrastare il calo di tensione.

Queste cifre rappresentano l'analisi modellata di Intel, non misurazioni di un acceleratore commerciale divulgato. Tuttavia, mostrano perché l'efficienza possa deteriorarsi all'aumentare della corrente. Le perdite causate dalla resistenza aumentano con il quadrato della corrente, quindi scalare la corrente produce una penalità sproporzionata.

La complessità del package aggiunge un altro vincolo. Un acceleratore moderno può combinare tile di calcolo, die di input e output, memoria ad alta larghezza di banda e bridge in silicio. Ogni componente può avere requisiti di tensione e comportamento transitorio diversi.

L'alimentazione deve raggiungere questi componenti attraverso substrati, bump, bridge e via attraverso il silicio. Un via attraverso il silicio, o TSV, è una connessione elettrica verticale che attraversa il silicio.

I progetti tradizionali sul lato frontale fanno inoltre competere fili di segnale e linee di alimentazione per lo spazio di instradamento. Ulteriori strati di cablaggio possono ridurre la congestione, ma possono allungare il percorso tra la sorgente di alimentazione e i circuiti attivi.

Quel percorso più lungo aggiunge resistenza. Aumenta inoltre la tensione persa prima che l'elettricità raggiunga i transistor.

Il problema si estende oltre il package. Intel stima che i rack tradizionali supportassero comunemente circa 10-20 kilowatt e facessero principalmente affidamento sul raffreddamento ad aria. I moderni rack IA superano già i 100 kilowatt e spesso richiedono il raffreddamento a liquido.

Le roadmap del settore indicano ora un consumo dei rack prossimo a un megawatt entro la fine del decennio. Un rack a quel livello non può limitarsi ad aggiungere più cavi, regolatori e apparecchiature di raffreddamento convenzionali.

Una maggiore potenza del rack riduce lo spazio disponibile per questi sistemi di supporto. Rende inoltre più costose piccole perdite di efficienza, perché ogni watt sprecato diventa calore che deve essere rimosso.

Il risultato è una catena di dipendenze. La tensione della struttura influenza la distribuzione nel rack. La distribuzione nel rack influenza il progetto della scheda. La tensione della scheda influenza il posizionamento dei regolatori, mentre il posizionamento dei regolatori influenza l'instradamento del package e il raffreddamento.

La distribuzione dell'alimentazione IA di Intel non può quindi essere valutata come una caratteristica di un singolo componente. Il suo valore dipende dal fatto che questi livelli operino come un'unica rete coordinata.

PowerVia separa i cavi di alimentazione dal traffico dei segnali

PowerVia modifica il percorso fisico verso lo strato dei transistor spostando il cablaggio di alimentazione principale dietro il silicio.

I chip convenzionali trasportano sia i segnali sia l'alimentazione attraverso strati metallici sopra i transistor. Man mano che i progetti diventano più densi, le due reti competono per uno spazio di instradamento sempre più limitato.

PowerVia, l'architettura di distribuzione dell'alimentazione sul retro di Intel, offre all'alimentazione un percorso separato. Colloca cablaggi e connessioni di alimentazione di grandi dimensioni sul retro del die, preservando gli strati frontali per i segnali.

L'architettura fa più che liberare la congestione del cablaggio. Accorcia il percorso resistivo tra le connessioni di alimentazione esterne e i circuiti attivi. Ciò può ridurre la caduta IR, ossia la tensione persa quando la corrente attraversa una resistenza.

Intel ha introdotto PowerVia con il suo processo produttivo Intel 18A. L'azienda afferma che la tecnologia migliora l'instradamento dei segnali, l'utilizzo delle celle standard e la stabilità della tensione sotto carichi impegnativi.

Un brief su Intel 18A sostiene che PowerVia possa offrire fino al 10 percento in più di utilizzo delle celle. Sostiene inoltre un incremento prestazionale fino al 4 percento a potenza costante.

Queste cifre dipendono da progetto e configurazione. Non dovrebbero essere interpretate come miglioramenti automatici per ogni processore realizzato con Intel 18A.

L'alimentazione sul retro modifica anche i requisiti termici, di test e di produzione. Il retro del die non è più soltanto una superficie strutturale o un percorso semplice verso il sistema di raffreddamento.

Le connessioni di alimentazione devono coesistere con la rimozione del calore e con strutture di packaging avanzato. Gli ingegneri necessitano inoltre di metodi diversi per ispezionare ed eseguire il debug dei circuiti quando l'alimentazione entra dal basso.

Intel ha affrontato alcuni di questi problemi mediante chip di test prima di inserire PowerVia nella propria roadmap produttiva. Tuttavia, i prodotti dei clienti restano la prova più importante, perché i progetti commerciali introducono sistemi più grandi e carichi di lavoro diversificati.

La successiva iterazione di Intel alza la posta. Intel 18A-P aggiunge Power Boost, un'architettura a doppio contatto che collega contatti frontali e posteriori. Intel riporta oltre il 10 percento di frequenza in più a capacità equivalente per questo approccio.

Intel 14A è previsto introdurre PowerDirect, la seconda generazione della sua tecnologia sul retro. Intel afferma che PowerDirect punterà a ulteriori miglioramenti nell'area e nella distribuzione dell'alimentazione.

Questi sviluppi collocano Intel in una più ampia competizione produttiva. Anche TSMC e Samsung stanno sviluppando tecnologie di alimentazione sul retro, sebbene le loro implementazioni e i calendari produttivi differiscano.

La competizione rilevante non riguarda solo quale fonderia introdurrà per prima il cablaggio sul retro. I clienti confronteranno resa, complessità di progettazione, comportamento termico, strumenti disponibili e vantaggi nei prodotti completi.

Questo crea pressione sui fornitori di automazione della progettazione elettronica. Il loro software deve comprendere la connettività sul retro, i vincoli di posizionamento, l'instradamento del clock, le interazioni termiche e il comportamento delle nuove reti di alimentazione.

Cambia anche la pianificazione della progettazione. La distribuzione dell'alimentazione non può più attendere che la maggior parte delle decisioni logiche e fisiche sia completata. Gli architetti devono considerare i percorsi di alimentazione insieme a chiplet, memoria, raffreddamento e interfacce di segnale.

Per le aziende di acceleratori IA, l'attrattiva è chiara. Liberare risorse sul lato frontale può supportare una maggiore larghezza di banda dei segnali, accorciando al contempo il percorso utilizzato dall'alta corrente.

Tuttavia, PowerVia affronta solo il percorso continuo che trasporta l'elettricità. Non fornisce la carica immagazzinata localmente necessaria quando un acceleratore cambia improvvisamente attività.

Questa esigenza porta i condensatori al centro della strategia di Intel.

I condensatori integrati diventano parte dell'architettura del package

Intel distribuisce i condensatori attraverso il die e il package perché nessun singolo livello di accumulo può coprire ogni scala temporale dei transitori.

Un condensatore di disaccoppiamento immagazzina una piccola quantità di carica elettrica vicino a un circuito. Rilascia tale carica quando la domanda aumenta più rapidamente di quanto la rete di alimentazione più ampia possa rispondere.

I sistemi tradizionali collocano condensatori sulla scheda madre e sul package. I moderni package per acceleratori lasciano meno spazio a questi componenti, perché i die di calcolo e la memoria occupano gran parte della superficie superiore.

Anche il lato inferiore è affollato. Le connessioni ball-grid devono trasportare corrente e segnali di input-output tra il package e la sua scheda.

La distanza conta durante un transitorio rapido. Un condensatore situato più lontano dal carico deve fornire energia attraverso un percorso più lungo, più resistivo e più induttivo.

La prima risposta di Intel è Omni MIM, un condensatore metallo-isolante-metallo sul die. A differenza dei vecchi progetti planari, Omni MIM estende verticalmente le strutture del condensatore attraverso trincee.

Questa struttura tridimensionale aumenta la densità di capacità senza consumare la stessa quantità di area orizzontale in silicio. Posizionarla vicino ai circuiti attivi la aiuta a rispondere a variazioni di alimentazione ad alta frequenza.

La capacità sul die resta tuttavia limitata. La sua carica immagazzinata deve infine essere reintegrata da un condensatore più grande a un altro livello.

Intel sta quindi sviluppando eMIM-T, che colloca più strati di condensatori MIM all'interno degli strati di build-up del package. L'approccio mantiene capacità aggiuntiva vicino al carico senza occupare area attiva del die.

Un'altra tecnologia, denominata condensatore a trincea profonda integrato, si trova nel core del package. Intel la descrive come uno stadio complementare per il disaccoppiamento a bassa e media frequenza.

Questi strati formano una gerarchia di risposta. I condensatori sul die affrontano le variazioni più rapide. I condensatori del package contribuiscono con una maggiore energia immagazzinata, mentre i sistemi della scheda e del rack supportano eventi più lunghi.

Intel ha inoltre riportato progressi separati su nuovi materiali per condensatori. I suoi ricercatori hanno dimostrato una densità di capacità intrinseca che raggiunge 98 femtofarad per micrometro quadrato in materiali selezionati.

L'azienda ha confrontato questa cifra con 37 femtofarad per micrometro quadrato per un materiale impiegato nella tecnologia allora corrente. Intel ha inoltre riportato un comportamento stabile per oltre 400.000 secondi durante test a temperatura elevata.

Questi esperimenti non garantiscono un'adozione produttiva immediata. Uniformità della deposizione, integrazione multistrato, perdite, affidabilità e costo di produzione determinano ancora se un materiale raggiungerà i prodotti dei clienti.

I bridge per chiplet creano un altro problema di alimentazione. L’Embedded Multi-die Interconnect Bridge di Intel, o EMIB, collega die adiacenti tramite un piccolo ponte in silicio.

Le implementazioni tradizionali instradano l’alimentazione attorno a quel ponte. Con l’aumento della densità di corrente, questa deviazione può aggiungere resistenza e concentrare la corrente nelle connessioni ai bordi.

Il più recente design EMIB-T di Intel aggiunge TSV attraverso il ponte, offrendo all’alimentazione un percorso verticale più diretto. Integra inoltre condensatori MIM locali per sopprimere il rumore sulle linee di input-output ad alta velocità.

Intel riporta che EMIB-T può raddoppiare la larghezza di banda e ridurre del 50 percento il rumore dell’alimentazione rispetto alla sua architettura precedente. Queste affermazioni provengono da lavori tecnici sostenuti da Intel e richiedono una validazione nei sistemi di produzione.

L’obiettivo è particolarmente rilevante per HBM4 e le successive interfacce di memoria. La memoria ad alta larghezza di banda combina collegamenti dati ampi con tolleranze di tensione ristrette, risultando sensibile al rumore dell’alimentazione.

È qui che distribuzione dell’alimentazione e movimento dei dati diventano inseparabili. Aggiungere più larghezza di banda di memoria può aumentare la domanda di corrente e consumare lo spazio di instradamento necessario alla rete di alimentazione.

Un ponte migliorato deve quindi fornire insieme segnali e corrente. Ottimizzare solo il percorso dati rischia di creare un vincolo di alimentazione che impedisce all’interfaccia di raggiungere le prestazioni previste.

Anche i condensatori integrati comportano compromessi. Aggiungono fasi produttive e occupano volume nel package. I guasti possono coinvolgere un assemblaggio costoso contenente diversi die di alto valore.

I progettisti devono modellare le interazioni tra comportamento elettrico, stress meccanico, calore e copertura dei test. Un condensatore che funziona bene isolatamente deve comunque sopravvivere all’assemblaggio del package e a lunghi cicli operativi.

L’approccio di portafoglio di Intel riconosce questi vincoli. Offre diverse posizioni per i condensatori anziché trattare una tecnologia come risposta universale.

La domanda restante è come ridurre innanzitutto la corrente che attraversa il package. La risposta di Intel consiste nel portare la conversione di tensione molto più vicino al carico di calcolo.

La tecnologia IVR di Intel porta la conversione verso il carico

La regolazione integrata della tensione scambia una complessa integrazione nel package con percorsi di alimentazione più brevi e una risposta più rapida.

Un regolatore di tensione convenzionale sulla scheda madre converte una tensione di distribuzione, spesso attorno ai 12 volt, nella tensione molto più bassa richiesta da un processore. La corrente risultante viaggia quindi attraverso la scheda e il package.

Questo modello diventa inefficiente quando la corrente degli acceleratori entra nell’intervallo dei multi-kiloampere. I lunghi percorsi a bassa tensione subiscono perdite resistive, mentre la loro induttanza rallenta la risposta a richieste improvvise.

Un regolatore di tensione integrato, o IVR, colloca la conversione sul processore, all’interno del package o direttamente sotto il carico. Trasporta l’energia a una tensione più elevata prima di convertirla localmente.

Una tensione più alta consente di trasportare la stessa potenza con una corrente inferiore. La conversione locale crea quindi la bassa tensione richiesta dai transistor soltanto vicino al punto di utilizzo.

Intel lavora sugli IVR da oltre un decennio. Il suo originale regolatore di tensione completamente integrato combinava interruttori, logica di controllo e condensatori di uscita sul die del processore.

Quel design utilizzava induttori ad aria nel package per l’accumulo di energia. Con l’aumento della densità di corrente, tali induttori richiedevano ingombri minori, il che poteva ridurne la qualità e l’efficienza di conversione.

Intel ha poi introdotto CoaxMIL, un induttore magnetico compatto impiegato per la prima volta con i processori Xeon Scalable di quarta generazione. Le successive famiglie Xeon hanno utilizzato versioni più recenti.

L’azienda afferma che il design magnetico migliora la densità di corrente e l’efficienza di conversione. Le configurazioni accoppiate possono inoltre migliorare la risposta ai transitori usando meno area nel package.

L’opzione più ambiziosa rimuove gli induttori dal convertitore locale. Intel chiama questo design C2VR, abbreviazione di continuous capacitive voltage regulator.

C2VR utilizza condensatori MIM ad alta densità per convertire un ingresso fino a 2,4 volt nelle tipiche tensioni dei core dei processori. Intel afferma che il design può superare il 90 percento di efficienza e fornire 10 ampere per millimetro quadrato.

La ricerca citata alla base di C2VR ha riportato un’efficienza di picco del 92 percento e 12,7 watt per millimetro quadrato. Come per qualsiasi risultato di conversione, carico di lavoro, rapporto di tensione, condizioni termiche e implementazione influenzano le prestazioni reali.

Un regolatore capacitivo può modificare rapidamente la corrente di uscita perché non dipende da un grande componente magnetico per l’accumulo di energia. Questa caratteristica aiuta a limitare il droop durante variazioni improvvise di corrente.

Intel afferma che C2VR può scalare a carichi multi-kiloampere. Può essere collocato sul lato del die, sul lato inferiore del package, all’interno degli strati del package o in un die di base.

Il passaggio più semplice colloca un IVR sul landside del package. Questa posizione accorcia il percorso rispetto a un regolatore sulla scheda madre ed evita alcune difficoltà dell’integrazione sul die.

Tuttavia, crea un altro conflitto. Il regolatore e i relativi requisiti di raffreddamento consumano area sul lato inferiore che altrimenti potrebbe ospitare connessioni del package.

Un minor numero di connessioni disponibili può aumentare la resistenza lungo il percorso di ingresso del convertitore. Questa perdita può compensare parte del vantaggio ottenuto collocando la conversione vicino al carico.

Il concetto più integrato di Intel posiziona C2VR direttamente sotto il die di calcolo. L’alimentazione entra attraverso TSV sul retro, raggiunge il regolatore e poi viaggia verticalmente nel processore.

Intel afferma che il regolatore capacitivo può essere assottigliato sotto i 100 micrometri restando funzionale. Il suo profilo lo rende adatto all’integrazione negli strati del package o in die di base impilati.

Questa è l’espressione più chiara della strategia Intel per la distribuzione dell’alimentazione nell’AI. Il cablaggio sul retro porta l’alimentazione attraverso il silicio, i condensatori integrati la stabilizzano e un regolatore locale la converte vicino al carico.

Il meccanismo promette percorsi elettrici più brevi e una migliore risposta ai transitori. Crea inoltre calore concentrato e un problema produttivo strettamente accoppiato sotto un processore già caldo.

Un regolatore guasto potrebbe compromettere l’intero package anziché un componente sostituibile sulla scheda madre. Test, riparazione, gestione termica e resa diventano quindi parti essenziali del calcolo economico.

Intel presenta C2VR come un’architettura scalabile, ma il documento non identifica un acceleratore AI commerciale che lo utilizzi alla piena scala multi-kiloampere. Questa distinzione conta nel valutare la maturità della tecnologia.

Il settore sta riprogettando entrambe le estremità della catena di alimentazione

Il lavoro di Intel a livello di package integra la transizione verso una tensione più alta negli impianti, ma le due transizioni devono incontrarsi su interfacce compatibili.

Google, Microsoft e NVIDIA stanno lavorando tramite l’Open Compute Project per stabilire requisiti comuni per la distribuzione in corrente continua a 800 volt. L’iniziativa punta al trasferimento di energia tra apparecchiature dell’impianto e rack di calcolo ad alta densità.

Una tensione più alta riduce la corrente necessaria per erogare una data quantità di potenza. Ciò può ridurre la sezione dei conduttori, l’uso di rame, le perdite di distribuzione e l’ingombro fisico del cablaggio.

Il framework OCP descrive due percorsi di implementazione. Le strutture esistenti possono usare rack di alimentazione laterali che convertono corrente alternata a 480 volt in corrente continua vicino ai rack di calcolo.

Le strutture future potrebbero convertire direttamente corrente alternata a media tensione in corrente continua a 800 volt. Questo design elimina le fasi di conversione intermedie e può integrare più direttamente batterie o microreti DC.

L’organizzazione afferma che oltre 80 partner stanno sviluppando infrastrutture compatibili. Tra i partecipanti figurano fornitori di convertitori, sbarre collettrici, connettori, sistemi di protezione e apparecchiature a livello di rack.

Questo lavoro non elimina la conversione a tensione inferiore all’interno del rack. Un core di acceleratore opera comunque molto al di sotto degli 800 volt, quindi restano diverse fasi di conversione tra la distribuzione dell’impianto e i transistor.

Intel si concentra principalmente sulla porzione finale di quella catena. PowerVia, condensatori del package, EMIB-T e IVR affrontano la distanza tra gli ingressi del package e la logica attiva.

L’architettura per impianti di NVIDIA e la strategia di package di Intel non sono quindi alternative dirette. Risolvono sezioni differenti dello stesso problema end-to-end.

La tensione competitiva emerge nel controllo delle interfacce. I fornitori di acceleratori possono definire l’architettura dei rack, mentre fonderie e fornitori di packaging definiscono le opzioni all’interno del package.

I fornitori di semiconduttori di potenza come Texas Instruments, Infineon e STMicroelectronics affrontano le fasi di conversione tra questi livelli. Le aziende di apparecchiature contribuiscono con interruttori, raddrizzatori, condotti sbarre e sistemi di raffreddamento.

Un’analisi di Texas Instruments stima che un rack da un megawatt che utilizza una distribuzione a 48 volt richiederebbe quasi 450 libbre di rame per contenere le perdite di distribuzione.

TI afferma inoltre che gli attuali processori possono richiedere oltre 1.000 ampere. L’azienda sta lavorando con NVIDIA sulla distribuzione a 800 volt e sull’alimentazione multiphase dei processori di prossima generazione.

Le stime delle società di consulenza mostrano perché il settore si stia muovendo ora. Una valutazione dei data center colloca i requisiti emergenti dei rack AI tra 200 e 600 kilowatt.

La stessa analisi prevede che alcuni requisiti dei rack si avvicinino a un megawatt più avanti in questo decennio. I tradizionali sistemi a bassa tensione non sono stati progettati per quella combinazione di densità e domanda continua.

Gli standard restano un vincolo importante. La corrente continua ad alta tensione richiede dispositivi di protezione, isolamento dei guasti, connettori, monitoraggio e procedure operative adatti al comportamento della corrente continua.

A differenza della corrente alternata, la corrente continua non attraversa lo zero a ogni ciclo. Interrompere un guasto in corrente continua può quindi richiedere apparecchiature specializzate per arrestare un arco elettrico sostenuto.

I partecipanti all’OCP stanno adattando pratiche provenienti dai veicoli elettrici e dai sistemi industriali. Tuttavia, i data center hanno requisiti di disponibilità, modelli di servizio e configurazioni fisiche diversi.

L’implementazione varierà inoltre tra le strutture. Un nuovo campus AI può essere progettato attorno alla distribuzione in corrente continua, mentre un sito esistente potrebbe non avere la capacità elettrica o lo spazio tra le file per modifiche estese.

Questa diversità sostiene il rifiuto di Intel di prescrivere un’unica architettura di alimentazione. Acceleratori e strutture differenti combineranno in modo diverso livelli di tensione, regolatori, condensatori e metodi di raffreddamento.

Il rischio è la frammentazione. Interfacce personalizzate possono rallentare i fornitori, complicare la certificazione e impedire alle apparecchiature di servire più clienti.

L’opportunità è il coordinamento. Interfacce comuni per rack possono offrire ai produttori di componenti un obiettivo stabile, mentre le tecnologie di fonderia possono ottimizzare il percorso finale verso ciascun chip.

Cosa deve essere dimostrato in seguito

Le prove decisive arriveranno da sistemi completi, non da singole affermazioni di efficienza o dimostrazioni di processo.

Il primo segnale è l’uso commerciale del portafoglio di Intel a livello di package. I clienti hanno bisogno di prodotti dichiarati che combinino alimentazione dal retro, condensatori avanzati, bridge per chiplet e regolazione vicina al carico sotto carichi di lavoro AI sostenuti.

PowerVia è già entrata in produzione tramite Intel 18A, ma l’adozione da parte dei clienti e il comportamento dei sistemi contano più della sola disponibilità del processo. Resa, frequenza, stabilità della tensione e prestazioni termiche devono mantenersi nei volumi di produzione.

Il secondo segnale è l’integrazione del regolatore. Intel ha pubblicato misurazioni convincenti di C2VR, incluse un’efficienza superiore al 90 percento e un’elevata densità di corrente.

Il test più difficile è un package su scala da acceleratore. Gli ingegneri hanno bisogno di prove che coprano il funzionamento multi-kiloampere, i transitori del carico di lavoro, il calore, l’invecchiamento, le variazioni produttive e le interazioni con la distribuzione dell’alimentazione dal retro.

Anche il comportamento in caso di guasto merita attenzione. Un regolatore strettamente integrato deve proteggere costosi die di calcolo e memoria senza trasformare un guasto locale nella perdita dell’intero package.

Il terzo segnale è il progresso nell’interoperabilità a 800 volt. Le specifiche OCP richiedono prodotti compatibili di più fornitori, seguiti da implementazioni in grado di operare in sicurezza al di fuori delle dimostrazioni.

Queste implementazioni dovrebbero rivelare se le promesse riduzioni delle perdite di conversione e dell’uso di rame si traducano in una migliore economia delle strutture. Metteranno inoltre in evidenza i requisiti di manutenzione e formazione.

Il documento di Intel contiene un’importante cautela. Afferma che non esiste una soluzione universale e rileva limitazioni elettriche, termiche e meccaniche per gli IVR landside.

Il documento afferma inoltre che le roadmap e le proiezioni sulle prestazioni restano incerte. La maggior parte dei benefici riportati varia in base al carico di lavoro, alla configurazione e all’implementazione.

Questa prudenza è appropriata. Portare più funzioni di alimentazione nel silicio e nei package avanzati può migliorare il comportamento elettrico, aumentando al contempo i costi di integrazione e concentrando i rischi.

I team responsabili dell’architettura dovranno valutare l’intero percorso dalla connessione alla rete elettrica al transistor. L’ottimizzazione di una fase di conversione può semplicemente spostare calore, resistenza o complessità altrove.

Dovranno inoltre considerare il comportamento dei carichi di lavoro. Addestramento, inferenza, networking e attività ad alta intensità di memoria generano diversi profili di corrente, anche quando la loro potenza media appare simile.

Per gli sviluppatori e gli acquirenti aziendali, le conseguenze arrivano indirettamente. Una migliore distribuzione dell’alimentazione può aumentare l’utilizzo sostenuto degli acceleratori e ridurre l’infrastruttura necessaria per ogni unità di calcolo utile.

Può inoltre influenzare la disponibilità dell’hardware. I sistemi che richiedono strutture specializzate, interfacce proprietarie o raffreddamento complesso potrebbero raggiungere meno clienti di quanto suggeriscano i risultati dei benchmark.

I team che confrontano infrastrutture AI dovrebbero quindi chiedere informazioni sulle prestazioni sostenute, non solo sul throughput di picco. Dovrebbero esaminare requisiti del rack, raffreddamento, architettura di tensione e vincoli di implementazione.

Le organizzazioni tecniche possono conservare queste valutazioni in una base di conoscenza ingegneristica consultabile. Le specifiche di alimentazione ora si estendono tra documenti dei processori, progetti dei rack, piani delle strutture e lavoro sugli standard.

Il cambiamento più ampio è già visibile. Le prestazioni AI non dipendono più solo dai transistor, dalla larghezza di banda della memoria o dalla velocità di interconnessione.

La distribuzione dell’alimentazione determina quanta parte di quel silicio possa operare in modo affidabile contemporaneamente. La proposta di Intel avvicina instradamento dell’alimentazione, carica immagazzinata e conversione di tensione al calcolo che supportano.

I prossimi uno-tre mesi dovrebbero chiarire tre aspetti: adozione da parte di clienti nominati, validazione C2VR a livello di package e hardware interoperabile a 800 volt. Progressi in tutti e tre rafforzerebbero l’argomento di Intel a favore di uno stack completo.

L’assenza di prove a qualsiasi livello metterebbe in luce il rischio centrale. Un componente efficiente non crea un data center AI efficiente se l’intera catena non funziona insieme.

Con la distribuzione dell’alimentazione per l’AI di Intel che si sposta sempre più all’interno del package, gli acquirenti dovrebbero porsi una domanda pratica: il sistema completo può sostenere la capacità di calcolo pubblicizzata senza spostare le perdite altrove?

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page