Lo studio sul pretraining di Dwarkesh Patel rileva che i dati hanno superato i miglioramenti dei modelli
Dwarkesh Patel ha pubblicato con Jerry Han uno studio sul pretraining che ha prodotto un risultato sorprendente: i miglioramenti nei dati hanno generato guadagni di efficienza computazionale di 12 volte. I miglioramenti nella ricetta del modello hanno prodotto guadagni di 3,7 volte nello stesso quadro sperimentale. Lo studio sul pretraining di Dwarkesh Patel attribuisce quindi ai dati un progresso in termini di efficienza circa 3,24 volte maggiore.
Questo risultato mette in discussione una narrazione consolidata sui progressi dei modelli linguistici. Il dibattito pubblico si concentra spesso su architetture, ottimizzatori, cluster più grandi e nuovi meccanismi di attenzione. Patel e Han hanno invece rilevato che, nell'intervallo da loro testato, corpora migliori hanno creato il maggiore vantaggio in termini di efficienza.
I ricercatori hanno ricostruito sei anni di progressi nel pretraining aperto, dai sistemi dell'era GPT-2 alle ricette dell'era OLMo-2. Hanno combinato design di modelli rappresentativi con dataset rappresentativi e addestrato tali combinazioni con vari budget di calcolo. Questo crea un confronto diretto tra due spiegazioni: macchinari migliori e materiale migliore.
Il risultato non stabilisce cosa sia accaduto all'interno di OpenAI, Anthropic, Google DeepMind o Meta. Queste aziende divulgano informazioni limitate sui loro attuali dati di addestramento. Tuttavia, sposta l'onere della prova su chi considera l'ingegneria dei dati una questione secondaria.
Lo studio sul pretraining di Dwarkesh Patel ha ricostruito sei anni di progressi
Patel e Han hanno cercato di separare due variabili che di solito cambiano insieme: la ricetta del modello e il corpus di addestramento.
Il loro esperimento di pretraining è stato pubblicato l'8 settembre 2026. Copre ricette rappresentative di modelli aperti e dataset pubblici rilasciati dal 2019 al 2025. Gli autori hanno addestrato da zero combinazioni di questi elementi.
Una ricetta del modello include l'architettura, l'ottimizzatore, l'inizializzazione, il programma del tasso di apprendimento, il metodo di normalizzazione e altre scelte di addestramento. Un corpus è la raccolta di testi convertiti in token per il pretraining. La maggior parte dei rilasci pubblici di modelli modifica simultaneamente entrambe le componenti, rendendo difficile isolarne i contributi individuali.
L'asse dei modelli parte dalla ricetta GPT-2 e termina con OLMo-2. Le modifiche intermedie includono embedding posizionali rotatori, RMSNorm, attivazioni SwiGLU, una collocazione rivista della normalizzazione, normalizzazione QK e metodi di inizializzazione più puliti. Ogni miglioramento modifica il modo in cui un modello rappresenta le informazioni o resta stabile durante l'addestramento.
L'asse dei dati parte da OpenWebText. Questo corpus del 2019 conteneva circa 9 miliardi di token provenienti da pagine web collegate da post Reddit sufficientemente popolari. I dataset successivi hanno utilizzato crawl web più ampi, estrazione più robusta, deduplicazione e filtri di qualità sempre più selettivi.
Il punto di arrivo del 2025 era UltraFineWeb. La sua pipeline applica filtri più sofisticati a un bacino molto più ampio di documenti web. Alcuni filtri moderni usano classificatori addestrati per prevedere quali documenti miglioreranno le prestazioni downstream del modello.
Patel e Han hanno testato cinque budget di calcolo nominali. Spaziavano da 100 quadrilioni di FLOPs a 10 quintilioni di FLOPs, indicati come da 1e17 a 1e19 FLOPs. I FLOPs misurano le operazioni aritmetiche consumate durante l'addestramento.
Per ogni budget, i ricercatori hanno variato la dimensione del modello e il numero di token. Questo processo ha consentito loro di stimare la combinazione ottimale in termini di calcolo per ogni abbinamento modello-corpus. Ottimale in termini di calcolo significa produrre il miglior risultato misurato entro una quantità fissa di calcolo per l'addestramento.
Hanno controllato anche diverse altre scelte in tutti gli esperimenti. Ogni esecuzione ha utilizzato il tokenizer GPT-2 BPE con un vocabolario di 50.257 token. Ciascuna ha inoltre usato una lunghezza di contesto di 2.048 token e un batch contenente 262.144 token.
I ricercatori hanno valutato le capacità finali tramite OLMES, una raccolta di dieci benchmark relativamente accessibili. La maggior parte utilizza domande a scelta multipla. Hanno scelto la valutazione delle capacità perché confrontare la perdita di entropia incrociata tra diversi dataset di addestramento avrebbe creato un test non uniforme.
Questa scelta è importante. Un modello valutato rispetto allo stesso corpus usato per definire la propria distribuzione di addestramento può ricevere un vantaggio artificiale. I compiti downstream offrono un obiettivo condiviso, pur introducendo più rumore statistico.
Il team ha eseguito più seed indipendenti per le curve di scaling computazionale. Un seed modifica l'inizializzazione casuale e l'ordinamento dei dati, aiutando a rivelare se un risultato persiste al variare dell'addestramento. La più ampia griglia 7 per 7 a 3,16e18 FLOPs ha utilizzato un seed per combinazione.
Con il budget di 1e19 FLOPs, i dati più recenti hanno prodotto un moltiplicatore di calcolo di 12 volte rispetto alla baseline di dati del 2019. Le ricette di modello più recenti hanno prodotto un moltiplicatore di 3,7 volte rispetto alla ricetta GPT-2. Il loro rapporto ha generato il vantaggio di 3,24 volte dei dati riportato nel titolo.
Un moltiplicatore di calcolo descrive quanto meno calcolo un ingrediente più recente richieda per raggiungere le prestazioni dell'ingrediente più vecchio. Non significa che il modello sia diventato dodici volte più intelligente. Descrive l'efficienza a un dato livello di prestazione e in una determinata suite di valutazione.
Gli autori hanno inoltre rilevato che i guadagni dei dati e dei modelli erano in gran parte indipendenti a 3,16e18 FLOPs. Un modello statistico additivo spiegava l'88 percento della variazione nei punteggi OLMES. Solo circa il 12 percento restava attribuibile a interazioni, effetti di ordine superiore o rumore nella valutazione.
Questo risultato suggerisce che dati migliori non richiedessero un'architettura speciale per offrire i propri benefici. Allo stesso modo, i miglioramenti architetturali restavano generalmente utili tra i diversi corpora. Questa indipendenza rende più difficile liquidare il contributo dei dati come un fortunato singolo abbinamento tra modello e dataset.
L'ingegneria dei dati ha vinto la sfida dell'efficienza
All'interno di questo esperimento, migliorare ciò che il modello leggeva contava più che migliorare il meccanismo con cui lo leggeva.
Il risultato si inserisce in un crescente corpo di ricerca sui modelli linguistici incentrata sui dati. I corpora moderni non sono semplicemente cumuli più grandi di testo da internet. I loro costruttori estraggono contenuti più puliti, rimuovono duplicazioni, bilanciano le fonti, filtrano i documenti di scarso valore e controllano la contaminazione.
La deduplicazione rimuove materiale identico o quasi identico. Senza di essa, pagine frequentemente copiate possono dominare l'addestramento e ridurre l'effettiva diversità del corpus. L'estrazione separa il testo significativo da menu, pubblicità, elementi standardizzati e markup corrotto.
Il filtraggio decide quindi quali documenti meritino il limitato calcolo disponibile per l'addestramento. I primi filtri si basavano soprattutto su regole relative a lingua, lunghezza, ripetizione e punteggiatura. Le pipeline più recenti applicano sempre più spesso classificatori addestrati su esempi di testo utile e poco utile.
DataComp-LM ha reso misurabile questo approccio attraverso competizioni controllate tra dataset. I suoi ricercatori hanno rilasciato un bacino Common Crawl di 240 trilioni di token e fissato la ricetta di addestramento per i partecipanti. I team potevano quindi competere attraverso strategie di filtraggio e mescolamento dei dati, anziché modificando il modello.
I risultati di DataComp-LM hanno rilevato che il filtraggio basato sui modelli era centrale per la sua baseline più solida. Il suo modello da 7 miliardi di parametri ha raggiunto il 64 percento di accuratezza five-shot su MMLU dopo l'addestramento su 2,6 trilioni di token.
Quel modello ha ottenuto prestazioni comparabili a modelli aperti più grandi sui benchmark riportati. Gli autori hanno inoltre segnalato un vantaggio di 6,6 punti percentuali su MMLU rispetto a MAP-Neo, utilizzando il 40 percento in meno di calcolo per l'addestramento. Si tratta di esperimenti distinti, ma la loro direzione supporta il risultato di Patel e Han.
DataComp-LM ha anche rivelato che il design del filtro può contare più del previsto. A una scala testata, cambiare il modello di filtraggio ha spostato l'accuratezza five-shot su MMLU dal 35 percento al 44 percento. Il bacino web grezzo sottostante restava disponibile per ogni approccio.
Sorprendentemente, il miglior filtro testato utilizzava un classificatore bigramma relativamente semplice, con esempi positivi e negativi selezionati con cura. Le valutazioni umane della qualità dei documenti hanno offerto un valore limitato in quegli esperimenti. Ciò che appare curato a un lettore non sempre genera un segnale di apprendimento migliore.
La ricerca su FineWeb è giunta a una conclusione correlata. I suoi creatori hanno confrontato scelte relative a estrazione, filtraggio linguistico, deduplicazione e selezione della qualità tra ampi corpora web. Il lavoro ha trattato la creazione dei dataset come una disciplina ingegneristica empirica, anziché come una fase di pulizia.
Il dataset FineWeb ha prodotto anche un sottoinsieme incentrato sull'istruzione, selezionato da un classificatore addestrato. Questa strategia ha privilegiato pagine simili a materiale didattico di alta qualità. Tali filtri mirano ad aumentare la densità di ragionamento utile e informazioni fattuali per token.
Questa storia spiega i risultati sui dati di Dwarkesh Patel. OpenWebText filtrava già il web, ma utilizzava la popolarità su Reddit come segnale di qualità generico. Le pipeline successive hanno testato segnali più diretti rispetto alle effettive prestazioni dei modelli.
La differenza è simile a sostituire un elenco generico di consigli con un programma didattico misurato. Entrambi contengono materiale leggibile. Solo il secondo ottimizza ciò che chi apprende ottiene da ogni ora.
Questa efficienza dei dati di pretraining conta perché ogni token consuma calcolo. Ripetizioni di scarso valore, testo danneggiato e contenuti standardizzati irrilevanti competono con esempi utili entro un budget fisso. Una selezione migliore aumenta la quantità di apprendimento prodotta dallo stesso tempo sugli acceleratori.
La conseguenza economica va oltre una singola esecuzione di addestramento. Una pipeline per dataset può supportare esperimenti ripetuti, generazioni di modelli e varianti specializzate. I miglioramenti a quella pipeline possono accumularsi nell'intero programma di ricerca di un'organizzazione.
I dati plasmano anche le capacità che emergono. Un corpus ricco di codice non si comporterà come uno dominato dalla prosa conversazionale. Articoli scientifici, testi legali, documenti multilingue e tracce sintetiche di ragionamento orientano ciascuno l'apprendimento in direzioni diverse.
Questo crea pressione sui laboratori di frontiera. Non possono presumere che un ulteriore ordine di hardware compenserà una progettazione debole del corpus. Hanno bisogno di sistemi più robusti per provenienza, licenze, estrazione, filtraggio, progettazione delle miscele, valutazione e aggiornamento continuo.
La pressione raggiunge anche gli sviluppatori di modelli più piccoli. I team con accesso limitato agli acceleratori non possono vincere una gara di spesa diretta. Possono comunque migliorare la densità informativa di ogni batch di addestramento e indirizzare il corpus verso capacità specifiche.
Tuttavia, lo studio non afferma che ogni dataset ristretto sia migliore. Negli esperimenti riportati, The Pile ha ottenuto risultati peggiori di OpenWebText su OLMES. The Pile include materiale diversificato da fonti quali articoli, codice, brevetti e documenti legali.
OLMES valuta soprattutto compiti a scelta multipla in inglese, in stile web. Il materiale specializzato può quindi ricevere poco riconoscimento, anche quando supporta capacità preziose altrove. La qualità dei dati non ha una definizione universale separata da un obiettivo.
Modelli migliori hanno comunque reso possibili addestramenti più grandi
Il risultato di 12 volte per i dati misura l'efficienza, ma la ricerca sui modelli ha anche ampliato la scala alla quale l'addestramento utile resta possibile.
Patel e Han respingono esplicitamente l'interpretazione più semplice del loro risultato principale. Il loro esperimento non dimostra che sei anni di ricerca sui modelli abbiano contribuito poco. Misura il calcolo necessario per raggiungere determinati punteggi downstream a scale relativamente piccole.
Molte innovazioni nei modelli svolgono uno scopo diverso. Mantengono stabile l'addestramento mentre aumentano il numero di parametri, le finestre di contesto, i volumi di dati e i cluster di acceleratori. Un miglioramento che impedisce il collasso di un'esecuzione enorme potrebbe non dominare un grafico dell'efficienza su piccola scala.
Un cluster di addestramento più grande crea numerosi punti di errore. I gradienti possono esplodere o svanire. La larghezza di banda di comunicazione può diventare un collo di bottiglia. La pressione sulla memoria può limitare la lunghezza delle sequenze, la dimensione dei batch o lo stato dell’ottimizzatore.
Le modifiche alla normalizzazione possono migliorare la stabilità. Un’inizializzazione migliore può prevenire divergenze iniziali. Il lavoro a livello di kernel può mantenere gli acceleratori operativi anziché in attesa dello spostamento dei dati in memoria.
FlashAttention offre un importante esempio storico. Riorganizza il calcolo esatto dell’attenzione attorno all’accesso alla memoria, riducendo i costosi trasferimenti tra diversi livelli di memoria. Ciò può ampliare le lunghezze di sequenza praticabili senza modificare il risultato di base dell’attenzione.
I modelli mixture-of-experts affrontano un altro vincolo della scalabilità. Attivano solo una parte della rete per ciascun token, consentendo alla capacità totale dei parametri di crescere senza un aumento proporzionale del calcolo per token. Questi progetti complicano il routing e l’addestramento distribuito.
L’attenzione a query raggruppate può ridurre la memoria necessaria per chiavi e valori memorizzati nella cache durante l’inferenza. Questo conta molto quando un modello gestisce milioni di prompt. Patel e Han osservano che questo tipo di miglioramento dell’inferenza non compare nel loro moltiplicatore di calcolo per il pre-addestramento.
Anche i miglioramenti dei tokenizer restano al di fuori dell’esperimento. Un tokenizer determina come il testo diventa un insieme di unità leggibili dal modello. Una tokenizzazione più efficiente può ridurre la lunghezza delle sequenze o migliorare la rappresentazione tra lingue e domini.
L’opposizione centrale è quindi tra efficienza dei dati e scala resa possibile dal modello, non tra addetti ai dati e ricercatori sui modelli. Corpus migliori aiutano un sistema ad apprendere di più con un budget fisso. Una migliore ingegneria dei modelli consente ai laboratori di impiegare budget maggiori senza instabilità o costi generali proibitivi.
Il lavoro di Google DeepMind su Chinchilla illustra come queste variabili si incontrino. Le precedenti pratiche di scalabilità spesso aumentavano il numero di parametri senza incrementare proporzionalmente i dati di addestramento. I modelli risultanti consumavano notevoli risorse di inferenza pur restando sottoaddestrati.
DeepMind ha addestrato oltre 400 modelli per stimare l’allocazione ottimale tra parametri e token. La sua ricerca sul calcolo ottimale ha concluso che, nelle condizioni testate, dimensione del modello e numero di token dovrebbero crescere insieme.
Chinchilla utilizzava 70 miliardi di parametri e 1.400 miliardi di token di addestramento. Gopher utilizzava 280 miliardi di parametri con un budget computazionale comparabile. Il Chinchilla più piccolo e addestrato più estesamente ha superato Gopher nella maggior parte delle valutazioni riportate.
Quel risultato ha spostato l’attenzione dal numero di parametri alla durata dell’addestramento e al volume del dataset. Non ha cancellato la ricerca sulle architetture. Ha mostrato che la sola dimensione del modello offriva una descrizione debole dell’efficacia con cui veniva usato il calcolo.
Patel e Han estendono quella conversazione separando l’evoluzione dei corpus da quella delle ricette. Chinchilla chiedeva quanti parametri e token acquistare con un budget computazionale. Il nuovo studio chiede se il progresso sia derivato più dal contenitore o dal suo contenuto.
La risposta, a questa scala, favorisce il contenuto. Eppure il contenitore determina quanto possa essere trasportato. Patel e Han paragonano i piccoli modelli a barche a vela e i sistemi di frontiera a navi portacontainer.
Un carico scelto con cura conta molto su una barca a vela, perché la capacità è scarsa. Una nave portacontainer può trasportare molto più materiale e resistere a condizioni più difficili. Il suo valore emerge attraverso scala e affidabilità, non soltanto dalla velocità.
Per i laboratori di IA, entrambe le capacità restano essenziali. Un corpus pulito non può addestrare un modello senza software e hardware stabili. Un’architettura efficiente spreca comunque calcolo quando i suoi batch di addestramento contengono materiale duplicato o di scarso valore.
L’utile ribaltamento proposto dallo studio è più circoscritto. All’architettura non dovrebbe più essere attribuito automaticamente il merito di ogni aumento generazionale delle prestazioni. Quando migliorano sia i dati sia le ricette, ablazioni controllate devono stabilire quale modifica abbia causato il guadagno osservato.
Cosa Non Dimostra il Risultato di 12 Volte
La conclusione più forte è anche strettamente delimitata: i dati hanno dominato un esperimento aperto di pre-addestramento su piccola scala, incentrato su una sola suite di capacità.
Gli autori sottolineano ripetutamente questi limiti. Il loro budget massimo era di 1e19 FLOPs, molto al di sotto delle moderne esecuzioni di addestramento di frontiera. Le tecniche dipendenti dalla scala possono offrire pochi benefici visibili nei modelli piccoli e diventare essenziali solo molto più tardi.
I modelli piccoli hanno capacità limitata. I token di scarso valore possono sottrarre spazio a materiale importante, perché il modello non può assorbire tutto. Una selezione aggressiva può quindi aiutare i modelli piccoli più dei sistemi con una capacità rappresentativa molto maggiore.
I modelli grandi possono beneficiare di un’ampia copertura, anche quando la qualità media dei documenti diminuisce. Una maggiore capacità può separare i segnali deboli dal rumore. Un filtraggio eccessivo potrebbe rimuovere fatti rari, stili insoliti, lingue minoritarie o materiale tecnico di nicchia.
Un filtraggio aggressivo riduce anche il corpus unico. Gli sviluppatori devono quindi ripetere il materiale superstite per più epoche, ovvero effettuare più passaggi sugli stessi esempi. La ripetizione può produrre rendimenti decrescenti o overfitting.
La ricerca sulla scalabilità vincolata dai dati ha rilevato che i dati ripetuti restano utili, ma diventano meno preziosi con passaggi aggiuntivi. Ciò crea un compromesso tra qualità media, diversità totale e ripetizione.
Patel e Han sollevano un’incertezza ancora maggiore. I modelli di frontiera vengono spesso addestrati oltre le classiche allocazioni di token ottimali secondo Chinchilla, perché modelli più piccoli possono ridurre i costi di inferenza successivi. Un dataset curato può richiedere una ripetizione estesa con questa strategia.
La valutazione OLMES aggiunge un’altra limitazione. I suoi dieci compiti sono relativamente accessibili e basati in gran parte su domande a scelta multipla. Valutazioni diverse potrebbero modificare la classifica delle ricette dei modelli, dei dataset o di entrambi.
Un benchmark di programmazione potrebbe premiare repository e documentazione tecnica. Un benchmark scientifico potrebbe favorire articoli e spiegazioni specialistiche. I test multilingue valorizzerebbero una copertura linguistica che una suite incentrata sull’inglese potrebbe trascurare.
Gli autori hanno osservato anomalie coerenti con questo problema di misurazione. NeoX ha ottenuto risultati peggiori di GPT-2 a 1e19 FLOPs su OLMES, nonostante lo avesse superato con budget testati inferiori. NeoX ha inoltre ottenuto risultati migliori sulla perdita FineWeb-Edu tenuta fuori dall’addestramento.
Anche l’ampia miscela di The Pile ha ottenuto risultati inferiori a OpenWebText su OLMES. Questo non dimostra che fonti diversificate siano generalmente inefficienti. Potrebbe indicare che la valutazione assegna un riconoscimento limitato alle loro conoscenze specialistiche.
Alcuni moltiplicatori riportati hanno richiesto estrapolazioni. Le curve di NeoX e The Pile non raggiungevano sempre le prestazioni di riferimento necessarie nell’intervallo misurato. Estendere una curva adattata oltre i risultati osservati introduce ulteriore incertezza.
La regolazione degli iperparametri crea un’altra fonte di errore. Le capacità finali possono cambiare con il tasso di apprendimento massimo, la dimensione dei batch, l’inizializzazione e la pianificazione. I ricercatori hanno esplorato i tassi di apprendimento in punti di ancoraggio selezionati, ma non potevano testare ogni configurazione possibile.
Ritengono che l’incertezza per i moltiplicatori delle ricette dei modelli superi le barre di errore statistiche visualizzate. Tali barre catturano la variazione della loro pipeline di stima. Non catturano ogni conseguenza di un’ottimizzazione limitata degli iperparametri.
I tassi annuali di efficienza riportati rafforzano la necessità di cautela. Le modifiche ai modelli hanno prodotto un moltiplicatore annuale di 1,24 volte, mentre le modifiche ai dati hanno prodotto 1,51 volte. Insieme, il guadagno annuale misurato è stato di 1,57 volte.
Queste cifre sono inferiori a una precedente stima di un miglioramento annuo dell’efficienza software di circa tre volte. Patel e Han propongono diverse spiegazioni, tra cui guadagni dipendenti dalla scala, ottimizzazioni dell’inferenza escluse, modifiche ai tokenizer e scelte di ricette rappresentative.
Lo studio esclude inoltre importanti fonti del moderno progresso nelle capacità. Si concentra sul pre-addestramento, la fase in cui un modello apprende schemi generali da corpus ampi. Non scompone l’apprendimento per rinforzo, il post-addestramento, l’uso di strumenti o il calcolo in fase di test.
Patel e Han osservano che l’apprendimento per rinforzo ha guidato molti dei guadagni visibili nei due anni precedenti alla pubblicazione. Un modello può migliorare molto nel ragionamento o nel seguire le istruzioni senza modificare la propria efficienza di pre-addestramento di base.
I dati sintetici restano un’altra grande lacuna. I laboratori di frontiera usano modelli per generare spiegazioni, codice, tracce di ragionamento ed esempi di compiti. L’esperimento ha esaminato corpus pubblici che per lo più curano sottoinsiemi di Common Crawl.
Gli autori non hanno testato se la generazione sintetica possa ampliare una piccola disponibilità di informazioni di alta qualità. Non hanno neppure confrontato l’espansione sintetica con la ripetizione dei documenti originali per più epoche.
Infine, lo studio non riproduce pipeline di frontiera chiuse. I grandi laboratori raramente divulgano composizioni complete dei dataset, classificatori di filtraggio, pesi delle miscele o controlli della contaminazione. I loro sistemi interni possono differire nettamente dalle ricette pubbliche.
L’interpretazione appropriata è prudente ma significativa. L’esperimento fornisce prove che il progresso dei corpus meriti più credito causale. Non fornisce una legge universale del fattore 12 per ogni modello, scala, benchmark o laboratorio.
La Qualità dei Dati Sta Diventando una Variabile di Scalabilità di Primo Livello
Il settore tratta sempre più la qualità dei dati come un input di scalabilità misurabile, anziché come una proprietà informale di un corpus.
Le leggi di scalabilità tradizionali collegano le prestazioni alla dimensione del modello, ai token di addestramento e al calcolo. Spesso presumono che un token sia comparabile a un altro. I dataset reali violano questa ipotesi attraverso rumore, duplicazione, differenze di dominio e densità informativa disomogenea.
La ricerca recente ha iniziato a modellare direttamente la qualità. Un articolo ICLR 2026 ha introdotto un parametro di qualità adimensionale ed esteso le leggi di scalabilità in stile Chinchilla. Il suo obiettivo era prevedere la perdita a partire da volume dei dati, dimensione del modello e qualità dei dati congiuntamente.
Il modello sensibile alla qualità usa proxy basati sulla corruzione e sulle carenze del dataset. Esperimenti controllati hanno rilevato che dati di qualità superiore potevano ridurre la dimensione del modello e il calcolo richiesti per una perdita obiettivo.
Questo approccio non convalida il preciso moltiplicatore di Patel e Han. Supporta il meccanismo più ampio alla base del loro risultato. Due corpus con lo stesso numero di token possono fornire quantità effettive di apprendimento molto diverse.
Questo cambia il modo in cui i team dovrebbero descrivere la scalabilità. Il numero di token resta necessario, ma non può rivelare se i token siano unici, pertinenti, accurati o formativi. I numeri sul calcolo da soli non possono rivelare se i batch di addestramento contengano segnali utili.
Lo stesso principio conta anche al di sotto della frontiera. Un’azienda che adatta un modello al proprio dominio deve decidere quali documenti rappresentino conoscenza affidabile. Inserire ogni file disponibile in una pipeline può amplificare duplicazioni, policy obsolete e istruzioni in conflitto.
Una buona infrastruttura informativa conserva la provenienza e rende visibile il materiale in conflitto. Aiuta inoltre le persone a trovare le fonti dietro le risposte generate dal modello. Una base di conoscenza ricercabile applica una disciplina simile su scala organizzativa.
Gli sviluppatori dovrebbero quindi separare tre domande. Primo, il corpus contiene le conoscenze necessarie per i compiti target? Secondo, la pipeline può estrarre e rappresentare tali conoscenze in modo pulito? Terzo, la valutazione premia la capacità prevista?
Gli acquirenti aziendali dovrebbero porre domande correlate quando valutano modelli specializzati. Il numero di parametri dichiarato da un fornitore dice poco sulla copertura del dominio o sulla freschezza delle fonti. I punteggi dei benchmark possono inoltre nascondere scelte ristrette sui dati che falliscono nei flussi di lavoro reali.
I lavoratori della conoscenza affrontano una versione ridotta dello stesso problema. Salvare più materiale non produce automaticamente un recupero delle informazioni o un ragionamento migliori. Il valore dipende da rilevanza, organizzazione, aggiornamento e dalla capacità del sistema di collegare le evidenze.
Per i laboratori di frontiera, pipeline dati migliori potrebbero diventare asset proprietari paragonabili al codice dei modelli. Le architetture pubbliche vengono spesso replicate rapidamente. Le miscele di alta qualità richiedono accesso continuativo, revisione legale, esperimenti e feedback dalle sessioni di addestramento.
Questo crea un divario competitivo meno visibile. I laboratori ben finanziati possono pagare raccolte con licenza, esempi prodotti da specialisti, repository privati e ambienti sintetici. I team più piccoli dipendono molto di più da corpora del web pubblico e filtri riproducibili.
Il cambiamento solleva anche questioni di governance. Un filtraggio più rigoroso richiede una definizione di utilità. Tale definizione può sopprimere dialetti, prospettive minoritarie, materiale controverso o conoscenze diverse dagli esempi preferiti da un classificatore.
L'ottimizzazione può inoltre puntare troppo direttamente ai benchmark. Un filtro addestrato rispetto alle prestazioni di valutazione può selezionare documenti simili a test noti. Senza controlli sulla contaminazione, l'apparente qualità dei dati può trasformarsi in un'esposizione nascosta ai benchmark.
L'ingegneria dei dataset richiede quindi lo stesso scrutinio applicato alla progettazione dei modelli. I ricercatori hanno bisogno di ablazioni, fonti documentate, valutazioni su dati esclusi dall'addestramento, test di contaminazione e prestazioni in più domini. Un singolo punteggio aggregato non può cogliere tutti i compromessi.
Il lavoro di Patel e Han aiuta rendendo la versione temporale dei dati un asse sperimentale indipendente. Studi futuri potranno ampliare questo disegno tra lingue, domini, dimensioni dei modelli e miscele sintetiche. Potranno inoltre misurare fattualità, programmazione, ragionamento, sicurezza e uso di contesti lunghi.
Il cambiamento operativo più importante è semplice. I team dovrebbero smettere di trattare i dati di addestramento come un input statico selezionato prima che inizi il lavoro serio. La progettazione del corpus fa parte del modello, anche quando vive fuori dal diagramma dell'architettura.
Tre segnali metteranno alla prova la tesi data-first
Le prossime evidenze dovranno mostrare se il risultato resiste alla scala di frontiera, all'espansione sintetica e a test delle capacità più ampi.
Il primo segnale è una replica più ampia. Patel e Han hanno raggiunto 1e19 FLOPs e descrivono il loro esperimento come estremamente piccolo. Un seguito dovrà estendere lo stesso disegno incrociato a modelli più grandi e budget computazionali sensibilmente superiori.
Quella replica dovrebbe mantenere intatta la separazione centrale. I ricercatori hanno bisogno di ricette rappresentative dei modelli su più versioni temporali del corpus, non di un confronto in cui ogni variabile cambia contemporaneamente. Saranno importanti anche più seed e uno sforzo comparabile sugli iperparametri.
Se il moltiplicatore dei dati resterà maggiore a scala più elevata, la tesi centrale diventerà molto più forte. I laboratori di frontiera avrebbero prove più solide che la curatela resti una leva dominante di efficienza. Un moltiplicatore in calo sosterrebbe la spiegazione degli autori basata sulle navi portacontainer.
Il secondo segnale è uno studio controllato sui dati sintetici. I ricercatori dovrebbero iniziare con un corpus limitato e di alta qualità, quindi confrontare due strategie. Una ripete il materiale originale, mentre l'altra lo espande tramite esempi sintetici generati con cura.
La valutazione deve verificare più della precisione sui benchmark. Dovrebbe misurare novità, affidabilità fattuale, diversità, memorizzazione e prestazioni al di fuori dei domini più forti del generatore. Altrimenti, l'espansione sintetica potrebbe limitarsi a riprodurre schemi familiari.
Un forte vantaggio dei dati sintetici indebolirebbe l'idea di un imminente muro dei dati fissi. I laboratori potrebbero trasformare materiale limitato creato da esseri umani in curricula molto più ampi. Risultati deboli aumenterebbero il valore strategico di dati con licenza e generati da esperti.
Il terzo segnale è l'ampiezza della valutazione. Le repliche future dovrebbero testare programmazione, matematica, capacità multilingue, recupero fattuale, ragionamento scientifico e attività a contesto lungo. Dovrebbero inoltre riportare i risultati separatamente, anziché nasconderli in una sola media.
Vantaggi dei dati coerenti in queste categorie rafforzerebbero lo studio sul preaddestramento di Dwarkesh Patel. Grandi differenze tra le categorie mostrerebbero che la qualità del corpus dipende fortemente dall'obiettivo scelto. Questo esito favorirebbe miscele specializzate rispetto a un'unica classificazione universale.
I lettori dovrebbero anche osservare le pratiche di divulgazione. Se i costruttori di modelli aperti pubblicheranno migliori dataset card, dettagli sulle miscele ed esperimenti di filtraggio, i ricercatori indipendenti potranno testare l'affermazione con maggiore rigore. La segretezza continua manterrà un ampio divario tra le evidenze pubbliche e la realtà di frontiera.
Per gli sviluppatori, la lezione immediata non è abbandonare il lavoro sulle architetture. È misurare la pipeline dati con altrettanta serietà. Tracciate duplicazione, contributo delle fonti, pesi delle miscele, aggiornamento e cambiamenti nelle prestazioni derivanti da ogni decisione di filtraggio.
Per i team aziendali, la lezione è chiedersi da dove provenga la conoscenza del modello e come venga mantenuta. Un modello più grande non può garantire risposte aggiornate, rilevanti o tracciabili. Input informativi migliori spesso contano prima di un ulteriore livello di complessità del modello.
Per i lavoratori della conoscenza, la domanda pratica è simile: quali informazioni meritano un'attenzione limitata? Una selezione migliore può migliorare sia il ragionamento umano sia quello delle macchine. Raccogliere tutto senza struttura sposta semplicemente il problema del filtraggio.
I risultati sui dati di Dwarkesh Patel rendono difficile ignorare una conclusione. Le narrazioni pubbliche hanno dato troppa enfasi ai cambiamenti visibili dei modelli perché le architetture sono più facili da nominare rispetto alle pipeline dei corpora. Le evidenze controllate attribuiscono ora alla variabile più silenziosa un ruolo molto più ampio.
I prossimi tre test decideranno fino a che punto si estenda quel ruolo. Cercate una replica con maggiore capacità di calcolo, un confronto tra sintesi e ripetizione e valutazioni di capacità diversificate. Insieme, potranno confermare o circoscrivere l'affermazione secondo cui i progressi nel preaddestramento sono derivati soprattutto dai dati.
Fino ad allora, considerate il risultato di 12 volte come un forte segnale sperimentale, non una costante universale. Verificate le informazioni che alimentano i vostri sistemi, testate i cambiamenti rispetto a compiti reali e conservate le fonti dietro ogni conclusione. Modelli migliori continuano a contare, ma le loro prestazioni iniziano da ciò che viene loro consentito di apprendere.



