Il world model Pokémon di stmonty gira in locale, ma la vera prova è la pianificazione a lungo termine
Lo sviluppatore stmonty ha addestrato un world model Pokémon da 12,5 milioni di parametri su una RTX 3080 Ti, usandolo poi per selezionare uno starter in Pokémon Red. Il modello non ha ricevuto le regole del gioco, una mappa né una ricompensa per aver ottenuto un Pokémon. Ha imparato prevedendo ciò che sarebbe accaduto dopo ogni pressione di un pulsante.
Il risultato può sembrare un’altra voce nella crescente raccolta di dimostrazioni di AI che giocano ai videogiochi. Tuttavia, il punto interessante non è se un’AI possa completare una sequenza di gioco familiare. Modelli linguistici più grandi e sistemi convenzionali di apprendimento per rinforzo hanno già affrontato sfide Pokémon molto più ampie.
Il world model Pokémon di stmonty verifica una tesi più circoscritta. Un piccolo modello predittivo può apprendere dinamiche ambientali utili dagli screenshot, pianificare all’interno della propria rappresentazione appresa e funzionare su hardware accessibile a uno sviluppatore indipendente?
La risposta è un sì con riserve. Dopo il fine-tuning, il modello ha ottenuto uno starter in 52 tentativi pianificati su 100. Sequenze casuali di pulsanti non hanno registrato successi, mentre lo stesso processo di ricerca abbinato a un predittore non addestrato ha avuto successo una sola volta.
Questi numeri mostrano che il modello appreso ha fornito informazioni utili. Definiscono anche i limiti del progetto. La posizione iniziale era stata selezionata con cura, il piano copriva appena 14 pressioni di pulsanti e premere ripetutamente A costituiva già una soluzione valida.
Il progetto offre quindi evidenza a favore di sperimentazioni accessibili sui world model, non di un giocatore Pokémon generalista. La lezione più importante deriva dal divario tra prevedere una singola azione e mantenere una previsione utile attraverso molte azioni.
Questo divario colloca l’esperimento all’interno di una competizione più ampia tra due percorsi dell’AI. Un percorso usa modelli grandi e generalisti, con conoscenza linguistica, strumenti esterni, memoria e un’ampia capacità di calcolo. L’altro costruisce sistemi più piccoli attorno alle dinamiche di un ambiente specifico.
Il progetto di stmonty non risolve questa competizione. Mostra però perché i modelli predittivi compatti restano interessanti, specialmente quando gli sviluppatori hanno bisogno di addestramento locale, sperimentazione rapida e controllo diretto sui dati.
Cosa ha fatto davvero il world model Pokémon di stmonty
Il modello ha appreso dinamiche di gioco sufficienti per guidare un breve piano, ma non ha imparato a giocare a Pokémon Red dall’inizio alla fine.
Inizialmente stmonty aveva preso in considerazione un obiettivo molto più ampio. La sequenza proposta prevedeva di raggiungere il laboratorio del Professor Oak, completare il dialogo, scegliere uno starter, uscire dall’edificio e sconfiggere il rivale.
Quel piano si è rivelato rapidamente troppo ambizioso per un primo esperimento. Il compito è stato ridotto a uno stato di salvataggio all’interno del laboratorio di Oak, dove il personaggio poteva ottenere Bulbasaur, Charmander o Squirtle.
Da quella posizione, era sufficiente premere A 12 volte. Il modello restava comunque libero di usare i controlli direzionali, annullare il dialogo con B o seguire un’altra sequenza valida. Il suo compito era identificare un piano di 14 azioni che portasse lo stato di gioco previsto vicino a un esempio di selezione riuscita dello starter.
Lo sviluppatore ha registrato 42.382 frame in scala di grigi da un emulatore di Pokémon Red. Questi frame hanno formato 1.009 brevi traiettorie contenenti uno screenshot, la pressione di un pulsante e lo screenshot successivo.
Alcune traiettorie seguivano percorsi predefiniti. Altre aggiungevano rumore o movimenti più casuali. Questa combinazione era importante perché un pianificatore esplora sia sequenze d’azione sensate sia sequenze inefficaci.
Un dataset contenente solo dimostrazioni perfette potrebbe associare A al progresso, imparando però poco su annullamenti, movimenti bloccati o input irrilevanti. Le traiettorie più disordinate hanno esposto il modello a una porzione più ampia del comportamento dell’ambiente locale.
Il sistema risultante era basato su LeWorldModel, un’architettura predittiva a embedding congiunto, o JEPA. Una JEPA prevede come cambia una rappresentazione astratta invece di ricreare ogni pixel dell’immagine successiva.
Questa distinzione mantiene l’obiettivo di addestramento concentrato sulla struttura utile. L’encoder converte uno screenshot in un embedding, ossia una rappresentazione numerica dello stato osservato. Un predittore stima quindi l’embedding successivo a partire dalla rappresentazione corrente e dall’azione selezionata.
Il resoconto del progetto afferma che la rete finale conteneva circa 12,5 milioni di parametri ed è stata addestrata localmente su una RTX 3080 Ti. L’implementazione è disponibile anche nel repository lePokeRed.
Dopo l’addestramento, stmonty ha verificato se la rappresentazione conservasse informazioni sull’obiettivo. Un piccolo classificatore poteva identificare se la squadra del giocatore contenesse un Pokémon mentre l’encoder sottostante rimaneva congelato.
Il predittore ha inoltre ottenuto risultati migliori rispetto a una baseline che copiava l’embedding corrente. Fornirgli l’azione sbagliata peggiorava la previsione, suggerendo che avesse appreso una certa relazione tra comandi e cambiamenti nel gioco.
Questi test non hanno dimostrato una pianificazione affidabile. Hanno solo mostrato che il modello rappresentava uno stato rilevante e reagiva in modo significativo al pulsante scelto.
La valutazione reale è arrivata quando la sequenza del pianificatore è stata eseguita nell’emulatore. Dopo il fine-tuning dei rollout, una sequenza proposta ha selezionato Squirtle e ha portato il conteggio dei Pokémon nella squadra da zero a uno.
In 100 ricerche con seed casuali diversi, 52 piani hanno ottenuto uno starter. Il risultato sostiene un’affermazione limitata: la rappresentazione del modello ha aiutato un pianificatore a trovare azioni utili da un punto di partenza fisso.
Non sostiene l’affermazione più ampia secondo cui il modello abbia padroneggiato in autonomia Pokémon Red. stmonty ha riconosciuto esplicitamente il divario, osservando nella discussione della community che rendere semplicemente più grande il modello attuale non risolverebbe i numerosi obiettivi intermedi del gioco.
Come il modello ha appreso i controlli prevedendo ciò che sarebbe accaduto dopo
Il meccanismo centrale era la previsione senza ricompense legate al compito, seguita dalla pianificazione verso esempi del risultato desiderato.
I dati di addestramento non etichettavano mai una traiettoria come successo né ricompensavano il modello per aver ottenuto un Pokémon. Durante l’addestramento iniziale, il sistema cercava soltanto di prevedere lo stato incorporato successivo.
Se l’immagine corrente mostrava una finestra di dialogo e l’azione registrata era A, il predittore imparava quale rappresentazione seguiva generalmente quella combinazione. Se il personaggio era rivolto verso un muro, poteva imparare che un input direzionale avrebbe potuto produrre pochi cambiamenti visibili.
Questa configurazione separa l’apprendimento dell’ambiente dalla selezione dell’obiettivo. Prima, il modello apprende come le osservazioni tendono a cambiare dopo le azioni. In seguito, un pianificatore usa quel meccanismo predittivo per cercare un risultato specifico.
La separazione è importante perché gli sviluppatori possono teoricamente riutilizzare un modello ambientale appreso per più obiettivi. Un nuovo compito richiederebbe nuovi esempi di obiettivo o una nuova logica di valutazione, ma non necessariamente una ricostruzione completa dell’ambiente.
L’architettura presentava una seria modalità di fallimento. Un encoder e un predittore addestrati insieme possono ridurre la loro perdita mappando ogni immagine sulla stessa rappresentazione. Il predittore diventa così perfettamente coerente senza conservare nulla di utile.
Questo problema è noto come collasso latente. Il design di LeWorldModel lo contrasta con SIGReg, un regolarizzatore che spinge le rappresentazioni apprese verso una forma gaussiana distribuita.
Il paper su LeWorldModel presenta questo approccio come un modo per addestrare una JEPA end-to-end a partire da pixel grezzi. Tra gli autori figurano Lucas Maes, Quentin Le Lidec, Damien Scieur, Yann LeCun e Randall Balestriero.
LeWorldModel usa una perdita di previsione del prossimo embedding insieme al regolarizzatore. Il suo codice di ricerca ufficiale fornisce checkpoint, riferimenti ai dati e un’implementazione del metodo più ampio.
stmonty ha adattato questa direzione di ricerca a Pokémon Red. Una volta addestrata la rappresentazione, lo sviluppatore ha fornito al pianificatore embedding provenienti da selezioni riuscite di Bulbasaur, Charmander e Squirtle.
Questi embedding di obiettivo descrivevano l’aspetto del successo senza specificare il percorso corretto. Il sistema immaginava quindi come le sequenze candidate di pulsanti avrebbero modificato lo stato corrente.
La ricerca ha usato il metodo dell’entropia incrociata, un processo di campionamento che si concentra gradualmente sui candidati migliori. Ogni round generava 512 piani completi di 14 azioni.
Il pianificatore confrontava gli stati previsti con i tre embedding di obiettivo. Conservava i 64 piani con le distanze minori, quindi aumentava la probabilità delle rispettive scelte di pulsanti nel round di campionamento successivo.
Questo processo non equivale a chiedere a un chatbot cosa fare. Il pianificatore cercava all’interno delle dinamiche apprese dagli screenshot registrati.
Non era nemmeno il classico apprendimento per rinforzo guidato da ricompense. Il world model non imparava attraverso un punteggio continuo per azioni buone e cattive. L’obiettivo entrava dopo l’addestramento tramite la somiglianza con esempi di risultati riusciti.
Questo design ha creato un’interessante forma di modularità. La previsione catturava l’ambiente locale, gli embedding di obiettivo definivano il successo e l’algoritmo di ricerca esplorava le possibili sequenze d’azione.
Il primo tentativo è comunque fallito. La traiettoria pianificata sembrava riuscita all’interno della rappresentazione appresa, ma non ha ottenuto un Pokémon quando è stata eseguita nell’emulatore.
Il fallimento ha rivelato una discrepanza tra addestramento e pianificazione. Durante l’addestramento ordinario, ogni previsione a un passo iniziava dall’embedding di uno screenshot reale. Ogni nuovo frame azzerava di fatto gli errori di previsione precedenti.
La pianificazione funzionava diversamente. Dopo lo screenshot iniziale, il predittore doveva usare il proprio stato stimato come input per il passo successivo. Ogni piccolo errore poteva distorcere la previsione seguente.
Dopo diverse azioni immaginate, il rollout poteva entrare in una rappresentazione che appariva interessante al pianificatore ma non corrispondeva più al gioco reale. Il processo di ricerca sfruttava quindi l’errore del modello.
Questo è un problema comune nei sistemi predittivi. Un modello può ottenere buoni risultati su previsioni isolate del passo successivo, diventando però inaffidabile quando i propri output alimentano le previsioni future.
stmonty lo ha affrontato con il fine-tuning dei rollout. L’encoder è rimasto fisso, mentre il predittore e l’encoder delle azioni si esercitavano a prevedere a partire dai propri stati stimati precedenti.
L’addestramento è iniziato con rollout brevi, estendendoli gradualmente. Al dodicesimo passo previsto, l’errore quadratico medio riportato è sceso da 0,4224 a 0,3045.
La prima previsione è peggiorata leggermente, ma l’errore si è accumulato più lentamente lungo la sequenza. Questo compromesso si adattava meglio al compito di pianificazione, in cui la coerenza sostenuta contava più dell’ottimizzazione di un singolo passo isolato.
Perché conta una sola RTX 3080 Ti
La GPU consumer è significativa perché rende l’esperimento riproducibile nello spirito, non perché dimostri che i piccoli modelli possano sostituire i sistemi di AI generalista.
La copertura dell’AI moderna tratta spesso la scala come la storia centrale. I conteggi dei parametri arrivano ai miliardi, i cluster di addestramento consumano migliaia di acceleratori e l’accesso dipende dall’infrastruttura cloud.
Il world model Pokémon di stmonty sposta l’attenzione verso un ciclo di sviluppo più piccolo. Una persona ha selezionato un compito circoscritto, registrato i dati di addestramento, adattato ricerche recenti, diagnosticato un fallimento nella pianificazione e riaddestrato localmente i componenti pertinenti.
Una RTX 3080 Ti non è un comune dispositivo di fascia bassa. È una GPU da gaming capace, con 12 GB di memoria. Tuttavia, appartiene a una categoria diversa rispetto ai cluster specializzati usati per i modelli fondamentali di frontiera.
Questa differenza influenza chi può testare un’idea. Lo sviluppo locale offre ai ricercatori accesso diretto a checkpoint, tracce, dataset e fallimenti. Evita inoltre di inviare ogni input sperimentale attraverso un modello ospitato.
Il vantaggio è particolarmente evidente nel lavoro specifico per un ambiente. Uno sviluppatore che indaga su un robot, un gioco, un’interfaccia o una simulazione potrebbe non aver bisogno di un’ampia competenza linguistica. Un modello compatto può dedicare la sua capacità limitata alle dinamiche che contano.
I modelli piccoli rendono inoltre più semplice l’iterazione. Un piano fallito può portare a una modifica mirata, come avvenuto qui con il fine-tuning dei rollout. Gli sviluppatori possono confrontare le esecuzioni, ispezionare la copertura dei dati e rivedere le ipotesi senza ricostruire un enorme sistema generico.
Tuttavia, l’addestramento locale non implica automaticamente un’ampia accessibilità. Riprodurre l’esperimento richiede comunque competenze di machine learning, strumentazione dell’emulatore, raccolta dati, hardware adeguato e pazienza.
Il modello descritto ha inoltre appreso una sola regione limitata di un gioco. Il suo dataset non era una mappa completa di Pokémon Red e il pianificatore partiva da uno stato di salvataggio fisso.
Il progetto va quindi inteso soprattutto come un prototipo di ricerca accessibile. Riduce la barriera computazionale per una specifica classe di esperimenti, lasciando però intatte notevoli barriere ingegneristiche.
La più ampia ricerca LeWorldModel rafforza questa interpretazione. Il paper descrive un’architettura di circa 15 milioni di parametri addestrata su una singola GPU per i suoi compiti sperimentali. Valuta ambienti di navigazione, manipolazione e pianificazione del movimento, senza rivendicare un’intelligenza generale.
Per gli sviluppatori, il segnale utile è l’efficienza architetturale. Una rappresentazione predittiva non deve generare fotogrammi futuri fotorealistici né verbalizzare ogni scelta. Può preservare soltanto la struttura necessaria per pianificare.
Questo può ridurre la dimensione del modello e il costo della valutazione di molte azioni candidate. Rende inoltre l’obiettivo del sistema più specifico rispetto a un modello linguistico sollecitato a dedurre i controlli da screenshot e testo.
Eppure, la specializzazione comporta costi propri. Lo sviluppatore ha dovuto raccogliere oltre 42.000 fotogrammi per un compito che un essere umano già comprende. Un modello generale potrebbe disporre di conoscenze pregresse su Pokémon, menu, dialoghi e obiettivi a lungo termine.
Il confronto non è quindi semplicemente tra piccolo e grande. È tra conoscenza pregressa e apprendimento specifico per il compito, controllo locale e competenza generale, previsione efficiente e ragionamento flessibile.
I recenti esperimenti su Pokémon rendono visibile questo confronto. Alcuni sistemi usano modelli linguistici, memoria di gioco, liste di azioni create manualmente o coaching esterno. Altri usano l’apprendimento per rinforzo rispetto a obiettivi espliciti.
Il modello di stmonty ha seguito una via visiva più rigorosa. Ha appreso da fotogrammi in scala di grigi e input registrati, quindi ha pianificato attraverso la rappresentazione risultante.
Questo input più ristretto è al tempo stesso il punto di forza e il limite del progetto. Conferisce al risultato chiarezza tecnica, ma rimuove informazioni che aiuterebbero a risolvere l’intero gioco.
Un modello che legge il testo può capire che le medaglie delle palestre sbloccano i progressi successivi. Un modello predittivo addestrato attorno al laboratorio del Professor Oak non riceve alcuna spiegazione naturale di questa gerarchia.
L’hardware consumer rende degno di nota il ciclo di apprendimento locale. Non elimina la necessità di una struttura degli obiettivi, dati diversificati o sistemi in grado di operare su periodi più lunghi.
Il Vero Avversario È l’Orizzonte di Pianificazione
Il problema più difficile dell’esperimento non era riconoscere i pulsanti, ma mantenere utili le previsioni mentre il piano si estendeva oltre brevi sequenze familiari.
Un orizzonte di 14 azioni ha già creato una deriva sufficiente a sconfiggere il primo pianificatore. Lo stato previsto dal modello si è gradualmente separato dallo stato effettivo dell’emulatore, anche se le singole transizioni apparivano plausibili.
Obiettivi Pokémon più lunghi moltiplicano questo problema. Attraversare una stanza richiede navigazione spaziale. I dialoghi richiedono contesto sulle selezioni precedenti. Le lotte aggiungono menu, salute, tipi, mosse e avversari variabili.
Il gioco completo contiene inoltre dipendenze distribuite nell’arco di ore. Un giocatore deve scoprire obiettivi intermedi, ricordare i compiti completati, ottenere gli oggetti richiesti e adattarsi quando un piano precedente fallisce.
stmonty ha individuato direttamente il problema nello scambio su Hacker News. Scalare fino al completamento dell’intero gioco richiederebbe rappresentazioni per obiettivi intermedi e un modo per organizzarli nel tempo.
Una versione più grande della stessa rete a breve orizzonte mancherebbe comunque di un meccanismo esplicito per quella gerarchia. Più parametri potrebbero migliorare le previsioni, ma non identificherebbero automaticamente quale medaglia, oggetto o luogo debba diventare l’obiettivo successivo.
È qui che i modelli generalisti mantengono un vantaggio. Possono usare la conoscenza linguistica per riconoscere concetti di gioco e ragionare su sequenze descritte in guide, dialoghi o memoria.
La loro debolezza è diversa. I modelli ampi possono allucinare azioni, perdere traccia dello stato, ripetere errori o consumare risorse significative ragionando su semplici decisioni di controllo.
Un modello del mondo specifico per il compito può gestire le dinamiche locali in modo più efficiente. Un sistema di livello superiore potrebbe quindi selezionare gli obiettivi, mentre il modello predittivo gestisce le sequenze brevi.
Questa progettazione a livelli è emersa nella discussione della comunità. Un partecipante ha suggerito modelli del mondo gerarchici che operano su diverse scale temporali. Un componente di alto livello potrebbe ragionare sul battere una palestra, mentre un modello di livello inferiore prevede i singoli input.
Un sistema simile assomiglierebbe a molti agenti pratici. Un componente mantiene gli obiettivi, un altro modella l’ambiente e un controller sceglie o verifica le azioni.
Tuttavia, l’esperimento attuale non ha testato questa architettura. Aveva tre embedding di obiettivi iniziali, una posizione di partenza e un orizzonte di pianificazione fisso.
Anche il tasso di successo del 52 percento merita un’interpretazione prudente. Era di gran lunga superiore alla baseline casuale, ma derivava da ricerche ripetute sullo stesso stato iniziale.
Il modello non ha dimostrato resilienza in stanze diverse, dialoghi mai visti, inventari variabili o lotte. Questi test richiederebbero dati più ampi e condizioni iniziali più varie.
All’interno dell’esperimento esiste un’altra baseline importante. Premere A 12 volte completava già il compito dallo stato di salvataggio.
Questo fatto non cancella il contributo del modello appreso. Le sequenze di azioni casuali continuavano a fallire e il predittore addestrato ha aiutato la ricerca a scoprire piani validi. Ridimensiona però qualsiasi affermazione secondo cui il sistema abbia mostrato un’ampia comprensione strategica.
Il vero risultato è stato apprendere una rappresentazione che supportava una ricerca guidata dagli obiettivi. La vera incertezza è se quella rappresentazione resti utile quando il successo dipende da catene causali più lunghe e variate.
L’apprendimento per rinforzo convenzionale offre un altro confronto. Un agente Pokémon collegato e citato nella discussione ha usato proximal policy optimization per un obiettivo di gioco molto più ampio.
Questa strada dipende da una progettazione esplicita della ricompensa e da interazioni ripetute. Il modello del mondo Pokémon di stmonty ha invece appreso le dinamiche senza ricevere l’obiettivo iniziale durante l’addestramento iniziale.
Nessuno dei due approcci prevale universalmente. Gli agenti guidati dalla ricompensa possono ottimizzare direttamente il comportamento, mentre i modelli del mondo possono separare la previsione ambientale dagli obiettivi successivi.
La domanda rilevante è quale metodo resti efficiente man mano che l’ambiente si espande. Una valutazione più ampia confronterebbe requisiti di dati, tempi di addestramento, tassi di fallimento e generalizzazione tra stati di salvataggio.
Senza queste misurazioni, il progetto non dovrebbe essere presentato come prova che piccoli modelli del mondo superino l’apprendimento per rinforzo o i modelli fondamentali. È la prova che un sistema predittivo compatto può produrre piani brevi utili da dati visivi.
È una conclusione più modesta, ma anche quella tecnicamente significativa.
Cosa Osservare Dopo il Modello del Mondo di Pokémon Red
Tre test successivi mostrerebbero se si tratta di un progetto di agente locale riutilizzabile o di una dimostrazione riuscita legata a un singolo compito attentamente delimitato.
Il primo segnale è la prestazione in stati iniziali variabili. Una valutazione più solida partirebbe da più posizioni all’interno del laboratorio del Professor Oak, incluse orientazioni non familiari e diverse fasi del dialogo.
Il successo in queste condizioni dimostrerebbe che il modello ha catturato più di un percorso ristretto attraverso un singolo stato di salvataggio. Un forte calo suggerirebbe che il pianificatore dipende pesantemente dall’esatta distribuzione di addestramento.
Il secondo segnale è un obiettivo più lungo con passaggi intermedi. stmonty ha proposto di iniziare altrove nel laboratorio, camminare fino a Oak, completare il suo dialogo e poi selezionare uno starter.
Il compito resta gestibile, ma costringe il modello a sostenere un rollout più lungo. Verifica inoltre se il pianificatore può collegare movimento, interazione e dialogo in una sequenza coerente.
Risultati affidabili in questo caso rafforzerebbero l’argomentazione a favore della pianificazione predittiva locale. Fallimenti ripetuti confermerebbero che la lunghezza dell’orizzonte, anziché il numero di parametri o la capacità della GPU, resta il collo di bottiglia decisivo.
Il terzo segnale è un controller gerarchico. Lo sviluppatore ha affermato che un gioco completo richiederebbe molteplici obiettivi intermedi e dati più diversificati provenienti da lotte, menu, dialoghi e luoghi.
Un sistema futuro potrebbe combinare un selettore di obiettivi di alto livello con un modello del mondo di basso livello. Il componente di alto livello potrebbe decidere di raggiungere Oak, scegliere uno starter o uscire dall’edificio. Il predittore locale potrebbe cercare gli input necessari per completare ogni passaggio.
Questa progettazione creerebbe anche punti di valutazione più chiari. I ricercatori potrebbero misurare separatamente se il sistema ha scelto il sotto-obiettivo corretto e se il pianificatore delle azioni lo ha eseguito.
Gli sviluppatori dovrebbero inoltre osservare le riproduzioni indipendenti. Il codice è pubblico, ma il risultato di un singolo autore non rivela quanto l’esito sia sensibile alla raccolta dati, ai seed, agli iperparametri o ai dettagli di implementazione.
La riproduzione su un’altra GPU consumer rafforzerebbe l’affermazione di accessibilità. Testare un altro ambiente visivo direbbe di più sulla trasferibilità del metodo oltre Pokémon Red.
Il contributo più forte del progetto non è un gioco completato. È una registrazione trasparente di un piccolo modello che fallisce, rivela perché ha fallito e migliora attraverso un aggiustamento mirato.
Questo flusso di lavoro è importante per la ricerca sull’IA locale. I sistemi compatti espongono errori che possono diventare difficili da interpretare all’interno di uno stack di agenti molto più grande.
Il modello del mondo Pokémon di stmonty offre inoltre agli sviluppatori una domanda concreta da perseguire. Quanta pianificazione può supportare una piccola rappresentazione predittiva prima di aver bisogno di linguaggio, memoria, obiettivi gerarchici o un diverso segnale di addestramento?
Per ora, la risposta va da uno stato di salvataggio nel laboratorio a un Pokémon starter. Il prossimo risultato utile arriverà estendendo quel confine senza nascondere nuova assistenza all’interno del sistema.
Se costruisci agenti locali, segui le evidenze anziché lo spettacolo. Testa nuovi stati iniziali, misura la deriva dei rollout, confronta baseline significative e registra ogni intervento. Un piano riuscito più lungo rafforzerebbe il caso a favore di modelli del mondo compatti. Un collasso fuori dal laboratorio di Oak sarebbe altrettanto utile, perché identificherebbe il limite architetturale che il prossimo esperimento dovrà affrontare.



