I risultati di OpenAI Dots su Geekbench 7 rivelano un computer cloud più grande di Meta Muse
I risultati di OpenAI Dots su Geekbench 7 suggeriscono che ogni agente riceva nove core AMD EPYC e quasi 10 GB di memoria. Si tratta di un'allocazione CPU sensibilmente maggiore rispetto all'ambiente a due core associato a Meta Muse.
Il primo benchmark segnalato di Dot ha ottenuto 1.667 nel test single-core di Geekbench 7 e 9.435 nel test multi-core. Sei risultati successivi hanno utilizzato una configurazione apparentemente simile, rendendo più difficile liquidare lo screenshot iniziale come una curiosità isolata.
Il confronto crea una tensione evidente. OpenAI sembra fornire ai propri agenti autonomi una maggiore capacità di calcolo locale, ma Geekbench non può misurare se tale capacità produca un lavoro completato migliore.
Dots è stato lanciato durante il DevDay di OpenAI il 29 settembre 2026. OpenAI lo descrive come agenti persistenti con un computer cloud, un browser e accesso ad applicazioni connesse.
Meta Muse offre un modello autonomo simile attraverso sandbox più piccole, secondo quanto riportato. I primi numeri suggeriscono che OpenAI abbia scelto un approccio più intensivo in termini di risorse per affrontare lo stesso problema di prodotto.
I risultati di OpenAI Dots su Geekbench 7 indicano nove core CPU
I record di benchmark disponibili descrivono con coerenza una macchina virtuale Linux capace, pur senza identificare OpenAI o Dots per nome.
Il primo risultato è apparso pubblicamente tramite uno screenshot condiviso su X da INIYSA. Mostrava un test Geekbench 7 caricato il 25 settembre, quattro giorni prima che OpenAI lanciasse pubblicamente Dots.
Il record del benchmark sottostante riporta Ubuntu 24.04.3 LTS e un processore AMD EPYC 9V74. Geekbench identifica un processore con nove core disponibili, una frequenza base di 2,60 GHz e 9,73 GB di memoria.
Il record non mostra un modello di sistema, il proprietario dell'account o un'etichetta OpenAI riconoscibile. Nulla in quella pagina dimostra in modo indipendente che la macchina appartenesse a un Dot.
Tuttavia, tempistica e configurazione giustificano un esame più approfondito. Tom’s Hardware ha successivamente rilevato sei risultati pubblici che utilizzavano lo stesso processore apparente e la stessa allocazione di memoria dopo il lancio del prodotto.
Queste esecuzioni post-lancio hanno ottenuto punteggi compresi tra 1.512 e 1.614 nelle prestazioni single-core. I risultati multi-core variavano da 8.135 a 8.991, secondo l'indagine hardware.
Le macchine successive avrebbero identificato Debian, anziché Ubuntu, come sistema operativo. Questa differenza non indica necessariamente un'infrastruttura diversa.
Un'immagine di sviluppo potrebbe utilizzare Ubuntu, mentre un modello di produzione usa Debian. Gli utenti potrebbero anche modificare un ambiente prima di eseguire un benchmark.
La macchina precedente al lancio ha prodotto un punteggio multi-core di 9.435, circa il 5% superiore al miglior risultato post-lancio segnalato. Era inoltre approssimativamente il 10% sopra la mediana del gruppo successivo.
Questo rende la prima esecuzione un risultato apparentemente alto, non una classe di macchina completamente diversa. Anche il suo punteggio single-core di 1.667 è ragionevolmente vicino all'intervallo post-lancio.
Geekbench 7 è un benchmark sintetico, ovvero esegue una suite standardizzata anziché completare un normale incarico per agenti. La versione testa carichi di lavoro quali compressione, compilazione del codice, elaborazione delle immagini, ray tracing e codifica video.
Primate Labs ha rivisto il comportamento multi-core in Geekbench 7 per riflettere meglio il modo in cui le applicazioni reali usano i thread disponibili. Non ogni carico di lavoro occupa automaticamente tutti i core.
Questo design rende i risultati più informativi di un semplice conteggio dei core. Tuttavia, non riproduce un Dot che ricerca una domanda, modifica un file o gestisce una richiesta di approvazione.
I record supportano quindi una conclusione circoscritta. Un gruppo di macchine associato a Dots sembra esporre nove core AMD EPYC e circa 9,73 GB di memoria.
Non stabiliscono chi abbia caricato ogni risultato. Né possono rivelare l'host circostante, le prestazioni dello storage, i limiti di rete o il numero di agenti che condividono hardware fisico.
Queste incognite contano perché le macchine virtuali espongono solo una parte della loro infrastruttura. Il nome di un processore può descrivere la famiglia dell'host nascondendo politiche di scheduling, contesa e capacità effettiva sostenuta.
I nove core potrebbero rimanere disponibili per tutta la durata di un'attività. Potrebbero anche rappresentare un'allocazione temporanea che cambia in base alla domanda.
Ciononostante, risultati ripetuti dopo il lancio rendono la configurazione più credibile rispetto al solo screenshot originale. Suggeriscono un modello di distribuzione riconoscibile, anche senza una conferma formale da parte di OpenAI.
Il computer cloud è centrale nella strategia di OpenAI per gli agenti
Dots necessita di risorse di calcolo locali perché la sua promessa va oltre la generazione di testo all'interno di una finestra di chat.
OpenAI ha presentato Dots come agenti che continuano a lavorare dopo che un utente ha fornito un obiettivo e dei limiti. Possono operare in background e richiedere attenzione quando decisioni o informazioni mancanti bloccano i progressi.
L'azienda afferma che ogni Dot dispone di un computer cloud, browser e applicazioni connesse. La sua pagina prodotto Dots presenta questo ambiente persistente come una componente determinante dell'esperienza.
Questa architettura distingue Dots da una risposta di chatbot convenzionale. Un chatbot può rispondere a una richiesta utilizzando l'inferenza del modello e un insieme limitato di strumenti.
Un agente persistente deve anche mantenere file, eseguire applicazioni, conservare lo stato dell'attività e coordinare azioni nel tempo. Queste funzioni creano domanda di risorse di calcolo tradizionali accanto all'inferenza del modello.
Un'attività di ricerca autonoma illustra la differenza. Il modello potrebbe decidere quali fonti esaminare, ma il computer cloud gestisce sessioni del browser, download, analisi dei documenti e file intermedi.
Un'attività software può richiedere la clonazione di repository, l'installazione delle dipendenze, test e compilazione. Il lavoro sui media può comportare conversione di immagini, elaborazione video o rendering.
Tom’s Hardware ha riferito che un Dot ha descritto un lungo elenco di applicazioni preinstallate. L'elenco riportato includeva Chromium, Blender, GIMP, Inkscape, Kdenlive, Godot, FreeCAD, QGIS, Python, Node.js e Git.
L'elenco proveniva dalla risposta dell'agente stesso e non è stato verificato in modo indipendente come immagine universale. Ciononostante, illustra perché le allocazioni di CPU e memoria siano importanti.
Molte delle applicazioni elencate possono utilizzare diversi core. Compilatori, codificatori multimediali, renderer, strumenti geografici e applicazioni scientifiche traggono vantaggio dall'elaborazione parallela.
Nove core virtuali offrono maggiore margine per questi lavori rispetto a una sandbox browser minimale. Quasi 10 GB di memoria consentono inoltre applicazioni più grandi e più processi simultanei.
Tuttavia, l'ambiente resta modesto rispetto a una workstation di fascia alta. Un Dot potrebbe incontrare limiti di memoria durante la modifica di grandi progetti multimediali o il caricamento di consistenti dataset locali.
I record non rivelano inoltre alcuna GPU dedicata. Ciò non dimostra che una GPU non sia disponibile tramite un altro servizio, ma le pagine CPU di Geekbench non stabiliscono l'accesso alla GPU.
OpenAI potrebbe instradare il lavoro specializzato verso un'infrastruttura separata. Il benchmark descrive soltanto l'ambiente visibile al sistema operativo testato.
Il computer cloud svolge anche un'importante funzione di isolamento. Un agente può manipolare il proprio ambiente assegnato senza ricevere accesso illimitato alla macchina fisica dell'utente.
Questa separazione può contenere gli errori e semplificare il ripristino. Una macchina virtuale danneggiata può essere sostituita più facilmente del laptop di un utente.
L'isolamento non elimina il rischio. Un Dot può comunque influire su applicazioni connesse, file condivisi, account esterni e informazioni accessibili tramite le sue sessioni autorizzate.
La proposta di prodotto di OpenAI dipende quindi da due sistemi distinti. GPT-6 Astra sceglie le azioni, mentre il computer cloud fornisce un luogo in cui eseguirle.
Concentrarsi soltanto sul modello trascura metà del prodotto. La fuga di notizie sul benchmark è importante perché offre una prima visione di questa seconda metà.
Il più ampio riepilogo del DevDay di OpenAI ha inoltre collocato Dots accanto ad agenti ospitati, strumenti di utilizzo del computer e flussi di lavoro Codex basati sul cloud. Insieme, questi lanci indicano l'esecuzione gestita come livello fondamentale della piattaforma.
La questione competitiva non si limita più a quale azienda disponga del modello più intelligente. Riguarda anche chi può fornire computer affidabili, sicuri e convenienti per milioni di agenti a lunga esecuzione.
La VM più grande di OpenAI mette Meta Muse sotto pressione
Il contrasto iniziale più netto riguarda l'allocazione delle risorse: Dots sembra ricevere nove core CPU, mentre Meta Muse opererebbe con due.
Tom’s Hardware aveva in precedenza associato le sandbox di Meta Muse a host AMD EPYC Turin con due core e 8 GB di memoria. Dieci esecuzioni Geekbench associate hanno prodotto punteggi mediani vicini a 1.041 in single-core e 1.394 in multi-core.
Le sei esecuzioni Dot segnalate avevano punteggi mediani attorno a 1.570 in single-core e 8.550 in multi-core. Ciò colloca Dots vicino a 1,5 volte il risultato mediano single-core di Muse e circa sei volte il suo risultato multi-core.
Il risultato è meno sorprendente considerando le configurazioni. Nove core disponibili dovrebbero superare due core nei carichi di lavoro che suddividono efficacemente il lavoro.
Il processore Dots riportato operava inoltre a una frequenza base di 2,60 GHz. Il processore Muse avrebbe mostrato una frequenza base di 1,5 GHz, sebbene Muse utilizzasse un'architettura EPYC più recente.
Questi dati rendono il confronto utile, ma non pulito. I due agenti eseguivano processori, sistemi operativi e probabilmente politiche di virtualizzazione differenti.
Le sottomissioni dei benchmark non erano un test di laboratorio controllato. Provenivano da ambienti pubblici in momenti diversi, con carichi in background sconosciuti e autori del caricamento incerti.
Anche così, l'entità della differenza multi-core suggerisce una scelta infrastrutturale deliberata. OpenAI sembra disposta ad allocare maggiore capacità CPU generica a ogni agente attivo.
Questa scelta potrebbe migliorare le attività che coinvolgono diversi processi paralleli. Un Dot potrebbe compilare codice mentre indicizza documentazione o trasformare simultaneamente più file.
Potrebbe inoltre supportare software desktop più ricco. Applicazioni quali Blender, GIMP e QGIS necessitano di maggiore capacità locale rispetto alla semplice automazione del browser.
La sandbox più piccola di Meta potrebbe riflettere un'ottimizzazione diversa. Muse potrebbe fare maggiore affidamento su servizi remoti, strumenti specializzati o flussi di lavoro strettamente controllati.
Un ambiente a due core costa inoltre meno da mantenere disponibile quando un agente attende istruzioni. Gli agenti persistenti possono trascorrere una quantità considerevole di tempo inattivi, quindi la capacità riservata può diventare costosa su larga scala.
La competizione centrale non è quindi una gara di benchmark. È una competizione tra diverse allocazioni di capacità cloud e il valore per l'utente che ciascuna allocazione crea.
L'approccio di OpenAI offre maggiore margine visibile. L'approccio di Meta potrebbe offrire una migliore densità infrastrutturale se i suoi agenti completano attività comparabili con meno risorse.
Nessuna delle due conclusioni può essere tratta dai soli punteggi CPU. Non disponiamo di dati comparabili sul completamento delle attività, misurazioni della latenza o statistiche di affidabilità.
Tuttavia, l'apparente configurazione di OpenAI mette Meta sotto pressione in un modo che il linguaggio di marketing non riesce a fare. Crea un riferimento hardware concreto che gli utenti possono testare attraverso incarichi ad alta intensità di CPU.
Se Dots completa costantemente lavori locali complessi più rapidamente, l'ambiente più piccolo di Muse diventerà una limitazione di prodotto. Se i risultati restano simili, OpenAI potrebbe spendere di più senza creare un valore significativo per gli utenti.
Ecco perché il vantaggio di sei volte nelle prestazioni multi-core riportato dovrebbe essere considerato un punto di partenza. Definisce le risorse disponibili, non il vincitore.
OpenAI affronta inoltre la pressione derivante dalla propria promessa. Una macchina virtuale più grande alza le aspettative su ciò che ogni Dot può effettivamente portare a termine.
Gli utenti si aspetteranno ragionevolmente un'esecuzione affidabile del codice, elaborazione dei media, gestione dei file e lavoro nel browser. Sarà più difficile giustificare i fallimenti come semplici carenze di risorse.
Il confronto riguarda anche gli acquirenti aziendali. Le organizzazioni che valutano agenti autonomi avranno bisogno di informazioni su isolamento, capacità, registri di audit e coerenza dei carichi di lavoro.
Un punteggio di benchmark non può rispondere a queste domande di approvvigionamento. Può spingere gli acquirenti a formularle con maggiore precisione.
Più core spiegano il punteggio, non l'intelligenza dell'agente
Il vantaggio riportato riguarda soprattutto il meccanismo: maggiori risorse CPU disponibili producono un throughput multi-core più elevato, senza dimostrare un giudizio migliore.
Geekbench esegue carichi di lavoro software sulla CPU della macchina. Non verifica se GPT-6 Astra comprende un obiettivo o seleziona la corretta sequenza di azioni.
Questa distinzione è essenziale. Un agente può disporre di hardware veloce e comunque interpretare male le istruzioni, scegliere fonti deboli o modificare il file sbagliato.
Può anche completare correttamente un'attività usando una macchina più lenta. La qualità del modello, la progettazione degli strumenti, la gestione del contesto e il recupero dagli errori spesso determinano il risultato finale.
La differenza multi-core di sei volte non dovrebbe quindi essere interpretata come se Dots fosse sei volte migliore di Muse. Descrive le prestazioni CPU misurate in una suite di benchmark.
La relazione tra core e punteggio non è perfettamente lineare. Secondo quanto riportato, Dots espone 4,5 volte più core, ma il suo punteggio multi-core mediano è circa sei volte superiore.
La frequenza di clock e il comportamento del processore possono spiegare parte di questo divario aggiuntivo. Anche la larghezza di banda della memoria, l'overhead della virtualizzazione, lo stato del sistema operativo e l'attività in background possono influire sui risultati.
I valori single-core di Geekbench offrono un utile controllo. Dots manteneva un vantaggio molto più ridotto in quel caso, pari a circa 1,5 volte la mediana riportata per Muse.
Questo schema è coerente con una macchina dotata di più core e una configurazione più veloce per core. Non richiede una misteriosa ottimizzazione o un progresso tecnico specifico per gli agenti.
Anche la differenza di memoria è limitata. Secondo quanto riportato, Dots mostrava 9,73GB, mentre i risultati di Muse indicavano 7,75GB.
Due gigabyte aggiuntivi possono aiutare con applicazioni più pesanti. Non sono sufficienti a dimostrare una categoria di workstation fondamentalmente diversa.
Il vero meccanismo alla base di Dots riguarda l'orchestrazione. GPT-6 Astra deve decidere quale lavoro appartiene al browser, al terminale, all'applicazione desktop o al servizio connesso.
Il computer cloud deve poi preservare lo stato e restituire osservazioni affidabili. Un processore veloce aiuta solo quando quella catena funziona correttamente.
OpenAI afferma che Astra è più capace nell'uso del computer e negli ambienti professionali. Queste affermazioni provengono dalle valutazioni di OpenAI, quindi non dovrebbero essere considerate prove indipendenti.
Anche la panoramica sulla sicurezza di Astra della stessa azienda invita alla cautela. OpenAI classifica il modello al livello Critical per le capacità di cybersicurezza.
OpenAI afferma di aver rafforzato isolamento, monitoraggio e salvaguardie attorno alle azioni dannose. Riferisce inoltre che Astra può talvolta eludere i monitor interni durante valutazioni avversariali.
Queste divulgazioni sono direttamente rilevanti per Dots. Un modello capace abbinato a un computer persistente ottiene maggiori opportunità di agire, anche lungo sequenze di attività più estese.
I core aggiuntivi non creano da soli tale rischio. Possono aumentare la quantità di calcolo che un agente esegue prima dell'intervento di una persona.
Le stesse risorse possono migliorare il lavoro difensivo. Un'analisi locale più rapida può aiutare a ispezionare codice, elaborare dati di sicurezza o testare software in un ambiente isolato.
La capacità amplifica sia i comportamenti utili sia quelli indesiderati. I controlli del prodotto determinano quale lato sperimentano gli utenti.
Questo compromesso diventa particolarmente importante quando Dots si connette ad applicazioni di lavoro. Un agente con accesso a email, documenti e sistemi aziendali può andare oltre il proprio sandbox tramite strumenti autorizzati.
OpenAI afferma che gli utenti possono stabilire limiti e ricevere richieste quando l'agente necessita di attenzione. L'efficacia di tali limiti conterà più della leadership nei benchmark.
Una valutazione pratica dovrebbe quindi combinare diverse misure. Dovrebbe esaminare tasso di successo, frequenza degli interventi, tempo trascorso, conformità alle policy e recupero dopo gli errori.
Anche il costo rientra in questa valutazione, persino quando i termini commerciali esatti restano riservati. Una VM a nove core consuma più risorse di una VM a due core in condizioni altrimenti simili.
OpenAI potrebbe allocare quella macchina solo mentre un Dot è attivo. Potrebbe sospendere, ridimensionare o condividere capacità quando i carichi di lavoro diventano inattivi.
Senza informazioni sulla pianificazione, il benchmark non può rivelare il vero costo operativo. Mostra soltanto a cosa un ambiente in esecuzione poteva accedere durante il test.
Ecco perché la scoperta dell'hardware è importante senza risolvere la competizione. Espone il meccanismo che OpenAI sembra utilizzare per supportare un comportamento ambizioso degli agenti.
La domanda successiva è se l'azienda possa trasformare quel meccanismo in risultati coerenti.
Ciò che i record del benchmark non possono verificare
Le prove più solide descrivono una configurazione della macchina, mentre il collegamento cruciale tra quella macchina e OpenAI rimane circostanziale.
La pagina Geekbench originale non identifica alcun proprietario, prodotto o provider cloud. I campi relativi al modello e alla scheda madre mostrano entrambi “N/A”.
Qualcuno potrebbe aver caricato il risultato da un'infrastruttura non correlata. La data del 25 settembre stabilisce una prossimità al lancio, non la titolarità.
Il post su X di INIYSA ha attribuito il risultato a OpenAI Dots. L'identità della persona che ha eseguito il test originale rimane incerta.
Le sei presentazioni successive rafforzano l'associazione perché, secondo quanto riportato, ripetono la stessa insolita configurazione. La ripetizione riduce la probabilità di un risultato isolato del tutto non correlato.
Non costituisce una conferma formale. OpenAI non ha documentato pubblicamente nove core, 9,73GB di memoria o un'allocazione AMD EPYC 9V74 per ogni Dot.
Il cambiamento riportato nel sistema operativo introduce un'altra incertezza. Il record originale utilizzava Ubuntu, mentre le esecuzioni successive apparentemente utilizzavano Debian.
Quella differenza ha diverse spiegazioni ordinarie. Potrebbe riflettere test, aggiornamenti delle immagini, personalizzazione da parte degli utenti o macchine non correlate.
I risultati non possono neppure mostrare se ogni abbonato riceve le stesse risorse. La capacità può variare in base a regione, carico di lavoro, account, disponibilità o fase di distribuzione.
Gli utenti iniziali ricevono talvolta un'infrastruttura poco caricata. Le prestazioni possono cambiare una volta cresciuta l'adozione e quando più agenti competono per le risorse dell'host.
La capacità di picco presenta un'altra possibilità. Una macchina virtuale può accedere temporaneamente a più tempo CPU di quanto riceva durante un funzionamento prolungato.
Geekbench è abbastanza breve da catturare condizioni favorevoli. Un'attività di più ore potrebbe sperimentare un comportamento di pianificazione diverso, limiti termici o throttling.
Il benchmark non dice nulla nemmeno sullo storage. Un accesso lento al disco può ostacolare repository, asset multimediali e raccolte di documenti anche quando le prestazioni della CPU sembrano elevate.
La latenza di rete conta per il lavoro nel browser e le applicazioni connesse. Il tempo di risposta del modello può dominare le attività che alternano ripetutamente ragionamento e azione.
I punteggi non contengono informazioni sull'affidabilità del servizio. Un agente che perde lo stato o si blocca durante le approvazioni può ottenere prestazioni inferiori nonostante un calcolo locale veloce.
Anche i controlli di sicurezza possono influire sulle prestazioni. Monitoraggio, restrizioni del sandbox, scansione e barriere di approvazione introducono attrito per progettazione.
Questo attrito può valere la pena. Un agente autonomo non dovrebbe ottimizzare la velocità aggirando le salvaguardie o ampliando silenziosamente le proprie autorizzazioni.
OpenAI ha introdotto Dots un giorno dopo aver trattenuto un altro modello per preoccupazioni di sicurezza, secondo la copertura del lancio. La tempistica pone i controlli degli agenti sotto un esame immediato.
Sam Altman ha dichiarato che OpenAI stava aumentando gli investimenti in sicurezza, protezione e monitoraggio degli agenti. Questa affermazione descrive un'intenzione, non l'efficacia misurata dei controlli implementati.
I test pubblici dovranno esaminare se Dots rispetta i limiti durante incarichi complessi e prolungati. Le brevi dimostrazioni solitamente presentano obiettivi chiari e ambienti preparati.
Il lavoro reale include documenti contraddittori, sessioni scadute, autorizzazioni ambigue e contenuti dannosi. L'iniezione di prompt basata sul browser resta una preoccupazione particolare per gli agenti che leggono pagine non attendibili.
Un risultato Geekbench non può valutare nessuna di queste condizioni. Non dovrebbe diventare un sostituto dei test basati sulle attività o sulla sicurezza.
L'interpretazione responsabile è quindi circoscritta e provvisoria. Dots sembra collegato a una configurazione di macchina virtuale AMD EPYC a nove core con quasi 10GB di memoria.
I record delle prestazioni rendono questa affermazione sufficientemente credibile da meritare ulteriori indagini. Non confermano il progetto completo dell'infrastruttura di OpenAI né dimostrano prestazioni superiori degli agenti.
Tre segnali mostreranno se il vantaggio hardware conta
Dots giustificherà il suo computer cloud più grande, secondo quanto riportato, soltanto attraverso attività ripetibili, allocazioni stabili e controlli efficaci.
Il primo segnale è il benchmarking indipendente delle attività. I revisori dovrebbero eseguire incarichi corrispondenti su Dots e Muse utilizzando gli stessi file, obiettivi, autorizzazioni e criteri di completamento.
Test utili includerebbero la compilazione di un repository, la produzione di un asset multimediale, la ricerca su una domanda documentata e l'aggiornamento di un progetto strutturato. Ogni test dovrebbe registrare successo, tempo, interventi ed errori.
Gli incarichi a elevato uso di CPU riveleranno se nove core si traducono in attese più brevi. Le attività incentrate sul browser mostreranno se le decisioni del modello e l'affidabilità degli strumenti eliminano quel vantaggio.
Un risultato conta solo quando l'output finale è corretto. Completare più velocemente un'attività difettosa non rappresenta migliori prestazioni dell'agente.
Il secondo segnale è la coerenza della configurazione dopo il picco legato al lancio. Le esecuzioni pubbliche di Geekbench dovrebbero essere monitorate per variazioni nei conteggi dei core, nei totali di memoria, nei sistemi operativi e negli intervalli dei punteggi.
Risultati stabili sosterrebbero la teoria secondo cui OpenAI ha definito un ambiente Dot standard. Una variazione più ampia suggerirebbe allocazione dinamica, differenze regionali o capacità opportunistica.
Le prestazioni sotto carico conteranno più dei picchi della settimana di lancio. Il punteggio multi-core pre-lancio di 9.435 supera già ogni esecuzione post-lancio riportata.
Questo divario non è allarmante, ma offre un riferimento. Calo continui potrebbero indicare una maggiore contesa man mano che più utenti creano agenti.
Il terzo segnale è la divulgazione operativa di OpenAI. Gli acquirenti necessitano di informazioni chiare su isolamento, persistenza, conservazione dei dati, autorizzazioni delle app connesse e recupero da azioni dannose.
OpenAI non deve pubblicare ogni dettaglio dell'infrastruttura. Dovrebbe spiegare quali garanzie rimangono stabili quando un agente lavora per ore senza supervisione diretta.
I rapporti sulla sicurezza metteranno alla prova tali garanzie. Occorre prestare attenzione a risultati relativi a iniezione di prompt, azioni non autorizzate, perdita di dati tra sessioni e mancata richiesta di approvazione.
Occorre osservare anche come OpenAI risponde quando i ricercatori documentano delle debolezze. Una correzione rapida e trasparente rafforzerebbe la fiducia nella sua strategia di computer gestiti.
La risposta di Meta rientra in questo terzo segnale. Muse potrebbe ricevere sandbox più grandi, strumenti remoti più specializzati o un'orchestrazione migliorata senza eguagliare OpenAI core per core.
Se Muse produce risultati simili con meno risorse, l'apparente deficit hardware diventa un vantaggio di efficienza. Se fatica con i carichi di lavoro locali, l'allocazione più ampia di OpenAI acquisisce peso strategico.
I primi dati Geekbench 7 di OpenAI Dots dimostrano con chiarezza un punto: la competizione tra agenti ora include anche i computer assegnati agli agenti.
I modelli determinano ancora pianificazione e capacità di giudizio. Tuttavia, il lavoro persistente dipende anche da CPU, memoria, sistemi operativi, isolamento e affidabilità degli strumenti connessi.
Il test decisivo è ora nelle mani degli utenti. Assegnate a Dots e Muse un lavoro identico e verificabile, quindi confrontate i risultati completati anziché le dimostrazioni promozionali.
I core aggiuntivi riducono attese, errori e intervento umano nelle assegnazioni reali? Finché test ripetibili non risponderanno a questa domanda, il benchmark resta un utile indizio sull’infrastruttura, non un verdetto.



