top of page

Claude Opus 4.6 perde 65 punti mentre i compiti di MineExplorer diventano più complessi

28 lug
Tempo di lettura: 15 min

Claude Opus 4.6 di Anthropic ha guidato MineExplorer, eppure il suo tasso di successo è sceso dal 77% nei compiti a un hop al 12% in quelli a quattro hop. Nel complesso, il modello ha completato solo il 41% del benchmark, secondo i risultati pubblicati dal team LongCat di Meituan.

Questo crollo è la vera storia di Anthropic MineExplorer. Claude ha ottenuto buoni risultati quando l'obiettivo richiedeva un singolo passaggio diretto. Ha invece faticato quando il successo dipendeva dalla scoperta e dal coordinamento di più prerequisiti non esplicitati in un mondo in evoluzione.

MineExplorer misura questa lacuna attraverso 813 scenari Minecraft verificati da esseri umani, della durata massima di tre minuti. Testa 18 modelli multimodali appartenenti a otto famiglie di modelli, inclusi sistemi Claude, GPT e Gemini. Gli autori del benchmark hanno rilasciato il codice, il dataset, il flusso di lavoro per la generazione dei compiti e l'ambiente di valutazione.

Il risultato mette in discussione un'assunzione diffusa sugli agenti multimodali. Riconoscere una minaccia, un oggetto o una risorsa non significa che un modello riesca a mantenere un piano utile mentre l'ambiente cambia. MineExplorer trasforma questa distinzione in una curva di fallimento misurabile.

I precedenti benchmark su Minecraft esaminavano pianificazione, esecuzione delle istruzioni, costruzione o conoscenza del gioco. MineExplorer, invece, rimuove molti compiti che dipendono fortemente da regole specifiche di Minecraft. Il suo obiettivo dichiarato è più ampio: un'esplorazione che combini percezione, ragionamento e azione lungo una traiettoria prolungata.

Il benchmark resta un preprint e Minecraft non può rappresentare ogni ambiente fisico. Tuttavia, i risultati esercitano una pressione immediata sulle affermazioni secondo cui una visione più potente e un contesto più lungo producono automaticamente agenti autonomi affidabili.

MineExplorer trasforma tre minuti in un serio test per gli agenti

MineExplorer sposta l'obiettivo della valutazione dal riconoscere una scena al superare una sequenza di decisioni interdipendenti.

Il team LongCat ha introdotto MineExplorer in un preprint del maggio 2026. Una seconda versione è seguita il 12 giugno, mentre il team tecnico di Meituan ha pubblicato a luglio un dettagliato riepilogo dei risultati.

Ogni episodio può durare 1.800 passaggi dell'ambiente. Un passaggio rappresenta 0,1 secondi, per un totale di tre minuti di interazione continua. Il mondo si aggiorna dopo ogni azione, quindi il modello deve rivalutare ripetutamente ciò che vede e ciò che dovrebbe fare in seguito.

Questa durata sembra breve secondo gli standard umani. È lunga per un agente che deve osservare immagini, mantenere lo stato, selezionare azioni e recuperare dagli errori attraverso centinaia di interazioni.

I compiti sono suddivisi in base al numero di hop. Un compito a un hop presenta un obiettivo che non richiede all'agente di dedurre un sottocompito non esplicitato. Gli scenari da due a quattro hop aggiungono prerequisiti nascosti che devono essere scoperti attraverso l'ambiente.

Si consideri un agente incaricato di raggiungere una posizione protetta. Il percorso immediato potrebbe essere bloccato, lo strumento necessario potrebbe trovarsi altrove e le entità ostili potrebbero limitare il movimento. L'istruzione indica la destinazione, ma non ogni azione necessaria per raggiungerla.

MineExplorer rappresenta ogni compito composito con uno stato iniziale, un'istruzione in linguaggio naturale, un grafo delle dipendenze e traguardi basati su regole. Il grafo delle dipendenze registra la struttura nascosta del compito. Il modello non riceve mai quel grafo completo.

I traguardi consentono al valutatore di misurare i progressi parziali senza chiedere a un altro modello linguistico di giudicare l'intera traiettoria. Un traguardo potrebbe rilevare se l'agente ha trovato un oggetto, è entrato in un'area o ha completato un'azione intermedia richiesta.

Gli autori hanno confrontato questi risultati automatizzati con valutazioni umane delle traiettorie di Claude Opus 4.6. Gli insiemi di traguardi completati hanno ricevuto punteggi umani medi vicini a quattro su una scala di cinque punti. Gli insiemi completamente falliti sono rimasti sotto tre.

Questa concordanza non rende perfetto il valutatore. Offre però evidenza che il completamento dei traguardi catturi progressi significativi, anziché eventi arbitrari del gioco.

Il team ha inoltre cercato di separare l'esplorazione dalla competenza memorizzata su Minecraft. I compiti atomici candidati sono stati vagliati per la dipendenza da convenzioni specifiche del gioco. I compiti dominati da conoscenze specialistiche sono stati rimossi.

Questa scelta progettuale è importante perché un agente potrebbe fallire un obiettivo in Minecraft per due ragioni molto diverse. Potrebbe non conoscere una ricetta tratta dal wiki del gioco, oppure potrebbe non riuscire a collegare le evidenze visibili a un piano praticabile.

MineExplorer cerca di enfatizzare il secondo problema. Le sue 14 categorie di capacità coprono percezione, ragionamento e azione. Comprendono percezione spaziale e temporale, tracciamento delle entità, consapevolezza delle risorse, ragionamento causale, movimento, raccolta, posizionamento, crafting e combattimento.

Gli 813 esempi rilasciati coprono dipendenze da uno a quattro hop. Il dataset aperto include testi dei compiti, comandi di configurazione delle scene, compiti atomici selezionati, traguardi, grafi delle dipendenze e note di progettazione.

Questo è più di un insieme statico di domande. I ricercatori possono esaminare come sono state costruite le scene, ripetere le valutazioni, creare varianti più difficili o usare l'ambiente per l'addestramento.

Questa apertura offre al benchmark la possibilità di influenzare lo sviluppo degli agenti. Rende anche più facile contestarne le assunzioni, una caratteristica importante per un benchmark che avanza affermazioni ampie sull'esplorazione.

Perché il primato di Anthropic MineExplorer resta un avvertimento

Claude Opus 4.6 ha vinto il confronto, ma il suo vantaggio rivela quanto tutti i modelli testati siano ancora lontani da un comportamento affidabile a lungo orizzonte.

Il benchmark ha valutato 18 modelli multimodali avanzati appartenenti a otto famiglie. Claude Opus 4.6 ha ottenuto il più alto tasso complessivo di successo nei compiti, raggiungendo il 41%.

Un risultato del 41% può sembrare rispettabile se osservato solo come posizione in classifica. Sembra molto più debole quando viene separato per profondità del compito.

Claude Opus 4.6 ha completato il 77% dei compiti a un hop. Il suo tasso di successo è sceso al 12% in quelli a quattro hop. Il calo di 65 punti mostra che dipendenze aggiuntive fanno più che aggiungere una piccola difficoltà.

Ogni prerequisito nascosto crea un'altra occasione per perdere il piano. Il modello deve notare le evidenze rilevanti, dedurre un obiettivo intermedio, eseguirlo correttamente e preservarne la relazione con l'obiettivo finale.

Un errore iniziale può propagarsi nell'episodio. Passare oltre una risorsa necessaria impedisce l'azione successiva. Scegliere il percorso sbagliato consuma passaggi e cambia la visuale dell'agente. Un'osservazione successiva può quindi essere interpretata usando uno stato interno già errato.

Ecco perché il risultato di Anthropic MineExplorer mette sotto pressione più della sola Anthropic. Claude è stato il modello più forte nel test. La sua curva di fallimento agisce quindi come limite superiore per questa specifica configurazione, non come prova di una debolezza isolata di Claude.

I risultati complicano anche la narrativa standard sullo scaling dei modelli. Il paper riferisce che modelli più grandi e modalità di ragionamento dedicate non hanno migliorato le prestazioni in modo coerente.

Più parametri possono rafforzare la percezione o il ragionamento in un prompt delimitato. Un ambiente dinamico richiede un'altra capacità: mantenere un utile allineamento tra memoria, osservazioni correnti e obiettivi in evoluzione.

Un contesto più lungo non garantisce tale allineamento. Può conservare immagini vecchie che non descrivono più la scena presente. Quelle osservazioni possono competere con evidenze più recenti invece di aiutare il modello.

Gli autori hanno testato questo problema aumentando il numero di frame visivi storici. Le prestazioni sono infine diminuite, poiché osservazioni obsolete interferivano con la comprensione dello stato attuale da parte del modello.

Hanno inoltre esaminato se ai modelli servisse semplicemente più tempo. Gli agenti senza successo continuavano a fallire anche quando gli episodi consentivano fino a 1.800 passaggi. I compiti risolvibili tendevano a essere completati prima, mentre interazioni aggiuntive non salvavano molte traiettorie compromesse.

Questi risultati indeboliscono due soluzioni semplicistiche. Dare a un agente più contesto non equivale a dargli una memoria migliore. Dargli più azioni non equivale a dargli un piano migliore.

La pressione si estende agli sviluppatori che realizzano agenti per l'uso del computer, sistemi robotici e strumenti di ricerca automatizzati. Questi prodotti operano al di fuori di uno screenshot fisso. I loro ambienti cambiano in risposta sia all'agente sia agli eventi esterni.

Un agente browser potrebbe dover individuare un record, modificare un filtro, interpretare la pagina aggiornata e verificare l'invio finale. Un robot di magazzino potrebbe dover ricalcolare il percorso dopo aver trovato un corridoio bloccato. Un agente di ricerca potrebbe dover rivedere la propria ricerca dopo aver scoperto evidenze contraddittorie.

In ogni caso, l'obiettivo visibile nasconde decisioni sui prerequisiti. Un modello può eseguire correttamente ogni azione isolata e fallire comunque l'intero lavoro.

MineExplorer non dimostra che i tassi di fallimento si trasferiranno direttamente ai browser o ai robot. Mostra che il successo in brevi test multimodali offre garanzie limitate quando si accumulano dipendenze nascoste.

Questa distinzione dovrebbe influenzare le decisioni di acquisto e distribuzione. Gli acquirenti dovrebbero chiedersi come un agente si comporti lungo flussi di lavoro completati, non solo se il suo modello riconosca schermate o generi azioni successive plausibili.

Il vero problema è la navigazione, non il riconoscimento visivo

Quasi il 60% dei fallimenti di Claude Opus 4.6 è stato attribuito alla navigazione, rendendo il movimento con stato il collo di bottiglia più evidente del benchmark.

L'analisi dei fallimenti del team LongCat separa gli errori di navigazione da problemi quali l'interazione con gli oggetti o il ragionamento sui compiti. La navigazione ha rappresentato quasi il 60% dei fallimenti analizzati.

Questa cifra non significa che al modello mancassero semplicemente le indicazioni. La navigazione in un mondo aperto combina memoria spaziale, riconoscimento visivo, controllo delle azioni e gestione degli obiettivi.

L'agente deve sapere dove si trova, ricordare dove è stato e determinare se il movimento ha prodotto il risultato previsto. Deve anche decidere quando abbandonare un percorso o esplorare un'alternativa.

Un test di visione statico isola solo una parte di questo ciclo. Il modello vede un'immagine e risponde a una domanda. La scena non cambia a causa della sua risposta e una risposta errata non distorce l'osservazione successiva.

Minecraft crea un feedback. Se l'agente gira nella direzione sbagliata, la sua immagine successiva contiene evidenze diverse. Se rimane bloccato contro un ostacolo, comandi di movimento ripetuti consumano tempo senza far avanzare il compito.

Il modello deve quindi diagnosticare se il percorso è fallito, se l'azione è fallita o se il suo piano originale era sbagliato. Questa distinzione è difficile quando le osservazioni arrivano come frame separati anziché come una mappa interna stabile.

I punteggi delle capacità di MineExplorer rafforzano questa interpretazione. Claude Opus 4.6 ha ricevuto un punteggio di percezione pari a 61,91 e un punteggio di ragionamento pari a 54,71. Nella maggior parte dei modelli valutati, la percezione ha superato l'azione, mentre l'azione ha superato il ragionamento.

I modelli riuscivano spesso a identificare dettagli rilevanti. Avevano più difficoltà a trasformare quei dettagli in una strategia coordinata che resistesse ai cambiamenti ambientali.

Questo crea un'importante inversione nel modo in cui viene solitamente presentato il progresso multimodale. Una migliore comprensione delle immagini amplia ciò che un agente può notare, ma espone anche la debolezza del sistema di pianificazione che elabora tali osservazioni.

Un modello che rileva dieci oggetti rilevanti deve comunque decidere quale sia importante in quel momento. Deve collegare quella scelta all'obiettivo finale e mantenere il collegamento dopo che il punto di vista cambia.

Il benchmark si ispira all'approccio ReAct, che alterna il ragionamento con azioni e nuove osservazioni. Il framework ReAct originale è stato progettato per consentire ai modelli di rivedere il proprio ragionamento attraverso il feedback ambientale.

MineExplorer mostra dove questo ciclo può interrompersi lungo traiettorie più estese. Il ragionamento si scollega dallo stato corrente, le azioni smettono di servire l’obiettivo iniziale oppure nuove osservazioni non innescano una revisione necessaria.

La navigazione amplifica tutti e tre i problemi. Un agente fuori posizione osserva le prove sbagliate, costruisce una stima dello stato errata e sceglie ulteriori azioni da una posizione compromessa.

È un problema più difficile che generare una catena di pensiero più lunga. Un agente necessita di una rappresentazione strutturata di entità persistenti, luoghi, traguardi completati, percorsi falliti e dipendenze irrisolte.

La cronologia visiva grezza è un sostituto debole. Conserva ciò che ha visto la telecamera, non ciò che l’agente dovrebbe ricordare.

La stessa distinzione vale per gli agenti aziendali. Una trascrizione di ogni schermata precedente non produce automaticamente uno stato del flusso di lavoro affidabile. L’agente deve sapere quale modulo è stato inviato, quale filtro resta attivo e quale requisito è ancora irrisolto.

Per i sistemi incorporati, la navigazione diventa sia una prova fisica sia cognitiva. Il modello deve muoversi nello spazio preservando al contempo la struttura logica del compito.

La quota del 60% di fallimenti attribuita da MineExplorer alla navigazione indica quindi la necessità di interventi a livello di sistema. Controller locali migliori, mappe esplicite, memoria causale, monitoraggio dei progressi e politiche di recupero potrebbero contare quanto un modello di base più potente.

Cosa misura il benchmark, e cosa non misura

MineExplorer offre un utile stress test, ma i suoi risultati restano circoscritti a un mondo simulato e a una distribuzione di compiti definita dai ricercatori.

L’argomento scettico più forte riguarda la validità esterna. Minecraft offre un mondo 3D dinamico con regole coerenti, ma non riproduce ogni difficoltà presente in case, fabbriche, uffici o spazi pubblici.

I robot reali affrontano fisica incerta, rumore dei sensori, danni fisici e vincoli di sicurezza. Gli agenti per l’uso del computer incontrano stati nascosti delle applicazioni, barriere di autenticazione, pop-up e interfacce in evoluzione.

Minecraft elimina molte di queste complicazioni. I suoi oggetti sono discreti, la sua fisica è ripetibile e il suo ambiente può essere reimpostato esattamente.

Questo controllo è anche un vantaggio. I ricercatori possono confrontare i modelli in condizioni identiche e tracciare i fallimenti senza mettere a rischio attrezzature o utenti.

La chiave è considerare MineExplorer uno strumento diagnostico, non un punteggio universale per l’intelligenza incorporata. Un risultato del 41% non significa che Claude completerebbe il 41% di flussi di lavoro reali non correlati.

Anche il filtraggio della conoscenza del benchmark richiede attenzione. Gli autori utilizzano valutazioni di modelli linguistici per classificare se i compiti atomici dipendano principalmente da conoscenze generali o da convenzioni specifiche di Minecraft.

Questo processo riduce i più evidenti fattori confondenti legati alla conoscenza del gioco. Non può garantire che ogni compito mantenuto sia privo di effetti di familiarità.

I modelli addestrati su video di Minecraft, guide o discussioni sul gameplay potrebbero comunque riconoscere configurazioni e comportamenti comuni. Diverse famiglie di modelli potrebbero essere state esposte a quantità differenti di tale materiale.

Secondo il suo record su arXiv, il benchmark è ancora in fase di sviluppo. Revisioni future potrebbero modificare compiti, prompt, controller o procedure di valutazione.

La progettazione del controller è particolarmente importante. Un modello multimodale raramente manipola un gioco attraverso il solo ragionamento astratto. Il sistema agente circostante converte gli output del modello in comandi di movimento e interazione.

Le prestazioni riflettono quindi sia il modello sottostante sia la sua infrastruttura di supporto. Un migliore sistema di mappatura o controller a basso livello potrebbe migliorare i risultati senza modificare il modello.

Gli autori del benchmark riconoscono un’altra limitazione. MineExplorer si concentra attualmente sulla valutazione empirica, sebbene la sua infrastruttura possa supportare anche l’addestramento.

L’addestramento nell’ambiente del benchmark crea un rischio proprio. Una volta che gli sviluppatori ottimizzano direttamente sui compiti pubblici, i miglioramenti in classifica potrebbero riflettere la specializzazione sul benchmark anziché un’esplorazione generale.

Il codice MineExplorer completamente aperto rende più semplici la replica e l’estensione. Rende inoltre più importanti le questioni di contaminazione e overfitting per le future versioni dei modelli.

Le valutazioni indipendenti dovrebbero preservare scenari di test nascosti. Dovrebbero inoltre variare la disposizione delle scene, le strutture di dipendenza, le implementazioni dei controller e i formati dei prompt.

Il contesto storico sostiene questa cautela. MinePlanner aveva precedentemente pubblicato 45 compiti Minecraft per la pianificazione a lungo orizzonte e aveva rilevato che pianificatori consolidati faticavano in ambienti estesi contenenti molti oggetti.

Il benchmark MinePlanner si concentrava sulla pianificazione proposizionale e numerica anziché sull’esplorazione multimodale interattiva. I suoi risultati hanno comunque mostrato che Minecraft può rivelare problemi di scalabilità nascosti da domini di pianificazione più piccoli.

Altri sistemi hanno esaminato l’esecuzione delle istruzioni, la costruzione, la memoria e le abilità aperte. Questi progetti usano lo stesso gioco per domande diverse, pertanto i loro punteggi principali non dovrebbero essere confrontati direttamente.

Il contributo specifico di MineExplorer è la combinazione di interazione visiva continua, prerequisiti nascosti, costruzione di compiti multi-hop e valutazione dei traguardi basata su regole.

La sua rivendicazione di essere il “primo” dovrebbe essere letta entro questa definizione. Minecraft ha ospitato ricerche a lungo orizzonte prima di MineExplorer. La pretesa di novità del team riguarda l’esplorazione multimodale open-world su scala di minuti, nella sua particolare struttura di valutazione.

Un’altra limitazione è la mancanza di un’ampia reazione indipendente così poco dopo il rilascio. La maggior parte delle interpretazioni dettagliate proviene attualmente dagli autori e dai loro canali tecnici affiliati.

I risultati misurati sono disponibili per l’esame, ma le spiegazioni causali restano in parte interpretative. L’ampia quota di fallimenti della navigazione, per esempio, non isola completamente se la causa principale fosse mappatura, memoria, pianificazione o esecuzione delle azioni.

Queste incertezze non cancellano la conclusione centrale. Il successo cala drasticamente man mano che si accumulano prerequisiti nascosti. Definiscono ciò che ulteriori esperimenti dovranno separare.

L’open source rende MineExplorer qualcosa di più di una classifica

Il rilascio è importante perché i ricercatori possono verificare se memoria, controller o metodi di addestramento migliori appiattiscano la curva di fallimento a lungo orizzonte.

Il team ha utilizzato un flusso di lavoro multi-agente per costruire le istanze del benchmark. Cinque agenti specializzati collaborano sotto un orchestratore che ne controlla la sequenza.

Il flusso di lavoro inizia con una bozza iniziale del compito. Agenti specialisti e di convalida discutono poi il progetto, individuano incongruenze e rivedono la scena, il grafo delle dipendenze e i valutatori dei traguardi.

Secondo la valutazione umana degli autori, questo processo ha aumentato la validità delle istanze di circa 30 punti percentuali rispetto a una baseline a singolo agente. Ha inoltre innalzato i punteggi di qualità di circa 0,5 punti, con il maggiore beneficio sui compiti a quattro hop.

La versione finale contiene 813 istanze verificate da esseri umani. Un sottoinsieme difficile separato fornisce 100 scenari selezionati per una maggiore difficoltà.

Questa pipeline di generazione affronta un problema persistente dei benchmark. Costruire manualmente centinaia di ambienti interattivi è lento, mentre i compiti generati dai modelli senza vincoli spesso contengono obiettivi impossibili o valutazioni difettose.

La combinazione di sintesi automatizzata e verifica umana offre una via intermedia. L’approccio può produrre più compiti preservando al contempo un controllo di qualità.

Lo stesso metodo può generare scenari di addestramento, non solo casi di test. I ricercatori possono creare grafi di dipendenza, istanziare scene sandbox e collegare controlli deterministici dei traguardi.

Questo conta perché gli agenti a lungo orizzonte necessitano di esercitarsi su fallimenti che si sviluppano nel tempo. I dataset visivi statici non possono insegnare il recupero da una svolta sbagliata o da un prerequisito mancato.

L’infrastruttura aperta invita anche ad alternative alla scalabilità end-to-end dei modelli. Un team può mantenere costante il modello di base e testare mappe spaziali esplicite, memoria episodica, grafi causali o pianificatori gerarchici.

Un altro esperimento potrebbe separare la pianificazione di alto livello dal movimento di basso livello. Il modello potrebbe selezionare gli obiettivi mentre un controller specializzato gestisce l’evitamento degli ostacoli e l’esecuzione del percorso.

I ricercatori possono quindi chiedersi se i fallimenti di navigazione riflettano un’intelligenza debole, un controllo motorio debole o un’interfaccia instabile tra i due.

Il benchmark può anche supportare la progettazione di curricoli. Gli agenti potrebbero iniziare con compiti a un hop, quindi progredire verso grafi di dipendenza più profondi man mano che il loro tasso di completamento si stabilizza.

Tuttavia, i set di addestramento e valutazione devono rimanere distinti. Riutilizzare scenari pubblici trasformerebbe MineExplorer in un test di memorizzazione.

Il risultato futuro più informativo non sarà un piccolo guadagno in classifica. Sarà un calo più contenuto dai compiti a un hop a quelli a quattro hop.

Un sistema che aumenta il successo complessivo mantenendo la stessa curva di crollo ha migliorato la competenza locale. Un sistema che conserva le prestazioni man mano che le dipendenze si approfondiscono ha migliorato il coordinamento a lungo orizzonte.

Questa distinzione dovrebbe orientare la rendicontazione futura. Il tasso complessivo di successo dei compiti comprime diversi comportamenti in un solo numero. Le prestazioni specifiche per hop rivelano dove l’agente smette di funzionare in modo affidabile.

Il rilascio aperto offre ai team esterni gli strumenti per verificare queste affermazioni. Consente inoltre di proporre valutazioni più difficili senza ricostruire l’intero stack Minecraft.

Cosa osservare dopo il risultato Anthropic su MineExplorer

La fase successiva dovrebbe concentrarsi sulla replica indipendente, sistemi di navigazione migliorati e prestazioni stabili su compiti multi-hop non visti.

Il primo segnale è la riproduzione indipendente del punteggio complessivo del 41% e del calo dal 77% al 12%. I ricercatori dovrebbero rieseguire Claude Opus 4.6 e altri modelli con impostazioni documentate di controller, prompt e ambiente.

Una riproduzione ravvicinata rafforzerebbe l’affermazione che i prerequisiti nascosti determinano un modello di fallimento generale. Grandi differenze suggerirebbero che l’infrastruttura agente contribuisce più di quanto indichi la classifica iniziale.

Il secondo segnale è se sistemi espliciti di stato e navigazione riducano la categoria di fallimento dominante. Esperimenti utili dovrebbero confrontare la cronologia dei frame grezzi con mappe, memoria strutturata, grafi causali dei compiti e politiche di recupero del percorso.

Un miglioramento significativo ridurrebbe i fallimenti di navigazione senza sacrificare le prestazioni di ragionamento o azione. Il semplice aumento della finestra di contesto non risponderebbe alla critica centrale del benchmark.

Il terzo segnale è la prestazione di modelli più recenti su scenari a quattro hop esclusi dall’addestramento. Gli sviluppatori dovrebbero riportare il successo dei compiti per numero di hop, non solo una media complessiva.

Un modello che ottiene punteggi più alti nei compiti a un hop ma resta vicino al 12% in quelli a quattro hop non ha colmato il divario a lungo orizzonte. Risultati più solidi su strutture di dipendenza non viste fornirebbero prove migliori di un’esplorazione generale.

I lettori dovrebbero anche osservare se gli sviluppatori di modelli adottino MineExplorer o valutazioni correlate nelle schede di sistema ufficiali. L’inclusione segnalerebbe che l’interazione multimodale prolungata sta diventando un obiettivo standard per le capacità.

Per gli sviluppatori, la lezione pratica è già chiara. Non valutate un agente solo attraverso azioni isolate o dimostrazioni curate.

Testate flussi di lavoro completi con prerequisiti nascosti, stato mutevole e opportunità di recupero. Misurate dove l’agente perde di vista il proprio obiettivo e distinguete gli errori di percezione dai fallimenti di navigazione, ragionamento e controllo.

Gli acquirenti aziendali dovrebbero chiedere le stesse prove. La posizione di un modello in un benchmark dice poco su quanto un agente integrato possa completare con coerenza un processo in più fasi.

MineExplorer non risolve il dibattito sull’IA incorporata. Fornisce un modo riproducibile per rendere più difficile ignorare una debolezza.

Il risultato Anthropic su MineExplorer è particolarmente rivelatore perché Claude Opus 4.6 si è classificato primo. Il modello più forte tra quelli testati ha comunque perso 65 punti percentuali quando la profondità del compito è passata da un hop a quattro.

Questo è il rovesciamento centrale del benchmark. Gli attuali modelli multimodali possono spesso descrivere un mondo che non riescono a navigare in modo affidabile.

Il prossimo traguardo credibile per gli agenti, quindi, non è un’altra risposta perfetta in forma di screenshot. È un progresso costante in un ambiente non familiare, inclusa la capacità di riconoscere una svolta sbagliata e rimediare prima che il compito si concluda.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page