top of page

La peer review di Sakana AI individua il 73% degli errori fondamentali, ma i veri paper ne rivelano il limite

7 ore fa
Tempo di lettura: 13 min

Sakana AI afferma che il suo sistema di peer review ha rilevato il 73,43% degli errori inseriti che influivano sulla tesi centrale di un paper. Tuttavia, questo risultato di rilievo deriva da quattro revisioni di contraddizioni sintetiche, non da revisioni di routine di ricerche non modificate.

Il sistema, denominato Multi-Layered Review, ha ottenuto risultati molto migliori di tre riferimenti di revisione automatizzata nel nuovo benchmark di Sakana AI. Tuttavia, il suo tasso di rilevamento esatto è sceso al 16,11% quando è stato testato sui problemi documentati in paper arXiv ritirati.

Questo divario definisce la vera storia. La peer review di Sakana AI offre prove del fatto che una lettura attenta e a più passaggi possa migliorare la critica automatizzata. Non dimostra che un LLM possa convalidare in modo affidabile il lavoro scientifico.

La ricerca spinge invece gli sviluppatori a riconsiderare il modo in cui valutano i revisori AI. Non basta eguagliare i punteggi umani o produrre feedback persuasivi. Un revisore utile deve collegare affermazioni, metodi, esperimenti e prove abbastanza bene da individuare quando sono in conflitto.

Il risultato di Sakana AI arriva inoltre in un contesto complesso. L'azienda aveva già usato l'AI per generare paper scientifici e aveva sollevato interrogativi su cosa dimostrasse davvero il superamento della peer review. Il suo ultimo progetto ribalta la stessa preoccupazione, chiedendosi se l'AI possa aiutare gli esseri umani a individuare ricerche deboli.

La peer review di Sakana AI cambia il test

Il cambiamento più importante non è il risultato del 73,43%. È la decisione di valutare i revisori AI in base alla loro capacità di individuare errori.

Gran parte del lavoro precedente sulla peer review automatizzata misurava la somiglianza. I ricercatori confrontavano una revisione generata dall'AI con il feedback umano, verificavano se i rispettivi punteggi fossero correlati o misuravano la sovrapposizione tra i commenti.

Questi test rilevano se un sistema si comporta come un revisore. Non mostrano direttamente se abbia notato l'errore centrale di un paper.

Il paper sulla peer review di Sakana AI propone un'alternativa incentrata sulla verifica. I suoi autori sostengono che il rilevamento degli errori sia una delle funzioni più importanti e dispendiose in termini di risorse della peer review.

Il team ha creato un Contradiction Benchmark contenente 1.164 varianti modificate di paper. Queste varianti provenivano da 257 paper pubblicati ad ACL, AISTATS, CVPR e ICML nel 2025, oltre che a NeurIPS nel 2024.

I ricercatori hanno limitato la raccolta ai paper dotati di licenze Creative Commons permissive. Questa restrizione ha permesso loro di modificare e ridistribuire i manoscritti.

Per ciascun paper, Gemini 2.5 Pro ha generato un grafo della conoscenza. Un grafo della conoscenza rappresenta affermazioni, metodi, prove e le loro relazioni come nodi collegati.

I ricercatori hanno quindi misurato la distanza di ciascun nodo da un'affermazione principale. Una distanza pari a zero indicava che il nodo rappresentava un'affermazione centrale. Distanze maggiori rappresentavano dettagli via via più periferici.

GPT-4.1 ha riscritto passaggi selezionati per contraddire i nodi corrispondenti. Il testo modificato è stato inserito nella fonte originale, poi ricompilata in un PDF completo.

Questa procedura ha fornito ai ricercatori un errore noto e una posizione nota. Ha anche consentito loro di classificare quanto direttamente ciascun errore minacciasse la conclusione principale del paper.

Un modello o3 ha stabilito se le revisioni generate avessero rilevato ciascuna contraddizione. Il processo di valutazione è stato eseguito dieci volte per esempio e i ricercatori ne hanno calcolato la media.

Secondo lo studio, sui paper puliti il giudice ha raggiunto un'accuratezza del 99,9%. Un'analisi manuale ha riscontrato una sensibilità dell'86,8% sui rilevamenti confermati, suggerendo che il punteggio automatizzato talvolta non riconoscesse intercettazioni legittime.

Questa impostazione offre un test più chiaro rispetto al chiedere se un modello suoni come un revisore. Un sistema solleva la contraddizione inserita oppure no.

Tuttavia, il benchmark misura una parte attentamente definita della revisione. Non copre ogni forma di fallimento scientifico, inclusi fabbricazione dei dati, ipotesi statistiche inappropriate, errori nascosti di pre-elaborazione o esperimenti non riproducibili.

La distinzione è importante perché il dato di rilievo si riferisce specificamente alle contraddizioni nelle affermazioni centrali. Non dovrebbe essere interpretato come un tasso generale di accuratezza del 73% per la revisione scientifica.

Perché il sistema MLR di Sakana AI individua più errori

Multi-Layered Review migliora il rilevamento degli errori costringendo il modello a comprendere un paper prima di giudicarlo.

Il sistema MLR completo di Sakana AI comprende tre ruoli: un Appendix Agent, un Literature Review Agent e un Review Agent. Questi componenti elaborano parti diverse del manoscritto prima di produrre una valutazione consolidata.

L'Appendix Agent usa Claude Haiku 3.5 per riassumere i dettagli di implementazione e sperimentali al di fuori del testo principale. Questo passaggio aiuta a evitare che il sistema critichi omissioni già affrontate nell'appendice.

L'opzionale Literature Review Agent usa Claude Sonnet 4 e la ricerca web. Il suo compito è collocare il manoscritto nella ricerca esistente e verificare se le sue affermazioni di novità appaiano giustificate.

Anche il Review Agent centrale usa Claude Sonnet 4. Riceve fino a dieci pagine di testo principale in formato PDF, preservando equazioni, grafici e informazioni di impaginazione che l'estrazione in testo semplice potrebbe danneggiare.

Il suo flusso di lavoro si basa sull'affermato metodo dei tre passaggi per la lettura dei paper di ricerca. Il primo passaggio crea una panoramica di alto livello delle idee principali del manoscritto.

Il secondo passaggio legge più attentamente e collega tali idee alle prove di supporto. Registra inoltre ipotesi, lacune e debolezze.

Il terzo passaggio combina queste note con i risultati rilevanti dell'appendice e della revisione della letteratura. Produce quindi punti di forza, debolezze, domande, una raccomandazione, un punteggio e un elenco di azioni.

Questa sequenza affronta un fallimento comune negli strumenti di revisione LLM. Un unico grande prompt può chiedere a un modello di riassumere, verificare, confrontare, criticare, assegnare un punteggio e formattare un paper contemporaneamente.

Il modello può produrre una revisione curata senza costruire una rappresentazione stabile della ricerca. Può ripetere le affermazioni dell'abstract trascurando prove contrarie nei risultati.

MLR separa la comprensione dalla valutazione. Questo design fornisce al modello note intermedie in grado di collegare una conclusione con il metodo o l'esperimento che la sostiene.

I risultati del benchmark suggeriscono che sia la scelta del modello sia il design del flusso di lavoro abbiano contribuito al miglioramento. La sostituzione di GPT-4.1 con Claude Sonnet 4 nel riferimento LLM-Review più semplice ha aumentato il rilevamento degli errori centrali dal 14,56% al 35,40%.

Una singola revisione MLR ha quindi raggiunto il 60,79% sulla stessa classe di contraddizioni centrali. Un ensemble di quattro revisioni MLR ha portato il rilevamento al 73,43%.

Il miglior risultato concorrente per gli errori nelle affermazioni centrali è stato del 14,81%, ottenuto da AgentReview. AI Reviewer ha raggiunto l'11,17%, mentre la configurazione originale di LLM-Review ha raggiunto il 14,56%.

Considerando le contraddizioni a ogni livello di gravità misurato, quattro revisioni MLR ne hanno rilevato il 40,95%. I sistemi concorrenti sono rimasti tra il 5,95% e il 6,50%.

Questi confronti rendono il meccanismo più interessante del punteggio assoluto. Cambiare il modello sottostante ha prodotto un forte miglioramento, mentre il design della revisione a più passaggi ne ha prodotto un altro.

Ciò significa che gli acquirenti non possono considerare “multi-agent” una spiegazione sufficiente delle prestazioni. AgentReview utilizza già ruoli di revisore, autore e area chair, eppure il suo risultato nel benchmark è rimasto molto più basso.

La domanda importante è cosa facciano gli agenti. Dividere un compito tra più personaggi è diverso dal suddividere un manoscritto in componenti basati sulle prove e costruire comprensione attraverso passaggi ripetuti.

MLR mette inoltre in discussione l'idea che più token producano automaticamente una migliore qualità della revisione. Nello studio ha utilizzato 189.062 token di input per ciascuna revisione completa, meno della metà dei 403.654 di AI Reviewer.

Il più semplice LLM-Review ha usato soltanto 6.517 token di input, in parte perché troncava contenuti lunghi. Questo approccio consumava meno risorse, ma perdeva informazioni che potevano rivelare contraddizioni.

Il compromesso utile, quindi, non è semplicemente tra piccolo e grande. È stabilire se il sistema impieghi il contesto per costruire un modello del paper che sia revisionabile.

L'affermazione del 73% si ridimensiona fuori dal benchmark

La prova più forte contro il trattamento di MLR come arbitro autonomo proviene dalla stessa valutazione di Sakana AI sugli errori reali.

I ricercatori hanno testato il Review Agent rispetto a WithdrarXiv-Check, un dataset basato su paper arXiv ritirati e sui relativi commenti di ritiro. Il suo set di test contiene 211 paper.

Questa valutazione è più difficile del rilevamento di contraddizioni inserite. Gli errori reali nella ricerca possono essere distribuiti tra ipotesi, derivazioni, citazioni ed esperimenti senza produrre un evidente conflitto a livello di frase.

Gli autori hanno disabilitato la componente di ricerca della letteratura per questo test. Altrimenti, il sistema avrebbe potuto individuare avvisi pubblici di ritiro anziché scoprire i problemi dai manoscritti.

MLR ha identificato una corrispondenza esatta con il problema di ritiro documentato nel 16,11% dei casi. In base a uno standard più flessibile, che accettava una preoccupazione sostanzialmente simile, ha raggiunto il 26,07%.

Il riferimento più forte ha raggiunto il 9% per le corrispondenze esatte e il 18,48% per quelle simili. MLR ha comunque guidato il confronto, ma il margine era molto più ridotto rispetto al benchmark sintetico.

Il dataset dei paper ritirati include inoltre principalmente ricerche teoriche in matematica e fisica. I sistemi di revisione sono stati progettati attorno ai paper delle conferenze di machine learning, il che limita il confronto diretto.

Anche con questa discrepanza di dominio, il divario di prestazioni rivela una limitazione centrale. Le contraddizioni inserite offrono al revisore un disaccordo netto da trovare. I difetti reali richiedono spesso di ricostruire una dimostrazione, rieseguire codice, controllare dati o possedere conoscenze specialistiche del dominio.

Gli autori del benchmark riconoscono un altro problema. I valutatori umani hanno esaminato 50 contraddizioni sintetiche e hanno rilevato che il 34% mancava di flusso coerente con le frasi adiacenti.

Solo l'8% suonava palesemente generato dall'AI, ma un contesto interrotto può comunque offrire un indizio per il rilevamento. Un revisore automatizzato potrebbe notare che un passaggio non si adatta senza comprendere perché la scienza sottostante sia errata.

Gli autori sostengono che ciò renda il benchmark più facile, non invalido. I sistemi di riferimento hanno comunque faticato, anche quando alcuni errori inseriti contenevano irregolarità rilevabili.

Questa interpretazione è ragionevole, ma cambia il significato del 73,43%. La cifra è un punteggio elevato in un compito controllato di contraddizione, non una stima della frequenza con cui MLR individua errori gravi nei paper sottoposti.

Anche la configurazione a quattro revisioni merita attenzione. L'ensemble considera un errore rilevato quando una qualsiasi delle quattro revisioni indipendenti lo menziona.

Questo è utile per lo screening lato autore, dove raccogliere più segnali di allarme può migliorare la copertura. È meno direttamente comparabile con l'assegnazione di una revisione automatizzata in sostituzione di un revisore umano.

Il risultato del 60,79% per gli errori centrali ottenuto da una singola revisione MLR rimane sostanziale. Tuttavia, quasi quattro contraddizioni centrali inserite su dieci non sono state rilevate nella configurazione a revisione singola.

Le prestazioni sono inoltre diminuite man mano che le contraddizioni si allontanavano dall'affermazione principale di un paper. Questo schema supporta la misura di gravità del grafo della conoscenza, ma mostra che gli errori secondari dettagliati rimangono difficili.

Per i team di ricerca, il caso d'uso pratico è quindi l'audit prima della sottomissione. Un sistema automatizzato può segnalare possibili incoerenze e indirizzare l'attenzione umana verso le affermazioni più vulnerabili.

Non è pronto a certificare la validità. Non si può presumere che un paper che non riceve avvisi sia corretto, né che un avviso sia giustificato.

L'accordo con gli esseri umani è utile, ma non è una verifica scientifica

MLR produce giudizi simili ai punteggi delle revisioni umane, ma l'accordo con i revisori resta distinto dall'accertamento della verità.

Sulle candidature a ICLR 2025, i punteggi di MLR hanno registrato una correlazione di Pearson pari a 0,586 con i punteggi umani. Il riferimento tra revisori umani era 0,742.

Sugli articoli di NeurIPS 2024, MLR ha raggiunto 0,451, rispetto a un riferimento umano di 0,781. A ICML 2025, MLR ha ottenuto 0,429, poco dietro all'AI Reviewer con 0,439.

Queste cifre mostrano un allineamento significativo, soprattutto rispetto ai sistemi i cui punteggi distinguevano a malapena tra articoli accettati e respinti. Non dimostrano che le decisioni umane o automatizzate siano fattualmente corrette.

La revisione tra pari include valutazioni soggettive su rilevanza, chiarezza e novità. Due revisori scrupolosi possono concordare che un articolo meriti l'accettazione pur non cogliendo la stessa debolezza tecnica.

L'analisi di Sakana AI ha inoltre rilevato differenze negli aspetti su cui si concentravano umani e sistemi automatizzati. MLR attribuiva maggiore peso alla validità e agli esperimenti, mentre i revisori umani prestavano più attenzione alla chiarezza e alla novità.

Questa divergenza può essere utile. Un assistente alla revisione aggiunge più valore quando porta alla luce questioni trascurate che quando si limita a prevedere i commenti che scriverà un essere umano.

Tuttavia, un focus complementare crea un problema di calibrazione a sé stante. Il sistema deve distinguere una reale debolezza metodologica da una critica plausibile ma non supportata dal manoscritto.

La valutazione degli utenti nello studio illustra questa sfida. Ricercatori attivi hanno completato 38 sessioni di revisione con il flusso di lavoro MLR completo.

Tra i 378 commenti che hanno ricevuto feedback diretto sull'accordo, gli utenti ne hanno accettato l'81%. Le raccomandazioni hanno ricevuto il 94% di accordo e i punti di forza il 92%.

Le domande hanno ricevuto il 79%, mentre gli elementi della lista di azioni hanno ricevuto il 78%. Le debolezze hanno avuto il tasso di accordo più basso, al 68%.

Gli autori non sono giudici neutrali delle critiche, quindi il disaccordo non significa necessariamente che il sistema avesse torto. Tuttavia, le debolezze sono proprio l'ambito in cui accuse infondate possono arrecare il danno maggiore.

Un revisore che sostiene erroneamente l'esistenza di un errore matematico o di un esperimento mancante può distorcere una decisione editoriale. Un linguaggio fluido può far apparire tale accusa più certa di quanto le prove consentano.

Anche i revisori umani possono commettere lo stesso errore. La differenza è che l'automazione può replicare un'interpretazione sbagliata su migliaia di candidature.

Per questo il sistema di revisione tra pari di Sakana AI è più adatto come secondo lettore che come decisore. Può ampliare l'insieme delle questioni esaminate da un essere umano senza ricevere l'autorità finale sull'accettazione.

Le note strutturate del sistema possono inoltre aiutare gli autori a gestire evidenze complesse. I team che utilizzano già una base di conoscenza ricercabile possono applicare un principio analogo collegando le affermazioni a esperimenti, citazioni e questioni irrisolte.

Questo non automatizza la verifica. Rende più semplice per gli esseri umani ispezionare la traccia delle evidenze.

Il prompt injection espone il rischio dell'automazione

Un revisore che comprende un articolo può comunque essere manipolato dal testo inserito al suo interno.

Sakana AI ha testato il prompt injection esplicito aggiungendo istruzioni nascoste dopo la conclusione di 50 manoscritti respinti, per lo più originariamente sottoposti a ICLR 2025.

Il prompt injection si verifica quando il contenuto all'interno di un documento cerca di sovrascrivere le istruzioni che regolano il modello che lo legge. Un passaggio malevolo potrebbe dire a un revisore automatizzato di ignorare le debolezze o assegnare un punteggio elevato.

Tutti e quattro i sistemi di revisione sono stati fortemente influenzati dal testo iniettato. MLR ha mostrato la minore variazione media del punteggio secondo alcune misure, ma i suoi risultati presentavano un'elevata varianza.

Ha rilevato esplicitamente la manipolazione in appena 8 dei 50 articoli. Nei casi restanti, il contenuto iniettato ha influenzato la revisione senza essere identificato in modo affidabile come ostile.

I ricercatori suggeriscono che MLR abbia ricevuto una certa protezione dal suo flusso di lavoro incentrato prima sulla comprensione e dall'input multimodale. Claude vedeva sia il testo del documento sia le sue pagine renderizzate, mentre l'istruzione iniettata non era presente nell'immagine visibile.

Questa discrepanza ha fornito al sistema un possibile segnale che il testo nascosto non appartenesse all'articolo. Non è stata sufficiente a impedire la manipolazione in modo coerente.

Questa debolezza conta perché la revisione tra pari coinvolge documenti non attendibili. Gli autori controllano il PDF, i file sorgente, il materiale supplementare, le citazioni e talvolta i repository collegati.

Qualsiasi revisore automatizzato dotato di strumenti di navigazione o esecuzione del codice affronta una superficie di attacco più ampia. Una pagina collegata può contenere istruzioni, un repository può includere commenti avversari e i dati supplementari possono nascondere metadati fuorvianti.

Le politiche delle conferenze riconoscono già che l'uso degli LLM richiede divulgazione e gestione attenta. La guida per i revisori ICLR pone la responsabilità umana al di sopra dell'assistenza automatizzata.

Un'implementazione sicura dovrebbe isolare il contenuto del documento dalle istruzioni di sistema. Dovrebbe inoltre limitare gli strumenti, registrare le azioni del modello, segnalare il testo nascosto e richiedere la conferma umana per le affermazioni con conseguenze rilevanti.

Neppure questi controlli risolverebbero ogni forma di manipolazione. Un passaggio può influenzare un modello senza contenere un'istruzione evidente.

Gli autori possono presentare selettivamente i confronti, nascondere esperimenti falliti o usare un linguaggio sicuro per orientare l'attenzione. Anche queste tecniche influenzano i revisori umani, ma i sistemi automatizzati possono sviluppare punti ciechi prevedibili.

Il lavoro precedente di Sakana AI offre un monito rilevante. Nel 2025, l'azienda ha ritirato un articolo per workshop generato dall'IA dopo la sua accettazione e ha descritto errori nelle citazioni della ricerca generata.

Ricercatori esterni hanno messo in dubbio che l'episodio dimostrasse un'abilità scientifica autonoma o un'efficace selezione umana di output dell'IA. Una successiva analisi della revisione tra pari ha sottolineato la differenza tra superare la revisione e contribuire con conoscenza affidabile.

MLR affronta una parte di questo problema testando i revisori su errori noti. Tuttavia, i risultati sull'injection mostrano che un valutatore costruito sulla stessa classe di modelli resta vulnerabile a input scritti strategicamente.

Autori automatizzati e revisori automatizzati potrebbero infine ottimizzarsi l'uno contro l'altro. Gli autori potrebbero imparare quale linguaggio evita le critiche, mentre i revisori potrebbero premiare schemi che assomigliano a lavori accettati.

Senza controlli indipendenti, questo ciclo potrebbe migliorare i punteggi senza migliorare la scienza.

Cosa osservare dopo il benchmark sulla revisione tra pari con LLM

Tre segnali determineranno se il risultato di Sakana AI diventerà uno strumento di ricerca utile o resterà un impressionante esperimento controllato.

Il primo segnale è la replica indipendente. Sakana AI afferma che dati e codice sono disponibili su richiesta, anziché tramite un repository pubblico immediatamente accessibile.

I team esterni devono riprodurre il benchmark con gli stessi articoli, prompt, versioni dei modelli e procedura di valutazione. Dovrebbero inoltre testare modelli giudice diversi e verificare manualmente i rilevamenti contestati.

La replica dovrebbe misurare i falsi positivi insieme al recall. Individuare più errori ha un valore limitato se il sistema genera anche molte critiche plausibili ma errate.

Il secondo segnale è la performance su difetti naturali. I benchmark futuri dovrebbero includere errori statistici verificati, affermazioni causali non supportate, problemi nelle citazioni, risultati non riproducibili e dimostrazioni errate.

Alcuni compiti richiederanno accesso a codice e dati, anziché al solo PDF. Un serio revisore della ricerca potrebbe dover eseguire esperimenti, ispezionare il preprocessing e confrontare i valori riportati con gli output generati.

Il risultato di corrispondenza esatta del 16,11% offre un punto di partenza. Se i sistemi futuri aumenteranno questo tasso su articoli diversificati e curati in modo indipendente, il caso a favore di un'assistenza pratica diventerà più solido.

Il terzo segnale è se le conferenze implementeranno questi sistemi con salvaguardie applicabili. Gli indicatori rilevanti includono regole di divulgazione, controlli sulla privacy, difese contro il prompt injection e supervisione umana documentata.

Una sperimentazione limitata che fornisca ai revisori avvisi privati e facoltativi testerebbe l'aumento delle capacità senza delegare le decisioni. Un sistema che assegni automaticamente punteggi alle candidature comporterebbe rischi molto maggiori.

I ricercatori dovrebbero anche osservare come i cambiamenti dei modelli influenzano il sistema MLR di Sakana AI. L'ablazione ha mostrato che il passaggio al modello sottostante ha rappresentato una quota rilevante del miglioramento.

Questo crea pressione sulla manutenzione. Un flusso di lavoro validato con una versione del modello può comportarsi diversamente dopo che un fornitore aggiorna il proprio modello o ritira un endpoint.

Solleva inoltre interrogativi sulla riproducibilità. I benchmark scientifici diventano più difficili da interpretare quando i modelli commerciali cambiano senza mantenere checkpoint pubblici identici.

Il contributo più profondo di Beyond Imitation è dunque metodologico. Il suo benchmark sulla revisione tra pari con LLM pone una domanda migliore rispetto a quella se i commenti generati assomiglino ai commenti umani.

Un revisore IA può trovare un problema concreto che minaccia il ragionamento dell'articolo?

La risposta di Sakana AI è incoraggiante in condizioni controllate e sobria sui lavori reali ritirati. Nei test riportati, la comprensione a più passaggi supera chiaramente l'imitazione superficiale.

Il divario rimanente è troppo ampio per affidare autorità alle decisioni automatizzate. Gli articoli reali contengono errori che non si annunciano come contraddizioni, e gli articoli malevoli possono manipolare direttamente il revisore.

Gli sviluppatori dovrebbero trattare la cifra del 73,43% come un risultato di benchmark con confini definiti. Gli editori dovrebbero esigere una validazione indipendente prima di inserire punteggi automatizzati nelle decisioni di pubblicazione.

I ricercatori possono comunque usare oggi l'idea centrale del sistema. Chiedete a un assistente IA di mappare ogni affermazione principale alle relative evidenze, ispezionate i collegamenti risultanti e analizzate manualmente ogni passaggio non supportato.

Il prossimo risultato decisivo non sarà un altro record sintetico. Sarà un sistema replicato che individua errori sottili e naturali senza sommergere i revisori di falsi allarmi né obbedire alle istruzioni nascoste nel manoscritto.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page