top of page

QED Science sostiene di poter classificare l'1% migliore dei preprint. I ricercatori dovrebbero fidarsi?

11 ago
Tempo di lettura: 13 min

QED Science ha classificato 57.455 preprint nelle scienze della vita e ne ha inseriti 574 nel proprio 1% migliore, nonostante restino irrisolte questioni su come la sua IA definisca la qualità scientifica.

La startup di Tel Aviv afferma che il suo sistema valuta originalità e validità senza vedere autori, affiliazioni, conteggi delle citazioni o nomi delle riviste. Questa promessa contrappone il QED Score ai segnali di prestigio che i ricercatori già usano, spesso con riluttanza, per orientarsi in una letteratura scientifica travolgente.

La questione centrale sollevata dalla copertura di Horizon Nature non è se l'intelligenza artificiale possa leggere gli articoli più rapidamente delle persone. Chiaramente può farlo. La domanda è se un punteggio proprietario possa diventare un filtro affidabile prima che ricercatori indipendenti ne testino a fondo le assunzioni.

QED Science ha trasformato un anno di preprint in un'unica classifica

QED Science ha trasformato il triage scientifico da un problema di lettura a un problema di classificazione.

L'azienda ha lanciato “The 1%” il 24 giugno 2026. Descrive il progetto come una selezione dei preprint nelle scienze della vita più originali e scientificamente validi pubblicati nell'arco di 12 mesi.

QED ha analizzato 57.455 manoscritti inviati a bioRxiv tra maggio 2025 e aprile 2026. La raccolta finale contiene 574 articoli, pari all'1% migliore di quella popolazione valutata.

Un preprint è un manoscritto diffuso prima della formale revisione tra pari di una rivista. Può far circolare rapidamente i risultati, ma i lettori devono valutare le prove senza le garanzie associate alla revisione editoriale.

Questa rapidità genera sia valore sia rischio. I ricercatori possono imbattersi in risultati importanti mesi prima della pubblicazione su rivista, ma si trovano anche di fronte a una quantità di materiale che nessuna persona può valutare attentamente.

QED afferma che una revisione convenzionale dell'intero corpus richiederebbe tra 860.000 e 1.030.000 ore di lavoro da parte di esperti. Secondo il paper di validazione dell'azienda, questa stima equivale a oltre 400 anni-ricercatore.

Il suo sistema ha completato le valutazioni in poche ore. Questa differenza spiega l'attrattiva dell'approccio, soprattutto per finanziatori, gruppi di ricerca e aziende che monitorano settori in rapida evoluzione.

Il risultato non è una decisione di accettazione. QED descrive The 1% come un segnale precoce per decidere quali manoscritti meritino attenzione.

Questa distinzione è importante. Un editor di rivista può richiedere revisioni, consultare revisori, esaminare le dichiarazioni e respingere un articolo dopo aver individuato un problema fatale. Un punteggio condensa un processo diverso in un unico numero.

L'elenco pubblico di QED copre le categorie delle scienze della vita di bioRxiv. Le neuroscienze contribuiscono con 83 articoli selezionati su 11.058 manoscritti valutati, mentre la biologia cellulare ne contribuisce 55 su 3.408.

Altre categorie includono genomica, immunologia, microbiologia, biologia del cancro, bioinformatica, genetica e biologia sintetica. La distribuzione riflette sia le dimensioni dei settori sia le valutazioni di QED.

QED segnala inoltre un'adozione che va oltre il progetto di classificazione. Al 31 maggio, la sua piattaforma serviva oltre 10.000 laboratori in più di 1.500 istituzioni in oltre 70 Paesi.

Queste cifre provengono da QED, non da un audit indipendente sull'utilizzo. Ciononostante, mostrano che la valutazione dei manoscritti assistita dall'IA sta andando oltre l'esperimento di laboratorio.

La questione posta da Horizon Nature si estende quindi oltre un singolo elenco. Se i ricercatori usano QED per scegliere cosa leggere, citare, finanziare o sviluppare, i suoi giudizi possono orientare l'attenzione prima ancora che inizi la revisione tra pari.

Questo è il vero cambiamento. QED non si è limitata a riassumere i preprint. Ha proposto un cancello automatizzato all'ingresso dell'attenzione scientifica.

Perché il dibattito di Horizon Nature è importante ora

La pressione nasce da un divario crescente tra la velocità con cui appare la ricerca e la lentezza con cui gli esperti possono valutarla.

I server di preprint consentono agli scienziati di condividere i risultati senza attendere l'intero ciclo di revisione di una rivista. Questo modello è diventato particolarmente visibile quando i ricercatori hanno avuto bisogno di un accesso rapido alle evidenze biomediche emergenti.

Ha però anche eliminato un familiare meccanismo di selezione. Un manoscritto appena pubblicato su bioRxiv non ha una collocazione finale in una rivista, uno storico consolidato di citazioni o una revisione tra pari completata.

I ricercatori compensano con segnali imperfetti. Riconoscono laboratori, istituzioni, autori, metodi e aree disciplinari. Seguono le raccomandazioni sociali ed esaminano ciò che emerge attraverso le reti professionali.

Queste abitudini possono far risparmiare tempo, ma possono anche riprodurre pregiudizi di prestigio. Il lavoro di un'istituzione famosa riceve più facilmente attenzione rispetto a un lavoro altrettanto solido di un gruppo poco conosciuto.

QED punta proprio a questa debolezza. Il suo annuncio di lancio afferma che ogni manoscritto viene anonimizzato prima della valutazione.

Il sistema rimuove nomi degli autori, affiliazioni e altre informazioni identificative. Ignora inoltre conteggi delle citazioni, sedi di pubblicazione e reputazione delle riviste.

Oded Rechavi, cofondatore e responsabile scientifico di QED, sostiene che la qualità scientifica dovrebbe essere giudicata attraverso il lavoro stesso. La valutazione cieca mira a impedire che la reputazione sostituisca le prove.

Questo obiettivo ha una base credibile. La revisione umana può essere influenzata dallo status istituzionale, dalle relazioni professionali, dalla lingua e dalle aspettative su chi produca lavori importanti.

Tuttavia, l'anonimato non crea automaticamente neutralità. Un manoscritto può contenere segnali indiretti sulla propria origine, inclusi argomenti di ricerca, apparecchiature, dataset, stile di scrittura e riferimenti.

Un modello di IA può inoltre ereditare associazioni dai propri dati di addestramento. Rimuovere il nome dell'istituzione dall'input non cancella ogni relazione appresa durante lo sviluppo del modello.

Ricerche precedenti hanno mostrato perché questa distinzione sia importante. Uno studio del 2024 ha testato GPT-3.5 su 30 abstract medici abbinati a diverse affiliazioni.

I ricercatori hanno generato 232.500 singole revisioni in condizioni di affiliazione randomizzate. Il loro studio sul pregiudizio di affiliazione ha rilevato che le informazioni istituzionali influenzavano i giudizi del modello.

L'anonimizzazione di QED affronta la versione più diretta di questo problema. Tuttavia, l'azienda non ha reso pubblici dettagli sufficienti del sistema perché osservatori esterni possano mappare ogni percorso residuo.

Anche il problema della scala sta peggiorando. L'IA generativa ha ridotto lo sforzo necessario per redigere testi tecnici, creare citazioni plausibili e produrre manoscritti rifiniti.

Questo non significa che ogni articolo assistito dall'IA sia inaffidabile. Significa che la fluidità superficiale è diventata un segnale ancora più debole di qualità scientifica.

Richard Sever, cofondatore di bioRxiv, ha descritto una possibilità più cupa nelle cronache sui contenuti scientifici sintetici. I sistemi di preprint diventano più difficili da usare quando articoli fabbricati sommergono le scoperte genuine.

La valutazione automatizzata appare quasi inevitabile in questo contesto. Editor e scienziati non possono rispondere a un numero illimitato di invii generati dalle macchine con una quantità illimitata di revisione umana.

QED propone una versione della risposta: usare l'IA per scomporre ogni manoscritto, testarne le affermazioni e indirizzare la scarsa attenzione umana verso i candidati più forti.

La pressione ricade anzitutto sui ricercatori che conducono revisioni della letteratura. Raggiunge anche editor di riviste, finanziatori, team biotecnologici e chiunque prenda decisioni sulla base di evidenze preliminari.

Questi gruppi hanno bisogno di filtri più rapidi. Devono anche sapere perché un articolo ha superato il filtro, cosa il sistema ha mancato e quanto spesso i suoi errori si ripetono.

Una classifica può ridurre il sovraccarico informativo creando al contempo una nuova concentrazione di influenza. Se un singolo punteggio diventa ampiamente affidabile, gli errori nel livello di valutazione possono reindirizzare l'attenzione in un intero settore.

Ecco perché il dibattito è arrivato ora. L'editoria scientifica ha bisogno di triage su scala delle macchine, ma gli standard per validare quel triage restano incerti.

QED Score sfida il prestigio, non la revisione tra pari

L'argomento più forte a favore di QED non è che sostituisca la revisione tra pari, ma che testi gli articoli più direttamente di quanto non faccia il rango della rivista.

QED Score valuta due dimensioni dichiarate. L'originalità misura quanto una scoperta faccia progredire la conoscenza esistente, mentre la validità misura se le prove supportino le conclusioni del manoscritto.

L'azienda afferma che la sua architettura multi-agente prima scompone ogni articolo in una meta-affermazione, affermazioni principali, affermazioni correlate ed esperimenti di supporto.

Agenti di IA specializzati esaminano poi in parallelo caratteristiche diverse. Cercano incongruenze nelle figure, debolezze statistiche, conflitti con la letteratura esistente, ipotesi alternative e problemi negli standard di rendicontazione.

Un livello di verifica ricontrolla le questioni segnalate. Un livello di valutazione assegna un punteggio alle singole affermazioni, e un aggregatore combina queste valutazioni in un percentile calibrato.

Un punteggio di 80 significa che il manoscritto si è classificato al di sopra dell'80% del corpus di riferimento. Non significa che l'articolo abbia una probabilità dell'80% di essere corretto.

Questa distinzione è facile da perdere quando un giudizio complesso diventa un numero familiare. I percentili descrivono una posizione relativa, non una verità assoluta.

QED ha testato la propria metrica in tre studi. Il primo ha utilizzato 925 articoli pubblicati di 185 autori, che esperti del settore avevano collocato nelle categorie Limitato, Soddisfacente o Forte.

La pipeline di valutazione non ha ricevuto quelle etichette. QED riporta un'area sotto la curva di 0,867 nel separare gli articoli Limitati dalle altre categorie.

L'area sotto la curva, o AUC, misura quanto bene un sistema distingua due classi. Un valore di 0,5 rappresenta il caso, mentre 1,0 rappresenta una separazione perfetta.

Per 795 articoli con sia QED Scores sia dati sul rango della rivista, QED ha riportato risultati migliori in due confronti. Ha ottenuto 0,863 contro 0,804 nell'identificazione degli articoli Limitati.

Per gli articoli Forti, i risultati erano molto più vicini. QED ha riportato 0,782, rispetto a 0,774 per la misura del rango della rivista.

Il secondo studio ha valutato 4.953 preprint di bioRxiv dell'aprile 2025. QED ha poi tracciato dove quegli articoli sono stati infine pubblicati.

I ricercatori hanno abbinato 2.879 preprint a versioni pubblicate con un rango di rivista associato. QED ha riportato una correlazione di Spearman di 0,63 tra i suoi punteggi sui preprint e il successivo rango della rivista.

La correlazione variava tra 21 discipline. Raggiungeva 0,78 nella genetica, ma scendeva a 0,39 nella biologia dei sistemi.

Queste differenze meritano attenzione. Un singolo percentile trasversale alle discipline può nascondere variazioni significative nelle prestazioni del modello, nelle convenzioni sulle prove e nei comportamenti di pubblicazione.

Il terzo studio si è concentrato sui disaccordi. QED ha creato 100 coppie di articoli in cui il suo punteggio preferiva l'articolo pubblicato nella rivista con rango inferiore.

Quindici esperti del settore hanno esaminato le coppie senza vedere i QED Scores né le sedi di pubblicazione. Hanno prodotto 70 giudizi sicuri, inclusi 60 scelte decisive dopo l'esclusione dei pareggi.

Gli esperti hanno selezionato l'articolo favorito da QED nel 75% di questi casi decisivi. L'intervallo di confidenza riportato al 95% andava dal 63% all'84%.

Questo risultato sostiene l'argomento di QED secondo cui il prestigio della sede di pubblicazione può rappresentare in modo errato la qualità a livello di singolo articolo. Non stabilisce che QED possa identificare la verità senza giudizio umano.

Anche la sede di pubblicazione è un parametro di riferimento problematico. La collocazione in una rivista dipende da novità, ambito editoriale, tempistiche, presentazione, disponibilità dei revisori e scelte strategiche di invio.

Un punteggio correlato al rango della sede può convalidare l'allineamento con gli esiti di pubblicazione esistenti. Non può, da solo, convalidare l'affermazione che il sistema sfugga ai pregiudizi del sistema editoriale.

QED riconosce un limite importante. La sua metodologia afferma che The 1% non sostituisce la revisione tra pari.

Questo è il modo sensato di inquadrare la questione. QED può dare priorità ai manoscritti da esaminare, ma un percentile elevato non dovrebbe autorizzare decisioni cliniche né risolvere controversie scientifiche.

La sfida principale è quindi tra valutazione diretta e inferenza basata sul prestigio. QED chiede se i lettori debbano esaminare affermazioni e prove invece di prendere in prestito la reputazione di una rivista.

Questa sfida è utile anche se il punteggio di QED rimane imperfetto. Il branding delle riviste ha sempre condensato molti giudizi in una scorciatoia che i lettori possono usare impropriamente.

Un punteggio di IA convalidato con rigore potrebbe diventare un altro segnale. Non dovrebbe diventare l’unico segnale, né una nuova etichetta di prestigio con minore responsabilità pubblica.

Cosa non dimostra l’affermazione sul top 1%

I risultati interni di QED giustificano test seri, ma non giustificano ancora una fiducia incondizionata.

Il limite principale è l’indipendenza. QED Science ha sviluppato il sistema, progettato la validazione, pubblicato la metodologia e riportato le principali metriche di performance.

Gli studi condotti da aziende possono fornire prove preziose. La replica indipendente diventa essenziale quando il valore commerciale di un prodotto dipende dalle stesse affermazioni sulle prestazioni.

Una revisione esterna ha individuato debolezze in tutti e tre gli studi di validazione. La critica è stata prodotta tramite un altro servizio di valutazione della ricerca basato sull’IA, quindi non costituisce una replica umana definitiva.

Tuttavia, le sue domande sono concrete. Il rapporto di revisione sostiene che gli studi di QED condividono segnali di riferimento correlati invece di offrire una conferma pienamente indipendente.

Il primo studio dipende da categorie di qualità assegnate da esperti. Il secondo utilizza il ranking delle riviste come risultato. Il terzo seleziona casi in cui QED e il ranking delle riviste sono fortemente in disaccordo.

Questa struttura può dimostrare coerenza nei test scelti da QED. Lascia aperta la questione di come il sistema si comporti nelle decisioni prospettiche definite da ricercatori esterni.

Il secondo studio ha inoltre associato solo 2.879 dei 4.953 preprint alle versioni pubblicate con dati sul ranking delle riviste. Ciò lascia 2.074 manoscritti fuori dall’analisi di correlazione riportata.

Alcuni articoli non associati potrebbero essere pubblicati in seguito, apparire in sedi prive della metrica richiesta o non arrivare mai alla pubblicazione formale. La loro esclusione può modificare la relazione apparente.

Gli effetti di selezione contano perché la pubblicazione non è casuale. Lavori solidi possono rimanere inediti, mentre lavori deboli possono superare la revisione.

Il terzo studio offre dati convincenti sui disaccordi, ma utilizza un campione deliberatamente insolito. I ricercatori hanno selezionato coppie perché QED e il ranking delle riviste indicavano direzioni opposte.

Questo disegno mette alla prova un conflitto rilevante. Non stima con quale frequenza QED compia la scelta migliore tra gli articoli ordinari.

Il risultato di preferenza del 75% deriva inoltre da 60 giudizi decisivi. È informativo, ma piccolo rispetto ai 57.455 manoscritti inclusi in The 1%.

L’elenco selezionato introduce un’altra questione. “Top 1%” sembra oggettivo, ma resta relativo al corpus di QED, alla gestione delle categorie, alla versione del punteggio e alle dimensioni di valutazione scelte.

Originalità e validità sono criteri preziosi. Non coprono ogni qualità a cui gli scienziati tengono.

Un articolo tecnicamente valido può essere circoscritto o poco importante. Un articolo originale può basarsi su misurazioni fragili. Una replica può offrire un’originalità limitata pur fornendo un enorme valore scientifico.

Etica, disponibilità dei dati, trasparenza metodologica, riproducibilità, importanza pratica e conflitti di interesse possono influenzare anch’essi il modo in cui i lettori dovrebbero utilizzare un risultato.

Gli agenti di QED esaminano diversi fattori correlati, ma gli osservatori esterni hanno bisogno di maggiore visibilità sulla loro ponderazione. Servono inoltre analisi degli errori, calibrazione a livello di disciplina ed esempi di falsi positivi.

L’opacità del modello solleva questioni operative. QED afferma che la sua architettura combina diversi modelli linguistici di grandi dimensioni con modelli proprietari.

La sua metodologia pubblica non identifica ogni modello sottostante, prompt, peso dei componenti o calendario di aggiornamento. Questi dettagli possono influire sulla riproducibilità.

Se un fornitore di modelli modifica un sistema, lo stesso manoscritto potrebbe ricevere un risultato diverso. QED avrebbe bisogno di punteggi versionati e registri di audit stabili per supportare un uso con conseguenze rilevanti.

La ricerca ha già dimostrato che i valutatori LLM possono riprodurre bias sociali. Un grande esperimento economico ha generato 27.090 valutazioni su 9.030 articoli.

Quell’esperimento di peer review ha rilevato che i modelli distinguevano la qualità, ma favorivano istituzioni prestigiose, autori uomini ed economisti rinomati.

L’input in cieco di QED dovrebbe ridurre diversi di questi effetti. Non risponde però alla domanda se il suo modello abbia appreso altre preferenze per metodi familiari, argomenti popolari o strutture argomentative convenzionali.

Il sistema potrebbe inoltre premiare i manoscritti più facili da analizzare per i modelli. Una struttura delle affermazioni chiara è positiva, ma la leggibilità non deve diventare un sostituto invisibile della forza delle prove.

Anche il comportamento avversariale è una preoccupazione. Una volta che gli autori comprendono cosa premia un sistema di punteggio, alcuni ottimizzeranno i manoscritti per la metrica.

Questo schema compare ovunque le classifiche distribuiscano attenzione. Motori di ricerca, metriche universitarie, misure di citazione e fattori di impatto delle riviste hanno tutti incoraggiato comportamenti strategici.

Un punteggio pubblico necessita quindi di resistenza alla manipolazione. Richiede anche monitoraggio di prompt nascosti, citazioni inventate, prove duplicate e tattiche stilistiche progettate per influenzare un valutatore.

I ricercatori dovrebbero trattare QED come uno strumento di scoperta finché queste domande non riceveranno risposte indipendenti. Un punteggio elevato può giustificare la lettura anticipata di un articolo, non il credergli prima.

È altrettanto importante il contrario. Un punteggio basso non dovrebbe seppellire silenziosamente una ricerca non convenzionale senza un percorso di appello o una spiegazione chiara.

Per i knowledge worker che seguono le affermazioni scientifiche, mantenere il contesto delle fonti conta più che raccogliere classifiche. Una base di conoscenza ricercabile può conservare insieme articoli, critiche, aggiornamenti e prove contrastanti.

Questo flusso di lavoro mantiene il punteggio nel suo ruolo appropriato. Diventa un filtro collegato a una fonte, non un verdetto separato dal lavoro sottostante.

Tre segnali determineranno se i ricercatori dovrebbero fidarsi

La fiducia dipenderà dalla validazione indipendente, da prestazioni stabili tra le discipline e dalla prova che gli scienziati usano il punteggio senza rinunciare al giudizio.

Il primo segnale è uno studio prospettico preregistrato condotto da ricercatori esterni a QED Science. Team indipendenti dovrebbero definire i criteri di valutazione prima di vedere i risultati.

Dovrebbero testare manoscritti nuovi che né i modelli né i valutatori hanno incontrato. Lo studio dovrebbe includere articoli pubblicati, articoli inediti, repliche, risultati negativi e invii intenzionalmente difettosi.

Esperti esterni dovrebbero valutare affermazioni e prove senza ricevere le etichette di QED. I ricercatori potranno quindi confrontare QED con panel umani, decisioni editoriali, risultati delle repliche e correzioni successive.

Nessun singolo benchmark fornisce una verità di riferimento perfetta. La concordanza tra misure realmente indipendenti rafforzerebbe l’affermazione di QED più di un altro confronto condotto dall’azienda.

Un fallimento in tali condizioni indebolirebbe l’affermazione secondo cui QED offre una misura generalmente affidabile della qualità scientifica. Potrebbe comunque restare utile per compiti di triage più circoscritti.

Il secondo segnale è la trasparenza delle prestazioni a livello di disciplina nel tempo. QED riporta già correlazioni comprese tra 0,39 e 0,78 nelle diverse discipline.

Le versioni future dovrebbero divulgare modelli di falsi positivi, modelli di falsi negativi, deriva della calibrazione e modifiche al punteggio per ciascun campo. L’accuratezza aggregata può nascondere prestazioni deboli in aree specialistiche.

Il versioning è particolarmente importante. Ogni punteggio dovrebbe identificare la versione del sistema, il corpus di riferimento, la data di valutazione e l’incertezza associata alla classifica.

I ricercatori hanno inoltre bisogno di spiegazioni che colleghino i punteggi ad affermazioni ed esperimenti specifici. Un percentile senza un ragionamento tracciabile non può sostenere correzioni significative.

Se QED pubblicherà risultati stabili e riproducibili a livello di disciplina, la sua tesi diventerà più solida. Se i punteggi cambieranno silenziosamente dopo modifiche ai modelli, i ricercatori dovrebbero limitare lo strumento alla scoperta informale.

Il terzo segnale è il modo in cui le istituzioni utilizzano la classifica. Le raccomandazioni di lettura comportano rischi minori rispetto a filtri per i finanziamenti, per le assunzioni o per decisioni sulle prove cliniche.

Uno strumento che aiuta gli scienziati a scoprire articoli trascurati può ridurre il bias di prestigio. Lo stesso strumento può creare prestigio algoritmico se le istituzioni trattano il punteggio come una soglia.

Osservate se finanziatori e riviste usano QED insieme alla revisione degli esperti o prima di essa. Osservate anche se gli autori possono contestare gli errori e ottenere una nuova valutazione dopo le revisioni.

L’adozione più sana conserverebbe la responsabilità umana. I ricercatori userebbero QED per identificare gli articoli, esaminarne il ragionamento e poi valutare le prove sottostanti.

L’adozione più rischiosa nasconderebbe le decisioni dietro un percentile. Un’istituzione potrebbe respingere automaticamente un lavoro sostenendo che il processo era neutrale perché i nomi erano stati rimossi.

La domanda di Nature ha una risposta condizionata. I ricercatori dovrebbero fidarsi di QED abbastanza da testarne le raccomandazioni, ma non abbastanza da esternalizzare il giudizio scientifico.

QED ha presentato una risposta credibile a un vero collo di bottiglia. La sua scala, il punteggio in cieco e l’analisi a livello di affermazione meritano un attento esame indipendente.

Il dibattito di Horizon Nature necessita ora di prove esterne all’azienda. Nei prossimi mesi, cercate repliche preregistrate, segnalazioni degli errori specifiche per disciplina e usi istituzionali resi noti.

Un punteggio QED cambierebbe quale preprint leggete per primo? Probabilmente sì. Cambierebbe ciò in cui credete senza controllare metodi e prove? Non dovrebbe.

 
 

Inizia gratis

Un assistente IA local-first con gestione della conoscenza personale

Per una migliore esperienza con l’IA,

al momento remio supporta solo Windows 10+ (x64) e M-Chip Macs.

Il tuo partner AI al lavoro
Fai di più con remio

Pianifica. Crea. Consegna.
Tutto in un unico posto.

bottom of page