top of page

QED Science affirme pouvoir classer les 1 % meilleurs préprints. Les chercheurs doivent-ils lui faire confiance ?

11 août
14 min de lecture

QED Science a classé 57 455 préprints en sciences de la vie et en a retenu 574 dans son top 1 %, malgré des questions non résolues sur la manière dont son IA définit la qualité scientifique.

La startup de Tel Aviv affirme que son système évalue l’originalité et la validité sans voir les auteurs, les affiliations, les nombres de citations ou les noms de revues. Cette promesse oppose le QED Score aux signaux de prestige que les chercheurs utilisent déjà, souvent à contrecœur, pour s’orienter dans une littérature écrasante.

La question centrale soulevée par la couverture de Horizon Nature n’est pas de savoir si l’intelligence artificielle peut lire des articles plus vite que les humains. Elle le peut clairement. La question est de savoir si un score propriétaire peut devenir un filtre digne de confiance avant que des chercheurs indépendants n’en aient pleinement testé les hypothèses.

QED Science a transformé une année de préprints en une liste classée

QED Science a fait passer le tri scientifique d’un problème de lecture à un problème de classement.

L’entreprise a lancé « The 1% » le 24 juin 2026. Elle présente le projet comme une sélection des préprints les plus originaux et scientifiquement valides en sciences de la vie, publiés sur une période de 12 mois.

QED a analysé 57 455 manuscrits soumis à bioRxiv entre mai 2025 et avril 2026. La collection finale compte 574 articles, soit les 1 % les mieux classés de cette population évaluée.

Un préprint est un manuscrit publié avant l’évaluation formelle par les pairs d’une revue. Il peut diffuser rapidement des résultats, mais les lecteurs doivent en évaluer les preuves sans la garantie associée à une relecture éditoriale.

Cette rapidité crée à la fois de la valeur et du risque. Les chercheurs peuvent découvrir des résultats importants des mois avant leur publication dans une revue, mais ils doivent aussi faire face à davantage de documents qu’une seule personne ne peut examiner attentivement.

QED estime qu’un examen conventionnel de l’ensemble de son corpus nécessiterait entre 860 000 et 1 030 000 heures de travail d’experts. Cela représente plus de 400 années-chercheurs, selon le document de validation de l’entreprise.

Son système a réalisé les évaluations en quelques heures. Cet écart explique son attrait, en particulier pour les bailleurs de fonds, les équipes de recherche et les entreprises qui suivent des domaines en évolution rapide.

Le résultat n’est pas une décision d’acceptation. QED présente The 1% comme un signal précoce permettant de décider quels manuscrits méritent de l’attention.

Cette distinction compte. Un éditeur de revue peut demander des révisions, consulter des évaluateurs, examiner les déclarations et rejeter un article après avoir découvert un problème rédhibitoire. Un score condense un processus différent en un seul chiffre.

La liste publique de QED couvre les catégories de sciences de la vie de bioRxiv. Les neurosciences contribuent 83 articles sélectionnés sur 11 058 manuscrits évalués, tandis que la biologie cellulaire en contribue 55 sur 3 408.

Les autres catégories incluent la génomique, l’immunologie, la microbiologie, la biologie du cancer, la bioinformatique, la génétique et la biologie synthétique. Cette répartition reflète à la fois la taille des domaines et les évaluations de QED.

QED rapporte également une adoption au-delà du projet de classement. Au 31 mai, sa plateforme était utilisée par plus de 10 000 laboratoires dans plus de 1 500 institutions réparties dans plus de 70 pays.

Ces chiffres proviennent de QED, et non d’un audit indépendant de l’utilisation. Ils montrent néanmoins que l’évaluation de manuscrits assistée par IA dépasse le stade de l’expérience de laboratoire.

La question de Horizon Nature dépasse donc une seule liste. Si les chercheurs utilisent QED pour choisir ce qu’ils lisent, citent, financent ou développent, ses jugements peuvent orienter l’attention avant le début de l’évaluation par les pairs.

C’est là le véritable changement. QED ne s’est pas contenté de résumer des préprints. L’entreprise a proposé un portail automatisé à l’entrée de l’attention scientifique.

Pourquoi le débat Horizon Nature compte aujourd’hui

La pression vient d’un fossé qui se creuse entre la vitesse à laquelle la recherche apparaît et la lenteur avec laquelle les experts peuvent l’évaluer.

Les serveurs de préprints permettent aux scientifiques de partager leurs résultats sans attendre le cycle complet d’évaluation d’une revue. Ce modèle est devenu particulièrement visible lorsque les chercheurs avaient besoin d’un accès rapide à des preuves biomédicales émergentes.

Il a aussi supprimé un mécanisme de tri familier. Un manuscrit tout juste publié sur bioRxiv n’a ni placement final dans une revue, ni historique de citations établi, ni évaluation par les pairs achevée.

Les chercheurs compensent par des signaux imparfaits. Ils reconnaissent des laboratoires, des institutions, des auteurs, des méthodes et des domaines. Ils suivent les recommandations sociales et examinent ce qui remonte dans les réseaux professionnels.

Ces habitudes peuvent faire gagner du temps, mais elles peuvent aussi reproduire les biais de prestige. Les travaux issus d’une institution célèbre reçoivent plus facilement de l’attention que des travaux tout aussi solides venant d’un groupe moins connu.

QED cible cette faiblesse. Son annonce de lancement indique que chaque manuscrit est anonymisé avant d’être noté.

Le système retire les noms des auteurs, les affiliations et d’autres informations d’identification. Il ignore également les nombres de citations, les lieux de publication et la réputation des revues.

Oded Rechavi, cofondateur et directeur scientifique de QED, soutient que la qualité scientifique doit être jugée à travers le travail lui-même. L’évaluation à l’aveugle vise à empêcher la réputation de se substituer aux preuves.

Cet objectif repose sur une base crédible. L’évaluation humaine peut être influencée par le statut institutionnel, les relations professionnelles, la langue et les attentes concernant les personnes susceptibles de produire des travaux importants.

Toutefois, l’anonymat ne crée pas automatiquement la neutralité. Un manuscrit peut contenir des signaux indirects sur son origine, notamment à travers les sujets de recherche, les équipements, les jeux de données, les styles d’écriture et les références.

Un modèle d’IA peut également hériter d’associations issues de ses données d’entraînement. Retirer le nom d’une institution de l’entrée n’efface pas toutes les relations apprises durant le développement du modèle.

Des recherches antérieures ont montré pourquoi cette distinction importe. Une étude de 2024 a testé GPT-3.5 sur 30 résumés médicaux associés à différentes affiliations.

Les chercheurs ont généré 232 500 évaluations individuelles dans des conditions d’affiliation randomisées. Leur étude sur les biais d’affiliation a constaté que les informations institutionnelles influençaient les jugements du modèle.

L’anonymisation de QED traite la forme la plus directe de ce problème. L’entreprise n’a toutefois pas rendu publics suffisamment de détails sur son système pour que des observateurs extérieurs puissent cartographier chaque voie restante.

Le problème d’échelle s’aggrave également. L’IA générative a réduit l’effort nécessaire pour rédiger des textes techniques, créer des citations plausibles et produire des manuscrits soignés.

Cela ne signifie pas que chaque article assisté par IA est peu fiable. Cela signifie que la fluidité de surface est devenue un signal encore plus faible de la qualité scientifique.

Richard Sever, cofondateur de bioRxiv, a décrit une possibilité plus sombre dans des reportages sur les contenus scientifiques synthétiques. Les systèmes de préprints deviennent plus difficiles à utiliser lorsque des articles fabriqués submergent les résultats authentiques.

L’évaluation automatisée paraît presque inévitable dans cet environnement. Les éditeurs et les scientifiques ne peuvent pas répondre à un nombre illimité de soumissions générées par machine par un examen humain illimité.

QED propose une version de la réponse : utiliser l’IA pour décomposer chaque manuscrit, tester ses affirmations et orienter l’attention humaine limitée vers les candidats les plus solides.

La pression s’exerce d’abord sur les chercheurs qui réalisent des revues de littérature. Elle touche aussi les éditeurs de revues, les bailleurs de fonds, les équipes de biotechnologie et toute personne prenant des décisions à partir de preuves préliminaires.

Ces groupes ont besoin d’un filtrage plus rapide. Ils doivent également savoir pourquoi un article a passé le filtre, ce que le système a manqué et à quelle fréquence ses erreurs se répètent.

Un classement peut réduire la surcharge informationnelle tout en créant une nouvelle concentration d’influence. Si un score devient largement digne de confiance, les erreurs au niveau de la notation peuvent rediriger l’attention dans tout un domaine.

Voilà pourquoi le débat survient maintenant. La publication scientifique a besoin d’un tri à l’échelle des machines, mais les normes de validation de ce tri restent incertaines.

QED Score défie le prestige, pas l’évaluation par les pairs

L’argument le plus solide en faveur de QED n’est pas qu’il remplace l’évaluation par les pairs, mais qu’il examine les articles plus directement que ne le fait le rang d’une revue.

QED Score évalue deux dimensions déclarées. L’originalité mesure dans quelle mesure une découverte fait progresser les connaissances existantes, tandis que la validité mesure si les preuves soutiennent les conclusions du manuscrit.

L’entreprise affirme que son architecture multi-agents décompose d’abord chaque article en une méta-affirmation, des affirmations principales, des affirmations connexes et des expériences à l’appui.

Des agents d’IA spécialisés examinent ensuite différentes caractéristiques en parallèle. Ils recherchent des incohérences dans les figures, des faiblesses statistiques, des conflits avec la littérature existante, des hypothèses alternatives et des problèmes liés aux normes de présentation.

Une couche de vérification réexamine les problèmes signalés. Une couche de notation évalue les affirmations individuelles, et un agrégateur combine ces évaluations en un percentile calibré.

Un score de 80 signifie que le manuscrit se classe au-dessus de 80 % du corpus de référence. Cela ne signifie pas que l’article a 80 % de chances d’être correct.

Cette distinction se perd facilement lorsqu’un jugement complexe devient un chiffre familier. Les percentiles décrivent une position relative, non une vérité absolue.

QED a testé sa métrique dans trois études. La première a utilisé 925 articles publiés par 185 auteurs, que des experts du domaine avaient classés dans les catégories Limited, Satisfactory ou Strong.

Le pipeline de notation n’a pas reçu ces étiquettes. QED rapporte une aire sous la courbe de 0,867 pour distinguer les articles Limited des autres catégories.

L’aire sous la courbe, ou AUC, mesure la capacité d’un système à distinguer deux classes. Une valeur de 0,5 représente le hasard, tandis que 1,0 représente une séparation parfaite.

Pour 795 articles disposant à la fois de QED Scores et de données de rang de revue, QED a rapporté de meilleurs résultats dans deux comparaisons. Le système a obtenu 0,863 contre 0,804 pour l’identification des articles Limited.

Pour les articles Strong, les résultats étaient beaucoup plus proches. QED a rapporté 0,782, contre 0,774 pour la mesure de rang de revue.

La deuxième étude a noté 4 953 préprints bioRxiv datant d’avril 2025. QED a ensuite suivi les revues dans lesquelles ces articles ont finalement été publiés.

Les chercheurs ont associé 2 879 préprints à des versions publiées disposant d’un rang de revue correspondant. QED a rapporté une corrélation de Spearman de 0,63 entre ses scores de préprints et le rang final de la revue.

La corrélation variait selon 21 disciplines. Elle atteignait 0,78 en génétique, mais tombait à 0,39 en biologie des systèmes.

Ces différences méritent l’attention. Un seul percentile interdisciplinaire peut masquer des variations significatives dans les performances du modèle, les conventions en matière de preuves et les comportements de publication.

La troisième étude s’est concentrée sur les désaccords. QED a créé 100 paires d’articles dans lesquelles son score favorisait l’article publié dans la revue la moins bien classée.

Quinze experts du domaine ont examiné les paires sans voir les QED Scores ni les lieux de publication. Ils ont produit 70 jugements assurés, dont 60 choix décisifs après exclusion des égalités.

Les experts ont sélectionné l’article favorisé par QED dans 75 % de ces cas décisifs. L’intervalle de confiance rapporté à 95 % allait de 63 % à 84 %.

Ce résultat soutient l’argument de QED selon lequel le prestige d’un lieu de publication peut représenter de manière inexacte la qualité d’un article. Il n’établit pas que QED puisse identifier la vérité sans jugement humain.

Le lieu de publication est aussi une référence maladroite. Le placement dans une revue dépend de la nouveauté, du périmètre éditorial, du calendrier, de la présentation, de la disponibilité des évaluateurs et de choix stratégiques de soumission.

Un score corrélé au rang d’une revue peut valider son alignement sur les résultats de publication existants. Il ne peut pas, à lui seul, valider l’affirmation selon laquelle le système échappe aux biais du système de publication.

QED reconnaît une limite importante. Sa méthodologie précise que The 1% ne remplace pas l’évaluation par les pairs.

C’est un cadrage raisonnable. QED peut prioriser les manuscrits à examiner, mais un percentile élevé ne devrait pas autoriser des décisions cliniques ni trancher des débats scientifiques.

Le principal enjeu est donc l’évaluation directe face à l’inférence fondée sur le prestige. QED demande si les lecteurs devraient examiner les affirmations et les preuves plutôt que d’emprunter la réputation d’une revue.

Cette remise en question est utile même si le score de QED reste imparfait. L’image de marque des revues a toujours condensé de nombreux jugements en un raccourci que les lecteurs peuvent mal utiliser.

Un score d’IA soigneusement validé pourrait devenir un signal supplémentaire. Il ne devrait pas devenir le seul signal, ni une nouvelle étiquette de prestige offrant moins de responsabilité publique.

Ce que l’affirmation du top 1 % ne prouve pas

Les résultats internes de QED justifient des tests sérieux, mais ils ne justifient pas encore une confiance inconditionnelle.

La principale limite est l’indépendance. QED Science a développé le système, conçu la validation, publié la méthodologie et communiqué les principaux chiffres de performance.

Les études menées par une entreprise peuvent apporter des éléments précieux. Une réplication indépendante devient essentielle lorsqu’un produit tire sa valeur commerciale des mêmes affirmations de performance.

Une évaluation externe a relevé des faiblesses dans les trois études de validation. Cette critique a été produite par un autre service d’évaluation de la recherche fondé sur l’IA ; elle ne constitue donc pas une réplication humaine définitive.

Ses questions restent néanmoins concrètes. Le rapport d’évaluation soutient que les études de QED reposent sur des signaux de référence liés plutôt que sur une confirmation pleinement indépendante.

La première étude dépend de catégories de qualité attribuées par des experts. La deuxième utilise le classement des revues comme résultat. La troisième sélectionne des cas où QED et le classement des revues divergent fortement.

Cette structure peut démontrer une cohérence dans le cadre des tests choisis par QED. Elle ne permet pas de savoir comment le système se comporte dans des décisions prospectives définies par des chercheurs externes.

La deuxième étude n’a également associé que 2 879 des 4 953 prépublications à leurs versions publiées disposant de données de classement de revue. Cela laisse 2 074 manuscrits en dehors de l’analyse de corrélation publiée.

Certains articles non appariés pourraient être publiés plus tard, paraître dans des revues ne disposant pas de la métrique requise ou ne jamais faire l’objet d’une publication formelle. Leur exclusion peut modifier la relation apparente.

Les effets de sélection importent, car la publication n’est pas aléatoire. Des travaux solides peuvent rester non publiés, tandis que des travaux faibles peuvent survivre à l’évaluation.

La troisième étude fournit des données convaincantes sur les désaccords, mais elle s’appuie sur un échantillon volontairement inhabituel. Les chercheurs ont sélectionné des paires parce que QED et le classement des revues pointaient dans des directions opposées.

Cette conception teste un conflit pertinent. Elle n’estime pas à quelle fréquence QED fait le meilleur choix parmi des articles ordinaires.

Le résultat de préférence de 75 % repose également sur 60 jugements décisifs. C’est informatif, mais limité comparé aux 57 455 manuscrits présentés dans The 1%.

La liste sélectionnée soulève un autre problème. « Top 1 % » semble objectif, mais reste relatif au corpus de QED, à la gestion des catégories, à la version du score et aux dimensions d’évaluation retenues.

L’originalité et la validité sont des critères précieux. Elles ne couvrent pas toutes les qualités qui importent aux scientifiques.

Un article techniquement valide peut être étroit ou peu important. Un article original peut reposer sur des mesures fragiles. Une réplication peut offrir une originalité limitée tout en apportant une immense valeur scientifique.

L’éthique, la disponibilité des données, la transparence méthodologique, la reproductibilité, l’importance pratique et les conflits d’intérêts peuvent également influencer la manière dont les lecteurs devraient utiliser un résultat.

Les agents de QED examinent plusieurs facteurs connexes, mais les observateurs externes ont besoin de davantage de visibilité sur leur pondération. Ils ont également besoin d’analyses d’erreurs, d’un étalonnage par domaine et d’exemples de faux positifs.

L’opacité du modèle soulève des questions opérationnelles. QED affirme que son architecture combine plusieurs grands modèles de langage avec des modèles propriétaires.

Sa méthodologie publique n’identifie pas chaque modèle sous-jacent, prompt, poids de composant ou calendrier de mise à jour. Ces détails peuvent influer sur la reproductibilité.

Si un fournisseur de modèles modifie un système, le même manuscrit pourrait recevoir un résultat différent. QED aurait besoin d’une notation versionnée et de registres d’audit stables pour soutenir des usages ayant des conséquences importantes.

La recherche a déjà montré que les évaluateurs fondés sur les LLM peuvent reproduire des biais sociaux. Une vaste expérience en économie a généré 27 090 évaluations sur 9 030 articles.

Cette expérience d’évaluation par les pairs a conclu que les modèles distinguaient la qualité, mais favorisaient les institutions prestigieuses, les auteurs masculins et les économistes renommés.

Les données en aveugle de QED devraient réduire plusieurs de ces effets. Elles ne permettent pas de savoir si son modèle a appris d’autres préférences en faveur de méthodes familières, de sujets populaires ou de structures argumentatives conventionnelles.

Le système pourrait aussi récompenser les manuscrits plus faciles à analyser pour les modèles. Une structure claire des affirmations est positive, mais la lisibilité ne doit pas devenir un substitut invisible à la force des preuves.

Les comportements adversariaux constituent une autre préoccupation. Une fois que les auteurs comprennent ce qu’un système de notation récompense, certains optimiseront leurs manuscrits pour la métrique.

Ce schéma apparaît partout où les classements distribuent l’attention. Les moteurs de recherche, les indicateurs universitaires, les mesures de citation et les facteurs d’impact des revues ont tous encouragé des comportements stratégiques.

Un score public doit donc résister à la manipulation. Il doit aussi faire l’objet d’une surveillance des prompts cachés, des citations fabriquées, des preuves dupliquées et des tactiques stylistiques conçues pour influencer un évaluateur.

Les chercheurs devraient considérer QED comme une aide à la découverte jusqu’à ce que ces questions reçoivent des réponses indépendantes. Un score élevé peut justifier de lire un article plus tôt, pas d’y croire plus tôt.

L’inverse est tout aussi important. Un score faible ne devrait pas enterrer discrètement une recherche non conventionnelle sans voie de recours ni explication claire.

Pour les travailleurs du savoir qui suivent les affirmations scientifiques, préserver le contexte des sources importe davantage que de collecter des classements. Une base de connaissances consultable peut conserver ensemble les articles, les critiques, les mises à jour et les preuves contradictoires.

Ce flux de travail maintient le score dans son rôle approprié. Il devient un filtre attaché à une source, et non un verdict détaché du travail sous-jacent.

Trois signaux détermineront si les chercheurs devraient lui faire confiance

La confiance dépendra d’une validation indépendante, de performances stables entre les disciplines et d’éléments montrant que les scientifiques utilisent le score sans renoncer à leur jugement.

Le premier signal est une étude prospective, préenregistrée et menée par des chercheurs extérieurs à QED Science. Des équipes indépendantes devraient définir les critères d’évaluation avant de voir les résultats.

Elles devraient tester des manuscrits récents que ni les modèles ni les évaluateurs n’ont rencontrés. L’étude devrait inclure des articles publiés, des articles non publiés, des réplications, des résultats négatifs et des soumissions intentionnellement défectueuses.

Des experts externes devraient évaluer les affirmations et les preuves sans recevoir les étiquettes de QED. Les chercheurs pourraient ensuite comparer QED aux panels humains, aux décisions des revues, aux résultats de réplication et aux corrections ultérieures.

Aucun benchmark unique ne fournit une vérité de terrain parfaite. Une concordance entre des mesures véritablement indépendantes renforcerait davantage l’affirmation de QED qu’une nouvelle comparaison menée par l’entreprise.

Un échec dans ces conditions affaiblirait l’affirmation selon laquelle QED offre une mesure généralement fiable de la qualité scientifique. Il pourrait néanmoins rester utile pour des tâches de triage plus limitées.

Le deuxième signal est une performance transparente au niveau des disciplines au fil du temps. QED rapporte déjà des corrélations allant de 0,39 à 0,78 selon les disciplines.

Les prochaines versions devraient divulguer, pour chaque domaine, les schémas de faux positifs, les schémas de faux négatifs, la dérive d’étalonnage et les modifications de notation. La précision globale peut masquer de faibles performances dans des domaines spécialisés.

Le versionnage est particulièrement important. Chaque score devrait indiquer la version du système, le corpus de référence, la date d’évaluation et l’incertitude entourant le classement.

Les chercheurs ont également besoin d’explications reliant les scores à des affirmations et expériences précises. Un percentile sans raisonnement traçable ne peut pas soutenir une correction significative.

Si QED publie des résultats stables et reproductibles au niveau des disciplines, son argument deviendra plus solide. Si les scores évoluent silencieusement après des changements de modèle, les chercheurs devraient limiter l’outil à la découverte informelle.

Le troisième signal est la manière dont les institutions utilisent le classement. Les recommandations de lecture présentent des enjeux plus faibles que les filtres de financement, de recrutement ou les décisions sur les preuves cliniques.

Un outil qui aide les scientifiques à découvrir des articles négligés peut réduire le biais de prestige. Le même outil peut créer un prestige algorithmique si les institutions traitent le score comme un seuil.

Observez si les bailleurs de fonds et les revues utilisent QED parallèlement à l’évaluation par des experts ou avant celle-ci. Observez également si les auteurs peuvent contester les erreurs et obtenir une nouvelle notation après des révisions.

L’adoption la plus saine préserverait la responsabilité humaine. Les chercheurs utiliseraient QED pour identifier des articles, examiner son raisonnement, puis évaluer les preuves sous-jacentes.

L’adoption la plus risquée cacherait les décisions derrière un percentile. Une institution pourrait rejeter automatiquement des travaux tout en affirmant que le processus était neutre parce que les noms avaient été retirés.

La question de Nature appelle une réponse conditionnelle. Les chercheurs devraient suffisamment faire confiance à QED pour tester ses recommandations, mais pas assez pour lui déléguer leur jugement scientifique.

QED a présenté une réponse crédible à un véritable goulet d’étranglement. Son échelle, sa notation en aveugle et son analyse au niveau des affirmations méritent un examen indépendant attentif.

Le débat Horizon Nature a désormais besoin d’éléments provenant de l’extérieur de l’entreprise. Au cours des prochains mois, recherchez des réplications préenregistrées, des rapports d’erreurs spécifiques à chaque domaine et des utilisations institutionnelles divulguées.

Un score QED changerait-il la prépublication que vous lisez en premier ? Probablement. Changerait-il ce que vous croyez sans vérifier les méthodes et les preuves ? Il ne le devrait pas.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page