L’évaluation par les pairs de Sakana AI détecte 73 % des erreurs centrales, mais les articles réels en révèlent les limites
Sakana AI affirme que son système d’évaluation par les pairs a détecté 73,43 % des erreurs introduites affectant l’affirmation centrale d’un article. Pourtant, ce résultat phare provient de quatre évaluations de contradictions synthétiques, et non d’évaluations courantes de recherches non modifiées.
Le système, appelé Multi-Layered Review, a largement surpassé trois références d’évaluation automatisée sur le nouveau benchmark de Sakana AI. Toutefois, son taux de détection exacte est tombé à 16,11 % lorsqu’il a été testé sur des problèmes documentés dans des articles arXiv retirés.
Cet écart constitue l’essentiel de l’histoire. L’évaluation par les pairs de Sakana AI montre qu’une lecture attentive, en plusieurs passes, peut améliorer la critique automatisée. Elle ne démontre pas qu’un LLM puisse valider de manière fiable des travaux scientifiques.
Cette recherche pousse plutôt les développeurs à revoir leur manière d’évaluer les évaluateurs IA. Faire correspondre des scores humains ou produire des retours convaincants ne suffit pas. Un évaluateur utile doit relier les affirmations, les méthodes, les expériences et les preuves suffisamment bien pour repérer leurs contradictions.
Le résultat de Sakana AI s’inscrit aussi dans un historique complexe. L’entreprise avait auparavant utilisé l’IA pour générer des articles scientifiques, suscitant des interrogations sur ce que le fait de réussir l’évaluation par les pairs démontrait réellement. Son dernier projet inverse cette préoccupation en demandant si l’IA peut aider les humains à détecter des recherches fragiles.
L’évaluation par les pairs de Sakana AI modifie le test
Le changement le plus important n’est pas le résultat de 73,43 %. C’est la décision d’évaluer les systèmes d’IA selon leur capacité à détecter les erreurs.
Une grande partie des travaux antérieurs sur l’évaluation automatisée par les pairs mesurait la similarité. Les chercheurs comparaient une évaluation générée par l’IA avec des retours humains, vérifiaient la corrélation de leurs notes ou mesuraient le chevauchement de leurs commentaires.
Ces tests mesurent si un système se comporte comme un évaluateur. Ils ne montrent pas directement s’il a repéré l’erreur centrale d’un article.
L’article sur l’évaluation par les pairs de Sakana AI propose une alternative axée sur la vérification. Ses auteurs soutiennent que la détection d’erreurs est l’une des fonctions les plus importantes et les plus gourmandes en ressources de l’évaluation par les pairs.
L’équipe a créé un Contradiction Benchmark contenant 1 164 variantes d’articles modifiés. Ces variantes provenaient de 257 articles publiés à ACL, AISTATS, CVPR et ICML en 2025, ainsi qu’à NeurIPS en 2024.
Les chercheurs ont limité la collecte aux articles sous licences Creative Commons permissives. Cette restriction leur a permis de modifier et de redistribuer les manuscrits.
Pour chaque article, Gemini 2.5 Pro a généré un graphe de connaissances. Un graphe de connaissances représente les affirmations, les méthodes, les preuves et leurs relations sous forme de nœuds connectés.
Les chercheurs ont ensuite mesuré la distance entre chaque nœud et une affirmation principale. Une distance de zéro signifiait que le nœud représentait une affirmation centrale. Des distances plus élevées correspondaient à des détails de plus en plus périphériques.
GPT-4.1 a réécrit des passages sélectionnés afin de contredire les nœuds correspondants. Le texte modifié a été inséré dans la source originale, puis recompilé en un PDF complet.
Cette procédure donnait aux chercheurs une erreur connue et un emplacement connu. Elle leur permettait également de classer la menace que chaque erreur faisait peser sur la conclusion principale de l’article.
Un modèle o3 a déterminé si les évaluations générées avaient détecté chaque contradiction. Le processus de jugement a été exécuté dix fois par exemple, et les chercheurs en ont calculé la moyenne.
Selon l’étude, sur les articles non modifiés, le juge a atteint une précision de 99,9 %. Une analyse manuelle a relevé une sensibilité de 86,8 % pour les détections confirmées, ce qui suggère que la notation automatisée a parfois manqué des détections légitimes.
Cette configuration offre un test plus clair que de demander si un modèle ressemble à un évaluateur. Un système signale ou non la contradiction introduite.
Toutefois, le benchmark mesure une composante soigneusement définie de l’évaluation. Il ne couvre pas toutes les formes d’échec scientifique, notamment la fabrication de données, des hypothèses statistiques inappropriées, des erreurs cachées de prétraitement ou des expériences irréproductibles.
Cette distinction est importante, car le chiffre phare concerne spécifiquement les contradictions portant sur des affirmations centrales. Il ne doit pas être interprété comme un taux de précision général de 73 % pour l’évaluation scientifique.
Pourquoi le système MLR de Sakana AI détecte davantage d’erreurs
Multi-Layered Review améliore la détection d’erreurs en obligeant le modèle à comprendre un article avant de le juger.
Le système MLR complet de Sakana AI comporte trois rôles : un Appendix Agent, un Literature Review Agent et un Review Agent. Ces composants traitent différentes parties du manuscrit avant de produire une évaluation consolidée.
L’Appendix Agent utilise Claude Haiku 3.5 pour résumer les détails de mise en œuvre et d’expérimentation situés hors du texte principal. Cette étape aide à éviter que le système ne critique des omissions déjà traitées dans l’annexe.
Le Literature Review Agent facultatif utilise Claude Sonnet 4 et la recherche web. Sa tâche consiste à situer le manuscrit dans les travaux existants et à vérifier si ses affirmations de nouveauté semblent justifiées.
Le Review Agent central utilise également Claude Sonnet 4. Il reçoit jusqu’à dix pages du texte principal au format PDF, préservant les équations, les graphiques et les informations de mise en page que l’extraction de texte brut pourrait endommager.
Son flux de travail s’inspire de la méthode des trois passes établie pour lire les articles de recherche. La première passe crée une vue d’ensemble des idées principales du manuscrit.
La deuxième passe lit plus attentivement et relie ces idées aux preuves qui les étayent. Elle consigne également les hypothèses, les lacunes et les faiblesses.
La troisième passe combine ces notes avec les conclusions pertinentes de l’annexe et de la revue de littérature. Elle produit ensuite les points forts, les faiblesses, les questions, une recommandation, une note et une liste d’actions.
Cette séquence répond à une défaillance courante des outils d’évaluation par LLM. Une seule grande requête peut demander à un modèle de résumer, vérifier, comparer, critiquer, noter et mettre en forme un article simultanément.
Le modèle peut produire une évaluation soignée sans construire une représentation stable de la recherche. Il peut répéter les affirmations du résumé tout en négligeant des preuves contraires dans les résultats.
MLR sépare la compréhension de l’évaluation. Cette conception fournit au modèle des notes intermédiaires capables de relier une conclusion à la méthode ou à l’expérience qui l’étaye.
Les résultats du benchmark suggèrent que le choix du modèle comme la conception du flux de travail ont contribué à l’amélioration. Remplacer GPT-4.1 par Claude Sonnet 4 dans la référence plus simple LLM-Review a fait passer la détection des erreurs centrales de 14,56 % à 35,40 %.
Une seule évaluation MLR a ensuite atteint 60,79 % sur la même classe de contradictions centrales. Un ensemble de quatre évaluations MLR a porté la détection à 73,43 %.
Le meilleur résultat concurrent pour les erreurs d’affirmations centrales était de 14,81 %, obtenu par AgentReview. AI Reviewer a atteint 11,17 %, tandis que la configuration LLM-Review originale a atteint 14,56 %.
Pour les contradictions de tous les niveaux de gravité mesurés, quatre évaluations MLR en ont détecté 40,95 %. Les systèmes concurrents sont restés entre 5,95 % et 6,50 %.
Ces comparaisons rendent le mécanisme plus intéressant que le score absolu. Changer le modèle sous-jacent a produit un gain important, tandis que la conception d’évaluation en plusieurs passes en a produit un autre.
Les acheteurs ne peuvent donc pas considérer « multi-agent » comme une explication suffisante des performances. AgentReview utilise déjà des rôles d’évaluateur, d’auteur et de président de domaine, mais son résultat au benchmark est resté bien inférieur.
La question importante est ce que font les agents. Répartir une tâche entre plusieurs personas diffère de la division d’un manuscrit en composants porteurs de preuves et de la construction d’une compréhension à travers des passes répétées.
MLR remet également en cause l’hypothèse selon laquelle davantage de tokens améliorent automatiquement la qualité de l’évaluation. Il a utilisé 189 062 tokens d’entrée par évaluation complète dans l’étude, soit moins de la moitié des 403 654 d’AI Reviewer.
Le LLM-Review plus simple n’a utilisé que 6 517 tokens d’entrée, en partie parce qu’il tronquait les contenus longs. Cette approche consommait moins de ressources, mais perdait des informations susceptibles de révéler des contradictions.
Le compromis utile n’oppose donc pas simplement le petit au grand. Il dépend de la capacité du système à consacrer son contexte à la construction d’un modèle évaluable de l’article.
L’affirmation des 73 % se réduit hors du benchmark
L’argument le plus solide contre le traitement de MLR comme arbitre autonome provient de la propre évaluation des erreurs réelles de Sakana AI.
Les chercheurs ont testé le Review Agent avec WithdrarXiv-Check, un jeu de données fondé sur des articles arXiv retirés et leurs commentaires de retrait associés. Son jeu de test contient 211 articles.
Cette évaluation est plus difficile que la détection de contradictions introduites. Les erreurs de recherche réelles peuvent être réparties entre hypothèses, dérivations, citations et expériences sans produire de conflit évident au niveau d’une phrase.
Les auteurs ont désactivé le composant de recherche documentaire pour ce test. Sans cela, le système aurait pu trouver des avis de retrait publics au lieu de découvrir les problèmes à partir des manuscrits.
MLR a identifié une correspondance exacte avec le problème de retrait documenté dans 16,11 % des cas. Selon une norme plus souple, qui acceptait une préoccupation substantiellement similaire, il a atteint 26,07 %.
La référence la plus performante a atteint 9 % pour les correspondances exactes et 18,48 % pour les correspondances similaires. MLR est resté en tête de la comparaison, mais l’écart était bien plus faible que sur le benchmark synthétique.
Le jeu de données d’articles retirés comprend également principalement des recherches théoriques en mathématiques et en physique. Les systèmes d’évaluation ont été conçus autour d’articles de conférences en apprentissage automatique, ce qui limite la comparaison directe.
Même avec ce décalage de domaine, l’écart de performances révèle une limite centrale. Les contradictions introduites offrent à l’évaluateur un désaccord clair à trouver. Les défauts réels exigent souvent de reconstituer une preuve, de réexécuter du code, de vérifier des données ou de posséder des connaissances spécialisées du domaine.
Les auteurs du benchmark reconnaissent un autre problème. Des évaluateurs humains ont examiné 50 contradictions synthétiques et constaté que 34 % d’entre elles manquaient de cohérence avec les phrases adjacentes.
Seuls 8 % semblaient manifestement générés par l’IA, mais un contexte perturbé peut tout de même fournir un indice de détection. Un évaluateur automatisé peut remarquer qu’un passage ne s’intègre pas sans comprendre pourquoi la science sous-jacente est erronée.
Les auteurs soutiennent que cela rend le benchmark plus facile, non invalide. Les systèmes de référence ont tout de même peiné, même lorsque certaines erreurs insérées contenaient des irrégularités détectables.
Cette interprétation est raisonnable, mais elle modifie la signification de 73,43 %. Ce chiffre est un score élevé dans une tâche contrôlée de détection de contradictions, et non une estimation de la fréquence à laquelle MLR détecte des erreurs graves dans des articles soumis.
Le cadre à quatre évaluations mérite également attention. L’ensemble considère une erreur comme détectée lorsqu’une des quatre évaluations indépendantes la mentionne.
Cela est utile pour le contrôle préalable côté auteur, où recueillir plusieurs signaux d’alerte peut améliorer la couverture. C’est moins directement comparable à l’attribution d’une évaluation automatisée pour remplacer un évaluateur humain.
Le résultat de 60,79 % pour les erreurs centrales avec une seule évaluation MLR reste substantiel. Néanmoins, près de quatre contradictions centrales introduites sur dix n’ont pas été détectées dans la configuration à évaluation unique.
Les performances ont également diminué à mesure que les contradictions s’éloignaient de l’affirmation principale d’un article. Cette tendance confirme la mesure de gravité du graphe de connaissances, mais montre que les erreurs secondaires détaillées restent difficiles.
Pour les équipes de recherche, le cas d’usage pratique est donc l’audit avant soumission. Un système automatisé peut signaler de possibles incohérences et orienter l’attention humaine vers les affirmations vulnérables.
Il n’est pas prêt à certifier la validité. Un article ne recevant aucun avertissement ne peut pas être supposé correct, et un avertissement ne peut pas être supposé justifié.
L’accord humain est utile, mais ne constitue pas une vérification scientifique
MLR produit des jugements qui ressemblent aux notes des évaluateurs humains, mais l’accord avec les évaluateurs reste distinct de la découverte de la vérité.
Sur les soumissions à ICLR 2025, les notes de MLR affichaient une corrélation de Pearson de 0,586 avec les notes humaines. La référence entre évaluateurs humains était de 0,742.
Sur les articles de NeurIPS 2024, MLR a atteint 0,451, contre une référence humaine de 0,781. À ICML 2025, MLR a atteint 0,429, juste derrière AI Reviewer à 0,439.
Ces chiffres montrent un alignement significatif, notamment par rapport aux systèmes dont les notes distinguaient à peine les articles acceptés des articles rejetés. Ils ne démontrent pas que les décisions humaines ou automatisées sont factuellement correctes.
L’évaluation par les pairs comporte des questions subjectives concernant l’importance, la clarté et la nouveauté. Deux évaluateurs rigoureux peuvent convenir qu’un article mérite d’être accepté tout en passant à côté de la même faiblesse technique.
L’analyse de Sakana AI a également relevé des différences dans les aspects mis en avant par les humains et les systèmes automatisés. MLR se concentrait davantage sur la validité et les expériences, tandis que les évaluateurs humains accordaient plus d’attention à la clarté et à la nouveauté.
Cette divergence peut être utile. Un assistant d’évaluation apporte davantage de valeur lorsqu’il fait émerger des préoccupations négligées que lorsqu’il se contente de prédire les commentaires qu’un humain écrira.
Cependant, cette complémentarité crée son propre problème d’étalonnage. Le système doit distinguer une véritable faiblesse méthodologique d’une critique plausible mais non étayée par le manuscrit.
L’évaluation auprès des utilisateurs de l’étude illustre ce défi. Des chercheurs actifs ont réalisé 38 sessions d’évaluation avec le flux de travail MLR complet.
Parmi les 378 commentaires ayant reçu un retour direct d’accord, les utilisateurs en ont accepté 81 %. Les recommandations ont recueilli 94 % d’accord, et les points forts 92 %.
Les questions ont obtenu 79 %, tandis que les éléments de la liste d’actions ont atteint 78 %. Les faiblesses présentaient le taux d’accord le plus bas, à 68 %.
Les auteurs ne sont pas des juges neutres de la critique ; le désaccord ne signifie donc pas nécessairement que le système avait tort. Néanmoins, les faiblesses sont précisément le domaine où de fausses accusations peuvent causer les dommages les plus importants.
Un évaluateur qui allègue à tort une erreur mathématique ou une expérience manquante peut fausser une décision éditoriale. Un langage fluide peut faire paraître cette allégation plus certaine que ne le justifient les éléments disponibles.
Les évaluateurs humains peuvent commettre la même erreur. La différence est que l’automatisation peut reproduire une interprétation erronée sur des milliers de soumissions.
C’est pourquoi le système d’évaluation par les pairs de Sakana AI convient mieux comme second lecteur que comme décideur. Il peut élargir l’ensemble des problèmes qu’un humain examine sans recevoir l’autorité finale sur l’acceptation.
Les notes structurées du système peuvent aussi aider les auteurs à gérer des éléments probants complexes. Les équipes utilisant déjà une base de connaissances interrogeable peuvent appliquer un principe similaire en reliant les affirmations aux expériences, aux citations et aux questions non résolues.
Cela n’automatise pas la vérification. Cela facilite l’examen de la piste des éléments probants par les humains.
L’injection de prompt révèle le risque de l’automatisation
Un évaluateur qui comprend un article peut néanmoins être manipulé par du texte placé à l’intérieur de cet article.
Sakana AI a testé une injection de prompt explicite en ajoutant des instructions cachées après la conclusion de 50 manuscrits rejetés, pour la plupart soumis à l’origine à ICLR 2025.
Une injection de prompt se produit lorsqu’un contenu présent dans un document tente de supplanter les instructions qui régissent le modèle chargé de le lire. Un passage malveillant peut demander à un évaluateur automatisé d’ignorer les faiblesses ou d’attribuer une note élevée.
Les quatre systèmes d’évaluation ont été fortement influencés par le texte injecté. MLR a affiché la plus faible variation moyenne des notes selon certaines mesures, mais ses résultats présentaient une forte variance.
Il n’a explicitement détecté la manipulation que dans 8 des 50 articles. Dans les autres cas, le contenu injecté a influencé l’évaluation sans être identifié de manière fiable comme hostile.
Les chercheurs suggèrent que MLR bénéficiait d’une certaine protection grâce à son flux de travail axé d’abord sur la compréhension et à son entrée multimodale. Claude voyait à la fois le texte du document et ses pages rendues, tandis que l’instruction injectée était absente de l’image visible.
Cette incohérence donnait au système un signal possible indiquant que le texte caché n’appartenait pas à l’article. Elle ne suffisait pas à empêcher systématiquement la manipulation.
Cette faiblesse compte, car l’évaluation par les pairs implique des documents non fiables. Les auteurs contrôlent le PDF, les fichiers sources, le matériel supplémentaire, les citations et parfois les dépôts liés.
Tout évaluateur automatisé disposant d’outils de navigation ou d’exécution de code fait face à une surface d’attaque plus vaste. Une page liée peut contenir des instructions, un dépôt peut inclure des commentaires adverses et des données supplémentaires peuvent cacher des métadonnées trompeuses.
Les politiques des conférences reconnaissent déjà que l’utilisation des LLM exige une divulgation et une gestion rigoureuse. Le guide des évaluateurs ICLR place la responsabilité humaine au-dessus de l’assistance automatisée.
Un déploiement sûr devrait isoler le contenu des documents des instructions système. Il devrait également restreindre les outils, enregistrer les actions du modèle, signaler le texte caché et exiger une confirmation humaine pour les affirmations importantes.
Même ces contrôles ne résoudraient pas toutes les formes de manipulation. Un passage peut influencer un modèle sans contenir d’instruction évidente.
Les auteurs peuvent présenter les comparaisons de manière sélective, dissimuler des expériences échouées ou employer un langage assuré pour orienter l’attention. Ces techniques influencent aussi les évaluateurs humains, mais les systèmes automatisés peuvent développer des angles morts prévisibles.
Les travaux antérieurs de Sakana AI apportent une mise en garde pertinente. En 2025, l’entreprise a retiré un article d’atelier généré par IA après son acceptation et a décrit des erreurs de citation dans la recherche générée.
Des chercheurs externes se sont demandé si cet épisode démontrait une capacité scientifique autonome ou une sélection humaine efficace de productions d’IA. Une analyse ultérieure de l’évaluation par les pairs a souligné la différence entre réussir une évaluation et contribuer à des connaissances fiables.
MLR répond à une partie de ce problème en testant les évaluateurs sur des erreurs connues. Pourtant, ses résultats face aux injections montrent qu’un évaluateur construit sur la même classe de modèles reste vulnérable à des entrées rédigées stratégiquement.
Les auteurs automatisés et les évaluateurs automatisés pourraient à terme s’optimiser les uns contre les autres. Les auteurs pourraient apprendre quel langage évite les critiques, tandis que les évaluateurs pourraient récompenser les schémas ressemblant à des travaux acceptés.
Sans contrôles indépendants, cette boucle pourrait améliorer les notes sans améliorer la science.
Ce qu’il faut surveiller après le benchmark d’évaluation par les pairs par LLM
Trois signaux détermineront si le résultat de Sakana AI devient un outil de recherche utile ou reste une expérience contrôlée impressionnante.
Le premier signal est la réplication indépendante. Sakana AI indique que les données et le code sont disponibles sur demande, plutôt que par l’intermédiaire d’un dépôt public immédiatement accessible.
Des équipes externes doivent reproduire le benchmark avec les mêmes articles, prompts, versions de modèles et procédure de jugement. Elles devraient également tester différents modèles juges et auditer manuellement les détections contestées.
La réplication devrait mesurer les faux positifs en plus du rappel. Détecter davantage d’erreurs a une valeur limitée si le système produit aussi de nombreuses critiques plausibles mais incorrectes.
Le deuxième signal est la performance face aux défauts naturels. Les futurs benchmarks devraient inclure des erreurs statistiques vérifiées, des affirmations causales non étayées, des défaillances de citation, des résultats irréproductibles et des preuves défectueuses.
Certaines tâches exigeront l’accès au code et aux données, plutôt qu’au seul PDF. Un auditeur de recherche sérieux pourrait devoir exécuter des expériences, examiner le prétraitement et comparer les valeurs rapportées aux sorties générées.
Le résultat de correspondance exacte de 16,11 % constitue un point de départ. Si de futurs systèmes augmentent ce taux sur des articles diversifiés, sélectionnés de manière indépendante, les arguments en faveur d’une assistance pratique se renforceront.
Le troisième signal est de savoir si les conférences déploient ces systèmes avec des garanties applicables. Parmi les indicateurs pertinents figurent les règles de divulgation, les contrôles de confidentialité, les défenses contre l’injection de prompt et une supervision humaine documentée.
Un essai limité qui fournirait aux évaluateurs des avertissements privés et facultatifs testerait l’augmentation sans déléguer les décisions. Un système qui noterait automatiquement les soumissions comporterait un risque bien plus élevé.
Les chercheurs devraient également surveiller l’incidence des changements de modèles sur le système MLR de Sakana AI. L’étude d’ablation a montré que le changement du modèle sous-jacent expliquait une grande part du gain.
Cela crée une pression de maintenance. Un flux de travail validé avec une version de modèle peut se comporter différemment après qu’un fournisseur met à jour son modèle ou retire un endpoint.
Cela soulève aussi des questions de reproductibilité. Les benchmarks scientifiques deviennent plus difficiles à interpréter lorsque des modèles commerciaux changent sans conserver des points de contrôle publics identiques.
La contribution plus profonde de Beyond Imitation est donc méthodologique. Son benchmark d’évaluation par les pairs par LLM pose une meilleure question que celle de savoir si les commentaires générés ressemblent aux commentaires humains.
Un évaluateur IA peut-il détecter un problème concret qui menace le raisonnement de l’article ?
La réponse de Sakana AI est encourageante dans des conditions contrôlées et préoccupante sur des travaux réels retirés. La compréhension en plusieurs passes surpasse clairement l’imitation superficielle dans les tests rapportés.
L’écart restant est trop important pour confier une autorité aux systèmes automatisés. Les vrais articles contiennent des erreurs qui ne se signalent pas comme des contradictions, et des articles malveillants peuvent manipuler directement l’évaluateur.
Les développeurs devraient considérer le chiffre de 73,43 % comme un résultat de benchmark aux limites définies. Les éditeurs devraient exiger une validation indépendante avant d’intégrer des notes automatisées dans les décisions de publication.
Les chercheurs peuvent néanmoins utiliser dès aujourd’hui l’idée centrale du système. Demandez à un assistant IA de relier chaque affirmation majeure à ses éléments probants, examinez les liens obtenus et enquêtez manuellement sur chaque saut non étayé.
Le prochain résultat décisif ne sera pas un nouveau record synthétique. Ce sera un système répliqué qui détecte des erreurs naturelles et subtiles sans submerger les évaluateurs de fausses alertes ni obéir à des instructions cachées dans le manuscrit.



