Les modèles d’Anthropic et de Google face au test du pelicanmaxxing, et la théorie des benchmarks s’effondre
Les modèles d’Anthropic et de Google viennent de subir un test de 1 008 images conçu pour détecter si les laboratoires d’IA optimisent secrètement leurs systèmes pour une invite célèbre. La comparaison entre Anthropic et Google n’a trouvé aucune preuve convaincante que Claude, Gemini ou cinq modèles concurrents aient bénéficié d’un entraînement spécial sur les pélicans. Mais le résultat soulève un problème plus important. Si l’optimisation ciblée ne peut être distinguée des progrès généraux de capacité, les benchmarks d’IA populaires restent difficiles à considérer comme fiables.
Le chercheur Dylan Castillo a testé sept modèles à l’aide de variations du défi informel de Simon Willison : « Generate an SVG of a pelican riding a bicycle. » L’expérience a croisé huit animaux et six véhicules, produisant 48 invites. Chaque modèle a répondu trois fois à chaque invite.
L’étude qui en résulte écarte l’explication la plus amusante des progrès observés dans les résultats. Les laboratoires d’IA ne remplissent probablement pas leurs cycles d’entraînement de pélicans à vélo. Elle montre toutefois aussi pourquoi l’évaluation d’Anthropic, Google, OpenAI et de leurs concurrents exige davantage que la répétition d’un test reconnaissable.
Une blague de benchmark est devenue une expérience contrôlée
Castillo a transformé une blague récurrente d’internet en un test structuré de l’optimisation propre à un benchmark.
Willison utilise depuis plusieurs années l’invite du pélican pour évaluer les principales sorties de modèles de langage. Un SVG, ou graphique vectoriel évolutif, décrit une image à l’aide de formes et de coordonnées textuelles. En produire un exige de programmer, de raisonner dans l’espace, de reconnaître des objets et de composer visuellement une image dans une seule réponse.
Cette combinaison a rendu l’invite étonnamment utile. Un modèle faible produit souvent un balisage invalide, des roues cassées, des membres mal placés ou un oiseau qui ne ressemble pas à un pélican. Un modèle plus performant peut renvoyer une image correctement rendue tout en préservant la relation demandée.
L’invite est aussi devenue particulièrement visible. Willison a accumulé plus de 100 publications sous son tag pelican benchmark. Ses résultats apparaissent fréquemment dans les discussions publiques autour des nouveaux modèles.
Cette visibilité crée un problème d’incitation. Une fois que les développeurs savent qu’une invite reconnaissable accompagnera chaque sortie, ils peuvent l’optimiser spécifiquement. Le benchmaxxing consiste à ajuster un système pour qu’il réussisse un benchmark public sans générer d’améliorations aussi étendues ailleurs.
Le pelicanmaxxing est la version comique de cette inquiétude. Un laboratoire pourrait placer des exemples de pélicans à vélo dans les données d’entraînement, ajouter des tâches similaires lors du post-entraînement ou récompenser les résultats qui reprennent des compositions familières. L’image obtenue paraîtrait impressionnante tout en révélant peu de choses sur les capacités générales.
Castillo a conçu une expérience susceptible de mettre ce schéma au jour. Son étude contrôlée incluait des pélicans, des flamants roses, des hérons, des loutres, des ratons laveurs, des antilopes, des baleines et des chats. Les véhicules comprenaient des vélos, des monocycles, des skateboards, des trottinettes, des avions et des bateaux.
Il a testé GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 et DeepSeek V4 Pro. L’étude a utilisé trois générations pour chaque combinaison modèle-invite, à une température de 1.0.
Ce calcul produit 1 008 images : 48 invites, multipliées par trois échantillons, multipliées par sept modèles. Seules 11 générations ont nécessité une nouvelle tentative, car la réponse initiale ne contenait pas de SVG exploitable.
Le pipeline d’évaluation comportait trois étapes. D’abord, il rendait chaque SVG sous forme d’image PNG. Ensuite, GPT-5.6 Luna évaluait de un à cinq la cohérence entre l’animal, le véhicule et l’action.
Troisièmement, Gemini 3.1 Flash-Lite extrayait les caractéristiques visibles. Elles comprenaient l’animal, le véhicule, la direction vers laquelle ils étaient tournés et les éléments récurrents de la scène. Castillo a ensuite utilisé Claude Fable 5 pour l’aider dans l’analyse statistique.
Cette configuration compte, car un unique pélican séduisant ne peut démontrer qu’un benchmark a été manipulé. L’expérience demande plutôt si chaque modèle réussit inhabituellement bien avec les pélicans, les vélos ou leur combinaison exacte.
Cette distinction transforme une anecdote en hypothèse testable. Si un entraînement ciblé avait eu lieu, l’invite célèbre devrait surpasser des invites étroitement liées une fois leurs niveaux de difficulté différents pris en compte.
Les résultats d’Anthropic et de Google ne montrent aucun avantage pour le pélican
Ni Claude ni Gemini n’ont affiché le schéma général attendu d’un pelicanmaxxing délibéré.
Les résultats les plus simples allaient immédiatement à l’encontre de la théorie. Les pélicans se classaient sixièmes parmi les huit animaux lorsque les scores étaient regroupés entre les modèles. Les chats, les baleines, les ratons laveurs, les hérons et les antilopes obtenaient de meilleures notes pour l’animal.
Les vélos ont fait encore moins bien. Ils se classaient cinquièmes sur six véhicules, tout juste devant les avions. Le juge a relevé un composant de vélo manquant ou déconnecté dans environ deux tiers des images de vélos.
Ces classements ne suffisent pas à trancher la question. Un pélican est plus difficile à représenter qu’un chat, tandis qu’un vélo exige deux roues, un cadre relié, un guidon, des pédales et une selle. Un entraînement spécial pourrait améliorer un sujet difficile sans le faire passer à la première place.
Castillo a donc ajusté une régression à effets fixes, un modèle statistique qui sépare les différences cohérentes entre groupes de l’effet spécifique étudié. Le modèle tenait compte de la difficulté intrinsèque de chaque combinaison animal-véhicule.
Il estimait ensuite trois effets pour chaque laboratoire. L’un mesurait les performances sur l’ensemble des invites impliquant un pélican. Un autre mesurait les performances sur l’ensemble des invites impliquant un vélo. Le dernier isolait la combinaison exacte pélican-vélo.
L’estimation pour les pélicans de chaque laboratoire se situait entre moins 0,11 et plus 0,14 point du juge. Aucune ne s’approchait de la significativité statistique, et la plus petite valeur p rapportée était de 0,25.
Aucun laboratoire n’a produit de gain statistiquement significatif pour la combinaison exacte. GLM-5.2 a enregistré l’estimation positive la plus élevée, à 0,35 point, mais sa valeur p était de 0,12. Ce résultat reste compatible avec le hasard.
La combinaison célèbre se classait 42e parmi les 48 combinaisons avant les ajustements de difficulté. Une invite ayant bénéficié d’une préparation spéciale approfondie ne devrait normalement pas se retrouver près du bas de sa grille de comparaison.
Les résultats pour les vélos ont produit une apparente exception. Gemini 3.5 Flash affichait un effet vélo de 0,27 point avec une valeur p de 0,022. Cette valeur franchit le seuil conventionnel de 0,05 lorsqu’elle est considérée isolément.
Toutefois, l’étude a mené 21 tests statistiques liés. Avec un seuil de 0,05, les variations aléatoires produiraient en moyenne environ un résultat positif apparent. L’effet Gemini était précisément ce résultat isolé.
Il n’a pas non plus résisté à une correction de Bonferroni, qui abaisse le seuil de significativité lorsque les chercheurs testent de nombreuses hypothèses. Le seuil corrigé était d’environ 0,002, bien inférieur au résultat de 0,022 de Gemini.
Cela rend le contraste entre Anthropic et Google moins spectaculaire que ne le laisse entendre son cadrage favorable aux mots-clés. Claude n’a révélé aucun avantage spécifique aux pélicans. Le résultat isolé de Gemini sur les vélos ne résiste pas à une correction standard pour comparaisons multiples.
OpenAI, xAI, Qwen, Z.ai et DeepSeek n’ont pas non plus produit la signature attendue. Certains modèles dessinaient globalement de meilleures images, mais une qualité générale supérieure ne démontre pas une optimisation étroite.
Cette conclusion devrait tempérer les affirmations fondées sur l’inspection visuelle. Un résultat soigné peut refléter un meilleur code, une meilleure composition ou un meilleur suivi des instructions. Il ne révèle pas automatiquement des éléments de benchmark mémorisés.
Castillo a également publié le dépôt de l’expérience, permettant aux lecteurs d’examiner le pipeline et les résultats sous-jacents. Cette transparence donne à l’étude davantage de valeur qu’une galerie sélectionnée de générations réussies.
La conclusion reste à juste titre limitée. L’expérience a trouvé peu d’éléments indiquant un pelicanmaxxing manifeste parmi ces modèles dans ces conditions. Elle n’a pas prouvé qu’aucun laboratoire n’avait jamais entraîné ses modèles sur des exemples liés.
Des images familières ne prouvent pas la mémorisation
Les motifs visuels répétés paraissent suspects, mais la grille de comparaison montre que nombre d’entre eux découlent de conventions de dessin ordinaires.
Chacune des 21 images de pélican à vélo était tournée vers la droite. Aucune autre combinaison n’a atteint un accord directionnel complet. Considéré isolément, ce résultat ressemble à un signe fort de composition mémorisée.
L’ensemble de données plus large en modifie la signification. Soixante pour cent des 1 008 images étaient tournées vers la droite. Les vélos faisaient face à droite dans 81 pour cent des échantillons, tandis que les trottinettes atteignaient 83 pour cent.
Les pélicans faisaient également face à droite dans 78 pour cent de leurs images. Les antilopes atteignaient le même taux, et les hérons 77 pour cent. Ces sujets encouragent naturellement une vue de profil, car les poses de face masquent leurs caractéristiques distinctives.
Un vélo est plus facile à reconnaître lorsque ses deux roues restent visibles. Un pélican bénéficie d’un profil qui dévoile son long bec et sa poche gulaire. La combinaison de ces deux préférences rend cette cohérence directionnelle peu surprenante.
Plusieurs autres combinaisons ont presque atteint l’unanimité. Les antilopes sur des trottinettes et les pélicans sur des trottinettes faisaient face dans la même direction dans 20 échantillons sur 21. Les hérons sur des vélos le faisaient dans 19 échantillons sur 21.
Les accessoires récurrents racontent une histoire semblable. Chaque image de flamant rose sur un bateau contenait un soleil. Des écharpes apparaissaient dans 38 pour cent des images de loutres en avion, tandis que des paniers figuraient dans 38 pour cent des images de chats à vélo.
Les scènes de pélican à vélo contenaient des éléments récurrents, mais pas à des niveaux particulièrement remarquables. Les modèles semblent puiser dans des associations visuelles communes pour de nombreuses invites, et pas seulement pour la plus célèbre.
Cette distinction est centrale dans le débat sur les benchmarks d’Anthropic et de Google. Les modèles génératifs peuvent converger vers des compositions similaires sans récupérer un exemple précis issu de l’entraînement. Leurs distributions apprises favorisent des arrangements, des couleurs, des poses et des éléments décoratifs familiers.
Les données d’entraînement comptent toujours. D’innombrables illustrations montrent des personnages en mouvement de profil, souvent allant de gauche à droite ou de droite à gauche. Les modèles peuvent absorber ces régularités sans mémoriser une image identifiable.
L’inverse est également vrai. Un modèle peut reproduire des motifs influencés par l’entraînement sans renvoyer une copie exacte. La similarité des résultats existe sur un spectre, et une petite grille d’images ne peut situer chaque résultat sur celui-ci.
Cette incertitude explique pourquoi la ressemblance visuelle constitue à elle seule une preuve faible. Un soleil, une écharpe, un panier ou un oiseau tourné vers la droite peuvent signaler une convention apprise. Ils peuvent aussi indiquer un groupe plus restreint d’exemples répétés.
Une affirmation plus solide exigerait des tests supplémentaires. Les chercheurs pourraient varier la formulation, la composition, la direction, le style artistique et le format de sortie. Ils pourraient également comparer les probabilités internes des modèles ou rechercher des exemples proches dans les corpus d’entraînement connus.
Les modèles fermés empêchent la plupart des chercheurs externes d’examiner ces signaux plus profonds. Le public peut tester les comportements, mais il ne peut pas inspecter les mélanges complets de données d’entraînement et les recettes de post-entraînement d’Anthropic ou de Google.
Ce déficit d’information confère une influence inhabituelle aux benchmarks informels. Les utilisateurs peuvent lancer la même invite et comparer immédiatement les résultats visibles. Ils ne peuvent pas facilement déterminer pourquoi un système a fait mieux qu’un autre.
L’expérience sur les pélicans améliore cette situation en élargissant l’ensemble de comparaison. Elle montre comment des alternatives contrôlées peuvent remettre en cause un récit séduisant avant qu’il ne devienne un fait admis.
La véritable possibilité est le SVGmaxxing
L’étude affaiblit la théorie étroite du pélican tout en laissant entièrement plausible une optimisation générale des SVG.
SVGmaxxing consiste à améliorer la génération de graphiques vectoriels sur de nombreux sujets plutôt que de viser un seul prompt célèbre. Un modèle entraîné de cette manière devrait mieux fonctionner dans l’ensemble de la grille de Castillo. Une telle amélioration indiquerait une véritable capacité générale.
C’est le principal angle mort de l’expérience. Sa conception statistique détecte un effet inhabituel lié aux pélicans, aux vélos ou à leur combinaison au sein de chaque laboratoire. Elle ne peut pas identifier un entraînement qui améliore simultanément les 48 combinaisons.
Castillo souligne que Google DeepMind a ouvertement évoqué des travaux visant à améliorer la génération de SVG. Cette information rend une explication fondée sur une optimisation générale plus crédible que l’existence d’entrepôts secrets remplis d’exemples de pélicans.
Un entraînement général aux SVG ne constitue pas automatiquement une manipulation de benchmark. Les graphiques vectoriels ont des usages concrets dans les icônes, schémas, graphiques, ressources d’interface, supports pédagogiques et illustrations modifiables. De meilleures performances peuvent servir de nombreuses tâches réelles.
La frontière dépend de la généralisation. Entraîner un modèle à produire des graphiques valides et modifiables pour des demandes variées développe une capacité utile. L’entraîner sur une famille restreinte de prompts d’évaluation anticipés produit un score trompeur.
Les observateurs externes savent rarement où se situe un laboratoire entre ces deux positions. La documentation publique des modèles décrit généralement des résultats d’évaluation globaux, tandis que les mélanges de données détaillés et les signaux de renforcement restent privés.
La comparaison entre Anthropic et Google illustre clairement cette ambiguïté. Claude et Gemini peuvent différer en qualité globale de SVG sans qu’aucun n’ait reçu d’entraînement spécifique aux pélicans. Ces différences peuvent refléter les capacités de programmation, le raisonnement spatial ou des travaux ciblés sur les graphiques.
Même une amélioration générale peut être optimisée pour les démonstrations. Les laboratoires savent quelles capacités génèrent des publications marquantes sur les réseaux sociaux. Un SVG net crée une comparaison avant-après immédiate, plus facile à partager qu’une amélioration subtile du raisonnement.
Cette incitation n’invalide pas la capacité. Elle signifie toutefois que les lecteurs devraient distinguer l’utilité d’un produit du spectacle d’un jour de lancement. Un modèle peut produire un vélo impressionnant tout en échouant sur des tâches moins photogéniques.
Les développeurs devraient donc tester les modèles graphiques dans leurs flux de travail réels. Une équipe produit peut avoir besoin d’icônes réutilisables aux dimensions cohérentes. Un chercheur peut avoir besoin de schémas précis avec des relations étiquetées.
Ces exigences diffèrent du dessin d’animaux fantaisistes. Un balisage valide, la possibilité de modification, l’accessibilité, la précision des coordonnées et la cohérence stylistique peuvent compter davantage que le charme visuel.
Le même principe s’applique au-delà de la génération de SVG. Les agents de programmation peuvent exceller dans des tâches logicielles publiques tout en peinant dans le dépôt privé d’une entreprise. Les modèles de raisonnement peuvent obtenir de bons scores sur des questions académiques tout en traitant mal des éléments de preuve professionnels incomplets.
Les équipes ont besoin d’évaluations fondées sur un travail représentatif et des cas de test cachés. Elles ont également besoin d’archives montrant quels prompts, sources et résultats ont éclairé une décision.
Une base de connaissances IA consultable peut conserver ces artefacts d’évaluation aux côtés des observations humaines. Ces archives deviennent précieuses lorsqu’une mise à jour du modèle modifie son comportement.
La leçon plus large n’est pas que les benchmarks publics sont inutiles. Ils fournissent des points de référence communs et rendent les régressions visibles. Toutefois, leur valeur diminue à mesure que les laboratoires et les utilisateurs s’optimisent autour d’eux.
Un benchmark célèbre devient progressivement une partie de l’environnement qu’il mesure. Les chercheurs en discutent, les développeurs le voient et des exemples générés circulent en ligne. Les futurs jeux de données d’entraînement peuvent alors absorber ces discussions et ces résultats.
Cette boucle de rétroaction rend la contamination difficile à éviter. Même sans manipulation délibérée, un test bien connu peut devenir statistiquement moins indépendant des systèmes auxquels il est appliqué.
Pelicanmaxxing est amusant parce que les enjeux semblent insignifiants. Le mécanisme qui le sous-tend ne l’est pas. Une contamination similaire peut affecter les évaluations de programmation, de mathématiques, de sécurité, de factualité et d’agents utilisées dans des décisions d’achat importantes.
Un seul juge LLM ne peut pas clore l’affaire
Les résultats sont instructifs, mais la taille de l’échantillon et la méthode d’évaluation laissent place à des effets plus faibles et à des erreurs de mesure.
Chaque score provenait de GPT-5.6 Luna, qui jugeait une image à la fois. Castillo n’a pas mesuré avec quelle cohérence le juge noterait des présentations répétées de la même image.
Un juge peu fiable ajoute du bruit à chaque estimation. Une préférence stylistique pourrait également favoriser une famille de modèles. Luna appartient à la même famille élargie que GPT-5.6 Terra, l’un des systèmes testés.
Les comparaisons intra-modèle de l’étude atténuent cette inquiétude. Si Luna apprécie simplement le style de Terra, elle devrait relever l’ensemble de la grille de Terra. L’analyse se concentre sur la question de savoir si certaines cellules spécifiques dépassent les performances habituelles de ce modèle.
Néanmoins, le comportement du juge peut interagir avec le contenu. Luna peut reconnaître certains animaux plus fiablement que d’autres. Elle peut récompenser une simplicité visuelle nette tout en négligeant des erreurs anatomiques.
Une évaluation humaine offrirait une vérification supplémentaire. Plusieurs évaluateurs indépendants pourraient juger l’identité de l’animal, la structure du véhicule, la cohérence de l’action et la qualité générale. Des scores d’accord révéleraient quels jugements restent subjectifs.
Un second juge modèle indépendant serait également utile. Différentes familles de juges pourraient noter les mêmes images rendues selon des grilles identiques. Les désaccords majeurs mettraient en évidence des conclusions fragiles.
Le budget a limité l’expérience à trois échantillons par cellule et un seul passage d’évaluation. Castillo indique que l’ensemble de l’exécution a coûté environ 80 dollars en crédits API. Les intervalles de confiance obtenus étaient en moyenne d’environ plus ou moins 0,6 point de juge.
Ces intervalles sont suffisamment larges pour masquer des améliorations modestes spécifiques au benchmark. Un laboratoire pourrait bénéficier d’un petit avantage que cette expérience n’a pas la puissance statistique nécessaire pour détecter.
L’étude a également régénéré les sorties invalides jusqu’à ce que chaque prompt produise un SVG utilisable. Seules 11 nouvelles tentatives ont été nécessaires, de sorte que ce choix a probablement eu une influence limitée. Toutefois, le comportement de relance élimine certaines différences de fiabilité des scores d’images finaux.
Une évaluation en production pourrait compter la première réponse. Les utilisateurs se soucient de savoir si un modèle respecte le format demandé sans correction. Les échecs de rendu peuvent compter autant que la qualité visuelle dans les flux de travail automatisés.
L’utilisation du mot « plane » a créé un autre problème connu. Certains modèles ont interprété le mot comme une surface géométrique plane plutôt que comme un avion. L’extracteur de caractéristiques n’a trouvé aucun véhicule dans 25 des 168 images de planes.
Vingt pour cent des images de planes ont reçu un score de véhicule de un ou deux. Les vélos ont atteint cinq pour cent, tandis que les bateaux, scooters et skateboards n’ont obtenu aucun score aussi faible.
Cette erreur de formulation n’efface pas le résultat central. Chaque modèle a reçu les mêmes prompts, et la régression tenait compte de la difficulté des combinaisons. Elle montre toutefois à quel point un terme ambigu peut fausser un benchmark.
L’accès aux modèles via OpenRouter ajoute une autre considération. L’expérience reflète les versions de modèles et le comportement de routage disponibles au moment de l’exécution. Les fournisseurs peuvent mettre à jour leurs systèmes sans offrir aux chercheurs externes une visibilité complète sur chaque modification.
La recherche devrait donc être considérée comme un test initial solide, et non comme un verdict définitif. Sa conception rigoureuse rend l’absence d’un effet important significative. Elle ne peut pas exclure chaque effort d’optimisation plus ancien ou plus limité.
Ce cadrage prudent s’applique également à l’article source qui a popularisé le résultat. Willison a qualifié le travail de Castillo de plus rigoureux que ses précédentes vérifications ponctuelles dans son commentaire de juillet. Il ne l’a pas présenté comme une preuve que la manipulation des benchmarks n’a jamais lieu.
Les lecteurs devraient résister à la tentation de transformer « aucune preuve claire ici » en « les laboratoires sont disculpés ». L’absence de détection dépend des prompts, des échantillons, du juge, du modèle statistique et de la puissance disponible.
La meilleure conclusion est méthodologique. Les affirmations concernant la manipulation de benchmarks nécessitent des comparaisons contrôlées, des données ouvertes, plusieurs évaluateurs et une incertitude explicitement formulée. Les captures d’écran seules ne peuvent pas porter cette charge.
Ce qu’Anthropic, Google et les acheteurs de modèles devraient surveiller ensuite
Les prochaines preuves utiles viendront de réplications, de tests SVG plus étendus et de changements de comportement d’une version à l’autre.
Premièrement, les chercheurs devraient reproduire l’étude avec davantage d’échantillons et des juges indépendants. Une exécution plus vaste réduirait les intervalles de confiance et révélerait si de petits effets persistent lors d’évaluations répétées.
Des évaluateurs humains devraient examiner un sous-ensemble représentatif selon une grille écrite. Au moins un juge issu d’une autre famille de modèles devrait noter l’ensemble du jeu de données. Un accord entre les méthodes renforcerait le résultat.
Si les effets liés aux pélicans, aux vélos et à leur combinaison restent proches de zéro, la théorie étroite du pelicanmaxxing s’affaiblit. Si un effet apparaît de manière répétée pour un laboratoire, les enquêteurs disposeraient d’une cible plus claire.
Deuxièmement, les futurs tests devraient élargir la tâche au-delà des dessins animés d’animaux sur des véhicules. Les modèles pourraient générer des diagrammes techniques, des icônes d’interface, des cartes, des processus étiquetés, des figures géométriques et des familles de ressources cohérentes.
Ces prompts permettraient de vérifier si de meilleures sorties SVG se transfèrent à un travail utile. Ils distingueraient également l’entraînement graphique général de l’optimisation autour d’une famille de prompts visuellement familière.
Les chercheurs devraient mesurer plus que l’apparence. La validité dès la première tentative, la possibilité de modification, les libellés d’accessibilité, les dimensions demandées, le nombre d’objets et la précision spatiale méritent tous des scores indépendants.
Cela pousserait Anthropic et Google à préciser ce que leurs modèles améliorent entre deux versions. Un modèle qui fonctionne mieux dans de nombreuses tâches SVG cachées offre des preuves plus solides de capacité générale.
Troisièmement, les observateurs devraient suivre les ruptures autour des lancements majeurs. Des gains soudains sur un prompt célèbre méritent d’être comparés à des tâches cachées voisines exécutées dans les mêmes conditions.
Les archives de Simon Willison offrent un historique public utile, mais les futures évaluations nécessitent aussi des ensembles de prompts non publiés. Les tests cachés réduisent l’optimisation directe et la contamination accidentelle.
Les acheteurs de modèles peuvent appliquer la même approche sans construire une étude de mille images. Commencez par une démonstration publique qui semble impressionnante. Créez ensuite plusieurs variations contrôlées qui préservent la compétence sous-jacente.
Modifiez les entités, les formats, les contraintes et la formulation. Exécutez suffisamment d’échantillons pour voir si les performances résistent aux variations ordinaires. Conservez les premières tentatives ainsi que les sorties corrigées.
Pour une décision d’approvisionnement entre Anthropic et Google, le modèle gagnant devrait réussir sur des tâches privées représentatives, et non sur un seul défi public célèbre. Les acheteurs devraient également refaire les tests après les mises à jour des modèles.
L’étude sur les pélicans offre un modèle pratique. Définissez le raccourci suspecté, construisez des alternatives proches, contrôlez la difficulté et publiez les échecs en même temps que les réussites. Indiquez ensuite ce que la conception ne peut pas détecter.
Cette norme est importante car les évaluations d’IA influencent de plus en plus les plans d’ingénierie, la sélection des fournisseurs et l’automatisation au travail. Un score de benchmark peut condenser un comportement complexe en un seul chiffre commercialisable.
Aucun chiffre unique ne peut décrire pleinement un modèle. Les expériences contrôlées peuvent néanmoins révéler lorsqu’un récit convaincant dépasse les preuves qui l’étayent.
La réponse immédiate est rassurante et incomplète. Castillo n’a trouvé aucun signe fort indiquant que sept modèles de premier plan bénéficiaient d’un avantage particulier pour les pélicans à vélo. Le résultat isolé de Google sur les vélos disparaît après correction pour les tests multiples.
Le défi plus vaste reste non résolu. L’optimisation générale, les tests contaminés, les choix d’entraînement cachés et les juges subjectifs peuvent encore brouiller la frontière entre progrès réel et stratégie d’évaluation.
Avant de croire à la prochaine démonstration virale d’un modèle, construisez autour d’elle une petite grille de comparaison. Demandez-vous si la compétence revendiquée résiste à des sujets, formats et contraintes différents. Le test du pélican de Google par Anthropic montre qu’une consigne absurde peut révéler un problème d’évaluation sérieux, à condition que quelqu’un mette l’histoire à l’épreuve plutôt que de la répéter.



