top of page

Anthropic affirme que l’amplitude à neuf boucles de Claude dépasse le record de huit boucles en physique

26 sept.
14 min de lecture

Anthropic affirme qu’un calcul d’amplitude à neuf boucles réalisé par Claude a fait progresser un résultat spécialisé de physique théorique au-delà du précédent record de huit boucles. L’entreprise indique que Claude a travaillé en grande partie sans supervision pendant plusieurs jours après avoir reçu une seule invite initiale.

Le calcul porte sur la diffusion à six particules dans la théorie de Yang-Mills supersymétrique N=4 planaire. Ce modèle très symétrique ne décrit pas directement la nature. Les physiciens l’utilisent comme environnement contrôlé pour développer des méthodes capables de révéler des structures cachées dans la théorie quantique des champs.

Cette distinction est importante. Anthropic ne prétend pas que Claude a prédit une nouvelle particule ou expliqué une anomalie expérimentale. L’entreprise affirme qu’un agent d’IA a prolongé un calcul symbolique difficile dans un domaine de recherche où la complexité augmente fortement à chaque ordre de boucle.

Le résultat remet en question une hypothèse plus restreinte, mais importante, concernant l’IA en science. Jusqu’ici, de nombreux exemples impressionnants reposaient sur des benchmarks soigneusement délimités, une forte supervision humaine ou des problèmes aux réponses faciles à vérifier. Cette tâche provenait d’un physicien extérieur, se situait au-delà de la frontière publiée et nécessitait une longue suite de décisions techniques.

Toutefois, les éléments publics ne sont pas encore équivalents à un article scientifique évalué par les pairs et accompagné d’un dossier complet de reproductibilité. Le récit d’Anthropic, l’évaluation du challenger et une vérification par un expert constituent des éléments significatifs. Ils ne permettent pas de déterminer à quelle fréquence une autre équipe pourrait reproduire le résultat.

Ce qu’Anthropic affirme que Claude a réellement calculé

L’affirmation centrale est précise : Claude a étendu une amplitude connue à six particules de huit à neuf boucles au sein d’une théorie quantique des champs simplifiée.

Une amplitude de diffusion est un objet mathématique utilisé pour calculer les interactions entre particules. Les physiciens l’approximent souvent sous forme de série, chaque boucle supplémentaire représentant une correction quantique d’ordre supérieur.

Davantage de boucles peuvent fournir davantage d’informations, mais les expressions deviennent considérablement plus difficiles à construire. Le défi ne consiste pas simplement à ajouter une ligne de plus à une formule existante. Chaque ordre élargit l’espace des fonctions, contraintes et contrôles de cohérence possibles.

La cible était une amplitude à six particules à violation maximale d’hélicité, ou MHV. MHV désigne un arrangement particulier des hélicités des particules, plus simple que beaucoup d’alternatives tout en restant mathématiquement riche.

La théorie était la théorie de Yang-Mills supersymétrique N=4 planaire. « Planaire » signifie que le calcul conserve les contributions qui dominent dans une limite de grand nombre de couleurs et peuvent être représentées sans lignes qui se croisent. N=4 décrit le degré exceptionnellement élevé de supersymétrie de la théorie.

Ces propriétés rendent le modèle bien plus contraint que la chromodynamique quantique, la théorie qui gouverne les quarks et les gluons. Elles en font aussi un laboratoire important pour tester des idées relatives aux amplitudes, à la symétrie, à la géométrie et aux structures mathématiques.

Anthropic a publié le résultat dans un billet invité intitulé Claude and nine loops. Le physicien et journaliste scientifique Matt von Hippel y décrit comment son défi public est parvenu aux chercheurs de l’entreprise.

Von Hippel avait demandé si un système d’IA pouvait calculer l’amplitude à six particules à neuf boucles à l’aide de ressources informatiques accessibles à un groupe universitaire. Son défi visait délibérément un problème non résolu, mais clairement défini.

La frontière précédente n’était pas hypothétique. Lance Dixon et Yu-Ting Liu ont publié une amplitude à huit boucles en 2023 en utilisant la dualité antipodale, qui relie l’amplitude à un autre objet mathématique appelé facteur de forme.

Ce calcul a passé des vérifications impliquant plusieurs limites cinématiques importantes. Il a fourni à la fois un record et une base qu’un effort à neuf boucles pouvait prolonger.

Selon Anthropic, Claude a utilisé des méthodes développées par Dixon et ses collaborateurs, plutôt que d’inventer une théorie sans rapport. L’entreprise indique que le système a trouvé deux voies indépendantes produisant des réponses concordantes.

L’accord entre des méthodes distinctes est précieux, car il réduit le risque d’une simple erreur d’implémentation. Il ne remplace pas une réplication externe, mais il est plus solide que la présentation d’une seule expression non vérifiée.

Le résultat a donc une portée clairement définie. Claude aurait fait progresser un calcul symbolique spécifique dans un modèle très structuré. Il n’a pas résolu les amplitudes de diffusion de manière générale, remplacé la physique expérimentale ni établi une nouvelle loi fondamentale.

Pourquoi l’amplitude à neuf boucles de Claude est importante

La partie la plus déterminante de cette histoire n’est pas seulement la boucle supplémentaire, mais la manière dont un agent aurait franchi cette frontière computationnelle.

Von Hippel a présenté le problème comme un test permettant de savoir si l’IA pouvait accomplir quelque chose de significatif dans son ancienne spécialité. Son défi initial distinguait une véritable avancée de recherche des exercices scolaires ou des dérivations familières.

Il a choisi les amplitudes parce que les calculs à de nombreux ordres de boucle combinent jugement mathématique et calcul intensif. Les méthodes connues peuvent orienter vers une solution, mais leur application à l’ordre suivant peut exiger des années d’attention experte.

Cela distingue ce résultat d’une IA produisant une explication plausible de la physique établie. Un résumé fluide peut masquer des erreurs, car les lecteurs ne vérifieront pas nécessairement chaque équation. Un calcul de frontière se heurte à des contraintes plus strictes.

L’objet final doit respecter les symétries connues et les limites physiques. Différentes voies de construction doivent converger. Les spécialistes peuvent le comparer à la structure héritée des ordres de boucle inférieurs.

Anthropic affirme que Claude a reçu une seule invite décrivant le problème, puis a opéré en grande partie sans supervision pendant plusieurs jours via Claude Science. Claude Science est un environnement de recherche qui permet à un modèle d’utiliser des outils, de gérer des travaux intermédiaires et de poursuivre sur de nombreux cycles d’inférence.

« Une seule invite » ne doit pas être confondue avec une seule réponse du modèle. L’environnement fournissait un cadre dans lequel Claude pouvait écrire du code, exécuter des calculs, examiner les échecs et réviser son approche.

Cette distinction est essentielle pour comprendre l’accomplissement. Le système concerné n’était pas uniquement un modèle de langage répondant de mémoire. C’était un agent intégré dans un flux de travail computationnel.

Le modèle sous-jacent pouvait interpréter des articles et formuler des étapes techniques. Des outils externes pouvaient effectuer de l’algèbre exacte, manipuler de grandes expressions ou tester des résultats candidats. L’environnement pouvait préserver l’état d’un projet durant plusieurs jours.

La littérature sur l’intégrande à toutes les boucles fournit déjà une connaissance structurelle approfondie des amplitudes de Yang-Mills supersymétrique N=4 planaires. Des méthodes bootstrap ultérieures utilisent la symétrie, l’analyticité et le comportement dans certaines limites pour contraindre les réponses possibles sans évaluer chaque diagramme de Feynman.

Claude aurait assemblé et appliqué cet ensemble de techniques accumulées. Cela reste significatif. Le travail scientifique progresse souvent par l’utilisation efficace de techniques établies, et non par des éclairs isolés de théorie entièrement nouvelle.

Le résultat met également à l’épreuve la fiabilité sur le long terme. Un agent de recherche doit suivre les hypothèses, les fichiers, les expressions intermédiaires et les étapes de validation. Une convention erronée peut corrompre tout ce qui suit.

Les projets de longue durée révèlent des faiblesses que les benchmarks courts ne détectent pas. Les modèles peuvent oublier pourquoi un choix a été fait, accepter un résultat intermédiaire défectueux ou s’optimiser vers un test incomplet.

Une exécution réussie suggère que des environnements scientifiques soigneusement conçus peuvent compenser certaines de ces faiblesses. Des fichiers persistants, des contrôles exécutables et un suivi explicite de la progression transforment le raisonnement en travail inspectable.

Ce mécanisme compte bien au-delà de la physique des amplitudes. La modélisation des matériaux, l’exploration de théorèmes, la chimie computationnelle et la conception d’algorithmes comportent tous des tâches avec de longues chaînes d’états intermédiaires vérifiables.

La leçon transférable porte donc sur l’architecture de la recherche. Un modèle compétent devient plus utile lorsqu’il est associé à la littérature du domaine, à des outils exacts, à un état durable et à des tests capables de rejeter des erreurs séduisantes.

Le véritable affrontement oppose la recherche agentique au calcul dirigé par des experts

La tension principale n’oppose pas Claude à un physicien ; elle oppose un flux de travail de recherche autonome au processus traditionnel de calcul piloté par des experts.

Les projets d’amplitudes à de nombreux ordres de boucle ont généralement reposé sur de petits groupes de spécialistes. Ces chercheurs développent les espaces de fonctions, identifient des dualités utiles, écrivent du code sur mesure et déterminent quelles conditions de cohérence sont décisives.

Ce processus intègre des années de jugement accumulé. L’article final peut présenter un cheminement concis, mais celui-ci repose sur une connaissance étendue des calculs qui valent la peine d’être tentés.

Le récit d’Anthropic suggère une répartition différente du travail. Des chercheurs humains ont sélectionné le problème et construit l’environnement opérationnel. Claude a ensuite pris en charge une grande partie de la recherche prolongée, de l’implémentation et du processus de vérification.

Il ne s’agit pas d’une automatisation complète de la science. Les humains ont encore fourni l’objectif, l’accès aux outils, à la littérature et à un cadre capable de soutenir l’exécution. Un expert a également évalué le résultat après coup.

Pourtant, la répartition des efforts paraît sensiblement différente. L’agent aurait exécuté un projet qui exigerait normalement une attention humaine spécialisée et continue.

Cela met les équipes de recherche, les laboratoires d’IA et les développeurs de logiciels scientifiques sous pression. Chacun doit désormais se demander quelles parties du calcul expert peuvent être converties en procédures lisibles par un agent.

Pour les équipes universitaires, l’opportunité immédiate est le débit de travail. Un agent peut explorer des ansätze alternatifs, relancer des vérifications et documenter des pistes abandonnées pendant que les chercheurs se concentrent sur l’interprétation.

Un ansatz est une hypothèse structurée contrainte par des propriétés mathématiques connues. Dans le bootstrap des amplitudes, les chercheurs réduisent un vaste espace de candidats jusqu’à ce qu’une fonction satisfasse toutes les conditions requises.

Les agents pourraient être particulièrement adaptés à ce travail, car le processus mêle recherche documentaire, génération de code, manipulation symbolique et tests itératifs. Chaque étape peut laisser des artefacts qu’un autre programme ou une autre personne peut examiner.

Pour les laboratoires d’IA, le résultat soulève une question d’évaluation plus difficile. Une réussite spectaculaire sur un problème choisi ne révèle pas le taux de succès du système sur des problèmes comparables.

Anthropic a déjà souligné que les évaluations d’agents nécessitent à la fois des résultats vérifiables et des essais répétés. Ses propres recommandations sur l’évaluation des agents distinguent une réussite obtenue une fois après plusieurs tentatives d’une réussite systématique.

Cette distinction s’applique ici. Le récit public décrit une trajectoire réussie, mais n’établit pas encore combien d’approches ont échoué ni à quel point l’issue dépendait des conditions.

Les équipes de logiciels scientifiques font face à un autre type de pression. Si des agents de recherche généralistes peuvent utiliser efficacement des systèmes spécialisés d’algèbre, l’interface entourant ces outils devient stratégiquement importante.

La documentation, les erreurs lisibles par machine, les points de contrôle et les environnements reproductibles pourraient compter autant que la vitesse d’exécution brute. Des outils conçus uniquement pour une utilisation interactive par des experts peuvent être plus difficiles à contrôler en toute sécurité pour les agents.

La comparaison historique ne porte pas sur une IA remplaçant les logiciels symboliques. Les programmes assistent les calculs d’amplitudes depuis des décennies. Le changement réside dans le fait qu’un agent fondé sur un modèle de langage peut potentiellement décider quel outil utiliser, interpréter sa sortie et réorienter le projet.

Cette couche d’orchestration constitue la nouvelle revendication. Elle relie des objectifs scientifiques formulés en langage naturel à des bibliothèques et à des routines de vérification qui exigeaient auparavant une supervision constante d’experts.

L’interprétation la plus solide n’est pas que Claude connaissait davantage de physique que la discipline elle-même. C’est que Claude aurait coordonné les connaissances et les calculs existants en physique avec une efficacité suffisante pour prolonger un résultat publié dans ce domaine.

Ce que la vérification indépendante établit — et n’établit pas

La vérification par des experts rend l’affirmation plus crédible, mais la reproductibilité exige davantage que l’examen d’une réponse par un seul physicien réputé.

Anthropic affirme que Lance Dixon a vérifié indépendamment le résultat à neuf boucles. Dixon est un évaluateur particulièrement pertinent, car il a cosigné le calcul publié à huit boucles qui définissait la frontière précédente.

Son implication donne un poids considérable à cette vérification. Il comprend la structure mathématique de l’amplitude, la construction antérieure et les contraintes auxquelles une extension valide devrait répondre.

L’expression « vérifié indépendamment » requiert toutefois une interprétation prudente. Elle peut désigner la vérification de l’expression finale au regard de contraintes, la reproduction de valeurs sélectionnées ou la dérivation du résultat via une chaîne de traitement distincte.

Ces niveaux de validation ne sont pas équivalents. Le résumé public d’Anthropic n’explique pas à lui seul chaque détail du protocole de vérification.

Deux dérivations internes concordantes renforcent également le dossier. Si leurs hypothèses et leurs chemins de code diffèrent suffisamment, leur concordance devient une défense significative contre les erreurs accidentelles.

Cependant, des méthodes supposément indépendantes peuvent partager des dépendances cachées. Elles peuvent utiliser la même base, des données importées, une convention ou un artefact intermédiaire défectueux.

Une publication scientifique conventionnelle permet à des groupes externes d’examiner ces dépendances. Les chercheurs peuvent étudier le prompt exact, le code, les versions des outils, les fichiers intermédiaires et les tests.

Au moment de la publication, le récit destiné au public doit être considéré comme un résultat rapporté crédible plutôt que comme un consensus communautaire achevé. Un article évalué par les pairs et un ensemble réutilisable d’artefacts réduiraient l’écart restant.

La question de la vérification s’étend également à l’attribution. Claude a peut-être généré du code et choisi des tactiques, mais des humains ont défini l’environnement et déterminé si le résultat constituait bien un résultat.

Les lecteurs ont besoin d’un relevé clair des contributions. Il devrait distinguer le prompt initial, les interventions humaines ultérieures, les méthodes générées par le modèle, les algorithmes hérités et la validation par des experts.

Il ne s’agit pas d’un simple détail administratif. L’attribution aide les autres chercheurs à comprendre quelle capacité a produit le résultat.

Si l’étape cruciale provenait d’un prompt intégrant une stratégie de résolution d’expert, l’histoire concerne l’exécution à grande échelle. Si Claude a sélectionné la stratégie après avoir lu la littérature, le résultat suggère une autonomie de recherche plus large.

Si des humains redirigeaient le système chaque fois qu’il bloquait, le travail ressemble à une collaboration étroite. Si les interventions se limitaient à une supervision opérationnelle, l’affirmation d’autonomie devient plus forte.

Le terme « non supervisé » peut masquer ces différences. Un système peut fonctionner sans orientation en direct tout en dépendant d’un échafaudage important, de ressources sélectionnées et de règles de validation écrites à l’avance.

La communauté scientifique devrait donc demander un relevé au niveau de l’exécution, et non uniquement la formule finale. Un relevé utile indiquerait quand Claude a changé de direction, quels tests ont échoué et quelles informations les humains ont fournies.

Une telle documentation peut aussi révéler si le processus se généralise. Les chercheurs pourraient adapter le flux de travail à une autre amplitude ou le tester sur un problème dont la réponse est cachée.

La lacune de vérification ne doit pas effacer l’accomplissement rapporté. Elle doit déterminer le niveau de confiance accordé aux conclusions plus larges.

Le jugement actuel le plus prudent est limité. Anthropic a présenté un résultat techniquement plausible, l’a relié à un défi ouvert reconnu et a rapporté un examen par le détenteur du record précédent.

L’affirmation plus large, selon laquelle des agents de recherche peuvent franchir de manière fiable des frontières computationnelles, exige des démonstrations répétées dans des conditions transparentes.

Pourquoi il ne s’agit pas encore d’une percée générale en physique

Un résultat au sein de la théorie de Yang-Mills supersymétrique plane N=4 ne se transfère pas automatiquement à une physique des particules réaliste sur le plan expérimental.

Cette théorie est précieuse notamment parce que ses symétries rendent gérables des calculs autrement écrasants. Elle sert de banc d’essai théorique où les structures deviennent visibles avant que les chercheurs ne cherchent des idées connexes ailleurs.

Les prédictions réelles pour les collisionneurs impliquent souvent la chromodynamique quantique. La QCD possède moins de symétries simplificatrices, des échelles supplémentaires et des interactions complexes liées à des processus observables.

Passer d’un résultat à neuf boucles dans le modèle simplifié à un calcul QCD comparable ne serait pas une substitution routinière. Les espaces de fonctions et les contraintes pertinents peuvent changer considérablement.

Un ordre de boucles plus élevé ne produit pas non plus toujours une valeur pratique immédiate. Les chercheurs peuvent utiliser le résultat pour tester des conjectures, étudier des structures à tous les ordres ou approfondir leur compréhension de la géométrie des amplitudes.

Ces contributions peuvent être importantes sans influencer une expérience l’an prochain. Ce travail relève de la physique mathématique et théorique avant de relever de la phénoménologie.

Cette limite précise aussi la véritable importance du résultat. Anthropic n’a pas choisi une théorie triviale, mais un domaine doté d’une structure formelle forte et de vérifications précises.

Cette combinaison est favorable aux agents d’IA. La littérature est abondante, les objets sont numériques et les réponses candidates sont soumises à des contraintes exactes.

D’autres sciences ne disposent souvent pas de ces conditions. Un agent de biologie doit composer avec des mesures bruitées, des modèles incomplets et des expériences qui prennent du temps. Un agent spécialisé dans les matériaux peut dépendre d’une validation physique coûteuse.

L’amplitude à neuf boucles de Claude apporte donc des éléments sur une catégorie de problèmes de recherche. Elle en dit moins sur la découverte empirique ouverte.

Il existe aussi un risque de biais de sélection. Les laboratoires d’IA peuvent essayer de nombreux problèmes et annoncer la réussite la plus impressionnante. Sans rapporter la distribution des tentatives, les lecteurs ne peuvent pas estimer la fiabilité de référence.

Un seul calcul réussi peut refléter un système généralement compétent. Il peut aussi refléter un problème exceptionnellement compatible, un échafaudage efficace et une trajectoire de recherche favorable.

Ces possibilités ne s’excluent pas mutuellement. Un problème peut être bien adapté aux agents tout en laissant la capacité qui en résulte importante.

La comparaison pertinente concerne d’autres tâches de pointe combinant une littérature dense, des outils programmables et une validation objective. Les mathématiques formelles et la cryptanalyse offrent des cas pertinents.

Anthropic a rapporté des travaux dans lesquels Claude a aidé à découvrir des faiblesses cryptographiques. Ce projet reposait également sur un usage prolongé d’outils, des tests computationnels et une validation humaine substantielle.

Pris ensemble, ces projets suggèrent une stratégie délibérée. Anthropic teste Claude sur des questions de recherche où un agent peut générer des artefacts et où des experts peuvent rejeter les mauvaises réponses.

C’est plus informatif que de s’appuyer sur un texte convaincant. Cela crée également une norme exigeante pour les annonces futures.

Les prochains résultats devront montrer si l’approche fonctionne hors de domaines mathématiques soigneusement structurés. Ils devront également révéler si des agents scientifiques peuvent formuler des questions utiles, et non seulement exécuter des défis définis.

Pour l’instant, les développeurs et les organisations de recherche devraient résister à deux extrêmes. Le résultat n’est ni une preuve de science générale automatisée ni une simple démonstration de chatbot.

Il s’agit d’un test sérieux d’agentivité technique de longue durée dans un domaine favorable mais exigeant. Son importance plus large dépend de la réplication et du transfert.

Trois signaux qui détermineront si le résultat se généralise

Les prochaines preuves devraient porter sur la reproductibilité, les performances répétées et une extension utile au-delà de ce seul calcul.

Le premier signal est une publication scientifique complète. Les chercheurs externes ont besoin de suffisamment de matériel pour reconstruire le résultat et comprendre la contribution de l’agent.

Cet ensemble devrait inclure le prompt exact de la tâche, le code, l’environnement informatique, les représentations intermédiaires et les tests de validation. Il devrait aussi décrire chaque intervention humaine substantielle.

Si un autre groupe reproduit l’amplitude à partir de ces matériaux, le récit d’Anthropic devient beaucoup plus solide. Si la reproduction exige une expertise non documentée, l’affirmation d’autonomie s’affaiblit.

Le deuxième signal est la performance sur des problèmes voisins. Claude devrait être confronté à des tâches d’amplitudes connexes dont les solutions sont inconnues des opérateurs du système ou retenues pendant l’évaluation.

Une étude utile rapporterait les réussites, les échecs, les nouvelles tentatives et l’utilisation des ressources sur l’ensemble complet. Elle éviterait de ne mettre en avant que la meilleure trajectoire.

Ces éléments distingueraient une exécution réussie d’une capacité de recherche fiable. Ils montreraient également quelles parties du flux de travail dépendent de la structure particulière de cette théorie.

Le troisième signal est l’utilisation scientifique. Les chercheurs devraient démontrer que le résultat étaye une nouvelle conjecture, permet un autre calcul ou révèle une structure invisible à huit boucles.

Une expression à neuf boucles peut être correcte tout en restant principalement un record. Sa valeur scientifique augmente si d’autres physiciens l’utilisent comme donnée d’entrée pour des travaux ultérieurs.

Ces signaux comptent davantage qu’une autre démonstration soignée. La reproductibilité teste l’affirmation, les essais répétés testent la fiabilité et l’utilisation en aval teste la pertinence.

L’événement offre aussi des orientations pratiques aux équipes qui expérimentent des agents de recherche. Elles devraient préserver les sources, les décisions et les résultats de tests tout au long d’une exécution.

Les projets techniques de longue durée dépassent rapidement ce que quiconque peut suivre dans une fenêtre de discussion. Une base de connaissances d’ingénierie consultable peut relier articles, hypothèses, code et notes de révision sans traiter la sortie du modèle comme une autorité.

Cette discipline favorise à la fois la productivité et le scepticisme. Les chercheurs peuvent retracer l’origine d’une affirmation, comparer des dérivations alternatives et identifier les conclusions qui demeurent provisoires.

L’amplitude à neuf boucles de Claude a déjà franchi un seuil significatif. Un agent d’IA de pointe aurait abordé un problème proposé de l’extérieur et produit une réponse acceptée par un expert de premier plan.

Le prochain seuil est collectif plutôt que computationnel. Des équipes indépendantes doivent pouvoir examiner le processus, reproduire le résultat et appliquer la méthode ailleurs.

Anthropic publiera-t-il suffisamment d’éléments de l’exécution pour qu’un autre groupe puisse la reconstruire ? C’est la question suivante la plus importante, car l’avenir de la science assistée par l’IA dépend de travaux reproductibles, et non de victoires isolées.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page