top of page

L’auto-amélioration de Claude d’Anthropic s’accélère, mais les humains choisissent toujours la destination

il y a 6 jours
17 min de lecture

Anthropic affirme que Claude dirige désormais 26 % de la recherche et du développement de ses modèles, alors qu’il ne dirigeait aucune de ces activités en février 2026. Cette forte progression fait de l’auto-amélioration de Claude d’Anthropic bien plus qu’un slogan provocateur. L’entreprise indique que son modèle peut mener à bien d’importantes missions à partir de prompts de haut niveau, même si des humains continuent de superviser le travail.

Cette annonce fait passer une tendance familière du codage dans un domaine aux conséquences plus importantes. Claude ne se contente plus d’aider les ingénieurs à créer des applications. Il écrit de plus en plus d’infrastructures, réalise des expériences, analyse les résultats et examine les modifications utilisées pour développer les futurs modèles Claude.

Anthropic qualifie cela de progrès vers l’auto-amélioration récursive, dans laquelle un système d’IA contribue à construire un successeur plus capable. Pourtant, ses éléments de preuve révèlent aussi l’obstacle qui demeure. Claude exécute rapidement un travail défini, tandis que les humains décident encore quels problèmes comptent et si les résultats méritent leur confiance.

Cette distinction place l’affirmation d’Anthropic entre deux interprétations concurrentes. L’une décrit une boucle de développement cumulative qui s’accélère à chaque génération de modèles. L’autre décrit une automatisation avancée opérant dans le cadre d’un programme de recherche que les humains contrôlent toujours.

L’auto-amélioration de Claude d’Anthropic atteint désormais la R&D des modèles

Le changement important n’est pas que Claude écrit du code. C’est que Claude dirige désormais des parties substantielles du travail qui sous-tend son successeur.

Anthropic a communiqué le chiffre de 26 % le 17 septembre 2026. L’entreprise définit le fait de « diriger » comme l’accomplissement de la majeure partie d’une tâche à partir d’un prompt de haut niveau, tout en restant sous supervision humaine. Selon l’entreprise, Claude ne dirigeait aucune des activités mesurées de recherche et développement en février.

En août, cette part avait atteint environ un quart. Anthropic indique également qu’environ 90 % de sa recherche et de son développement de modèles impliquent désormais une collaboration avec Claude. Dans cette catégorie plus large, le modèle accomplit de grandes portions du travail sous une étroite direction humaine.

Ces deux chiffres mesurent des niveaux de délégation différents. Le chiffre de 90 % inclut les tâches pour lesquelles une personne reste étroitement impliquée. Le chiffre de 26 % couvre les missions où Claude assume une responsabilité accrue dans l’exécution après avoir reçu l’objectif.

Cette distinction est importante, car aucun de ces chiffres ne signifie que Claude fonctionne de manière indépendante. Le modèle ne choisit pas les objectifs d’entreprise d’Anthropic, n’approuve pas son propre déploiement et ne contrôle pas l’ensemble du processus d’entraînement. Les chercheurs humains continuent de cadrer les problèmes, d’allouer les ressources, d’examiner les résultats et d’autoriser les décisions importantes.

Le changement signalé reste néanmoins exceptionnellement rapide. La première annonce indique que Claude est passé d’aucune part de direction à 26 % en six mois. Cette trajectoire, plus que le pourcentage actuel à lui seul, explique l’attention suscitée.

Anthropic divise le développement des modèles de pointe entre ingénierie et recherche. L’ingénierie comprend l’écriture de logiciels, la maintenance de l’infrastructure et la supervision des systèmes d’entraînement. La recherche comprend la sélection des expériences, l’interprétation des résultats et la décision de poursuivre ou non certaines idées.

Claude est désormais profondément impliqué dans les deux catégories. Pour les tâches d’ingénierie, Anthropic affirme que les personnes fournissent de plus en plus des objectifs sans prescrire chaque étape de mise en œuvre. Pour les tâches de recherche, Claude peut exécuter des expériences bien définies et recommander les actions suivantes.

Un incident concret illustre la différence entre la complétion de code ordinaire et l’ingénierie déléguée. Une mise à niveau de routine avait commencé à faire planter des dizaines de milliers de tâches d’entraînement. Un ingénieur a fourni à Claude le contexte et l’accès au cluster concerné.

Claude a testé les paramètres de l’environnement, isolé un indicateur de débogage obscur, reproduit la panne et confirmé une correction. Anthropic indique que l’enquête a pris environ deux heures. L’entreprise estime qu’un ingénieur humain aurait généralement besoin de deux ou trois jours.

Il ne s’agit pas de création autonome de modèles. Cela reste important, car l’infrastructure d’entraînement affecte directement la rapidité avec laquelle un laboratoire peut tester et améliorer les modèles. Réduire plusieurs jours de débogage à quelques heures offre aux chercheurs davantage d’occasions de mener des expériences et de corriger les défaillances.

Le compte rendu de recherche de l’entreprise décrit donc un rôle humain qui se resserre, non sa disparition. Claude prend de plus en plus en charge la mise en œuvre et l’expérimentation. Les personnes conservent l’autorité sur l’orientation, l’évaluation et les décisions de publication.

Cette frontière définit la tension centrale. Anthropic a présenté des éléments attestant d’une automatisation rapide au sein du développement de l’IA, tout en documentant le jugement humain qui empêche le processus de devenir autonome.

Les chiffres du codage montrent pourquoi Anthropic tire la sonnette d’alarme

La contribution de Claude prend davantage d’importance lorsque la génération de code, la revue et l’expérimentation commencent à se renforcer mutuellement.

En mai 2026, Anthropic affirme que Claude avait produit plus de 80 % du code fusionné dans sa base de code. Avant l’entrée de Claude Code en aperçu de recherche en février 2025, cette part restait de l’ordre de quelques pourcents.

L’entreprise fait également état d’une forte hausse de la production d’ingénierie. Au cours du deuxième trimestre 2026, son ingénieur type fusionnait quotidiennement huit fois plus de code qu’en 2024. Anthropic attribue une grande partie de cette hausse aux ingénieurs qui dirigent et examinent Claude plutôt qu’à la saisie de chaque modification.

Les lignes de code constituent une mesure imparfaite de la productivité. Davantage de code peut créer des coûts de maintenance, dupliquer des fonctions existantes ou dissimuler une mauvaise conception. Anthropic reconnaît explicitement que cette hausse d’un facteur huit surestime presque certainement le véritable gain de productivité.

Le volume de production n’est toutefois qu’un élément de son argumentaire. Anthropic indique que les taux d’intervention ont diminué au cours des sessions Claude Code. Les ingénieurs corrigeraient, réorienteraient ou reprendraient le contrôle du modèle moins souvent qu’il y a un an.

Sur les tâches d’ingénierie les plus ouvertes d’Anthropic, le taux de réussite communiqué pour Claude a atteint 76 % en mai 2026. Cela représentait une hausse de 50 points de pourcentage en six mois. Un évaluateur basé sur Claude a déterminé si les sessions achevaient leurs tâches attribuées sans nécessiter de corrections.

Cette méthodologie appelle à la prudence. Un modèle interne qui évalue un autre modèle n’offre pas les mêmes garanties qu’une évaluation indépendante. La composition des tâches peut également évoluer au fil du temps, ce qui complique les comparaisons entre les taux de réussite mensuels.

Anthropic rapporte néanmoins que le code écrit par Claude a approché la qualité du code écrit par des humains au sein de l’entreprise en 2026. Les avis du personnel n’étaient pas unanimes. L’entreprise affirme que de nombreux employés considéraient le code de Claude comme moins bon à la fin de 2025, mais globalement comparable à la mi-2026.

La revue automatisée ajoute une autre couche à la boucle. Anthropic utilise désormais Claude pour inspecter les modifications de code proposées afin de détecter les défauts et les faiblesses de sécurité. Une analyse rétrospective de l’entreprise a révélé que ces revues auraient détecté environ un tiers des bugs à l’origine d’incidents de production antérieurs.

Cela crée un cycle de développement où l’IA intervient des deux côtés. Une session Claude écrit ou modifie du code. Une autre examine la modification proposée. Les humains examinent le résultat, décident s’il doit être mis en production et enquêtent sur les cas où les vérifications automatisées divergent.

Le schéma s’étend au-delà de la programmation. Anthropic a testé des modèles sur une tâche d’optimisation impliquant du code qui entraîne un petit système d’IA. L’objectif était d’améliorer la vitesse sans échouer aux vérifications de correction prédéterminées.

Claude Opus 4 a produit une accélération moyenne d’un facteur trois en mai 2025, selon Anthropic. Un modèle interne appelé Mythos Preview a atteint une accélération d’environ 52 fois en avril 2026. L’entreprise affirme qu’un chercheur humain qualifié avait généralement besoin de quatre à huit heures pour parvenir à une amélioration d’un facteur quatre.

Ces chiffres montrent pourquoi Anthropic présente cette tendance comme une accélération plutôt que comme une simple automatisation. Une mise en œuvre plus rapide permet davantage d’expériences. Davantage d’expériences produisent des éléments supplémentaires, qui peuvent guider la conception de modèles et d’outils ultérieurs.

Les propres données de l’entreprise restent la principale source de ces affirmations. Aucun auditeur externe n’a reproduit ses étiquettes de tâches internes, ses jugements de réussite ou ses calculs de productivité. Les lecteurs devraient considérer la tendance rapportée comme un élément significatif, et non comme une loi du progrès établie de manière indépendante.

Même avec cette limite, il est difficile d’écarter la direction prise. Claude est passé de la suggestion d’extraits à l’édition de dépôts, à l’utilisation d’outils, au débogage de systèmes en direct et à l’exécution de boucles expérimentales. Chaque étape transfère une autre partie du développement de l’IA de l’exécution manuelle à une délégation supervisée.

Le véritable goulot d’étranglement passe de l’exécution au jugement

Claude réduit le coût de la recherche, mais n’a pas supprimé la nécessité de décider quelle recherche mérite d’être menée.

Les preuves les plus solides d’Anthropic concernent l’exécution. Donnez à Claude un objectif mesurable, l’accès aux outils pertinents et un moyen de tester les résultats, et le modèle peut explorer de nombreuses solutions possibles. Cela transforme la mise en œuvre de la recherche en un processus itératif plus rapide.

Le problème le plus difficile est la définition de l’orientation. Les chercheurs doivent choisir les questions qui font progresser les capacités, améliorent la sécurité ou résolvent des incertitudes importantes. Ils doivent aussi reconnaître les benchmarks trompeurs, les évaluations contaminées et les solutions qui ne fonctionnent que dans des conditions restreintes.

Anthropic décrit le jugement de recherche comme un avantage humain persistant. Cela comprend la sélection de problèmes utiles, la décision de savoir quelles preuves sont crédibles et l’abandon d’approches qui ont atteint une impasse. Ces choix façonnent l’ensemble du processus de développement.

L’entreprise a testé la capacité de Claude à recommander de meilleures étapes suivantes lors d’enquêtes réalistes. Les chercheurs ont sélectionné 129 moments où un humain avait emprunté un détour improductif au cours de travaux antérieurs. Différents modèles Claude ont ensuite proposé ce qui devait se passer ensuite.

Un modèle Claude distinct a comparé ces recommandations au résultat final. Opus 4.5 d’Anthropic aurait surpassé le choix humain initial dans 51 % des cas en novembre 2025. Mythos Preview a atteint 64 % en avril 2026.

Le résultat suggère une amélioration du jugement tactique, mais n’établit pas une direction de recherche indépendante. Anthropic a délibérément sélectionné des moments où la décision humaine initiale pouvait être améliorée. Un modèle ayant accès à la session achevée a également servi d’évaluateur.

L’expérience mesure donc la capacité de Claude à naviguer parmi certains points de décision. Elle ne montre pas que Claude peut définir un programme de recherche, reconnaître ses conséquences plus larges ou décider quand un nouveau modèle doit être déployé.

Un projet distinct a testé une autonomie plus large dans la recherche sur la sécurité de l’IA. Plusieurs agents Claude ont étudié la possibilité qu’un modèle plus faible puisse superviser un modèle plus fort. Ils ont généré des hypothèses, mené des expériences, partagé leurs résultats et ajusté leur approche.

Anthropic indique que deux chercheurs humains ont comblé environ 23 % de l’écart entre supervision faible et forte sur une période d’environ une semaine. Les agents ont comblé 97 % de cet écart grâce à 800 heures cumulées de travail et à d’importantes ressources informatiques.

L’entreprise a toutefois identifié d’importantes contraintes. Les humains ont choisi la question et conçu le système de notation. Le résultat ne s’est pas transféré proprement aux modèles à l’échelle de la production. Ces réserves distinguent une boucle expérimentale impressionnante d’une découverte scientifique autonome.

Le même schéma apparaît dans l’usage quotidien de Claude Code. L’analyse d’utilisation d’Anthropic a révélé que les utilisateurs prennent environ 70 % des décisions de planification au cours d’une session typique. Claude prend environ 80 % des décisions d’exécution.

Cette répartition décrit plus clairement la situation que l’expression « l’IA se construit elle-même ». Les humains décident généralement de ce qui doit se produire. Claude décide de plus en plus de la manière d’exécuter l’instruction, parfois au moyen de longues chaînes de lecture de fichiers, de modifications de code, de tests et d’exécution de commandes.

L’expertise métier demeure importante, car quelqu’un doit reconnaître un résultat plausible mais incorrect. Un comptable peut orienter un script de rapprochement en comprenant les règles comptables. Un ingénieur infrastructure peut déterminer si une correction proposée crée un risque opérationnel inacceptable.

À mesure que l’exécution devient moins coûteuse, le jugement gagne en valeur. Les chercheurs peuvent superviser davantage d’expériences, mais ils doivent aussi évaluer davantage de résultats. Le goulot d’étranglement se déplace au lieu de disparaître.

Ce changement affecte la manière dont les équipes techniques organisent leur travail. L’écriture du code devient une part plus réduite du métier. La spécification, la revue, la conception des systèmes, la vérification et la responsabilité occupent une place plus importante.

Les propres évaluations de recrutement d’Anthropic ont rencontré cette transition. L’entreprise affirme que ses ingénieurs performance continuent de gérer les décisions de débogage et de conception difficiles, même lorsque Claude résout les tests de programmation conventionnels. Ses résultats d’évaluation montrent que les évaluations représentatives deviennent plus difficiles lorsque l’IA peut accomplir les parties mécaniques.

Le défi pratique consiste à préserver l’expertise lorsque les personnes réalisent moins directement l’implémentation. Les relecteurs doivent conserver une compréhension suffisante pour détecter les erreurs cachées. Pourtant, une délégation constante peut réduire l’expérience pratique qui permet de développer cette compréhension.

C’est l’aspect humain non résolu de l’auto-amélioration d’Anthropic Claude. Un modèle plus rapide peut élargir ce que chaque chercheur supervise. Il peut également rendre les systèmes de recherche plus difficiles à comprendre entièrement pour une seule personne.

L’affirmation d’Anthropic met la pression sur chaque laboratoire d’IA de pointe

Si les mesures d’Anthropic sont directionnellement correctes, les laboratoires concurrents doivent égaler à la fois cette accélération et la transparence qui l’entoure.

OpenAI, Google DeepMind, Meta et d’autres développeurs de pointe utilisent des outils de programmation par IA en interne. Leurs méthodes précises et leurs niveaux de délégation diffèrent, mais tous font face à la même incitation concurrentielle. Un laboratoire qui mène davantage d’expériences utiles peut améliorer ses modèles plus rapidement.

La contribution rapportée de Claude donne à Anthropic un avantage potentiel de rétroaction. De meilleurs modèles accomplissent davantage de travail d’ingénierie. Ce travail améliore l’infrastructure et l’expérimentation, ce qui aide à produire le modèle suivant.

Le processus n’a pas besoin d’une autonomie complète pour avoir une importance concurrentielle. Les chercheurs humains peuvent continuer à choisir les objectifs tandis que l’IA multiplie leur capacité d’exécution. Anthropic qualifie cela d’accélération cumulative, même en l’absence d’une boucle d’auto-amélioration entièrement fermée.

Cette dynamique pousse les concurrents à déployer des agents de manière plus agressive. Attendre une fiabilité parfaite a un coût d’opportunité lorsqu’une autre entreprise peut tester davantage d’idées, réparer l’infrastructure plus vite et réduire le délai entre les générations de modèles.

La course qui en résulte crée un problème de gouvernance. Chaque laboratoire contrôle les preuves internes montrant dans quelle mesure le développement des modèles a été automatisé. Les observateurs extérieurs ne peuvent pas facilement comparer la « collaboration », le « leadership », la réussite des tâches, la qualité du code ou la productivité des chercheurs entre les entreprises.

Anthropic a exhorté les autres développeurs à publier des mesures comparables. L’entreprise soutient que des méthodes communes aideraient le public à comprendre à quel point les laboratoires se rapprochent de l’auto-amélioration récursive. Des rapports réguliers pourraient également révéler si les courbes de croissance actuelles se poursuivent ou s’aplatissent.

L’annonce rapportée est intervenue alors que les dirigeants d’Anthropic appelaient également à ralentir le développement des systèmes de pointe. Cette combinaison crée une contradiction inévitable.

Anthropic accélère ses propres recherches avec Claude tout en avertissant que cette accélération pourrait devenir difficile à contrôler. La pression concurrentielle aide à expliquer pourquoi l’entreprise ne cesse pas simplement d’utiliser cette technologie.

Une retenue unilatérale pourrait laisser un laboratoire prudent à la traîne sans ralentir le secteur dans son ensemble. Des normes coordonnées pourraient réduire ce désavantage, mais elles exigent un accord entre des entreprises et des gouvernements aux intérêts économiques et stratégiques différents.

Cette divulgation sert donc plusieurs objectifs. Elle informe le public, renforce l’argument de sécurité d’Anthropic et fait la promotion des capacités de Claude. Ces objectifs peuvent coexister, mais les lecteurs devraient reconnaître chacun d’entre eux.

Les concurrents ont également des raisons de contester le cadrage d’Anthropic. Une forte part de code rédigé par l’IA ne mesure pas directement l’intelligence du modèle. Le volume de code indique peu si Claude a formulé une idée de recherche précieuse ou s’il a simplement implémenté une spécification détaillée.

Les différents laboratoires peuvent catégoriser le travail différemment. Une entreprise peut qualifier une session de débogage menée par un agent de leadership de recherche. Une autre peut considérer la même tâche comme un outil d’ingénierie utilisé par un chercheur humain.

Une norme de mesure partagée devrait distinguer la planification, l’exécution, la vérification et l’autorisation. Elle nécessiterait également un audit indépendant. Sans ces contrôles, les entreprises pourraient publier des pourcentages impressionnants qui resteraient impossibles à comparer.

La pression plus large dépasse les laboratoires de modèles. Les responsables de l’ingénierie en entreprise se demanderont si le flux de travail interne d’Anthropic s’applique à eux. Beaucoup mettront en place des systèmes similaires reliant des agents de programmation aux dépôts, aux tests, aux outils de déploiement et aux données opérationnelles.

La réponse dépend de la qualité de la vérification. Anthropic construit des modèles et emploie des spécialistes capables d’examiner des défaillances inhabituelles. Une entreprise sans expertise comparable peut automatiser la production de code plus vite qu’elle n’améliore sa capacité à évaluer ce code.

Les résultats générés par l’IA peuvent donc accentuer les écarts entre les organisations. Les équipes disposant de tests solides, d’une bonne documentation, d’une observabilité efficace et de pratiques de revue rigoureuses peuvent déléguer plus sûrement. Les équipes aux fondations fragiles risquent de produire des erreurs à plus grande vitesse.

C’est aussi pourquoi un contexte institutionnel consultable est important. Un agent a besoin d’accéder aux exigences, aux décisions antérieures et aux contraintes techniques. Une base de connaissances IA bien entretenue peut aider les personnes à examiner le raisonnement entourant le travail délégué, même si elle ne peut remplacer la validation technique.

Pour les acheteurs en entreprise, l’annonce d’Anthropic n’est pas une instruction visant à tout automatiser. Elle montre que le développement assisté par IA passe des suggestions individuelles à des flux de travail supervisés. La question concurrentielle porte sur le niveau de responsabilité qu’une organisation peut vérifier, et non seulement sur ce qu’elle peut déléguer.

Ce que les chiffres d’Anthropic ne prouvent toujours pas

Anthropic a montré une assistance en forte expansion, mais n’a pas démontré qu’un modèle conçoit, entraîne et approuve indépendamment son successeur.

L’expression « se construire lui-même » condense plusieurs activités distinctes. Écrire du code applicatif diffère du choix d’une architecture de modèle. Exécuter une expérience diffère de la décision de savoir si son résultat justifie un investissement majeur dans l’entraînement.

Selon Anthropic, Claude accomplit un travail significatif sur l’ensemble de ce spectre. Toutefois, les humains continuent de fournir les objectifs, les critères d’évaluation, l’accès à l’infrastructure et l’autorité de publication. Ces contrôles empêchent le processus actuel d’être considéré comme une auto-amélioration récursive complète.

La qualité des mesures constitue une autre préoccupation. La plupart des chiffres centraux proviennent des systèmes internes d’Anthropic. L’entreprise a créé les catégories de tâches, collecté les sessions et évalué de nombreux résultats à l’aide de juges basés sur Claude.

Les juges modèles peuvent traiter de grands ensembles de données de façon cohérente, mais ils peuvent hériter des angles morts des systèmes qu’ils évaluent. Une session peut sembler réussie parce que les tests ont été validés, tout en introduisant des problèmes de maintenance, de sécurité ou d’architecture hors du périmètre des tests.

La paternité du code est tout aussi ambiguë. Claude peut générer un fichier entier après une planification humaine approfondie. À l’inverse, un chercheur peut fournir un objectif succinct tandis que le modèle détermine l’implémentation. Les deux fichiers sont comptés comme rédigés par l’IA, bien qu’ils représentent des niveaux d’indépendance différents.

Le chiffre d’une production multipliée par huit mesure également le code fusionné, et non une valeur économique vérifiée. Un ingénieur qui génère davantage de code peut résoudre davantage de problèmes. Ce même ingénieur peut aussi créer davantage de travail de revue et des systèmes plus vastes dont la maintenance devient coûteuse.

La recherche indépendante fournit un contexte utile sans résoudre les affirmations internes d’Anthropic. Un article de travail de 2026 a étudié 7,8 millions de commits coécrits avec Claude et un panel de 5 838 développeurs. L’étude a associé l’adoption à un travail couvrant davantage de dépôts et de technologies.

Son étude sur les développeurs suggère que les agents de programmation peuvent élargir l’éventail des tâches que les personnes tentent d’accomplir. Cependant, l’activité publique sur GitHub ne mesure pas la recherche interne d’Anthropic sur les modèles et ne prouve pas une amélioration récursive.

La fiabilité varie également selon la tâche. Les problèmes structurés disposant de tests clairs favorisent l’itération automatisée. Les questions de recherche ouvertes manquent souvent d’un score objectif, ce qui permet à des conclusions plausibles mais faibles de subsister plus longtemps.

La capacité de calcul et l’infrastructure physique imposent d’autres limites. Des agents plus rapides peuvent proposer et exécuter davantage d’expériences, mais l’entraînement de modèles de pointe exige des puces, de l’énergie, de la capacité réseau et des données soigneusement gérées. L’intelligence n’est pas la seule ressource rare.

La revue humaine peut devenir un goulot d’étranglement à mesure que la production augmente. Si Claude génère des changements plus rapidement que les spécialistes ne peuvent les examiner, Anthropic doit soit ralentir le déploiement, soit s’appuyer plus fortement sur l’évaluation automatisée.

Cela crée un problème circulaire de vérification. Claude écrit le code, un autre Claude le révise, et des systèmes fondés sur Claude jugent si les tâches ont réussi. Les spécialistes humains restent le dernier filet de sécurité, mais leur visibilité peut diminuer à mesure que la chaîne automatisée s’allonge.

La sécurité augmente les enjeux. Un agent disposant d’un accès aux dépôts, aux clusters et aux commandes peut résoudre des problèmes opérationnels difficiles. Ce même accès accroît les conséquences d’un raisonnement défectueux, d’un contexte compromis ou d’instructions manipulées.

Les organisations qui adoptent des flux de travail similaires ont besoin d’autorisations limitées, de journaux complets, de tests reproductibles et de voies d’escalade claires. Elles ont également besoin de personnes qui restent responsables des changements en production, quelle que soit la personne ayant généré le code.

Anthropic ne prétend pas que Claude a franchi le seuil de l’autonomie. Son argument le plus défendable est que la distance se réduit. L’exécution en ingénierie est devenue fortement automatisée, tandis que le jugement de recherche montre des progrès précoces mais limités.

Cette affirmation est suffisamment importante sans exagération. Un système n’a pas besoin de devenir un scientifique indépendant avant de modifier la vitesse et l’économie du développement de l’IA.

Trois signaux montreront si la boucle se referme réellement

La prochaine étape dépend de changements mesurables dans le leadership de recherche, la validation indépendante et le contrôle humain des décisions aux conséquences importantes.

Le premier signal est la part de Claude dans le leadership de la recherche et du développement des modèles. Anthropic a rapporté une hausse de zéro en février à 26 % en août 2026. Les futures divulgations devront indiquer si cette courbe se poursuit, plafonne ou s’inverse.

Une hausse continue renforcerait l’hypothèse d’une accélération cumulative, en particulier si les tâches deviennent moins spécifiées. Un plateau suggérerait que l’implémentation s’est améliorée plus rapidement que le jugement de recherche. Un recul pourrait indiquer des changements de mesure, des missions plus difficiles ou des problèmes de fiabilité.

La définition du leadership doit rester stable. Dans le cas contraire, un pourcentage plus élevé pourrait refléter un reclassement du travail plutôt qu’une plus grande indépendance. Anthropic devrait publier des exemples couvrant l’ingénierie, l’expérimentation, l’interprétation et la planification stratégique.

Le deuxième signal est la réplication indépendante. Des évaluateurs externes doivent pouvoir accéder à des tâches représentatives, à des critères de notation et aux résultats, sans recevoir de secrets sensibles liés au développement des modèles. Des tests comparables entre laboratoires seraient plus instructifs que des pourcentages publiés isolément par les entreprises.

La réplication devrait examiner la qualité du code dans le temps, et pas uniquement l’achèvement des tâches. Elle devrait mesurer les défauts, les problèmes de sécurité, la charge de maintenance et la fréquence des interventions humaines. Les tâches de recherche devraient vérifier si les agents choisissent des orientations productives avant de connaître les résultats finaux.

Des preuves indépendantes renforceraient ou affaibliraient le récit d’Anthropic. Des résultats similaires entre différents évaluateurs et environnements étayeraient l’idée d’un vaste changement de capacités. Des écarts importants montreraient que les flux de travail internes ou les choix d’évaluation expliquent une grande part des performances rapportées.

Le troisième signal concerne la manière dont Anthropic gère la supervision humaine à mesure que la production augmente. L’entreprise reconnaît déjà que la revue peut devenir un goulot d’étranglement. Sa réponse révélera si les personnes conservent un contrôle réel ou si elles approuvent de plus en plus les décisions au moyen de synthèses automatisées.

Surveillez les changements concernant les exigences de revue, les contrôles d’accès, les procédures de déploiement et le signalement des incidents. Observez également si Claude commence à choisir des objectifs de recherche plutôt qu’à se limiter à leur mise en œuvre.

Une véritable fermeture de la boucle exigerait davantage qu’un pourcentage plus élevé de paternité du code. Claude devrait proposer des pistes de recherche utiles, concevoir des évaluations crédibles, interpréter des preuves ambiguës et améliorer son successeur avec une orientation humaine limitée.

Même dans ce cas, l’autorisation reste distincte de la capacité. Un modèle pourrait devenir techniquement capable de diriger davantage de recherche tout en laissant Anthropic préserver délibérément l’approbation humaine. Les choix de gouvernance détermineront si une autonomie potentielle devient une autonomie opérationnelle.

Pour les développeurs, la leçon immédiate est concrète. Le développement logiciel se déplace vers la spécification, l’orchestration, les tests et la revue. Les ingénieurs qui comprennent profondément les systèmes peuvent déléguer davantage tout en sachant reconnaître les cas où la sortie assurée d’un agent est erronée.

Les acheteurs en entreprise devraient demander ce que les fournisseurs mesurent lorsqu’ils revendiquent un travail autonome. Les seuls taux d’achèvement ne suffisent pas. Les acheteurs ont besoin de preuves sur la supervision, les annulations, les défauts, l’auditabilité et la responsabilité après les échecs.

Les travailleurs du savoir connaissent une transition comparable. L’IA peut réaliser davantage d’exécution, mais les personnes ont toujours besoin d’un contexte fiable et d’un historique des décisions importantes. Les outils de knowledge blending deviennent utiles lorsqu’ils aident les utilisateurs à retracer les preuves plutôt qu’à simplement générer une réponse supplémentaire.

L’auto-amélioration d’Anthropic Claude est donc réelle dans un sens limité mais conséquent. Claude accélère déjà le travail d’ingénierie et d’expérimentation qui produit les modèles Claude ultérieurs. L’entreprise n’a pas démontré qu’un système autonome construisait indépendamment son successeur.

L’écart entre ces deux affirmations est là où se jouera le prochain chapitre. Suivez le pourcentage de leadership, exigez une validation indépendante et examinez qui prend encore les décisions irréversibles. Si ces trois signaux évoluent ensemble, « l’IA qui construit l’IA » décrira un système opérationnel plutôt qu’un titre accrocheur.

La question pour chaque organisation n’est plus de savoir si l’IA peut produire davantage de travail. Elle est de savoir si les personnes peuvent vérifier ce travail, préserver l’expertise nécessaire pour le remettre en question et rester responsables à mesure que la chaîne automatisée s’étend.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page