top of page

Le Qwen3.7-Max d'Alibaba a mené une session de codage autonome de 35 heures

13 août
15 min de lecture

Alibaba a lancé Qwen3.7-Max après qu'un test de codage autonome de 35 heures a transformé une brève habituelle de Google News en défi direct pour les équipes logicielles. Le modèle aurait exécuté 1 158 appels d'outils et testé 432 variantes de kernel sans intervention humaine. Alibaba affirme que le code obtenu s'exécutait dix fois plus vite que l'implémentation de référence.

Le titre ressemble à un nouvel avertissement selon lequel l'IA s'apprête à remplacer les emplois d'ingénierie. Pourtant, l'interprétation la plus utile va dans le sens opposé. Qwen3.7-Max n'a pas produit une application jetable à partir d'un court prompt. Il a passé des heures à mesurer, déboguer, réviser et valider du code très spécialisé.

Cette distinction met Anthropic, DeepSeek, Moonshot AI, Zhipu AI et les équipes logicielles d'entreprise sous pression. La compétition ne porte plus seulement sur le modèle qui répond correctement à une question de programmation. Elle concerne désormais celui qui peut rester productif dans un flux de travail long et sujet aux échecs.

Alibaba a fourni des éléments impressionnants, mais n'a pas tranché le débat. La plupart des chiffres de performance proviennent de l'entreprise ou de benchmarks créés par l'équipe Qwen. Des équipes indépendantes devront reproduire les résultats avant que les acheteurs ne les considèrent comme des garanties opérationnelles fiables.

Ce que le Qwen3.7-Max d'Alibaba a réellement changé

Le changement important n'est pas que Qwen3.7-Max écrit du code, mais qu'il aurait maintenu un cycle d'ingénierie mesurable pendant 35 heures.

Alibaba a présenté Qwen3.7-Max le 20 mai 2026, lors de son sommet cloud à Hangzhou. Ce modèle propriétaire cible les charges de travail agentiques, c'est-à-dire les tâches où le logiciel choisit des actions, appelle des outils, observe les résultats et révise son approche.

Cette orientation diffère du modèle familier du chatbot. Un chatbot reçoit souvent un prompt et renvoie une réponse. Un agent doit conserver son objectif tout en naviguant entre erreurs, informations incomplètes, état changeant et utilisation répétée d'outils.

Alibaba a testé cette capacité sur un kernel d'attention pour SGLang, un système open source utilisé pour servir des modèles de langage. Un kernel est un programme de bas niveau qui effectue un calcul précis sur du matériel. De petites améliorations peuvent affecter la vitesse et le coût de chaque requête de modèle utilisant cette opération.

Le matériel visé était une instance cloud équipée d'accélérateurs T-Head Zhenwu M890 d'Alibaba. Selon l'entreprise, Qwen3.7-Max n'avait pas rencontré cette architecture de puce durant son entraînement. Il n'a reçu ni documentation matérielle, ni historique de mesures, ni exemple d'implémentation optimisée.

Le modèle a commencé avec une version de référence écrite en Triton, un langage de programmation destiné au développement de kernels GPU hautes performances. Il a ensuite compilé des alternatives, mesuré leurs performances, identifié les défaillances et modifié le code.

L'expérience de 35 heures a impliqué 432 tests de kernel et 1 158 appels d'outils. Alibaba affirme que l'implémentation finale a offert une accélération moyenne d'un facteur dix par rapport à la référence initiale.

Ces détails comptent davantage qu'un seul score de benchmark. Le modèle devait relier un objectif à une longue série d'actions. Il devait aussi se rétablir lorsque les résultats de compilation ou de performance contredisaient ses choix précédents.

La tâche conservait néanmoins des limites favorables. Alibaba contrôlait le modèle, la puce, l'environnement cloud et une grande partie du processus d'évaluation. L'entreprise pouvait concevoir la configuration autour d'une infrastructure qu'elle connaissait bien, même si le modèle n'avait pas été entraîné sur cette architecture précise.

Toutefois, cette session représente un test plus exigeant que demander à un modèle de compléter une fonction isolée. Elle ressemble à un flux d'optimisation d'ingénieur, où les progrès dépendent d'expériences répétées plutôt que d'une réponse mémorisée.

Alibaba transforme également cette orientation agentique en stratégie commerciale plus large. Son annonce cloud présente Qwen3.7-Max comme un modèle conçu pour des opérations soutenues et en plusieurs étapes, dans le codage comme dans le travail de bureau.

Le modèle prend en charge des interfaces compatibles avec les outils OpenAI et Anthropic. Alibaba indique que les développeurs peuvent le connecter à des environnements d'agents tels que Claude Code, OpenClaw, Qwen Code, Hermes Agent et Qoder.

Cette compatibilité réduit l'importance de toute application de chat prise isolément. Les entreprises peuvent tester le modèle sous-jacent au sein d'un harness d'agent existant, le logiciel environnant qui gère les outils, les autorisations, le contexte et l'exécution.

C'est pourquoi cette histoire a dépassé la couverture spécialisée pour apparaître dans Google News. Alibaba ne revendique pas simplement un meilleur assistant. L'entreprise présente le modèle comme un opérateur capable de rester au sein d'un processus d'ingénierie jusqu'à ce que celui-ci produise un résultat validé.

Pourquoi la session de 35 heures met les agents de codage sous pression

Qwen3.7-Max élève le standard concurrentiel, de la génération de code plausible au maintien d'une dynamique utile à travers des centaines de décisions.

Les modèles de codage se sont rapidement améliorés dans les tests mesurant la capacité d'un système à résoudre un problème logiciel défini. Ces évaluations restent utiles, mais elles compressent le travail d'ingénierie en une tâche nette dotée d'une ligne d'arrivée identifiable.

Le travail en production est moins ordonné. Les dépôts contiennent des dépendances non documentées, des exigences contradictoires, des tests intermittents et des décisions dont les conséquences n'apparaissent que beaucoup plus tard. Un modèle peut écrire un patch impressionnant tout en laissant à un humain davantage de nettoyage que le problème initial n'en exigeait.

L'expérience d'Alibaba s'attaque à une partie de cette faiblesse. Son affirmation centrale concerne l'endurance face au retour d'information. Qwen3.7-Max n'avait pas besoin que chaque action réussisse, car la boucle de mesure lui permettait de corriger les tentatives infructueuses.

Ce schéma ressemble davantage à la méthode scientifique qu'à l'autocomplétion. Le modèle a proposé une modification, mené une expérience, examiné le résultat et généré un autre candidat. La valeur venait de l'ensemble de la boucle, non d'une réponse particulièrement astucieuse.

Alibaba a fait état d'écarts importants entre Qwen3.7-Max et plusieurs concurrents sur la même tâche de kernel. L'entreprise affirme que GLM-5.1 a atteint une accélération d'un facteur 7,3, Kimi K2.6 d'un facteur cinq et DeepSeek V4 Pro d'un facteur 3,3. Qwen3.6-Plus aurait atteint un facteur 1,1.

Ces comparaisons doivent rester provisoires. Alibaba a choisi la tâche, configuré les agents et communiqué les résultats. Des changements dans le prompting, les limites d'outils, les règles d'arrêt ou l'allocation de calcul peuvent fortement influencer une évaluation d'agent.

Anthropic demeure un point de référence crucial. Sur KernelBench L3, Alibaba affirme que Qwen3.7-Max a généré avec succès des kernels accélérés dans 96 % des cas. Claude Opus 4.6 aurait atteint 98 % selon la comparaison du fournisseur.

Le tableau général des benchmarks est contrasté plutôt qu'univoque. Qwen3.7-Max aurait obtenu 80,4 sur SWE-bench Verified, contre 80,8 pour Claude Opus 4.6 Max et 80,6 pour DeepSeek V4 Pro Max.

Alibaba reconnaît également des domaines où Claude menait dans sa comparaison. Il s'agissait notamment de NL2Repo, ClawEval et CoWorkBench. Cela rend la compétition réelle moins spectaculaire, mais plus pertinente pour les acheteurs qui sélectionnent des modèles autour de flux de travail précis.

La pression s'exerce donc sur chaque fournisseur de modèles formulant de vastes promesses sur les agents. Les clients demanderont de plus en plus combien de temps un agent reste efficace, à quelle fréquence il doit être secouru et si son travail résiste à une revue indépendante.

Un score élevé sur un benchmark court ne peut répondre à ces questions. Une démonstration soignée non plus. Les entreprises ont besoin de distributions sur des exécutions répétées, y compris les échecs, les taux de récupération, le temps d'intervention et la qualité des artefacts finaux.

Ce nouveau standard met également sous pression les développeurs de plateformes d'agents. Le modèle n'est qu'un composant d'un système opérationnel. La conception des outils, la gestion du contexte, l'observabilité, les limites d'autorisation et les validateurs déterminent si une autonomie prolongée produit des progrès ou des dégâts prolongés.

La méthode d'entraînement d'Alibaba reflète cette vision à l'échelle du système. L'équipe Qwen sépare chaque exercice en une tâche, un environnement d'outils et un validateur. Les chercheurs peuvent recombiner ces éléments afin de décourager les stratégies qui ne fonctionnent que dans une configuration familière.

Un validateur vérifie si le résultat satisfait l'objectif visé. Cette fonction devient essentielle lors de longues sessions, car un modèle sûr de lui pourrait autrement optimiser la mauvaise métrique pendant des heures.

Alibaba affirme que Qwen3.7-Max a maintenu des résultats plus cohérents sur OpenClaw, Claude Code et Hermes que son prédécesseur. Si des tests indépendants confirment ce résultat, cela réduirait le travail requis lorsque les organisations changent de frameworks d'agents.

Pour les responsables d'ingénierie, la cohérence peut compter davantage que la première place dans les classements. Un modèle légèrement moins performant mais au comportement prévisible entre les outils peut être plus facile à gouverner qu'un meilleur score dont les performances changent avec chaque harness.

Tel est le message concurrentiel sous le titre de Google News. Alibaba demande aux acheteurs de juger les modèles comme des opérateurs persistants intégrés à des systèmes, et non comme des générateurs isolés attendant dans des onglets de navigateur.

Le travail que Qwen prend en charge est la boucle d'expérimentation répétitive

Le déplacement le plus crédible à court terme concerne les itérations d'ingénierie répétitives, tandis que les humains conservent la responsabilité des objectifs, des contraintes et des conséquences.

L'expression « prendre votre emploi » regroupe de nombreuses activités différentes en une prédiction dramatique. L'ingénierie logicielle comprend la découverte produit, l'architecture, l'implémentation, les tests, la revue de sécurité, la réponse aux incidents, la négociation et la maintenance.

Qwen3.7-Max n'a pas assuré toutes ces fonctions. Il s'est attaqué à un objectif d'optimisation étroit dans un environnement instrumenté. Son résultat le plus fort est venu de la répétition d'une boucle que les machines peuvent exécuter plus vite et plus longtemps que les humains.

L'optimisation de kernels en est un bon exemple. Un ingénieur doit souvent essayer de nombreux choix d'implémentation, les évaluer, examiner les goulots d'étranglement et écarter la plupart des tentatives. Le travail exige de l'expertise, mais une grande partie de sa durée provient de l'expérimentation répétée.

Un agent qui automatise ces répétitions peut accroître la portée d'un spécialiste. Un ingénieur peut définir la cible, établir des tests de correction, superviser l'environnement et examiner un processus de recherche plus vaste qu'une personne ne pourrait mener manuellement.

Cette organisation transforme le métier sans éliminer la responsabilité. Quelqu'un doit toujours décider de ce que signifie « plus rapide », quelles tolérances numériques sont acceptables et si l'optimisation crée des problèmes de sécurité ou de maintenance.

Les échecs du modèle deviennent également une partie de la charge de travail d'ingénierie. Le code généré requiert une revue, tandis que les longues sessions autonomes nécessitent des journaux expliquant quels fichiers ont changé, quelles commandes ont été exécutées et quelles hypothèses ont façonné le résultat.

C'est ici que l'interprétation optimiste gagne en crédibilité. La recherche et la mesure fastidieuses peuvent être confiées à l'agent, laissant aux humains plus de temps pour la conception des systèmes et le jugement.

Toutefois, ce bénéfice n'est pas automatique. Les organisations peuvent utiliser les gains de productivité pour améliorer la qualité, entreprendre des travaux plus difficiles, réduire les effectifs ou relever les attentes de production. La technologie ne décide pas de la manière dont la direction répartit les gains.

Les développeurs doivent également distinguer l'automatisation des tâches du remplacement des professions. Un modèle peut automatiser une activité importante sans comprendre le contexte métier qui l'entoure. Les employeurs peuvent néanmoins réorganiser les rôles si suffisamment d'activités deviennent automatisables.

La transition sera probablement inégale. Les équipes travaillant dans des dépôts bien testés tireront davantage parti des agents, car les validateurs peuvent détecter rapidement les régressions. Les systèmes mal documentés offrent un retour d’information plus faible ; un agent peut donc produire des modifications plausibles mais dommageables.

Les travaux d’infrastructure spécialisés pourraient devenir plus accessibles. Un développeur sans années d’expérience du kernel pourrait utiliser un agent pour explorer des options d’implémentation, à condition qu’un réviseur qualifié vérifie la justesse et le comportement matériel.

Cela ne rend pas l’expertise inutile. Cela peut rendre la revue experte plus précieuse, car les agents génèrent davantage de travaux potentiels que les équipes n’avaient auparavant le temps d’essayer.

La gestion des connaissances devient également plus importante pendant cette transition. Un agent doit avoir accès aux exigences, aux décisions passées, aux runbooks et aux contraintes s’il doit agir au-delà d’un benchmark circonscrit.

Les équipes peinent déjà à rendre ce contexte consultable par les ingénieurs humains. Une base de connaissances techniques maintenue peut aider les personnes à vérifier ce qu’un agent a utilisé et à identifier les informations manquantes avant l’exécution.

Le travail évolue encore lorsque les agents interviennent dans les tâches de bureau. Alibaba affirme que Qwen3.7-Max peut coordonner des projets multi-fichiers et des workflows impliquant des outils externes. Ces affirmations étendent le modèle au-delà de la génération de code, jusque dans les processus opérationnels.

Le rapport annuel explicite l’ambition d’Alibaba. Les dirigeants de l’entreprise s’attendent à ce que les agents réalisent une part croissante du travail numérique et deviennent une interface principale entre les personnes et les logiciels.

Cette vision d’entreprise doit être lue comme une stratégie, et non comme une prévision établie de manière indépendante. Alibaba vend des modèles, de la capacité cloud, des puces et des plateformes d’agents. Une adoption plus large des agents soutient directement chacune de ces activités.

L’entreprise construit néanmoins autour d’une thèse cohérente. Les modèles génèrent des actions, les actions consomment des ressources cloud, et Alibaba fournit l’infrastructure qui les sous-tend. Qwen sert donc à la fois de produit et de moteur de demande pour le reste de la pile.

Pour les développeurs, la réponse pratique n’est pas de rivaliser avec la patience d’un agent. Il s’agit d’améliorer les compétences qui déterminent si le travail de l’agent mérite d’être livré.

Ces compétences comprennent la rédaction d’exigences exécutables, la construction de tests pertinents, la conception de limites d’autorisation, la revue des modifications générées et la capacité à reconnaître quand le modèle a optimisé la mauvaise cible.

Une exécution de 35 heures est impressionnante parce que peu de personnes souhaitent répéter une expérience contrainte aussi longtemps. Elle ne devient menaçante que lorsque les organisations confondent persistance et responsabilité complète de l’ingénierie.

Ce que les titres de Google News ne prouvent pas

Alibaba a présenté une expérience convaincante menée par l’entreprise, et non une mesure universelle du développement logiciel autonome.

La principale limite est la concentration des sources. Alibaba a fourni le modèle, le matériel, les conditions de benchmark, les affirmations de performance et de nombreux résultats concurrents. The Decoder note à juste titre que plusieurs benchmarks cités ont été créés par l’équipe Qwen.

Les benchmarks maison ne sont pas intrinsèquement invalides. Les développeurs de modèles créent souvent des tests parce que les évaluations établies ne capturent plus les nouvelles capacités. Le risque apparaît lorsque ces tests sont utilisés comme preuve générale sans réplication externe.

L’expérience sur le kernel ne comporte pas non plus l’incertitude présente dans de nombreux environnements de production. Elle disposait d’une cible mesurable, de code exécutable, de matériel accessible et d’une boucle de retour resserrée. Ces conditions rendent l’itération autonome exceptionnellement praticable.

Une exigence produit telle que « rendre l’onboarding plus facile » n’offre pas de retour comparable. Elle requiert de la recherche utilisateur, du jugement de conception, des considérations juridiques et des choix entre des objectifs concurrents.

Une longue durée d’exécution peut aussi amplifier les erreurs. Un modèle bénéficiant d’un accès excessif peut modifier davantage de fichiers, consommer plus de ressources, exposer des informations sensibles ou créer des dépendances à partir d’une prémisse erronée.

Le nombre d’appels d’outils ne mesure pas la valeur à lui seul. Un agent réalisant 1 158 actions rigoureuses peut surpasser une exécution plus courte. Il peut aussi masquer une inefficacité si un autre système atteint le même résultat avec moins d’opérations.

Les équipes ont donc besoin de métriques de résultat associées à des métriques opérationnelles. Elles devraient mesurer la justesse, le temps de revue, la fréquence des retours en arrière, les constats de sécurité et l’effort humain requis avant le déploiement.

L’affirmation d’Alibaba selon laquelle Qwen3.7-Max n’aurait jamais vu l’architecture Zhenwu M890 pendant l’entraînement est également difficile à auditer pour les observateurs extérieurs. Les jeux de données d’entraînement des modèles propriétaires de pointe sont rarement disponibles pour une inspection complète.

Le modèle a bien reçu une implémentation de référence, et cet artefact contient des informations substantielles sur le calcul. Il a donc commencé sans documentation, mais pas sans point de départ techniquement significatif.

Les comparaisons avec les concurrents appellent une prudence similaire. Le résultat d’un agent dépend de son harnais, de ses prompts, de ses interfaces d’outils, de l’allocation de contexte et de sa politique d’arrêt. Une évaluation neutre doit fournir à chaque modèle une configuration adaptée à ses forces.

La même préoccupation s’applique à la cohérence entre différents harnais. Alibaba affirme que sa nouvelle approche d’entraînement a réduit les variations de performance entre différents environnements d’agents. Des chercheurs indépendants devraient répéter ces tests avec des dépôts publics et des règles d’évaluation fixes.

La sécurité présente une autre question non résolue. Un agent de codage exécuté sur une longue durée peut rencontrer des instructions malveillantes dans des dépôts, de la documentation, des systèmes de suivi des tickets ou les sorties d’outils. L’autonomie persistante augmente le temps et la surface disponibles pour la manipulation.

La conception des autorisations devient la défense pratique. Les équipes devraient accorder le minimum d’accès nécessaire à une tâche, isoler l’exécution, conserver des journaux complets et exiger une approbation avant que les modifications n’atteignent des systèmes sensibles.

La revue humaine reste nécessaire, mais elle doit être substantielle. Approuver un large patch après avoir parcouru un résumé ne constitue pas un contrôle significatif. Les réviseurs ont besoin de tests, de diffs, de provenance et de descriptions claires des incertitudes non résolues.

Alibaba a signalé un autre usage intrigant de Qwen3.7-Max pendant l’entraînement. Le modèle aurait surveillé des trajectoires d’ingénierie logicielle afin de détecter le reward hacking, qui se produit lorsqu’un modèle exploite une évaluation au lieu de résoudre le problème prévu.

Selon l’entreprise, l’agent a examiné 13 952 trajectoires sur 86 heures. Il a créé 13 règles de détection et signalé 1 618 cas suspects.

Cette application illustre à la fois la promesse et la circularité de l’évaluation des agents. Un modèle peut aider à identifier les comportements abusifs d’un autre, mais les chercheurs doivent toujours vérifier si ses détections étaient exactes.

Les faux positifs peuvent supprimer des exemples d’entraînement légitimes. Les faux négatifs peuvent récompenser des raccourcis qui apparaîtront ensuite comme d’impressionnantes performances de benchmark. L’agent de surveillance nécessite donc son propre processus d’audit.

Ces incertitudes n’effacent pas le résultat de 35 heures. Elles définissent ce que ce résultat peut étayer. Il constitue une preuve qu’un modèle de pointe peut soutenir une boucle d’optimisation spécialisée dans des conditions contrôlées.

Il ne prouve pas que Qwen3.7-Max peut maintenir de manière indépendante un système de production inconnu, interpréter des besoins ambigus des parties prenantes ou assumer la responsabilité d’un déploiement défaillant.

Les lecteurs arrivant depuis Google News devraient résister aux deux extrêmes. L’expérience est plus substantielle qu’une démonstration mise en scène de chatbot, mais plus limitée qu’un remplacement d’un département d’ingénierie.

Ce qu’il faut surveiller après le lancement de Qwen3.7-Max

Trois signaux indiqueront si Alibaba a livré une plateforme d’agents durable ou une démonstration exceptionnellement favorable.

Le premier signal est la réplication indépendante du résultat sur le kernel. Les chercheurs doivent avoir accès à la définition de la tâche, au code de départ, aux tests de justesse, aux conditions d’exécution, aux prompts, aux politiques d’outils et aux critères d’arrêt.

Une reproduction réussie sur du matériel non-Alibaba renforcerait l’affirmation centrale. Des échecs répétés ou une forte dépendance à une infrastructure privée en limiteraient la portée.

L’étude la plus utile comparerait plusieurs exécutions plutôt que de publier un seul meilleur résultat. Les systèmes d’agents peuvent varier fortement d’une tentative à l’autre ; les moyennes et les distributions d’échecs comptent donc davantage qu’une seule trajectoire réussie.

Le deuxième signal est la performance de Qwen3.7-Max au sein de vrais dépôts sur des périodes plus longues. Les entreprises devraient signaler la fréquence des interventions, les modifications acceptées, les modifications annulées, le temps de revue et les défauts détectés après le déploiement.

Alibaba cite des scores sur des benchmarks logiciels et d’agents, mais des études de cas publiques révéleraient si ces capacités résistent à des conditions organisationnelles désordonnées. Un déploiement utile devrait réduire l’effort humain total, et non simplement augmenter le volume de code généré.

Surveillez particulièrement les exemples impliquant de la maintenance. Construire un nouveau prototype autorise une grande liberté, tandis que maintenir un système existant exige une compatibilité avec les décisions passées et les contraintes opérationnelles.

Le troisième signal est la réponse des fournisseurs de modèles concurrents. Anthropic, DeepSeek, Moonshot AI et Zhipu AI sont désormais incités à publier des exécutions autonomes plus longues avec des règles d’évaluation plus claires.

La concurrence peut améliorer les preuves si les fournisseurs divulguent des tâches reproductibles et des cas d’échec. Elle peut les affaiblir s’ils se contentent d’augmenter les durées d’exécution et d’annoncer des victoires de benchmark sélectionnées par eux-mêmes.

L’infrastructure d’agents ultérieure d’Alibaba offre un autre indice sur son orientation. L’entreprise a introduit des outils pour tracer, évaluer, coordonner et gouverner plusieurs agents.

Cet investissement reconnaît une vérité centrale : l’intelligence du modèle seule ne crée pas un travailleur fiable. Les organisations ont besoin de contrôles qui révèlent ce qu’un agent a fait et permettent aux personnes d’intervenir avant que les dégâts ne se propagent.

Qwen3.7-Max reste également propriétaire via les services hébergés d’Alibaba, contrairement à certaines versions antérieures de Qwen. Ce choix donne à l’entreprise un plus grand contrôle sur le déploiement et relie plus étroitement l’usage à son activité cloud.

Il complique également l’inspection indépendante. Les chercheurs peuvent évaluer les sorties et le comportement, mais ne peuvent pas examiner pleinement les poids, le processus d’entraînement ou les changements de service derrière le modèle.

Alibaba fait face à un compromis stratégique. L’accès hébergé peut prendre en charge les mises à jour de sécurité et les opérations gérées. Les poids ouverts peuvent stimuler l’adoption chez les développeurs qui ont besoin de contrôle local, de personnalisation ou d’une évaluation technique plus approfondie.

La feuille de route Qwen plus large révélera comment l’entreprise équilibre ces objectifs. Alibaba a continué à publier certains modèles ouverts et composants d’infrastructure, tout en réservant ses systèmes Max les plus puissants à l’accès hébergé.

Pour les acheteurs d’entreprise, la question immédiate est plus limitée que celle de savoir quel laboratoire domine chaque benchmark. Ils doivent savoir si Qwen3.7-Max accomplit leur travail de manière fiable dans le cadre de leurs exigences de conformité, de données et de revue.

Un court pilote devrait utiliser un élément réel du backlog avec des critères d’acceptation mesurables. L’agent devrait fonctionner dans un environnement isolé, avec chaque appel d’outil journalisé et les actions sensibles bloquées.

Les équipes devraient comparer le temps total de réalisation à leur workflow actuel. Ce calcul doit inclure la préparation des prompts, la supervision, la revue de code, les tests, la remédiation et la documentation.

Les développeurs peuvent mener une expérience similaire sur une tâche interne à faible risque. Choisissez un travail comportant des tests répétitifs tout en exigeant encore du jugement. Consignez les points où le modèle progresse, bloque ou demande du contexte manquant.

L’objectif n’est pas de prouver qu’un agent peut remplacer quelqu’un. Il est de localiser la frontière entre une délégation productive et une supervision coûteuse.

Cette frontière se déplacera à mesure que les modèles s’améliorent. Elle différera également selon les dépôts, les organisations et les environnements réglementaires. Aucun titre de Google News ne peut la déterminer pour chaque équipe.

L'expérience d'Alibaba attire l'attention parce qu'elle montre un modèle persistant dans un véritable processus d'optimisation pendant 35 heures. L'aspect encourageant est que la cible était un travail technique répétitif, et non l'ensemble du rôle qui l'entoure.

La prochaine étape revient aux personnes appelées à utiliser ces systèmes. Mettez cette affirmation à l'épreuve dans votre propre travail, mesurez le coût complet de la supervision et demandez-vous quelles décisions doivent rester humaines. Si Qwen3.7-Max élargit de façon constante ce qu'un ingénieur consciencieux peut accomplir, le travail le plus important qu'il prendra pourrait être celui que cet ingénieur n'a jamais voulu répéter.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page