top of page

Les longs agents IA font grimper les coûts, et l’équation de la valeur se complique

Le 2 août, Google News a fait remonter un avertissement sans détour sur les longs agents IA : « Le compteur tourne. » Le titre figurait dans le numéro 1166 d’AI: Reset to Zero. Le conflit qu’il expose est clair : les agents travaillent plus longtemps, mais chaque étape de planification, appel d’outil, nouvelle tentative et évaluation consomme des ressources.

Cet avertissement intervient alors que les principales entreprises d’IA incitent leurs clients à dépasser les brefs échanges avec des chatbots. Google, Anthropic et OpenAI décrivent désormais des agents capables d’opérer entre plusieurs applications, de conserver l’état d’une tâche et de poursuivre leur travail après le départ de l’utilisateur.

Un fonctionnement plus long crée une nouvelle valeur, mais il modifie aussi la question d’achat. Les acheteurs doivent mesurer les résultats obtenus, plutôt que des démonstrations impressionnantes ou des appels de modèle isolés. L’enjeu central oppose désormais autonomie et responsabilité.

Cet enjeu compte parce que l’unité économique de l’IA évolue. Un chatbot produit une réponse qu’une personne examine immédiatement. Un agent peut, lui, lancer plusieurs processus, déléguer du travail, inspecter les résultats et répéter les étapes qui ont échoué.

Chaque action supplémentaire crée un point de plus où les coûts ou les erreurs peuvent se multiplier. Le compteur ne mesure pas la seule intelligence. Il enregistre tout ce que le système a tenté avant de fournir quelque chose d’utile.

Ce que signale réellement le titre de Google News

L’évolution importante n’est pas le titre d’une seule newsletter. C’est l’émergence des coûts d’exploitation des agents comme sujet technologique grand public.

Google News a agrégé l’article d’AI: Reset to Zero dans sa couverture des modèles d’IA. Ce placement ne signifie pas que Google cautionne l’argument de l’auteur. Google News est une surface de découverte et d’agrégation, pas l’éditeur d’origine.

Cette agrégation reste néanmoins importante, car elle montre quelles questions sortent des cercles de spécialistes. La consommation de tokens relevait auparavant surtout de la documentation d’API et des tableaux de bord d’ingénierie. Elle façonne désormais les discussions sur la planification des effectifs, les budgets logiciels et les achats d’entreprise.

Une autre newsletter, intitulée CO/AI, a utilisé la même métaphore du compteur dans son argument sur les coûts. Sa thèse était que l’intelligence subventionnée touche à sa fin, à mesure que l’usage de l’IA devient visible et mesurable. L’article présentait l’IA facturée à l’usage comme une comparaison économique avec le travail humain.

Cette comparaison est provocatrice, mais elle peut aussi induire en erreur. Un agent en fonctionnement n’est pas automatiquement l’équivalent d’un salarié. Il n’assume pas de manière autonome la responsabilité organisationnelle, ne comprend pas toutes les contraintes implicites et ne subit pas les conséquences d’une mauvaise décision.

Les agents dépendent également d’une infrastructure que les comparaisons avec le travail humain omettent souvent. Ils nécessitent des modèles, des intégrations d’outils, des contrôles d’identité, des accès aux données, de la supervision, des évaluations et des voies d’escalade. Un calcul sérieux doit inclure ces systèmes de soutien.

Le titre ne saisit donc que la première moitié de l’histoire. Oui, le compteur tourne. La question sans réponse est de savoir s’il mesure du travail productif, une exploration infructueuse, des efforts dupliqués, ou les trois à la fois.

Cette distinction sépare un agent utile d’une boucle coûteuse. Un système peut rester actif pendant des heures tout en produisant peu de valeur durable. Un autre peut effectuer une courte séquence d’actions vérifiées qui élimine des jours de coordination manuelle.

La durée seule ne prouve pas la productivité. Le volume de tokens ne prouve pas la qualité. Même une tâche achevée peut être économiquement négative si la vérification et la correction de son résultat exigent plus d’efforts que l’automatisation n’en a économisés.

Google News contribue à exposer cette tension à un public plus large. Le débat passe de la capacité des agents à réaliser de longues tâches à la capacité des organisations à les gouverner de façon économiquement viable.

Les longs agents IA deviennent de véritables workflows

Les agents de longue durée passent des démonstrations de laboratoire à des workflows qui se mettent en pause, reprennent et franchissent les frontières organisationnelles.

L’Agent Development Kit de Google illustre cette transition. Un guide sur les workflows d’agents publié en mai 2026 décrivait des processus capables de se poursuivre pendant des semaines tout en préservant leur état.

L’exemple portait sur l’intégration des employés. L’agent envoie des documents, attend des signatures, délègue le provisionnement informatique, suit la livraison du matériel et prépare le programme du premier jour.

Il ne s’agit pas d’une seule longue réponse de modèle. C’est un workflow durable composé de travail actif, d’état enregistré et de périodes d’inactivité. L’agent doit savoir ce qui est terminé, ce qui reste bloqué et quelle action nécessite une approbation.

Cette architecture modifie la manière de comprendre les coûts d’exploitation. Un agent qui attend une signature ne devrait pas consommer continuellement des ressources de modèle. Il devrait enregistrer son état, suspendre son exécution et reprendre après un événement vérifié.

Des agents mal conçus peuvent faire l’inverse. Ils peuvent interroger inutilement des systèmes, reconstruire leur contexte après chaque interruption ou demander à plusieurs reprises à un modèle d’interpréter des informations inchangées. Ces schémas transforment le temps écoulé en consommation évitable.

Le même problème apparaît dans le développement logiciel. Anthropic décrit des agents travaillant sur de nombreuses fenêtres de contexte, car les projets logiciels importants ne tiennent pas dans une seule session. Chaque nouvelle session exige un passage de relais fiable depuis la précédente.

Les recherches d’Anthropic sur les agents de longue durée utilisent un initialiseur et un processus de développement incrémental. Les agents laissent des artefacts qui expliquent le travail accompli et orientent les sessions ultérieures.

Ces artefacts ne sont pas une décoration administrative. Ils constituent un contrôle économique. Un registre clair des tâches réduit le risque qu’une nouvelle session répète des analyses, rouvre des décisions déjà tranchées ou reconstruise des composants déjà terminés.

Le travail de longue durée bénéficie aussi de tests explicites. Un agent de programmation a besoin d’un signal objectif indiquant si sa modification fonctionne. Sans ce signal, le modèle peut continuer à réviser une réponse correcte ou accepter avec assurance une réponse défaillante.

Le calcul scientifique fournit un autre cas concret. Anthropic a rapporté un projet de compilateur ayant fonctionné sur environ 2 000 sessions. Ses recommandations ultérieures ont mis l’accent sur des fichiers de progression, des oracles de test et une orchestration structurée pour des tâches de recherche sur plusieurs jours.

De tels exemples montrent de réelles capacités. Ils révèlent aussi pourquoi le compteur peut s’accélérer. La continuité exige une reconstruction répétée du contexte, des vérifications et de la coordination. L’agent paie une taxe opérationnelle pour rester cohérent dans le temps.

Cette taxe est parfois justifiée. Un projet qui exigerait autrement des semaines d’attention de spécialistes peut absorber des coûts substantiels de calcul et de revue. Une tâche administrative courante offre une marge de tolérance beaucoup plus étroite.

L’expression « long agent IA » recouvre donc deux dimensions différentes. L’une est la durée écoulée, y compris le temps passé à attendre. L’autre est la profondeur computationnelle active, incluant le raisonnement, l’usage d’outils et les nouvelles tentatives.

Les acheteurs d’entreprise doivent les distinguer. Un workflow qui dure deux semaines peut être efficace s’il ne se réveille que pour des événements significatifs. Un processus de dix minutes peut être gaspilleur s’il entre dans une boucle incontrôlée.

Pourquoi les coûts des agents résistent aux prévisions simples

Les dépenses liées aux agents deviennent imprévisibles lorsque le modèle choisit son propre chemin au lieu de suivre une séquence fixe.

Les logiciels traditionnels présentent des schémas d’exécution relativement stables. Une requête arrive, un code connu s’exécute et le système renvoie un résultat. Les ingénieurs peuvent estimer l’utilisation des ressources à partir du trafic et de données de référence.

Un agent se comporte différemment. Il planifie, agit, observe et révise. Deux requêtes similaires peuvent entraîner des nombres différents d’appels de modèle, d’invocations d’outils, de tâches déléguées et d’étapes de validation.

Cette variation provient d’une flexibilité utile. Un agent peut se rétablir lorsqu’un site web change, qu’une base de données renvoie des informations incomplètes ou qu’une première tentative échoue. Une automatisation fixe s’arrête souvent dans les mêmes conditions.

La flexibilité crée aussi de la variance. Un agent peut choisir le mauvais outil, mal interpréter une erreur ou répéter une action sans modifier son approche. Une seule mauvaise décision de planification peut alors affecter toutes les étapes en aval.

Google Cloud a souligné ces risques en évoquant l’observabilité de son Agent Development Kit. Ses recommandations de supervision ont identifié les boucles, les nouvelles tentatives, les échecs de transfert, les coûts imprévus et les problèmes de sécurité.

Une boucle est particulièrement révélatrice. Le modèle peut interpréter un appel d’outil échoué comme un problème temporaire et réessayer. Si la cause sous-jacente est une autorisation manquante, aucune répétition ne le résoudra.

Un opérateur humain reconnaît le schéma et fait remonter le problème. Un agent insuffisamment contraint continue de dépenser des ressources tout en générant davantage de données d’échec. L’autonomie transforme un petit problème de configuration en facture d’exploitation variable.

Les systèmes multi-agents amplifient cet effet. Un planificateur délègue à un chercheur, qui transmet du matériel à un rédacteur, qui remet ensuite le résultat à un évaluateur. Chaque transfert peut ajouter du contexte, de la latence et une occasion supplémentaire de malentendu.

L’évaluateur peut améliorer la qualité, mais il consomme aussi des ressources. S’il formule un retour vague, l’agent de production peut réviser l’artefact entier au lieu de corriger un seul défaut. La boucle d’évaluation s’étend alors sans amélioration proportionnelle.

Anthropic a testé ce compromis dans le développement d’applications de longue durée. Son environnement multi-agents utilisait des rôles de planificateur, de générateur et d’évaluateur sur une session de plusieurs heures. Le système a produit une meilleure application qu’une exécution individuelle plus courte.

Cependant, Anthropic a indiqué que le processus complet était plus de 20 fois plus coûteux. Ce résultat ne doit pas être considéré comme un ratio universel. Il montre à quel point l’orchestration peut modifier le profil de coût d’une tâche.

La comparaison essentielle n’est pas celle entre environnement complet et agent seul, prise isolément. Les acheteurs doivent comparer des résultats utilisables. Une exécution bon marché qui produit un logiciel inutilisable a peu de valeur économique, tandis qu’une exécution coûteuse peut tout de même surpasser un projet manuel.

C’est pourquoi l’efficacité par token ne peut pas trancher le débat. Un modèle plus capable peut consommer moins de tokens parce qu’il atteint plus rapidement la bonne voie. Un modèle moins cher peut exiger des nouvelles tentatives, des évaluateurs et des corrections humaines supplémentaires.

OpenAI a formulé ce point dans ses recommandations de juillet 2026 sur la gestion des investissements IA. L’entreprise a avancé que le prix de token le plus bas ne produit pas nécessairement le coût total le plus faible.

Cette observation met les routeurs de modèles et les plateformes d’entreprise sous pression. Acheminer chaque étape vers le modèle le moins cher peut se retourner contre l’organisation lorsque des décisions plus faibles créent des charges de travail plus importantes en aval.

La stratégie inverse gaspille également des ressources. Affecter le modèle le plus capable à chaque étape de classification, de récupération ou de mise en forme ignore les tâches que des systèmes plus petits peuvent traiter de manière fiable.

Une orchestration efficace exige un routage adapté aux tâches. Une planification complexe peut justifier un raisonnement plus puissant. Les transformations déterministes peuvent ne nécessiter aucun modèle génératif. Les actions à haut risque nécessitent davantage de vérification que les étapes de recherche réversibles.

La difficulté est que les équipes doivent concevoir ces politiques avant de disposer de nombreuses données de production. Les premiers déploiements s’appuient souvent sur la précision des benchmarks, mais ceux-ci reproduisent rarement les véritables échecs d’outils, les autorisations obsolètes ou les instructions internes ambiguës.

Les entreprises se retrouvent ainsi face à un déficit de prévision. Elles connaissent le coût d’un appel de modèle individuel. Elles ne connaissent pas encore le coût stable d’un résultat métier accepté.

L’autonomie face à la responsabilité est le véritable enjeu

Les agents d’IA de longue durée ne deviennent économiquement utiles que lorsque les organisations peuvent relier chaque action à un responsable, un objectif, un budget et un résultat.

Le titre AI: Reset to Zero présente le sujet comme un compteur qui tourne. Cette approche devient exploitable lorsque les équipes peuvent retracer ce qui a fait évoluer le compteur et pourquoi.

Le modèle actuel d’observabilité des agents de Google Cloud met l’accent sur les journaux, les métriques et les traces. Les journaux enregistrent les événements et les erreurs. Les métriques synthétisent la latence et l’utilisation des tokens.

Les traces reconstituent le chemin d’exécution. Elles peuvent indiquer combien d’appels de modèle ont eu lieu, quels outils ont été sélectionnés et où le workflow s’est ramifié. Ce niveau de détail est essentiel pour déboguer les coûts comme les comportements.

Un total mensuel ne permet pas d’identifier la cause du gaspillage. Le même total peut correspondre à dix investigations utiles ou à des milliers de tentatives triviales. Les dépenses agrégées n’offrent un contrôle qu’après coup.

Le traçage par workflow permet de poser une meilleure question : quelle séquence a produit un résultat accepté ? Les équipes peuvent alors comparer les exécutions réussies, échouées et abandonnées sans considérer leur consommation de ressources comme équivalente.

L’unité économique devrait devenir un résultat vérifié. En développement, il peut s’agir d’une modification fusionnée qui passe les tests. Dans les opérations client, d’un dossier résolu qui ne rouvre pas.

Pour la recherche, le résultat peut être une note de décision dont les citations résistent à la vérification. Pour l’intégration, il peut s’agir d’un dossier collaborateur finalisé avec toutes les approbations enregistrées.

Cette approche fondée sur le résultat modifie aussi les incitations internes. Une équipe récompensée pour la réduction du volume de tokens pourrait déployer des modèles moins performants qui génèrent davantage de corrections humaines. Une équipe récompensée uniquement pour l’achèvement des tâches pourrait ignorer les tentatives excessives.

L’indicateur utile combine qualité, coût et temps. Il doit aussi refléter le risque. Un agent qui envoie un résumé interne erroné est différent d’un agent qui approuve un paiement ou modifie une infrastructure de production.

L’autonomie ne devrait progresser que là où les preuves la justifient. Les tâches à faible risque peuvent tolérer une exploration plus large. Les actions à conséquence nécessitent des limites d’autorisation, des étapes de confirmation et une exécution réversible lorsque cela est possible.

Anthropic définit un agent comme un modèle qui dirige lui-même ses processus et son utilisation des outils. Son cadre de gouvernance des agents souligne que le comportement dépend du modèle, du harnais, des outils et de l’environnement.

Cette vision plus large compte pour la maîtrise des coûts. Un modèle performant peut encore gaspiller des ressources dans un harnais mal configuré. Un plan correct peut tout de même échouer lorsqu’un outil renvoie des erreurs ambiguës.

L’environnement détermine les enjeux. Un agent doté d’un accès en lecture seule à une collection de documents peut explorer en toute sécurité. Le même agent connecté à des systèmes d’e-mail, de finance et de déploiement requiert des limites bien plus strictes.

La responsabilité exige aussi une mémoire durable. Un workflow devrait conserver les décisions, les approbations, les sources et les obligations non résolues. Pourtant, la mémoire persistante introduit ses propres risques, notamment des instructions obsolètes et des hypothèses promues à tort.

Un contexte long ne résout pas ce problème à lui seul. Placer tout l’historique dans la fenêtre d’un modèle peut accroître le traitement tout en rendant les faits importants plus difficiles à retrouver. Conserver davantage de texte n’équivaut pas à un état mieux gouverné.

Une couche de connaissances structurée peut aider à séparer les décisions vérifiées de la conversation brute. Pour les travailleurs du savoir, une base de connaissances personnelle peut préserver les sources sans contraindre chaque exécution d’agent à tout relire.

L’agent ne devrait récupérer que ce que l’étape en cours exige. Il devrait aussi consigner quelle source a étayé chaque décision importante. Cette approche réduit la charge de contexte et améliore l’auditabilité.

La responsabilité n’est donc pas un frein à l’autonomie. C’est l’infrastructure qui rend l’autonomie commercialement défendable. Sans elle, une opération plus longue élargit surtout l’incertitude entourant chaque résultat.

Ce que le compteur ne peut toujours pas dire aux acheteurs

Les données d’utilisation peuvent révéler où les ressources ont été consommées, mais elles ne peuvent pas prouver qu’un agent a créé de la valeur ou mérite une autorité accrue.

L’Economic Index d’Anthropic de juin 2026 reflète la rapidité avec laquelle les schémas d’utilisation évoluent. Les sessions Claude incluent de plus en plus de tâches de longue durée via Claude Code et Cowork.

Le rapport a constaté que les résultats plus complexes tendent à consommer davantage de tokens que les réponses plus simples. Les conversations consacrées à la création d’applications utilisaient plus de trois fois les tokens de la conversation médiane.

Il a également mis en évidence une relation entre l’utilisation des tokens et la valeur économique des professions associées. Les conversations liées à des emplois mieux rémunérés tendaient à inclure davantage de production, d’engagement utilisateur et un raisonnement légèrement plus étendu.

Ces résultats confirment une intuition raisonnable. Les travaux plus difficiles exigent souvent davantage de calcul. Réduire l’utilisation sans tenir compte de la complexité de la tâche peut détruire de la valeur plutôt qu’améliorer l’efficacité.

Toutefois, une corrélation ne prouve pas la productivité. Une conversation associée à une profession très rémunérée ne génère pas automatiquement un travail équivalent à la valeur de marché de cette profession.

Le modèle peut produire une première version utile, un artefact incorrect ou une réponse plausible nécessitant une vérification experte. La consommation de tokens décrit une activité. Elle ne mesure pas la part de responsabilité qui est restée à l’utilisateur.

Le rapport d’Anthropic lui-même fournit un indice important. Les utilisateurs restaient davantage impliqués dans les tâches à plus forte valeur, même lorsque Claude produisait davantage de contenu. Ce schéma ressemble plus à une augmentation des capacités qu’à une substitution complète du travail humain.

Cette conclusion complique les tentatives de comparaison directe entre un poste d’agent et un poste humain. L’agent peut accroître la production d’un spécialiste tout en dépendant encore de lui pour l’orientation, le jugement et la responsabilité.

Le meilleur déploiement peut donc maintenir une implication profonde d’une personne. Un expert du domaine peut définir les critères d’acceptation, reconnaître les erreurs subtiles et décider quand une exploration supplémentaire ne justifie plus son coût.

Une autonomie plus longue ne devrait pas être considérée comme un objectif inconditionnel. L’étude d’Anthropic de février a révélé que les plus longues sessions Claude Code étaient passées de moins de 25 minutes à plus de 45 minutes en trois mois.

Cette durée presque doublée indique une extension des capacités et de la confiance des utilisateurs. Elle ne révèle pas si chaque minute supplémentaire a amélioré le résultat. Les sessions plus longues peuvent contenir à la fois une persistance productive et une errance improductive.

Il existe aussi un problème de sélection. Les utilisateurs peuvent accorder des exécutions plus longues à des tâches aux tests plus clairs, comme la compilation logicielle. Les travaux impliquant négociation, stratégie ou appréciation subjective offrent des signaux d’arrêt plus faibles.

Un agent doté d’une suite de tests sait quand un logiciel échoue. Un agent qui rédige un document stratégique peut continuer à apporter des modifications stylistiques parce qu’aucun oracle binaire ne lui indique de s’arrêter.

Les agents évaluateurs offrent une réponse possible, mais leur jugement peut partager les faiblesses de l’agent générateur. Anthropic a noté que les modèles évaluent souvent leur propre travail trop généreusement, surtout pour les tâches subjectives.

Séparer la génération de l’évaluation améliore la conception. Cela ne rend pas l’évaluation objective. Les deux agents peuvent encore privilégier un langage soigné à la profondeur factuelle ou accepter la même hypothèse cachée.

La revue humaine reste nécessaire lorsque les erreurs ont des conséquences significatives. La charge de revue doit figurer dans le calcul économique. Sinon, les organisations comptent la production du modèle comme un travail terminé tout en masquant le travail nécessaire à sa validation.

La sécurité ajoute une autre variable non chiffrée. Un agent de longue durée rencontre davantage de documents, de messages, de sites web et de réponses d’outils. Chaque entrée supplémentaire peut contenir des instructions trompeuses ou des tentatives d’injection de prompt.

Un accès accru aux outils augmente les dommages potentiels. Une boucle de recherche incontrôlée gaspille du calcul. Un agent opérationnel compromis peut exposer des données, envoyer des messages ou modifier des systèmes avant que quiconque ne s’en aperçoive.

Les limites de coût sont utiles, mais constituent des protections incomplètes. Un workflow peut causer de graves dommages tout en restant sous le budget. La conception des autorisations, la confirmation des actions et la détection des anomalies doivent fonctionner en parallèle des contrôles de ressources.

Le compteur ne peut donc pas répondre seul à la question de gestion la plus importante. Il peut montrer ce qu’un agent a consommé. Il ne peut pas déterminer si l’organisation devrait confier davantage de travail à cet agent.

Ce que les lecteurs de Google News devraient surveiller ensuite

La prochaine phase sera déterminée par la comptabilisation des résultats, l’exécution durable et des limites strictes qui résistent aux défaillances réelles en production.

Le premier signal sera de voir si les fournisseurs exposent le coût par résultat vérifié. Les totaux de tokens et les nombres d’appels de modèle sont des données d’ingénierie utiles, mais les acheteurs ont besoin de mesures au niveau du workflow liées à des résultats acceptés.

Les plateformes devraient distinguer les exécutions réussies, échouées, relancées et sauvées par un humain. Elles devraient aussi montrer quel modèle, outil ou embranchement a le plus contribué au coût final.

Si ces contrôles deviennent la norme, l’argument sous-jacent au titre de Google News se renforcera de manière productive. Le compteur deviendra un instrument d’optimisation plutôt qu’un voyant d’alerte.

Si les fournisseurs continuent de mettre l’accent sur de larges totaux d’utilisation, les équipes d’entreprise auront du mal à comparer les déploiements. Elles pourraient réduire les accès sans discernement parce qu’elles ne peuvent pas identifier quels workflows créent de la valeur.

Le deuxième signal est l’adoption de schémas d’exécution durable. L’architecture de pause et reprise de Google en fournit un exemple. Les agents devraient conserver leur état pendant les périodes d’inactivité et reprendre à partir d’événements vérifiés.

Cette architecture doit aussi résister aux défaillances. Un processus redémarré devrait savoir quelles actions ont déjà eu lieu. Il ne devrait pas envoyer deux fois le même message, rouvrir un ticket terminé ou répéter une transaction externe.

Les registres de progression, les outils idempotents et les enregistrements d’approbation explicites sont moins visibles que l’intelligence des modèles. Ils détermineront si les agents d’IA de longue durée peuvent fonctionner pendant des jours sans créer de confusion opérationnelle.

Une adoption plus large de ces schémas renforcerait l’argument en faveur d’une autonomie de longue durée. Des défaillances persistantes et des actions dupliquées l’affaibliraient, quels que soient les progrès des benchmarks.

Le troisième signal est l’apparition de limites exécutoires en matière de ressources et d’autorité. Un tableau de bord qui signale une consommation excessive une fois l’exécution terminée n’est pas une limite stricte.

Les équipes ont besoin de contrôles qui suspendent un workflow lorsqu’il dépasse le nombre d’étapes prévu, répète un appel d’outil, modifie trop souvent son plan ou approche d’un budget de ressources défini.

La pause devrait conserver les éléments de preuve pour examen. Les opérateurs doivent voir le dernier état vérifié de l’agent, l’objectif non résolu, les réponses d’outils récentes et la raison de l’escalade.

Les limites d’autorité devraient fonctionner de la même manière. Un agent peut étudier un achat sans le réaliser. Il peut préparer un e-mail sans l’envoyer. Il peut proposer un déploiement sans modifier la production.

Si les plateformes rendent ces limites simples et fiables, les entreprises pourront accorder l’autonomie progressivement. Si les contrôles restent des projets d’ingénierie sur mesure, l’adoption se concentrera parmi les organisations dotées de grandes équipes d’infrastructure.

Google News publiera probablement davantage d’articles sur des agents qui remplacent des tâches, travaillent pendant des heures et opèrent à travers des logiciels. Les lecteurs devraient dépasser la question de la durée et demander ce qui a arrêté le workflow.

S’est-il arrêté parce que l’objectif a été vérifié, parce qu’une personne a approuvé le résultat, ou parce que le budget a expiré ? Ce sont des résultats sensiblement différents.

La métaphore du compteur est utile parce qu’elle rend visible une consommation cachée. Sa faiblesse est qu’elle réduit un travail complexe à un seul chiffre cumulatif.

Un marché mature des agents a besoin de plusieurs compteurs. L’un devrait suivre les ressources. Un autre devrait suivre les résultats acceptés. Un troisième devrait suivre le risque, l’intervention et la réversibilité.

Les travailleurs du savoir peuvent s’y préparer en préservant les sources et les décisions dont les agents ont besoin, plutôt qu’en reconstruisant le contexte pour chaque tâche. Un second cerveau consultable peut rendre ces transmissions plus sélectives et plus faciles à auditer.

La question pratique n’est plus de savoir si un agent IA peut continuer à travailler longtemps. Google News a contribué à faire émerger une question plus difficile dans le débat public : quelqu’un peut-il expliquer ce que l’agent a accompli avant que le compteur ne s’arrête ?

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page