top of page

La flambée des tokens de Meta fait de Microsoft son fournisseur discret d’IA

21 août
14 min de lecture

Meta consommerait des milliers de milliards de tokens d’IA via Microsoft chaque semaine, faisant du développeur de Llama l’un des plus grands clients d’intelligence artificielle d’Azure.

Ce volume de tokens de Meta est frappant, car l’entreprise consacre depuis des années des efforts à bâtir ses propres modèles, centres de données et stratégie d’IA à poids ouverts. Pourtant, elle dépend toujours d’une infrastructure qui donne à ses employés accès à des modèles concurrents d’OpenAI, Anthropic et d’autres développeurs.

Microsoft profite de ce revirement. L’entreprise n’a pas besoin que chaque client se standardise sur un modèle Microsoft. Azure peut générer des revenus chaque fois que des entreprises comparent des modèles, exécutent des agents de programmation ou acheminent des charges de travail via sa plateforme gérée.

Le conflit central dépasse donc largement un simple contrat de cloud. Meta veut contrôler sa pile d’IA, tandis que ses employés veulent accéder immédiatement au modèle qui traite le mieux une tâche donnée.

Le volume signalé de tokens de Meta change la donne

Meta n’utiliserait pas Azure dans le cadre d’une expérience limitée. L’entreprise est devenue une grande consommatrice de modèles d’IA hébergés par Microsoft.

Un article original du 20 août 2026 indiquait que Meta dépense chaque année des centaines de millions de dollars pour accéder à des modèles via Azure. Le rapport citait une personne au fait du dossier ayant requis l’anonymat.

Selon cette source, Meta traite chaque semaine des milliers de milliards de tokens via la plateforme. Un token est une petite unité de texte qu’un modèle d’IA lit ou génère lors d’une requête.

Ni Meta ni Microsoft n’ont commenté l’accord signalé. Ce silence compte, car les chiffres mis en avant restent attribués à une seule source anonyme plutôt qu’à des informations publiées par les entreprises.

Le rapport ne précise pas le volume hebdomadaire exact, les équipes de Meta concernées ni la répartition entre les modèles. Il ne distingue pas non plus les tokens d’entrée des résultats générés, du contenu mis en cache ou de l’activité répétée des agents.

Ces distinctions peuvent modifier sensiblement le coût et la signification de tout total de tokens. Un long flux de travail de programmation peut consommer bien plus de tokens que ne le laisse penser sa réponse visible.

Les agents d’IA inspectent souvent des fichiers, génèrent du code, testent des modifications et révisent leur travail à travers de nombreuses étapes internes. Chaque étape peut renvoyer du contexte supplémentaire à un modèle.

Le volume signalé indique néanmoins une utilisation soutenue en production, plutôt que de simples conversations occasionnelles avec un chatbot. Même la limite basse suggérée par « milliers de milliards » représente un nombre immense d’interactions avec des modèles.

Le calendrier correspond aussi à une tendance plus large au sein de Meta. Des informations antérieures décrivaient des employés consommant chaque mois des dizaines de milliers de milliards de tokens via des outils d’IA internes.

Meta a encouragé ses ingénieurs à utiliser l’IA de manière intensive, en particulier pour le développement logiciel. La programmation constitue l’un des environnements les plus évidents où les appels répétés aux modèles peuvent s’accumuler rapidement.

L’entreprise a également expérimenté des systèmes internes qui mesurent l’utilisation de tokens par les employés. Un tel suivi peut encourager l’adoption, mais il peut aussi transformer la consommation en indicateur trompeur de productivité.

Davantage de tokens ne signifie pas nécessairement de meilleurs logiciels ou une livraison plus rapide. Un agent mal configuré peut inspecter à répétition le même dépôt sans produire de travail utile.

Cette incertitude doit guider l’interprétation du chiffre concernant les tokens de Meta. Il mesure une activité de calcul, et non une valeur commerciale.

Ce chiffre modifie néanmoins le paysage concurrentiel. Meta ne se contente pas de bâtir une alternative aux fournisseurs d’IA propriétaires. L’entreprise achète aussi un accès substantiel à ces fournisseurs via Microsoft.

C’est là que réside la tension centrale de cet article. L’entreprise qui recherche l’indépendance aux niveaux de l’infrastructure et des modèles a toujours besoin de capacités externes au niveau applicatif.

Pourquoi Meta a toujours besoin de modèles développés ailleurs

Les dépenses signalées sur Azure reflètent l’écart pratique entre la possession d’un modèle d’IA et la capacité à répondre efficacement à chaque flux de travail des employés.

Meta développe Llama, exploite de vastes grappes de calcul et intègre Meta AI à ses services grand public. Aucun de ces efforts ne donne automatiquement à chaque ingénieur le meilleur outil pour chaque tâche.

Les assistants de programmation exigent davantage qu’un modèle de fondation performant. Ils nécessitent un accès aux dépôts, la gestion de longs contextes, l’exécution d’outils, des contrôles de sécurité, une gestion des identités et une disponibilité fiable.

Les employés comparent aussi les modèles pour la planification, le débogage, la recherche et l’analyse de documents. Un modèle performant pour une charge de travail peut peiner avec une autre.

Azure offre aux acheteurs professionnels une voie gérée vers plusieurs familles de modèles. Microsoft a positionné sa plateforme Foundry autour du choix des modèles plutôt que d’une dépendance exclusive à un seul fournisseur.

Lors de sa conférence téléphonique sur le troisième trimestre de l’exercice 2026, Microsoft a déclaré que plus de 10 000 clients avaient utilisé plusieurs modèles sur Foundry. L’entreprise a également indiqué que l’utilisation des modèles Anthropic et OpenAI avait doublé d’un trimestre à l’autre.

Ces déclarations trimestrielles montrent pourquoi Microsoft peut bénéficier de la situation même lorsque ses clients développent leurs propres modèles. Azure devient la couche de contrôle où les entreprises testent, gouvernent et consomment des systèmes concurrents.

La stratégie de modèles internes de Meta répond à un problème différent. Llama donne à l’entreprise une influence sur l’architecture des modèles, leur déploiement et la communauté de développeurs des poids ouverts.

Un modèle à poids ouverts distribue des paramètres entraînés que les développeurs peuvent exécuter ou personnaliser sous sa licence. Cela n’élimine pas le travail opérationnel nécessaire à un déploiement en entreprise.

Une grande entreprise doit gérer la capacité, la latence, les autorisations, les frontières des données et les mises à niveau des modèles. Acheter un accès géré peut être plus rapide que d’adapter les systèmes internes à chaque nouveau modèle.

Cet arbitrage devient plus important lorsque les classements des modèles d’IA évoluent rapidement. Les employés peuvent préférer un modèle pour la génération de code et un autre pour le raisonnement complexe.

Les limiter à Llama pourrait réduire les dépenses externes. Mais cela pourrait aussi ralentir les équipes dont les tâches sont mieux prises en charge par un autre modèle.

Meta se trouve donc face à une décision de plateforme classique. L’entreprise peut optimiser le contrôle interne, ou préserver le choix et accepter une dépendance envers un fournisseur externe.

Son choix signalé privilégie l’accès. Meta semble disposée à payer Microsoft plutôt que de forcer chaque flux de travail à utiliser ses propres modèles et son infrastructure.

Cela ne prouve pas que Llama a échoué. Les assistants grand public, les systèmes de recommandation, les produits publicitaires et les outils de programmation internes présentent des exigences techniques différentes.

Cette décision suggère plutôt que la propriété et la consommation des modèles se sont dissociées. Une entreprise peut créer une famille majeure de modèles tout en restant une cliente importante de ses concurrents.

La flambée des tokens de Meta est l’un des résultats de cette dissociation. Les employés de Meta peuvent utiliser tout ce que la plateforme gérée met à leur disposition, même lorsque ces choix renforcent l’activité d’IA d’une autre entreprise.

Microsoft gagne lorsque les clients refusent de choisir un seul modèle

L’avantage de Microsoft ne se limite pas à posséder un modèle gagnant. L’entreprise peut profiter du refus du marché de se fixer sur un seul modèle.

L’opposition évidente dans cette histoire réside entre la volonté de Meta de devenir indépendante en matière d’IA et le rôle de Microsoft comme place de marché incontournable des modèles.

Meta veut davantage de contrôle sur le calcul, les modèles et la distribution de produits. Microsoft veut qu’Azure reste l’endroit où les entreprises accèdent à presque tous les modèles dont elles ont besoin et les gèrent.

Ces objectifs ne sont pas directement incompatibles. Ils deviennent concurrentiels lorsque la demande de Meta procure à Microsoft des revenus, des données d’utilisation et un levier sur la distribution de l’IA d’entreprise.

Le catalogue de modèles de Microsoft couvre des systèmes propriétaires et à poids ouverts. Les clients peuvent acheminer différentes charges de travail via une relation cloud commune sans négocier des accords d’infrastructure distincts.

Cette approche réduit le risque stratégique consistant à miser sur un seul laboratoire. Si OpenAI perd un benchmark particulier ou si Anthropic devient préférable pour la programmation, Azure peut toujours servir le client.

Microsoft a mis en avant cette largeur de choix lors de sa conférence sur les résultats. L’entreprise a indiqué que les clients de Foundry utilisaient des modèles OpenAI, Anthropic, open source et régionaux.

Elle a aussi déclaré que plus de 300 clients étaient en bonne voie de traiter plus de mille milliards de tokens au cours de l’année. La consommation hebdomadaire signalée de Meta la placerait bien au-delà de ce seuil annuel.

Ces chiffres ne sont pas parfaitement comparables. La déclaration publique de Microsoft concerne des clients atteignant un seuil annuel, tandis que le rapport sur Meta décrit une activité hebdomadaire totale.

Le contraste illustre néanmoins l’échelle possible de Meta. Sa charge de travail signalée en ferait une cliente d’une intensité inhabituelle, même au sein de la base d’entreprises en expansion de Microsoft.

Microsoft développe également ses propres modèles MAI et adapte la technologie d’OpenAI pour ses produits propriétaires. Pourtant, Azure n’exige pas que ces systèmes remportent chaque comparaison technique.

La plateforme cloud tire sa position de la gestion de l’accès, de la facturation, de la sécurité et de la capacité. Cela rappelle la concurrence antérieure dans le cloud, où les fournisseurs d’infrastructure profitaient de logiciels qu’ils ne possédaient pas.

Cette position met Amazon et Google sous pression. Les deux entreprises proposent de larges catalogues de modèles, des services d’IA gérés et leurs propres modèles de fondation.

Amazon a fait d’Anthropic un élément central de sa stratégie, tandis que Google associe Gemini à sa plateforme Vertex AI. Microsoft peut répliquer en répartissant la demande des clients entre plusieurs familles de modèles.

La présence de Meta renforce ce récit, car il ne s’agit pas d’un acheteur professionnel conventionnel. C’est une autre entreprise technologique hyperscale disposant d’une vaste infrastructure interne.

Une décision signalée de Meta d’acheter l’accès à des modèles suggère que les plateformes cloud conservent leur valeur même pour les entreprises capables de bâtir elles-mêmes des systèmes gigantesques.

Microsoft peut également utiliser la demande agrégée pour justifier davantage de centres de données et d’achats d’accélérateurs. Une utilisation plus élevée améliore l’économie de capacités qui resteraient autrement coûteuses et sous-utilisées.

Cet avantage comporte des risques. Microsoft doit maintenir suffisamment de puissance de calcul disponible, gérer ses relations avec les fournisseurs et éviter que l’accès aux modèles ne devienne une commodité à faible marge.

Pour l’instant, la consommation signalée de tokens de Meta soutient sa stratégie de place de marché. Microsoft peut remporter des transactions sans convaincre Meta qu’un seul modèle contrôlé par Microsoft devrait remplacer Llama.

L’indépendance de Meta en matière d’IA comporte une coûteuse exception

Le revirement tient au fait que l’échelle de Meta n’élimine pas sa dépendance extérieure. Elle rend l’accès à chaque modèle utile plus précieux.

Meta a construit certains des plus grands systèmes d’entraînement de l’IA au monde. Son propre rapport sur l’infrastructure décrivait des dizaines de grappes d’IA desservant des centaines d’équipes et des milliers de tâches d’entraînement quotidiennes.

Cette infrastructure prend en charge les systèmes de recommandation, la publicité, les produits génératifs et le développement de modèles. Meta prévoyait une capacité équivalente à des centaines de milliers de GPU avancés.

Ces ressources devraient rendre Meta moins dépendante des clouds externes que la plupart des entreprises. Le rapport sur Azure montre pourquoi cette conclusion est trop simpliste.

L’entraînement et l’inférence sont des charges de travail différentes. L’entraînement crée ou met à jour un modèle, tandis que l’inférence exécute un modèle existant pour répondre à des requêtes.

Meta peut posséder une infrastructure d’entraînement considérable tout en achetant un accès d’inférence à des modèles qu’elle ne contrôle pas. L’entreprise peut aussi utiliser des capacités externes lorsque son offre interne ne peut répondre à la demande à court terme.

Le budget IA croissant de l’entreprise apporte du contexte. Meta a prévu des dépenses d’investissement pour 2026 comprises entre 130 et 145 milliards de dollars, selon ses dernières prévisions de dépenses.

Cet investissement couvre bien plus que l’entraînement des modèles. Les centres de données nécessitent du réseau, de l’énergie, du refroidissement, du stockage et des serveurs, dont le déploiement prend du temps.

L’accès à des modèles externes peut combler l’écart entre la demande des employés et la capacité interne. Il évite également d’attendre que les propres modèles de Meta égalent chaque capacité spécialisée.

C’est le cœur du revirement. Des investissements internes plus importants n’ont pas créé un environnement fermé et autonome.

Au contraire, une adoption agressive génère davantage de demande qu’une seule famille de modèles ne peut satisfaire. Meta devient à la fois concurrent et client au sein de la même chaîne d’approvisionnement en IA.

Cet arrangement rappelle une phase antérieure du cloud computing. Les grandes entreprises technologiques construisaient leur infrastructure interne tout en louant des capacités externes pour certains services ou pics de demande.

L’IA ajoute une couche supplémentaire, car l’actif loué inclut la capacité du modèle, et pas seulement des serveurs. Les employés se préoccupent de la qualité des résultats, de l’utilisation des outils et de la fiabilité, plutôt que de la structure de propriété sous-jacente.

Cela crée un défi organisationnel. Meta doit décider si les tokens externes constituent un pont temporaire ou un composant permanent du travail des employés.

Si cette utilisation est temporaire, les modèles et l’infrastructure internes devraient à terme absorber une plus grande part de la demande. Si elle perdure, Microsoft aura obtenu un rôle durable au sein des opérations IA de Meta.

Cette distinction affecte également la signification concurrentielle de Llama. Llama peut rester influent sans devenir la norme interne exclusive de Meta.

Les poids ouverts attirent les développeurs en permettant la personnalisation et le déploiement local. Les équipes internes peuvent tout de même choisir des modèles propriétaires hébergés lorsque ceux-ci font gagner du temps.

Pour les développeurs et les acheteurs d’entreprise, c’est un avertissement utile contre l’idée qu’une stratégie de modèles se réduit à une décision de fournisseur unique. Les déploiements réels impliquent de plus en plus d’orienter les tâches entre plusieurs systèmes.

Ce routage crée son propre problème de connaissance. Les équipes doivent conserver les prompts, décisions, évaluations et résultats entre les différents outils.

Une base de connaissances IA consultable peut aider à organiser ce contexte. Toutefois, elle ne peut pas déterminer si les dépenses sous-jacentes en modèles produisent une productivité mesurable.

Cette réponse exige des résultats plutôt que des totaux de tokens.

Ce que les chiffres de tokens ne prouvent pas

Des milliers de milliards de tokens signalent une échelle considérable, mais ne prouvent pas que Meta obtient une valeur proportionnelle à ses dépenses.

Les chiffres centraux restent non vérifiés par les deux entreprises. Ils proviennent d’une personne non identifiée au fait d’un accord interne.

Meta et Microsoft ont refusé de commenter, laissant plusieurs questions fondamentales sans réponse. Aucune des deux n’a divulgué les modèles exacts, les conditions négociées, les charges de travail ou la période de mesure.

La comptabilisation des tokens peut également varier selon les systèmes. Les fournisseurs peuvent comptabiliser différemment les prompts, les sorties, le contexte mis en cache, les résultats d’outils ou le raisonnement interne.

Un total hebdomadaire de tokens ne peut donc pas être directement traduit en activité des employés. Il ne peut pas non plus révéler quelle part du trafic a atteint les systèmes de production.

Une partie de l’utilisation pourrait provenir d’évaluations automatisées. Les équipes envoient couramment le même prompt à plusieurs modèles afin de comparer précision, latence et sécurité.

D’autres flux pourraient provenir d’agents de codage qui lisent à répétition de grands référentiels. Ces systèmes peuvent générer des volumes énormes de tokens tout en exécutant une tâche qu’un ingénieur ne vérifie qu’une seule fois.

La mise en cache complique encore l’analyse. Un fournisseur peut réutiliser un contexte déjà traité, réduisant le travail de calcul même lorsque l’enregistrement de facturation fait toujours référence à de grands volumes de tokens.

La taille du modèle compte également. Un modèle plus petit peut traiter des tokens avec moins de calcul qu’un modèle de raisonnement de pointe.

Les estimations énergétiques doivent donc rester prudentes. La propre analyse d’inférence de Microsoft explique que l’énergie consommée par une requête dépend des modèles, du matériel, des logiciels, des centres de données et des caractéristiques de la charge de travail.

Cette étude a estimé l’énergie nécessaire pour un volume défini de requêtes conversationnelles. Elle ne fournit pas de conversion fiable pour le trafic rapporté de Meta.

Le chiffre du coût comporte une incertitude similaire. Les contrats d’entreprise peuvent inclure des capacités réservées, des remises, des engagements et des tarifs différents selon les modèles.

Les dépenses annuelles de Meta et ses tokens hebdomadaires ne doivent pas être divisés pour obtenir un coût universel par token. Le résultat mélangerait des modèles et des conditions contractuelles qui n’ont pas été divulgués.

Il y a aussi une question de productivité. Les incitations internes peuvent pousser les employés à maximiser une utilisation visible sans maximiser les résultats utiles.

Un classement fondé sur les tokens risque de récompenser les prompts longs et les agents inefficaces. Une meilleure évaluation mesurerait les tâches terminées, le code accepté, les taux de défauts et le temps économisé.

La sécurité et la gouvernance restent également des préoccupations. Envoyer le contexte de l’entreprise vers des modèles externes exige des autorisations, des contrôles des données, de la journalisation et des politiques de conservation.

Azure peut fournir une frontière gérée, mais la gestion n’élimine pas le risque. Meta doit toujours décider quels référentiels et documents chaque outil peut consulter.

La conclusion la plus solide est donc plus limitée que le titre. Meta achèterait des capacités IA externes à une échelle immense malgré ses ressources internes.

La conclusion la plus fragile serait que la consommation de tokens prouve que les modèles de Microsoft surpassent Llama. Les éléments disponibles ne soutiennent pas cette affirmation.

Ils ne montrent pas non plus que Meta prévoit de réduire son investissement dans Llama. Son utilisation externe peut coexister avec la poursuite du développement de modèles internes.

Les lecteurs devraient considérer le chiffre rapporté des tokens de Meta comme un indice de dépendance, et non comme une preuve de défaite technique.

Trois signaux montreront si cette dépendance perdure

La prochaine phase sera déterminée par les résultats des charges de travail, l’adoption des modèles internes de Meta et la capacité de Microsoft à convertir la croissance des tokens en marges durables.

Le premier signal sera de savoir si Meta modifie l’accès des employés aux modèles externes. De nouveaux budgets, limites ou règles sur le modèle par défaut indiqueraient que la direction considère une consommation non contrôlée comme un problème financier.

Un virage vers les modèles internes renforcerait l’argument de l’indépendance. Le maintien d’un accès étendu conforterait la position de Microsoft sur le marché.

Le deuxième signal viendra du prochain déploiement de modèles et d’infrastructure de Meta. La question importante n’est pas de savoir si Meta annonce une nouvelle version de Llama.

La mesure utile est de savoir si les équipes internes déplacent des charges de travail de production vers ce modèle. Son adoption au sein de Meta montrerait que l’entreprise peut transformer ses investissements dans les modèles en substitution concrète.

Si les employés préfèrent encore des systèmes concurrents après une sortie majeure, la relation rapportée avec Azure semblera structurelle plutôt que temporaire.

Le troisième signal apparaîtra dans les publications financières de Microsoft. Les investisseurs devraient surveiller la capacité IA, la croissance d’Azure, les marges brutes et les références à l’adoption multi-modèles de Foundry.

Le rythme annualisé des revenus IA de Microsoft a dépassé 37 milliards de dollars au cours de son troisième trimestre fiscal, selon ses déclarations publiques de résultats. L’entreprise a également fait état d’une croissance rapide des tokens parmi les grands clients de Foundry.

Ces chiffres étayent le récit de la demande, mais les coûts d’infrastructure restent élevés. Microsoft doit acheter des accélérateurs et construire des installations avant que toute cette capacité ne génère des revenus.

Un client comme Meta peut améliorer le taux d’utilisation. Toutefois, un usage important négocié peut encore peser sur les marges si les coûts de service des modèles diminuent moins vite que les tarifs contractuels.

Cette relation met donc les deux entreprises à l’épreuve. Meta doit prouver que l’achat de modèles externes accélère le travail utile sans compromettre sa stratégie interne.

Microsoft doit prouver que servir des milliers de milliards de tokens crée une économie attractive, plutôt qu’une activité impressionnante à elle seule.

Amazon, Google et les fournisseurs de modèles spécialisés influenceront les deux résultats. Des tarifs plus bas ou de meilleurs modèles pourraient détourner les charges de travail de Meta d’Azure.

Microsoft peut défendre sa position grâce à sa capacité, sa gouvernance et l’étendue de ses modèles. Elle ne peut pas supposer que le modèle préféré aujourd’hui le restera au trimestre prochain.

Pour les développeurs, la leçon pratique est que le choix du modèle reste mouvant. Les systèmes doivent conserver les évaluations et permettre aux charges de travail de changer de destination sans reconstruire tous les processus environnants.

Les acheteurs d’entreprise devraient également exiger des indicateurs de résultats. Le volume de tokens est une entrée opérationnelle, au même titre que le temps de calcul ou le stockage.

Les meilleures questions concernent la vitesse de livraison, la qualité, la fiabilité et les revenus. Une équipe doit savoir si un agent a résolu un problème, et pas seulement combien de tokens il a consommés.

La hausse rapportée des tokens de Meta rend visible l’ampleur de l’adoption de l’IA en entreprise. Elle révèle aussi le peu d’informations publiques disponibles sur la valeur produite à cette échelle.

Surveillez les modèles par défaut de Meta, les migrations internes de charges de travail et les marges cloud de Microsoft au cours des prochains mois. Ensemble, ces signaux montreront si Azure est un pont pour Meta ou une couche permanente de sa pile IA.

Si votre équipe étend son utilisation des modèles, commencez par suivre les flux de travail qui s’améliorent et ceux qui ne produisent que davantage d’activité. Conservez le contexte associé, enregistrez les décisions concernant les modèles et comparez les résultats entre des tâches répétées. Demandez-vous si chaque système réduit le temps de révision, améliore la qualité ou traite un travail auparavant laissé inachevé. Cette discipline compte davantage que la recherche d’un total de tokens plus élevé. La consommation rapportée de Meta offre un aperçu rare d’une adoption à une échelle extrême, mais elle ne fournit pas à elle seule un modèle à suivre. Le véritable critère sera de savoir si Meta transforme ces tokens en meilleurs produits tout en réduisant sa dépendance envers le concurrent qui les fournit.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page