top of page

La China Computing Power Conference révèle l’écart entre capacité d’IA et production utile

15 sept.
18 min de lecture

Les données de la China Computing Power Conference ont révélé un net décalage : seules sept provinces chinoises ont mis en service plus de 75 % de leur capacité de calcul.

Ce constat intervient alors que la Chine annonce une croissance historique de ses infrastructures. En juin 2026, le pays disposait de 2 185 EFLOPS de capacité de calcul intelligent mesurée à la précision FP16, en hausse de 177 % sur un an. Or, la seule capacité installée en dit peu sur le volume de travail d’IA utile qu’un cluster accomplit réellement.

Le conflit qui structure désormais le marché chinois des infrastructures d’IA n’oppose plus la rareté à l’abondance. Il oppose la capacité nominale à la production effective. Les fournisseurs de cloud, opérateurs télécoms, sociétés indépendantes de centres de données et développeurs de modèles doivent démontrer que leurs coûteux clusters peuvent rester actifs.

La China Computing Power Conference s’est tenue du 11 au 13 septembre à Langfang, dans le Hebei. Les intervenants ont à plusieurs reprises déplacé l’attention du déploiement matériel vers l’ordonnancement des charges de travail, les performances réseau, l’approvisionnement énergétique et la fiabilité opérationnelle.

Cette évolution met sous pression tous les opérateurs qui vendent encore l’échelle comme principal avantage. Une installation peut contenir des milliers d’accélérateurs et pourtant sous-performer si ses logiciels, son réseau, son refroidissement ou son portefeuille clients ne permettent pas de les maintenir productifs.

La conférence a privilégié l’utilisation plutôt que l’expansion

Le jalon atteint par les infrastructures chinoises a aussi révélé les limites du comptage des accélérateurs, des racks ou des opérations théoriques.

La conférence a ouvert à Langfang le 12 septembre, dans le cadre d’un programme consacré à la construction et à l’exploitation d’un réseau national de calcul. Les organisateurs avaient auparavant confirmé que l’événement global se déroulerait sur trois jours.

Le programme de la conférence couvrait les infrastructures, les technologies clés, l’adoption sectorielle et la coordination des ressources de calcul régionales. Cette portée reflétait un marché qui dépasse son premier cycle de construction.

Les chiffres phares restent considérables. L’analyse panoramique complète de la puissance de calcul 2026 a fait état de 2 185 EFLOPS de capacité de calcul intelligent en service en juin. Les EFLOPS mesurent un quintillion d’opérations en virgule flottante par seconde, même si les performances réelles dépendent de la charge de travail et du format numérique.

La même analyse a recensé 15,56 millions de racks standards en service et plus de 2 000 exaoctets de capacité de stockage. Elle a évalué les 31 régions de niveau provincial selon les dimensions du calcul, du stockage, des réseaux et de l’environnement d’exploitation.

Ces mesures importent car un cluster d’IA ne fonctionne pas comme une collection isolée de puces. Il a besoin d’un stockage capable d’alimenter les données, de réseaux capables de synchroniser le travail et de logiciels capables d’allouer efficacement les ressources.

La statistique la plus révélatrice du rapport n’était pas le taux de croissance national. Selon les conclusions présentées lors de l’événement, seules sept provinces affichaient un taux de déploiement des racks supérieur à 75 %.

Un taux de déploiement des racks décrit la part de la capacité disponible d’un centre de données qui a effectivement été remplie et activée. Il ne mesure pas directement l’utilisation des accélérateurs ni le travail d’IA achevé.

Cette distinction est essentielle. Une installation peut placer des serveurs dans des racks sans maintenir des charges de travail productives sur l’ensemble de ceux-ci. À l’inverse, un cluster spécialisé peut fournir un travail précieux sans faire fonctionner chaque composant en continu.

Le chiffre de sept provinces constitue donc un signal d’alerte, et non un score national complet d’utilisation. Il suggère que l’offre d’infrastructures et la demande du marché restent inégalement alignées.

L’analyse provinciale a identifié le Hebei, le Guangdong, le Jiangsu, Shanghai et Pékin comme des régions présentant des atouts dans plusieurs dimensions du calcul. Leurs avantages provenaient de sources différentes.

Pékin, Shanghai et le Guangdong étaient en tête pour le développement de modèles, les services d’IA générative et l’activité industrielle associée. Le Guangdong, le Hebei et Shanghai disposaient de fondations comparativement solides en matière de stockage.

Le Jiangsu, le Zhejiang et le Guangdong ont obtenu de bons résultats en matière de coordination réseau. Le Xinjiang, le Gansu et le Qinghai bénéficiaient de conditions favorables en matière d’énergie, de climat et de foncier.

Ces différences expliquent pourquoi un chiffre unique de capacité nationale peut masquer des goulets d’étranglement locaux. La demande, l’électricité, les terrains disponibles, la latence réseau, les talents techniques et les écosystèmes logiciels ne se trouvent pas aux mêmes endroits.

Le principal changement apporté par la conférence était donc conceptuel. Les autorités et les opérateurs ont publiquement considéré la production productive comme une mesure concurrentielle plus importante que le volume de construction.

Ce jugement crée une épreuve bien plus difficile. Construire une installation est visible et mesurable. Prouver qu’elle fournit une production d’IA fiable et économique exige des preuves opérationnelles continues.

Pourquoi les données de la China Computing Power Conference modifient le critère concurrentiel

La nouvelle compétition est centrée sur la puissance de calcul effective, c’est-à-dire la production utile qu’un système fournit après les pertes et contraintes opérationnelles.

La puissance de calcul effective ne correspond pas simplement aux performances théoriques des puces multipliées par le nombre d’accélérateurs installés. Elle reflète la quantité de travail exploitable qui subsiste après les délais de communication, les pannes, les conflits d’ordonnancement, les limites de mémoire et les temps d’inactivité.

Wang Yue, spécialiste du calcul et de l’énergie à la China Academy of Information and Communications Technology, a décrit plusieurs facteurs opérationnels influençant cette production. Ils incluent la parallélisation, le découpage des tâches, le contrôle de congestion, la reprise après panne, l’équilibrage de charge et l’orchestration des ressources.

La parallélisation répartit une tâche importante entre de nombreux processeurs. Une mauvaise répartition peut laisser certains appareils en attente tandis que d’autres supportent des charges excessives.

L’efficacité des communications devient de plus en plus importante à mesure que les clusters grandissent. Les accélérateurs doivent échanger des paramètres et des résultats intermédiaires, souvent plusieurs fois au cours d’une seule étape d’entraînement.

Une liaison lente ou congestionnée peut contraindre des processeurs coûteux à attendre. Le cluster reste installé et alimenté, mais son débit réel tombe sous sa capacité annoncée.

La gestion des pannes crée un autre écart. Les grands clusters comportent suffisamment de composants pour que les défaillances matérielles et réseau deviennent des événements opérationnels courants plutôt que de rares exceptions.

Un système résilient peut rediriger le travail ou restaurer des points de contrôle avec un délai limité. Un système plus faible peut perdre des heures de traitement ou redémarrer une tâche importante.

L’orchestration des ressources détermine quelle charge de travail reçoit quels processeurs, quelle mémoire, quelle capacité réseau et quel accès au stockage. Une orchestration insuffisante peut immobiliser du matériel exploitable alors que des clients attendent une configuration compatible.

Ces enjeux deviennent plus complexes à l’échelle désormais envisagée par la politique chinoise. Un plan sectoriel du 7 septembre appelait à un déploiement ordonné de clusters comprenant 10 000, 100 000 accélérateurs ou davantage.

Le plan insistait aussi sur des infrastructures d’inférence adaptées à des scénarios spécifiques et sur une adaptation accrue aux puces produites localement. L’inférence est le processus qui consiste à exécuter un modèle entraîné afin de générer un résultat.

L’entraînement et l’inférence créent des exigences d’infrastructure différentes. L’entraînement favorise souvent de grands clusters étroitement interconnectés, capables de traiter de longues tâches.

La demande d’inférence est plus fragmentée. Elle peut nécessiter une faible latence, des temps de réponse prévisibles, une proximité géographique et une montée en charge rapide face à l’évolution du trafic utilisateur.

Zhou Zhengang, vice-président de la recherche chez IDC China, a déclaré à CLS que le marché des AIDC fait face à une rareté structurelle plutôt qu’à une pénurie uniforme. AIDC désigne des centres de données conçus autour de charges de travail d’IA.

Selon Zhou, la capacité générale d’entraînement s’est développée rapidement. Les capacités d’inférence de haute qualité et les ressources conçues pour les agents d’IA restent plus limitées.

Cette évaluation complique les affirmations d’excédent généralisé comme de pénurie universelle. Ces deux situations peuvent coexister selon les types de matériel, les régions, les piles logicielles et les segments de clientèle.

Un opérateur télécom peut disposer de racks disponibles mais manquer de l’environnement logiciel requis par une entreprise de modèles. Un cluster de l’ouest peut proposer des coûts d’électricité plus faibles tout en offrant une latence inadaptée à un client de l’est.

Un fournisseur de cloud peut réserver sa meilleure capacité à ses modèles internes et à ses clients existants. Un opérateur indépendant peut alors avoir du mal à obtenir à la fois un matériel adapté et une demande fiable.

Le reportage sectoriel original a illustré cette divergence. Un professionnel a indiqué que la demande était moins surchauffée que durant la première phase d’expansion, tandis que les grandes entreprises technologiques faisaient toujours face à une offre tendue.

Le centre de données de China Unicom dans le nord de la Chine présentait l’autre versant de cette situation. Sa direction a indiqué que des clients avaient manifesté leur intention d’achat avant la construction d’une installation prévue.

Selon l’opérateur, le campus de Langfang comptait six bâtiments de centres de données en activité, 18 600 racks et environ 660 000 serveurs déployés. Sa capacité existante de calcul intelligent était annoncée à 3 425 pétaflops.

Le campus prévoyait trois bâtiments supplémentaires de calcul intelligent en 2026. Le projet divulgué comprenait 315 mégawatts de capacité de centre de données et une hausse substantielle du calcul général comme du calcul intelligent.

Ces projets montrent pourquoi la construction ne s’est pas arrêtée. Le marché différencie la capacité qui existe quelque part de celle qui répond aux exigences techniques réelles d’un client.

Pour les opérateurs, la puissance de calcul effective transforme les logiciels et les opérations en infrastructure commerciale. Une capacité nominale plus faible peut avoir davantage de valeur commerciale lorsqu’elle exécute plus de charges de travail de manière fiable.

Pour les clients, ce changement encourage des questions d’approvisionnement plus précises. Les acheteurs doivent examiner le débit délivré, les temps d’attente, les taux de panne, les performances réseau et la compatibilité logicielle.

Un nombre d’accélérateurs cité ne peut pas répondre à ces questions. La taille d’un bâtiment ou le nombre de racks installés non plus.

Les fournisseurs de cloud et les opérateurs télécoms arrivent avec des avantages différents

Les entreprises de cloud disposent d’un avantage en matière de logiciels et de clients, tandis que les opérateurs télécoms contrôlent les installations et les actifs de réseau nationaux.

Cette répartition constitue la principale tension concurrentielle derrière le débat sur l’utilisation à la conférence. Les deux groupes peuvent construire des clusters, mais ils abordent la production effective depuis des points de départ différents.

Les grands fournisseurs de cloud relient l’infrastructure aux modèles, aux outils de développement, aux clients du cloud public et aux plateformes logicielles établies. Ils peuvent diriger la demande interne et externe vers leurs propres installations.

Alibaba Cloud, Tencent Cloud et ByteDance exploitent également des services qui génèrent des charges de travail d’IA récurrentes. Leur visibilité sur la demande peut réduire le risque de construire des clusters sans clients.

Leur position full-stack offre un autre avantage. Les fournisseurs de cloud peuvent optimiser conjointement les frameworks de modèles, les logiciels d’ordonnancement et l’infrastructure.

Cette intégration est importante lorsque les clients ont besoin de charges de travail spécialisées d’inférence ou d’agents. L’opérateur peut optimiser les couches de l’application, du modèle, de l’environnement d’exécution et du matériel.

Les opérateurs télécoms arrivent avec de vastes parcs de centres de données, des réseaux dorsaux, des raccordements électriques et une présence régionale. China Mobile, China Telecom et China Unicom peuvent relier des installations dans de nombreuses villes.

Toutefois, les opérateurs télécoms disposent souvent d’écosystèmes de modèles et de logiciels d’IA moins solides que les grandes entreprises de cloud. Zhou a suggéré qu’ils pourraient prendre en charge l’externalisation d’infrastructures personnalisées pour les fournisseurs de cloud et de modèles.

Cela ne fait pas des opérateurs télécoms de simples bailleurs passifs. Leurs réseaux prennent davantage de valeur lorsque les charges de travail exigent une latence prévisible dans plusieurs régions.

La China Computing Platform a désormais relié les plateformes provinciales des 31 régions de niveau provincial. Des responsables ont présenté le système comme une couche nationale de supervision des inventaires, des conditions d’exploitation et de la disponibilité des ressources.

La plateforme comptait plus de 10 000 entreprises enregistrées, plus de 2 000 produits de calcul référencés et plus de 300 modèles connectés. Elle avait également accumulé des milliards d’enregistrements de supervision.

La plateforme nationale améliore la visibilité, mais la visibilité ne garantit pas la réussite de la migration des charges de travail. Une inscription sur une place de marché ne peut pas éliminer les contraintes de latence, de gouvernance des données ou de compatibilité logicielle.

Les fournisseurs AIDC indépendants se trouvent dans une position plus difficile. Les grands opérateurs disposant de clients cloud de référence peuvent se spécialiser ou obtenir de longs contrats.

Les plus petits fournisseurs disposent de moins de capitaux, d’un accès plus limité à l’électricité et de moins de clients garantis. Ils risquent de devenir des sous-traitants ou de desservir des marchés régionaux et sectoriels étroits.

Les développeurs de modèles constituent un quatrième groupe. Les entreprises de premier plan peuvent construire des clusters afin de sécuriser leur capacité d’entraînement et de gérer les risques d’approvisionnement à long terme.

Elles peuvent toutefois continuer à acheter des capacités d’inférence ou des services fondés sur les tokens auprès de fournisseurs externes. Les services de tokens vendent la sortie d’un modèle plutôt qu’un accès brut au matériel.

Cette séparation peut accroître la flexibilité, mais elle modifie aussi les critères de comparaison des clients d’infrastructure. Ils s’intéressent moins à la possession d’une baie donnée qu’au coût et à la fiabilité d’une sortie de modèle exploitable.

La frontière concurrentielle restera mouvante. Une entreprise cloud peut louer une installation télécom, tandis qu’un opérateur télécom fournit le réseau et du matériel personnalisé.

Un fournisseur indépendant peut se spécialiser dans un secteur soumis à des exigences strictes de localisation des données. Une entreprise de modèles peut réserver sa capacité interne à l’entraînement tout en externalisant les flux d’inférence imprévisibles.

Le gagnant ne possédera pas nécessairement la plus grande empreinte physique. Il reliera la demande, le matériel, les logiciels, l’électricité et le réseau avec le moins de pertes opérationnelles possible.

Cette norme renforce aussi l’importance de mesures transparentes. Les fournisseurs peuvent définir la capacité différemment, notamment selon les types de processeurs et la précision numérique.

Un chiffre en EFLOPS mesuré en FP16 ne peut pas être comparé sans précaution à un chiffre mesuré dans un autre format. Les charges de travail réelles dépendent aussi de la bande passante mémoire, des interconnexions et de l’optimisation logicielle.

Les clients ont besoin d’éléments de preuve au niveau des charges de travail. Parmi les mesures utiles figurent les étapes d’entraînement terminées, les tokens produits, la latence de réponse, les taux d’achèvement des tâches et l’énergie consommée par tâche.

Sans reporting cohérent, la puissance de calcul effective risque de devenir une nouvelle étiquette promotionnelle. Le concept n’a de valeur que si les opérateurs le relient à des résultats de production observables.

Le chiffre de sept provinces laisse encore des questions importantes

Le déploiement des baies révèle un déséquilibre régional, mais il ne prouve pas que chaque serveur actif réalise un travail d’IA utile.

Le seuil de 75 % peut facilement être mal interprété. Il mesure si les emplacements disponibles dans les centres de données ont été occupés, et non si les accélérateurs restent pleinement utilisés.

Il n’identifie pas non plus les sept provinces dans la couverture publique de la conférence examinée pour cet article. L’analyse régionale associée indiquait seulement que le Shanxi, le Qinghai et le Xinjiang obtenaient de bons résultats en matière de déploiement de baies.

Cette omission limite les comparaisons. Les lecteurs ne peuvent pas déterminer à quelle distance les autres provinces se situent sous les 75 %, ni si les taux régionaux s’appuient sur des échantillons d’installations pleinement comparables.

Les données historiques apportent un certain contexte. Un livre blanc de la CAICT publié en 2023 indiquait que les dix provinces affichant les taux de déploiement les plus élevés à la fin de 2022 dépassaient toutes 55 %.

Le point de référence antérieur attribuait le faible taux global de déploiement en partie à un positionnement régional peu clair et à des écosystèmes industriels incomplets. Il recommandait une planification coordonnée afin d’équilibrer les investissements et l’utilisation.

La statistique plus récente de 75 % suggère une amélioration chez les leaders, mais elle n’établit pas une série chronologique nationale. Les seuils, les populations d’installations et les méthodes de reporting devraient être harmonisés.

Une deuxième incertitude concerne l’expression « capacité de calcul intelligent en service ». La couverture publiée faisait état de 2 185 EFLOPS parallèlement à l’avertissement sur le déploiement des baies.

« En service » peut décrire une infrastructure mise en exploitation plutôt qu’une utilisation productive continue. Cette expression ne doit pas être interprétée comme la preuve que chaque opération répond à une charge de travail client.

Un troisième enjeu concerne la qualité des charges de travail. Un cluster peut afficher un taux d’utilisation élevé tout en exécutant des tâches à faible valeur, des logiciels inefficaces ou des charges de travail principalement subventionnées pour remplir la capacité.

Une production commercialement utile exige plus qu’une activité. Le travail doit répondre aux exigences des clients à un coût d’exploitation soutenable.

Le rapport de la conférence a identifié trois grandes contraintes : les écarts de développement régional, la faible intégration avec les cas d’usage industriels et les obstacles à l’ordonnancement interrégional. Chacune peut réduire différemment la production utile.

Les écarts régionaux placent la demande et les infrastructures dans des lieux différents. Les provinces de l’Est accueillent de nombreux développeurs et utilisateurs de modèles, mais font face à des contraintes plus fortes en matière d’énergie et de foncier.

Les régions de l’Ouest peuvent offrir de l’électricité renouvelable, des climats plus frais et de l’espace pour des installations plus grandes. La distance introduit des contraintes de latence et de transfert de données.

Les tâches d’entraînement et le stockage à froid tolèrent davantage la distance que l’inférence interactive. Un agent d’IA destiné aux clients peut exiger des réponses suffisamment rapides pour que la géographie devienne déterminante.

L’ordonnancement interrégional soulève également des préoccupations en matière de sécurité et de gouvernance. Le déplacement de données ou de résultats intermédiaires peut entrer en conflit avec les politiques des clients, les obligations réglementaires ou les limites de bande passante.

L’intégration industrielle pose un autre défi. La construction d’un cluster ne crée pas automatiquement une demande de la part des fabricants, des hôpitaux, des institutions financières ou des collectivités locales.

Ces organisations ont besoin de modèles compatibles, de données propres, d’une approbation des achats et de flux de travail repensés. Le matériel peut arriver bien avant que ces éléments soient prêts.

Le contre-exemple le plus fort est venu du Hebei, la province hôte. Des responsables ont indiqué 556 EFLOPS de capacité de calcul intelligent et 2,5 millions de baies standard en exploitation.

Le Hebei a également déclaré un taux d’utilisation supérieur à 80 %. La province a relié son programme d’infrastructure à 441 grands modèles verticaux et 98 agents dans 26 secteurs.

Il s’agit d’affirmations régionales officielles, et non de mesures de charges de travail auditées indépendamment. Elles montrent néanmoins le type de lien avec la demande que les autres provinces sont encouragées à construire.

Langfang offre une stratégie particulièrement réfléchie. La ville est suffisamment proche de Pékin pour viser une inférence à faible latence plutôt que de reproduire les pôles d’entraînement de l’Ouest.

Des responsables ont indiqué que les données peuvent atteindre un nœud central de Pékin en environ une milliseconde. Langfang a déclaré disposer de 36 grands centres de données en exploitation et d’une offre de calcul intelligent de plus de 200 000 pétaflops.

Son emplacement soutient un modèle complémentaire : Pékin peut concentrer la recherche et les applications, tandis que Langfang voisin prend en charge le calcul en temps réel. Les pôles de l’Ouest peuvent servir des charges de travail moins sensibles à la latence.

Cette spécialisation est plus crédible que de considérer chaque province comme un emplacement de cluster interchangeable. Elle aligne la conception des installations sur les clients et les conditions de réseau.

Même ainsi, cette approche doit prouver que la demande locale croît avec l’offre. Les subventions, les coupons de calcul et les coupons de modèles peuvent accélérer l’adoption, mais ils peuvent aussi masquer l’économie sous-jacente.

Le cadre de calcul effectif de la conférence devrait donc être considéré comme une orientation vérifiable. Il ne constitue pas encore une mesure nationale de performance standardisée.

L’électricité, le refroidissement et les réseaux définissent désormais la capacité utile

Un cluster ne peut pas fournir une puissance de calcul effective lorsque l’électricité, les systèmes thermiques ou les liaisons de données deviennent la ressource limitante.

L’infrastructure d’IA exerce une pression inhabituelle sur ces trois systèmes. Les baies d’accélérateurs denses consomment davantage d’électricité et dégagent plus de chaleur que les serveurs d’entreprise traditionnels.

Les participants à la conférence ont déclaré que la part d’électricité verte, la densité de puissance des baies et la capacité de refroidissement liquide avaient remplacé la superficie foncière et le nombre de baies comme mesures critiques de valorisation.

Le refroidissement liquide transfère la chaleur via un fluide à proximité des processeurs. Il peut prendre en charge une densité de baies supérieure à celle du refroidissement par air conventionnel, même si sa mise en œuvre et sa maintenance restent complexes.

La disponibilité de l’électricité affecte à la fois la vitesse d’expansion et le coût d’exploitation. Les grands projets nécessitent de plus en plus des centaines de mégawatts, tandis que les plus grandes propositions internationales approchent une alimentation à l’échelle du gigawatt.

Les prix régionaux de l’électricité peuvent donc remodeler la concurrence. L’installation de China Unicom à Huailai a indiqué un prix de l’électricité proche de 0,62 yuan par kilowattheure.

L’opérateur a comparé ce tarif à des prix supérieurs à 0,40 yuan en Mongolie-Intérieure et à 0,50 yuan au Shanxi. Certains projets occidentaux auraient atteint des tarifs subventionnés plus bas.

Ces chiffres proviennent de déclarations d’entreprises et peuvent dépendre des contrats, des subventions et des profils de consommation. Ils illustrent néanmoins pourquoi un matériel identique peut avoir une économie d’exploitation différente.

Des coûts énergétiques élevés réduisent la valeur commerciale de chaque tâche d’IA achevée. Ils peuvent également décourager les clients de confier leurs charges de travail à une région.

Les opérateurs réagissent par des accords directs d’approvisionnement en énergie renouvelable, le commerce de l’électricité et l’ordonnancement flexible des charges. L’ordonnancement flexible déplace les travaux appropriés vers les périodes ou les lieux où l’électricité est plus disponible.

L’orientation de la politique nationale soutient cette approche. Le plan chinois pour les infrastructures appelle à une coordination entre le calcul, le stockage, les réseaux, l’électricité et la comptabilité carbone.

La politique d’infrastructure encourage également les réseaux de calcul, la coordination des ressources hétérogènes et un déploiement adapté aux besoins industriels. Ces priorités sont antérieures à la conférence de 2026, mais revêtent désormais une urgence opérationnelle plus forte.

Les réseaux restent tout aussi importants. La Chine a fait état de plus de 70 routes de transmission reliant les pôles nationaux de calcul et d’autres régions clés.

Des responsables ont également indiqué que 17 nœuds régionaux nationaux d’interconnexion du calcul avaient été approuvés. Le nœud régional du Hebei est entré en fonctionnement durant la conférence.

Ces projets améliorent la capacité à découvrir et connecter les ressources. Ils ne garantissent pas que chaque charge de travail puisse se déplacer économiquement entre les régions.

La latence réseau peut être tolérée pour l’entraînement asynchrone de modèles ou le traitement de données. L’inférence interactive et les systèmes multi-agents exigent souvent des objectifs de réponse plus stricts.

Les coûts de bande passante comptent également lorsque les jeux de données d’entraînement ou les points de contrôle de modèles atteignent des tailles importantes. Le transfert du travail peut annuler les économies permises par une électricité moins chère.

Wu Hequan, académicien de l’Académie chinoise d’ingénierie, a proposé de combiner le calcul local et distant. Un système pourrait effectuer une tâche initiale localement et envoyer le traitement plus lourd ailleurs.

Il a également évoqué la séparation des différentes étapes d’inférence et l’utilisation du chiffrement ou du masquage des données. Ces conceptions cherchent à équilibrer latence, énergie et sécurité.

Une autre proposition concernait des réseaux optiques plus plats pour accélérer l’ordonnancement et réduire la consommation d’énergie. Ces technologies doivent encore passer des démonstrations à des environnements de production stables.

La fiabilité opérationnelle reste la dernière couche. L’installation de China Mobile dans la région Pékin-Tianjin-Hebei présentait plusieurs protections électriques, notamment des alimentations réseau indépendantes, des générateurs diesel et des systèmes d’alimentation sans interruption.

Cette installation disposait apparemment de 15 générateurs diesel de 2 000 kilowatts chacun et d’une réserve de carburant dédiée. Ces systèmes de secours protègent la disponibilité, mais ajoutent des coûts de capital, de maintenance et environnementaux.

Chaque couche de support influe sur la production utile. Un accélérateur qui attend des données, surchauffe, perd son alimentation ou redémarre régulièrement apporte peu, quelle que soit sa vitesse théorique.

C’est pourquoi l’évolution vers une puissance de calcul effective dépasse les fournisseurs de puces. Elle modifie les priorités d’achat en matière d’équipements réseau, de stockage, de refroidissement, de gestion de l’alimentation et de logiciels de cluster.

Elle favorise également les équipes qui documentent efficacement leurs décisions d’infrastructure et les incidents d’exploitation. Les clusters complexes génèrent d’importants volumes de journaux, de notes de conception et de dossiers de dépannage.

Les équipes d’ingénierie peuvent transformer ces éléments en une base de connaissances techniques consultable. Un accès plus rapide aux correctifs antérieurs peut réduire les efforts de diagnostic répétés, sans toutefois remplacer des opérations matures.

Trois signaux montreront si la puissance de calcul effective s’impose

Le prochain test consistera à voir si le langage employé lors de la conférence produit des changements mesurables dans l’utilisation, la livraison des charges de travail et la spécialisation régionale.

Le premier signal concerne la publication des taux d’utilisation par province. Les futurs rapports devront fournir des résultats régionaux nommés, des définitions cohérentes et des mesures comparables du déploiement des racks et de l’utilisation des accélérateurs.

Ces éléments renforceraient la thèse de la puissance de calcul effective si davantage de provinces dépassaient le seuil de 75 % sans s’appuyer sur des catégories de capacité vagues. Ils l’affaibliraient si les informations publiées restaient trop limitées pour être vérifiées.

Le deuxième signal est l’existence de véritables flux de charges de travail interrégionaux. La plateforme nationale couvre désormais 31 régions de niveau provincial, des milliers de produits et des centaines de modèles connectés.

Le résultat important n’est pas le nombre de ressources figurant dans un catalogue. C’est le nombre de charges de travail de production qui circulent avec succès entre les régions tout en respectant les exigences de latence, de sécurité, de fiabilité et de coût.

Une hausse des tâches interrégionales achevées montrerait que le réseau réduit les déséquilibres entre l’offre et la demande. Le maintien d’une concentration des applications d’IA générative à Beijing, Shanghai et Guangdong en révélerait les limites.

Le troisième signal concerne la manière dont les fournisseurs commercialisent les capacités d’inférence et d’agents. Les entreprises cloud, les opérateurs télécoms et les installations indépendantes convergent vers les mêmes clients avec des actifs différents.

Surveillez les contrats fondés sur les tokens, le débit fourni, la latence et la fiabilité du service. Ces critères relient plus directement les dépenses d’infrastructure aux résultats obtenus par les clients que les décomptes de racks ou d’accélérateurs.

Surveillez également les opérateurs qui remportent des charges de travail d’inférence récurrentes. Les projets d’entraînement peuvent être importants mais temporaires, tandis que la demande d’inférence croît avec l’usage quotidien des applications.

La China Computing Power Conference a établi un constat clair : le volume de construction ne constitue plus une mesure suffisante du progrès. La statistique des sept provinces a rendu ce constat difficile à ignorer.

La Chine a encore besoin de davantage de capacités d’IA spécialisées sur plusieurs marchés. Dans le même temps, les capacités existantes doivent devenir plus faciles à découvrir, planifier, alimenter, refroidir et connecter.

Pour les développeurs et les acheteurs en entreprise, la question pratique est simple. Un fournisseur propose-t-il une capacité théorique, ou peut-il documenter les performances réellement obtenues par les charges de travail ?

Pour les opérateurs d’infrastructure, le défi est plus difficile. Ils doivent transformer des puces, des bâtiments, de l’électricité, des réseaux et des logiciels en production fiable tout en maintenant l’activité de leurs clients.

Au cours des trois prochains mois, regardez au-delà des annonces de nouveaux clusters. Suivez les taux d’utilisation publiés, les charges de travail interrégionales achevées et les contrats liés à une production d’IA effectivement fournie.

Ces indicateurs montreront si la puissance de calcul effective devient une discipline opérationnelle ou reste un slogan de conférence.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page