Analyse 4-hi HBM de SemiAnalysis : pourquoi des piles plus courtes pourraient s’imposer dans l’inférence IA
SemiAnalysis remet en question la course à la hausse de l’industrie de la mémoire pour l’IA, avançant que le HBM 4-hi peut fournir toute la bande passante avec trois fois moins de dies DRAM.
Cette affirmation compte, car les fabricants d’accélérateurs ont passé des années à empiler davantage de couches mémoire. Des piles plus hautes ont accru la capacité, pris en charge des modèles plus grands et contribué à faire de la mémoire à large bande passante un élément essentiel du calcul IA.
L’analyse 4-hi HBM de SemiAnalysis estime que l’inférence change désormais cette équation. Les systèmes à l’échelle du rack offrent davantage de capacité totale, tandis que la quantification et le déport de cache réduisent la quantité que chaque GPU doit contenir.
Le rapport ne dit pas que chaque charge de travail nécessite moins de mémoire. L’entraînement, les grands lots et les futurs modèles peuvent encore favoriser des piles plus hautes. Son argument le plus précis concerne l’inférence interactive, où la bande passante limite souvent la génération de tokens avant que la capacité ne devienne rare.
Cela crée une confrontation directe entre deux priorités de conception. L’une privilégie la capacité mémoire maximale par accélérateur. L’autre privilégie la bande passante maximale en tokens issue de chaque wafer DRAM soumis à des contraintes.
La réduction de mémoire annoncée pour Rubin Ultra de Nvidia fournit le signal immédiat. Selon SemiAnalysis, l’accélérateur embarquera 192GB de HBM, contre 288GB sur Rubin standard et Blackwell Ultra.
L’entreprise n’a pas détaillé publiquement de configuration Rubin Ultra 4-hi. Toutefois, l’orientation signalée vers des piles 8-hi suggère que des HBM toujours plus hautes ne constituent plus un choix automatique.
Si ce raisonnement s’étend au HBM4E 4-hi, l’infrastructure IA pourrait utiliser moins de dies DRAM sans sacrifier la bande passante externe de chaque pile. Cela réduirait les coûts mémoire et permettrait de produire davantage de boîtiers HBM exploitables à partir d’une offre limitée de wafers.
La feuille de route mémoire de Nvidia ne progresse plus dans une seule direction
Le changement significatif n’est pas que Nvidia ait soudainement besoin de peu de mémoire. C’est que la capacité supplémentaire ne semble plus avoir de valeur à n’importe quel prix.
Blackwell Ultra a clairement établi l’orientation vers une grande capacité. Nvidia indique 288GB de HBM3E par GPU Blackwell Ultra et 20TB sur un rack GB300 NVL72.
Les spécifications du GB300 de l’entreprise indiquent également une bande passante mémoire GPU agrégée atteignant 576TB par seconde. Ces chiffres expliquent pourquoi Nvidia mettait auparavant l’accent à la fois sur la capacité et la bande passante.
SemiAnalysis rapporte désormais que Rubin Ultra inversera une partie de cette tendance. Les 192GB attendus par GPU représentent une réduction d’un tiers par rapport à Blackwell Ultra et au Rubin conventionnel.
La comparaison exige une certaine prudence. L’architecture de Rubin Ultra serait passée de quatre dies de calcul à deux. Sa capacité mémoire initialement attendue appartenait donc à une conception de système différente.
Même après normalisation de ce changement, SemiAnalysis estime que la mémoire passe de 256GB auparavant par die de calcul à 96GB. Il s’agit d’une réinitialisation architecturale majeure, et non d’un simple ajustement cosmétique des spécifications.
Le rapport identifie l’approvisionnement comme l’une des raisons. Nvidia aurait sécurisé d’importantes capacités de logique avancée et de packaging, mais les wafers HBM disponibles ne peuvent pas prendre en charge des volumes équivalents de piles 12-hi.
Une pile 12-hi contient douze dies DRAM principaux au-dessus de son die de base. Une pile 8-hi en utilise huit, ce qui permet à une même quantité de DRAM traitée de prendre en charge davantage de piles finies.
C’est important car le HBM consomme plus de capacité de fabrication par bit que la DRAM conventionnelle. Les vias traversant le silicium, appelés TSV, transportent verticalement les signaux et l’alimentation à travers la pile mémoire.
Ces TSV exigent des étapes de traitement supplémentaires. Les dies HBM réservent également de la surface aux connexions verticales, ce qui réduit la densité en bits par rapport à une mémoire ordinaire fabriquée sur un procédé similaire.
SemiAnalysis avait auparavant estimé que le HBM consomme environ trois fois plus de capacité de wafer par bit que la DRAM standard. Son estimation approche quatre fois plus à mesure que la production bascule vers HBM4.
Ce chiffre est une estimation d’analyste, et non une norme industrielle. Toutefois, la charge de fabrication sous-jacente est bien établie chez les fournisseurs de mémoire.
SK hynix, Samsung et Micron doivent traiter, amincir, connecter, tester et encapsuler plusieurs dies connus comme fonctionnels. Chaque couche supplémentaire accroît l’utilisation de matériaux et expose le boîtier à des risques de rendement additionnels.
Les piles plus hautes ont historiquement justifié cette charge parce que les accélérateurs avaient besoin de leur capacité. Les poids des modèles, activations, gradients, états d’optimiseur et caches clé-valeur se disputent tous la mémoire selon les charges de travail.
La nouvelle décision suggère que la capacité a franchi un seuil pour certains systèmes d’inférence. Une fois qu’un rack contient l’ensemble de travail requis, ajouter de la mémoire à chaque GPU produit moins de valeur.
Nvidia n’a pas confirmé publiquement la répartition exacte de capacité de Rubin Ultra avancée par SemiAnalysis. Cette affirmation doit donc rester un changement de feuille de route rapporté, et non une spécification produit finalisée.
Néanmoins, les préparatifs de la chaîne d’approvisionnement peuvent révéler une direction avant un lancement public. SemiAnalysis affirme que les fournisseurs préparent des configurations 8-hi pour qu’elles deviennent la norme après une poussée de l’industrie vers les produits 12-hi et 16-hi.
Ce changement rapporté ouvre la voie au HBM 4-hi. Si huit couches suffisent, les concepteurs doivent se demander si quatre couches peuvent servir certains déploiements d’inférence de manière plus économique.
Cette question aurait semblé à contre-courant durant la récente course à la capacité. Dans un contexte de fortes contraintes sur la DRAM, elle devient l’un des choix architecturaux les plus pragmatiques de l’industrie.
Le HBM 4-hi de SemiAnalysis conserve la bande passante tout en retirant des dies
Une pile HBM plus courte réduit la capacité, mais ne réduit pas automatiquement la bande passante externe du boîtier.
Le HBM transfère les données par une interface très large plutôt qu’en s’appuyant uniquement sur une vitesse de signalisation extrême. HBM4 étend cette interface à 2 048 connexions de données par pile.
La norme HBM4 a été publiée par JEDEC en avril 2025. Elle définit les fondations d’une nouvelle génération de mémoire pour l’IA et le calcul haute performance.
Selon SemiAnalysis, chaque die DRAM HBM4 peut accéder à jusqu’à 512 des connexions de données de la pile. Quatre dies peuvent donc peupler les 2 048 connexions.
L’ajout d’un cinquième au douzième die accroît la capacité. Il n’élargit pas l’interface externe au-delà de ces 2 048 connexions.
Les broches disponibles sont réparties entre davantage de couches mémoire dans une pile plus haute. La pile présente toujours la même interface globale à l’accélérateur.
C’est le mécanisme central de l’argument en faveur des piles courtes. Un boîtier 4-hi, 8-hi ou 12-hi peut offrir une bande passante nominale comparable lorsqu’ils utilisent la même génération et le même débit de signalisation.
Leurs capacités diffèrent fortement. SemiAnalysis modélise des dies principaux HBM4E de 32 gigabits, produisant 16GB pour le 4-hi, 32GB pour le 8-hi et 48GB pour le 12-hi.
Il s’agit de configurations futures modélisées, et non de produits de détail généralement disponibles. Elles illustrent comment le nombre de couches modifie la capacité tout en laissant intacte l’interface du boîtier.
La distinction économique découle de ce que consomment les fournisseurs. Le contenu DRAM représente une grande partie du coût d’une pile HBM, tandis que les clients de l’inférence valorisent souvent la bande passante alimentant leurs accélérateurs.
Un acheteur de 4-hi obtient moins de gigaoctets. Il peut néanmoins recevoir le chemin de données nécessaire pour maintenir les unités de calcul alimentées.
Cela modifie la mesure d’efficacité pertinente. Les achats axés sur la capacité demandent combien de gigaoctets tiennent à côté de chaque accélérateur. Les achats axés sur la bande passante demandent combien de tokens ces liaisons mémoire peuvent prendre en charge.
Pour l’inférence, la seconde question peut dominer. Le décodage autorégressif génère la sortie séquentiellement, et chaque étape doit lire les poids actifs du modèle depuis la mémoire.
Le processus effectue souvent relativement peu d’opérations arithmétiques pour chaque octet déplacé. Le décodage est donc limité par la bande passante mémoire : la livraison de données limite le débit avant la puissance de calcul brute.
Une pile plus haute n’aide que lorsque la charge de travail utilise sa capacité additionnelle. Sinon, les dies supplémentaires transportent des informations que la bande passante disponible ne peut pas lire assez fréquemment.
SemiAnalysis donne une bande passante HBM4E illustrative de 3 328GB par seconde par pile. Ce nombre est dérivé de 2 048 broches fonctionnant à 13 gigabits par seconde.
À 100 tokens générés par seconde, cela représente 33.28GB de bande passante théorique pour chaque token. L’ensemble de travail utile ne peut pas dépasser ce budget si chaque token doit le lire une fois.
Une pile de 48GB contiendrait alors plus de données que la bande passante théorique ne peut en parcourir par token. Une partie de la capacité resterait indisponible pour cette charge de travail spécifique à cette vitesse.
Les systèmes réels ne soutiennent jamais chaque unité de bande passante nominale. Les surcharges de protocole, les schémas d’accès, les communications et le comportement logiciel réduisent le débit effectif.
Cette limite peut renforcer l’argument en faveur des piles courtes. Une bande passante utile moindre signifie que la charge de travail atteint son plafond de bande passante avant de pouvoir exploiter toute la capacité installée.
Le HBM 4-hi expliqué par ce mécanisme n’est pas simplement une mémoire moins chère. C’est une configuration qui dissocie la bande passante externe de la densité verticale maximale.
Cette distinction affecte également la production manufacturière. Un wafer utilisé pour des piles à quatre couches peut théoriquement prendre en charge trois fois plus de boîtiers qu’un wafer utilisé pour des piles à 12 couches.
Les gains réels dépendent des rendements, de la disponibilité des dies de base, des tests et du débit de packaging. Les piles plus courtes devraient également éviter certaines pertes cumulatives d’assemblage associées aux couches supplémentaires.
SemiAnalysis soutient que la bande passante résultante par wafer HBM compte autant que les tokens par watt. Ces deux métriques mesurent la production IA utile par rapport à une ressource qui ne peut pas s’étendre rapidement.
Pourquoi l’inférence valorise davantage la bande passante que la capacité maximale
L’inférence interactive valorise une mémoire capable d’alimenter rapidement le processeur, tandis que la capacité inutilisée contribue peu au débit de tokens.
L’entraînement et l’inférence imposent des exigences différentes au HBM. L’entraînement stocke les poids, activations, gradients et données d’optimiseur tout en traitant de grands lots à travers les passes avant et arrière.
Cette charge de travail peut consommer une capacité énorme. Elle effectue également suffisamment d’opérations arithmétiques pour être limitée par le calcul durant de nombreuses opérations.
Le décodage d’inférence est différent. Le système lit à répétition les poids actifs et le cache clé-valeur de l’utilisateur, ou cache KV, tout en produisant un token après l’autre.
Le cache KV stocke les informations d’attention des tokens précédents. Il évite au modèle de recalculer toute la conversation chaque fois qu’il génère un autre token.
Davantage d’utilisateurs et des contextes plus longs agrandissent ce cache. Toutefois, une capacité plus importante n’a de valeur que si le système peut servir ces utilisateurs dans un objectif de latence acceptable.
Le traitement par lots complique le tableau. En traitant plusieurs requêtes ensemble, un serveur peut amortir une lecture des poids du modèle entre plusieurs utilisateurs.
Des lots plus grands améliorent le débit total, mais ils exigent aussi davantage de capacité de cache KV. C’est là que les piles 8-hi ou 12-hi peuvent retrouver un avantage.
Le compromis concerne l’interactivité. Un fournisseur peut attendre plus longtemps pour former des lots plus grands, ou retourner rapidement des tokens avec des lots plus petits.
SemiAnalysis modélise cette relation avec Kimi K3 sur une future configuration Rubin Ultra NVL576. Il constate que les piles plus hautes offrent des gains de débit décroissants à mesure que la vitesse requise par utilisateur augmente.
À 213 tokens par seconde modélisés pour chaque utilisateur, le rapport ne constate aucun avantage de débit au-delà du 4-hi. Le plafond de bande passante est atteint avant que la capacité mémoire supplémentaire ne devienne utile.
À d’autres points de la courbe, le 8-hi augmente le débit maximal de 8 percent. Une configuration 12-hi l’augmente de 10 percent par rapport au 4-hi.
Ces améliorations sont réelles au sein du modèle. La question est de savoir si elles compensent le surcoût de mémoire et de système.
SemiAnalysis estime que son système Rubin Ultra 8-hi modélisé coûte 12,1 % de plus que la configuration de référence 4-hi. Sa configuration 12-hi ajoute 26,3 %.
Il s’agit d’estimations d’analystes fondées sur des composants futurs et des prix de mémoire supposés. Ce ne sont ni des devis de fournisseurs ni des coûts de possession mesurés sur des systèmes Rubin Ultra déployés.
Dans le cadre de ces hypothèses, le débit progresse moins vite que le coût du système. Le coût par token qui en résulte est plus élevé pour les deux configurations plus hautes.
C’est l’affirmation la plus forte de SemiAnalysis dans le scénario HBM 4-hi. Les piles plus courtes ne font pas que réduire la facture matérielle ; elles améliorent la production modélisée par unité de dépense.
Le calcul à l’échelle du rack rend cet argument plus plausible. Les serveurs antérieurs connectaient huit GPU, de sorte que la mémoire de chaque appareil limitait fortement l’ensemble du système d’inférence.
Un système H100 HGX fournissait 640GB de HBM agrégée. Les poids des grands modèles pouvaient occuper l’essentiel de cette capacité avant même que le système ne stocke un cache KV important.
Le H200 a réduit cette pression en ajoutant de la mémoire à chaque GPU. À ce stade, une plus grande capacité par appareil avait une valeur opérationnelle immédiate.
GB300 NVL72 change d’échelle. Nvidia connecte 72 GPU Blackwell Ultra via NVLink, créant un domaine de communication partagé beaucoup plus vaste.
Le rack embarque environ 20TB de mémoire GPU. Sa capacité agrégée est bien supérieure à celle d’un serveur Hopper à huit GPU.
SemiAnalysis compare cette croissance à Kimi K3, un modèle mixture-of-experts de 2,8 billions de paramètres. Ces modèles n’activent qu’un sous-ensemble de leurs experts pour chaque token.
Le rapport estime qu’une réplique quantifiée de Kimi K3 occupe 1 561GB. Cela représenterait moins de 8 % d’une configuration GB300 NVL72 d’environ 21TB.
La quantification représente les nombres avec moins de bits, ce qui réduit le stockage des poids et le trafic mémoire. Elle échange une part de précision numérique contre des besoins matériels nettement inférieurs.
Les grands domaines NVLink répartissent également les experts sur davantage de GPU. Cette organisation accroît les besoins de communication, mais réduit le nombre de poids de modèle que chaque appareil doit conserver.
Rubin Ultra étendrait le domaine de NVL72 à NVL576. Cette multiplication par huit du nombre de GPU connectés peut compenser une réduction d’un tiers de la HBM par accélérateur.
La capacité passe donc d’un problème individuel par GPU à un problème d’allocation à l’échelle du rack. Un déploiement peut héberger un grand modèle tout en utilisant des piles de mémoire locale plus fines.
Cela n’élimine pas les contraintes de mémoire. Cela modifie l’endroit où les architectes les résolvent et la ressource qui devient rare en premier.
Le déport du cache aide, mais la HBM 4-hi n’est pas une solution gratuite
La stratégie des piles courtes ne fonctionne que lorsque le logiciel, la mémoire secondaire et le comportement des charges de travail empêchent la capacité HBM réduite de devenir le goulet d’étranglement.
SemiAnalysis a testé une partie de cette hypothèse avec une charge de travail InferenceX utilisant Kimi K3 et 16 GPU GB300. Huit GPU géraient le prefill, tandis que huit autres géraient le decode.
Le prefill traite le prompt avant le début de la génération de tokens. Le séparer du decode permet aux opérateurs d’ajuster chaque phase à des comportements de calcul et de mémoire différents.
L’expérience a réduit l’utilisation HBM autorisée de 92 % à 85 %. C’est bien moins que la réduction de capacité entre les piles 8-hi et 4-hi.
Toutefois, cette limite a fortement réduit l’espace disponible pour le cache KV. Selon le rapport, la capacité de cache KV d’inférence agrégée est passée de 53GB à 34GB par GPU.
Pour les paires désagrégées, le budget disponible est passé de 44GB à 24GB. Ces changements représentent des baisses de 36 % et 44 %.
Le débit est resté similaire pour la plupart des niveaux de concurrence testés. La configuration restreinte a déplacé les données inactives du cache KV vers la DRAM ordinaire du serveur.
Ce processus est appelé déport du cache KV. Il conserve les informations fréquemment consultées dans la HBM tout en transférant l’état des conversations moins actif vers une mémoire plus lente et plus grande.
Les charges de travail agentiques peuvent convenir à cette approche. Elles sont souvent en pause pendant l’exécution d’outils, l’exécution de code par les CPU ou l’attente d’informations provenant de services externes.
Durant ces pauses, le GPU n’a pas besoin immédiatement du cache de chaque conversation. Déplacer les données moins actives peut libérer de la HBM coûteuse pour les requêtes actives.
Le test restreint a rencontré une limite claire. Une fois la concurrence supérieure à 70, le débit a chuté de près de 30 % par rapport à la configuration dotée de davantage de mémoire.
L’occupation du cache KV GPU avait atteint 100 %. La préemption, les transferts répétés et les files d’attente ont alors réduit le travail utile.
L’exécution contrainte a également enregistré plus de dix fois plus de lectures depuis le cache KV basé sur la DRAM. Le déport a réduit la pression sur la capacité, mais augmenté le trafic dans une couche plus lente.
Ce résultat est à la fois encourageant et prudent. Il montre que le logiciel peut préserver les performances après une réduction significative de mémoire, mais seulement sous un seuil dépendant de la charge de travail.
Un service de production comptant de nombreux utilisateurs simultanés avec de longs contextes peut franchir ce seuil. Dans ce cas, des piles HBM plus hautes peuvent prendre en charge des lots plus grands et un débit total supérieur.
La capacité réseau compte également. Répartir les experts et les caches de modèles sur des centaines d’accélérateurs crée une communication all-to-all intensive.
Un système peut cesser d’être limité par la capacité mémoire et devenir limité par le réseau. Ce résultat immobilise toujours de la HBM supplémentaire, mais ne garantit pas de bonnes performances globales.
La DRAM secondaire constitue une autre contrainte. La mémoire serveur subit sa propre pression d’approvisionnement à mesure que les systèmes d’IA augmentent leur capacité côté CPU.
Le déport consomme également de l’énergie et ajoute de la complexité opérationnelle. Le logiciel doit décider ce qui reste actif, ce qui est déplacé et à quel moment les données doivent revenir.
De mauvaises décisions peuvent transformer les économies de capacité en pics de latence. L’architecture exige une planification rigoureuse, une gestion du cache et une isolation des charges de travail.
La croissance future des modèles représente l’incertitude la plus importante. SemiAnalysis reconnaît que son analyse applique une charge de travail actuelle à du matériel attendu plus tard.
Les serveurs d’IA restent souvent déployés pendant plus de cinq ans. Les modèles, les contextes, la concurrence des utilisateurs et les charges de raisonnement peuvent évoluer considérablement durant cette période.
Le rapport teste sous contrainte un modèle trois fois plus grand que Kimi K3 et nécessitant un cache par utilisateur trois fois supérieur. Les piles plus hautes deviennent plus utiles dans cette hypothèse.
Sa configuration 8-hi fournit 36 % de tokens totaux supplémentaires par rapport à la 4-hi. La version 12-hi en fournit 47 % de plus, bien que les deux fonctionnent à une vitesse par utilisateur inférieure.
Après prise en compte des coûts estimés, la configuration 8-hi devient favorable sous 180 tokens par seconde par utilisateur. Le système 12-hi ne parvient toujours pas à compenser son augmentation de coût modélisée.
Ces résultats montrent pourquoi la HBM 4-hi ne peut pas devenir une prescription universelle. La hauteur de pile privilégiée dépend de la taille du modèle, des objectifs de latence, du batching et de la durée de vie du système.
Les systèmes d’entraînement restent une cible particulièrement inadaptée à une réduction agressive de capacité. Leurs activations, gradients et états d’optimiseur peuvent utiliser toute la mémoire disponible.
Les systèmes d’inférence servant de nombreux modèles indépendants ont également besoin de capacité. Les opérateurs peuvent valoriser la flexibilité davantage que le coût le plus bas pour une charge de travail optimisée.
Les acheteurs de matériel font face à un problème d’optionnalité. Un accélérateur 4-hi peut être efficace pour le service actuel, mais restrictif lorsque les charges de travail évoluent.
Les chercheurs pourraient adapter les modèles au matériel installé. Les calculs en boucle, la quantification, les experts clairsemés et des caches plus petits peuvent réduire la dépendance aux paramètres stockés.
Cette adaptation n’est pas garantie. Les améliorations de qualité des modèles pourraient de nouveau provenir de nombres de paramètres plus élevés ou d’architectures gourmandes en mémoire.
La meilleure interprétation est donc plus limitée. La HBM à quatre couches offre une configuration robuste pour une inférence soigneusement caractérisée, et non un remplacement automatique des mémoires plus hautes.
Moins de couches mettent sous pression les fournisseurs de mémoire et les constructeurs de systèmes
Si les acheteurs optimisent la bande passante plutôt que les gigaoctets, la pression économique se déplace de la production de DRAM vers les dies de base, le packaging, le réseau et l’intégration complète du système.
SK hynix, Samsung et Micron ont passé des années à développer des HBM plus denses et plus hautes. Leurs feuilles de route mettent l’accent sur la capacité, la vitesse de signalisation, le rendement du packaging et le contrôle thermique.
SK hynix a commencé à fournir des échantillons HBM4 à 12 couches en 2025. Son annonce HBM4 décrivait des packages de 36GB offrant plus de 2TB par seconde de bande passante.
Cette orientation produit reste utile pour l’entraînement et l’inférence exigeante en capacité. Un basculement significatif vers le 4-hi introduirait une priorité d’achat très différente.
Les clients pourraient exiger la pleine bande passante d’interface avec moins de dies de base. Les fournisseurs expédieraient davantage de packages, mais moins de bits DRAM dans chacun d’eux.
À première vue, cela semble négatif pour les revenus HBM. Les fournisseurs ont bénéficié de la vente de davantage de contenu DRAM spécialisé dans chaque génération d’accélérateurs.
SemiAnalysis soutient que le résultat pourrait être plus équilibré. Des piles plus courtes pourraient améliorer les rendements d’assemblage et augmenter le nombre de packages commercialisables produits à partir de chaque wafer.
Un fournisseur pourrait également facturer la valeur de bande passante au lieu de traiter la HBM principalement comme un produit au gigaoctet. La question de savoir si les clients accepteront ce modèle reste incertaine.
L’avantage pour l’approvisionnement est plus clair. Passer de 12-hi à 4-hi triple théoriquement le nombre de groupes de dies de taille pile disponibles à partir d’une quantité fixe de DRAM.
L’augmentation réelle peut dépasser ce simple ratio si des piles plus courtes améliorent le rendement du packaging. Elle sera inférieure à ce ratio lorsque d’autres composants deviendront limitants.
Chaque package HBM nécessite toujours un die de base, des tests, un empilement et une fixation à côté d’un accélérateur. Multiplier la production de packages accroît la demande pour toutes ces étapes.
HBM4 rend le die de base plus important, car il comprend davantage de logique et peut utiliser un procédé de fonderie avancé. Les économies de DRAM ne créent pas une capacité de fonderie équivalente.
Davantage de packages mémoire nécessitent également davantage de packages accélérateurs. Ces packages requièrent des interposeurs, des substrats organiques, une alimentation électrique, du refroidissement et un assemblage haute densité.
Le goulet d’étranglement peut donc migrer plutôt que disparaître. Les wafers logiques, les dies de base, les substrats, les cartes de circuits imprimés et l’intégration système seraient tous confrontés à une demande plus élevée.
Les grands domaines scale-up renforcent une autre contrainte. Davantage d’accélérateurs exigent une commutation et un réseau étendus avant que leur mémoire agrégée ne puisse se comporter comme une ressource partagée réellement pratique.
Le GB300 NVL72 de Nvidia utilise neuf plateaux NVSwitch pour connecter 72 GPU. Son tissu NVLink de cinquième génération fournit 130TB par seconde de bande passante agrégée.
Les futurs systèmes NVL576 devront étendre cette échelle de manière substantielle. Leur économie dépend du maintien d’un réseau suffisamment rapide pour prendre en charge les experts distribués et les mouvements de cache.
L’énergie reste la limite finale. Doubler le nombre de packages HBM riches en bande passante n’aide que si les opérateurs peuvent déployer les accélérateurs auxquels ils sont attachés.
Une stratégie 4-hi peut étendre l’approvisionnement en DRAM sans produire de nouvelle capacité électrique. La construction des centres de données, le refroidissement et l’accès au réseau électrique déterminent toujours la capacité de calcul utilisable.
Cette pression explique pourquoi les tokens par wafer HBM constituent une mesure utile, mais incomplète. Les opérateurs doivent optimiser simultanément les tokens par watt, par rack, par port réseau et par budget d’investissement.
Ce changement affecterait également les marchés de mémoire conventionnelle. La production de HBM entre en concurrence avec la DRAM pour serveurs, PC et mobiles pour les ressources de fabrication.
Utiliser moins de dies HBM peut rendre une partie de la capacité de wafers disponible pour ces produits. Ce soulagement importe alors que la mémoire côté CPU augmente parallèlement aux déploiements d’IA agentique.
Toutefois, le bénéfice dépend de l’adoption réelle. Une conception 4-hi permettant des expéditions bien plus nombreuses d’accélérateurs pourrait absorber une partie des économies par un volume total d’unités plus élevé.
Les fournisseurs de mémoire pourraient également résister à une évolution rapide si elle affaiblit la demande en bits. Leur réponse apparaîtra à travers la disponibilité des produits, les calendriers de qualification et l’allocation des capacités.
Le véritable enjeu n’oppose donc pas Nvidia à un seul fournisseur de mémoire. Il oppose une conception de l’inférence centrée sur la bande passante à une économie de la HBM centrée sur la capacité.
Cette grille de lecture clarifie les conséquences pour l’industrie. Les piles courtes l’emportent lorsque la bande passante génère des revenus et que les gigaoctets installés ne le font pas.
Les piles plus hautes l’emportent lorsque les clients peuvent transformer leur capacité supplémentaire en lots plus grands, davantage de modèles ou une flexibilité matérielle plus durable.
Trois signaux montreront si la HBM 4-hi s’impose réellement
La thèse des piles courtes ne devient crédible que lorsque les feuilles de route produits, la disponibilité en production et les résultats d’inférence mesurés convergent.
Le premier signal sera la configuration finale de Rubin Ultra de Nvidia. La documentation publique devra confirmer la capacité mémoire, la hauteur des piles, la bande passante et l’architecture système NVL576.
Une configuration confirmée de 192GB utilisant de la HBM 8-hi soutiendrait l’argument directionnel. Un retour à la HBM 12-hi affaiblirait l’affirmation selon laquelle les exigences de capacité se sont largement assouplies.
Un produit Rubin commercial en 4-hi constituerait une preuve bien plus solide. D’ici là, la proposition de HBM 4-hi de SemiAnalysis reste une prévision éclairée concernant les futurs ASIC et accélérateurs.
Le deuxième signal sera la qualification par les fournisseurs de HBM4 ou HBM4E 4-hi à haute vitesse. Les fournisseurs devront proposer ces boîtiers aux débits de signalisation exigés par les concepteurs d’accélérateurs.
La largeur nominale de l’interface ne suffit pas. Les produits doivent offrir des rendements, une gestion thermique, une fiabilité et des performances soutenues acceptables dans des systèmes complets.
Il faudra surveiller si SK hynix, Samsung ou Micron ajoutent des configurations 4-hi à leurs feuilles de route publiques. Des échantillons destinés aux clients montreraient que les piles courtes ont dépassé le stade des études architecturales internes.
Il faudra également surveiller le modèle de tarification. Si les coûts de la 4-hi évoluent principalement avec sa capacité inférieure, son économie de bande passante devient convaincante.
Si les fournisseurs concentrent l’essentiel de la valeur dans le die de base et l’interface, les économies attendues pourraient se réduire. Les pénuries de boîtiers pourraient aussi maintenir des primes élevées malgré une quantité moindre de DRAM.
Le troisième signal sera constitué de tests d’inférence indépendants sur des charges de travail variées. Les benchmarks devront inclure des assistants interactifs, des services agentiques, des requêtes à contexte long et des déploiements à grands lots.
Le débit moyen de tokens ne suffira pas. Les tests devront mesurer la vitesse par utilisateur, le comportement des files d’attente, les taux de succès du cache, le trafic d’offload et la latence de fin de distribution.
Les résultats devront aussi comparer des modèles de tailles et d’architectures différentes. Une configuration optimisée pour Kimi K3 ne peut pas établir le meilleur choix pour tous les futurs modèles de pointe.
La preuve décisive sera un avantage stable en coût par token dans des objectifs de niveau de service réalistes. Cet avantage devra résister à une forte concurrence et à l’évolution des combinaisons de charges de travail.
Les développeurs devraient s’y intéresser car les contraintes matérielles façonnent la conception des modèles. La mémoire disponible influence la quantification, le placement des experts, la gestion du contexte et la politique de cache.
Les acheteurs en entreprise devraient s’y intéresser car la capacité annoncée peut être trompeuse. Davantage de HBM ne garantit pas une inférence plus utile lorsque la bande passante, le réseau ou la latence constituent la limite.
Les équipes d’infrastructure devraient évaluer les ensembles de travail à l’échelle du rack. Elles devraient distinguer les charges d’entraînement, de prefill, de decode et agentiques avant de sélectionner un profil mémoire unique.
Elles devraient aussi conserver une marge de manœuvre opérationnelle. Un système 4-hi optimisé de manière trop étroite peut perdre son avantage lorsque la demande évolue vers des lots plus importants ou davantage de modèles simultanés.
La leçon générale n’est pas que moins de mémoire l’emporte toujours. C’est que la mémoire doit être achetée en fonction de la ressource réellement consommée par une charge de travail.
Pour l’inférence interactive, cette ressource est souvent la bande passante. La HBM à quatre couches peut conserver le chemin de données externe complet tout en utilisant moins de dies DRAM rares.
Cela fait de l’analyse de SemiAnalysis sur la HBM 4-hi une remise en question sérieuse des hypothèses de l’industrie favorisant les piles les plus hautes. Les prochaines annonces de produits montreront si les équipes matérielles sont du même avis.
Avant de vous engager sur une future flotte d’accélérateurs, posez-vous trois questions. L’ensemble de travail tient-il à l’échelle du rack, les données de cache froid peuvent-elles être déplacées en toute sécurité et la capacité supplémentaire augmente-t-elle le débit utile ?
Si les réponses penchent vers la bande passante, le roi des piles courtes mérite une place sur la feuille de route.



