top of page

L’accord NVLink Fusion de d-Matrix intègre Raptor à la stratégie de racks de NVIDIA

12 sept.
16 min de lecture

d-Matrix a adopté NVIDIA NVLink Fusion pour Raptor, bien qu’elle développe un accélérateur d’inférence destiné à offrir une alternative aux conceptions GPU conventionnelles. L’accord relie le futur processeur à l’architecture de racks, au réseau, aux CPU et à la chaîne d’approvisionnement en infrastructure de NVIDIA. Il révèle également la tension centrale du partenariat d-Matrix NVLink Fusion.

Les accélérateurs spécialisés peuvent concurrencer le silicium de calcul de NVIDIA sans évincer le reste de sa plateforme. Pour d-Matrix, ce compromis offre une voie plus rapide entre une conception de puce ambitieuse et une infrastructure déployable. Pour NVIDIA, chaque nouveau XPU connecté via NVLink renforce sa position autour du rack.

Cette décision intervient avant que Raptor ne devienne un produit commercial. d-Matrix prévoit que la puce sera finalisée avant la fin de 2026, les systèmes MGX intégrés étant initialement disponibles au quatrième trimestre 2027. Ce calendrier fait de cette annonce une annonce de feuille de route, et non une preuve de performances en production.

Elle place également d-Matrix aux côtés d’un groupe grandissant d’entreprises utilisant l’infrastructure NVIDIA pour des processeurs spécialisés. Ces partenaires comprennent des fournisseurs établis de silicium, des fournisseurs de cloud et des spécialistes de l’inférence. L’autre voie consiste à assembler un rack ouvert autour de technologies telles que l’architecture Helios d’AMD, UALink et Ultra Ethernet.

Ce que change l’accord d-Matrix NVLink Fusion

d-Matrix ne conçoit plus Raptor comme une carte accélératrice isolée. Elle conçoit le processeur comme un élément d’un rack défini par NVIDIA.

Les entreprises ont annoncé leur collaboration le 10 septembre 2026. Selon l’annonce de Raptor, l’accord comprend une feuille de route produit pluriannuelle plutôt qu’un simple test d’interopérabilité.

Raptor se connectera à des commutateurs NVLink pour la communication scale-up au sein d’un système étroitement interconnecté. Le réseau scale-up permet à plusieurs accélérateurs de se comporter davantage comme une grande ressource de calcul unique, avec des délais de communication plus faibles que ceux des réseaux de centres de données ordinaires.

Le rack utilisera également Spectrum-X Ethernet pour le réseau scale-out entre les systèmes. Cette couche relie des racks ou clusters distincts tout en gérant la congestion et les schémas de trafic associés aux charges de travail d’IA distribuées.

La conception proposée comprend des CPU NVIDIA Vera, des unités de traitement de données BlueField-4 et des SuperNIC ConnectX-9. Elle utilise également NVIDIA MGX, une architecture de référence modulaire couvrant les tiroirs physiques, l’alimentation électrique, le refroidissement et l’intégration système.

Astera Labs fournira une technologie de connectivité destinée à maintenir des transferts de données à haut débit à travers le système. d-Matrix affirme que le rack utilisera des tiroirs modulaires sans câbles issus de l’écosystème de fabrication MGX existant.

Cette portée est importante, car un processeur seul ne constitue pas un service d’IA exploitable. Les acheteurs ont besoin de serveurs, de firmware, de réseaux, d’orchestration, de refroidissement, de procédures de réparation et d’un approvisionnement fiable en pièces de remplacement.

Une startup doit généralement construire ces éléments ou convaincre des partenaires de le faire. Elle doit ensuite qualifier le système complet auprès de clients qui ne peuvent tolérer des arrêts imprévus.

NVLink Fusion modifie cette séquence. NVIDIA donne accès à certains éléments de son fabric scale-up et de ses conceptions de racks, permettant au XPU d’une autre entreprise d’intégrer le même cadre d’infrastructure.

Le terme XPU désigne au sens large un processeur spécialisé optimisé pour des charges de travail qui ne correspondent pas à un CPU polyvalent. Dans le cas de Raptor, la cible est l’inférence d’IA générative, notamment la génération de jetons sensible à la latence.

Le XPU d-Matrix Raptor peut également fonctionner aux côtés de systèmes GPU NVIDIA, notamment Vera Rubin NVL72. NVIDIA décrit cet arrangement comme une inférence désagrégée, dans laquelle différents processeurs gèrent des étapes ou des types distincts de travail de service.

Cette coexistence crée le renversement central de l’histoire. d-Matrix n’a pas besoin de remplacer NVIDIA dans l’ensemble d’un centre de données pour remporter un déploiement d’inférence. Elle peut rivaliser pour certaines charges de travail tout en s’appuyant sur des composants NVIDIA tout autour de sa puce.

NVIDIA y gagne quelque chose d’aussi important. Elle peut accueillir des accélérateurs personnalisés sans abandonner son contrôle sur l’architecture système environnante. La frontière concurrentielle se déplace de la puce vers le rack.

L’accord représente donc davantage qu’un simple badge de compatibilité. Il teste la capacité de NVIDIA à faire augmenter la demande pour son infrastructure grâce à des accélérateurs tiers, même lorsque ceux-ci concurrencent ses GPU.

Pourquoi l’intégration en rack est devenue le véritable obstacle

La capacité rare n’est plus de concevoir un accélérateur impressionnant. Elle consiste à transformer ce silicium en une infrastructure que les clients peuvent déployer de manière prévisible.

L’inférence d’IA impose au matériel des exigences différentes de l’entraînement des modèles. L’entraînement privilégie de vastes calculs parallèles sur de nombreux accélérateurs. L’inférence doit également gérer le temps de réponse, les utilisateurs simultanés, la mémoire des modèles et un flux imprévisible de requêtes.

Les modèles de raisonnement intensifient cette pression, car ils peuvent générer bien davantage de jetons avant de renvoyer une réponse. Les applications à contexte long conservent également de grands caches clé-valeur, qui stockent les informations nécessaires pendant la génération de jetons.

Ces charges de travail font du déplacement de la mémoire une contrainte centrale. Un accélérateur peut offrir une capacité de calcul abondante tout en laissant ses unités de calcul attendre les poids du modèle ou le contexte mis en cache.

d-Matrix s’attaque à ce problème par le calcul centré sur la mémoire. Son architecture place les opérations matricielles plus près des données stockées, réduisant la distance parcourue par l’information pendant l’inférence.

Toutefois, résoudre le goulot d’étranglement de la mémoire à l’intérieur d’un processeur ne résout pas le déploiement à l’extérieur. Les systèmes à l’échelle du rack doivent coordonner accélérateurs, hôtes, stockage, réseaux, alimentation et refroidissement dans des conditions d’exploitation réelles.

Chaque composant introduit un travail de qualification. Les ingénieurs doivent valider l’intégrité du signal, le comportement thermique, la compatibilité du firmware, les communications collectives, la récupération après défaillance et les procédures de maintenance.

Les racks refroidis par liquide ajoutent une couche opérationnelle supplémentaire. Un nouveau fournisseur doit s’intégrer aux conceptions d’installations existantes sans obliger les clients à reconstruire l’alimentation et le refroidissement autour d’un seul processeur.

Le lancement initial de NVLink Fusion par NVIDIA répondait directement à ce problème. L’entreprise a lancé la plateforme en mai 2025 pour une infrastructure d’IA semi-personnalisée utilisant des CPU et XPU externes.

Sa liste initiale de partenaires couvrait plusieurs maillons de la chaîne de conception. MediaTek, Marvell, Alchip, Astera Labs, Synopsys et Cadence prenaient en charge le silicium personnalisé, la connectivité ou la propriété intellectuelle.

Fujitsu et Qualcomm prévoyaient des CPU personnalisés susceptibles de fonctionner avec les GPU NVIDIA. Des collaborations ultérieures ont étendu la plateforme à d’autres processeurs et conceptions cloud.

Cette liste grandissante accroît la pression sur chaque fournisseur indépendant d’accélérateurs. Un fabricant de puces peut rejoindre un écosystème de racks établi, construire seul un système équivalent ou s’aligner sur une norme ouverte concurrente.

La première voie réduit le risque d’intégration, mais crée une dépendance stratégique. La deuxième préserve davantage de contrôle, mais exige du capital, du temps et la confiance des clients. La troisième dépend de la capacité d’un autre écosystème à atteindre une maturité comparable.

d-Matrix a choisi la rapidité et la déployabilité pour Raptor. Son directeur général, Sid Sheth, a formulé cette contrainte clairement : la demande d’inférence augmente tandis que le capital, le temps et l’énergie restent limités.

La décision de l’entreprise reflète également son stade de développement. d-Matrix a commencé à livrer sa plateforme Corsair avant de présenter Raptor, mais reste bien plus petite que les fournisseurs d’infrastructure qu’elle espère concurrencer.

Construire une nouvelle plateforme de racks parallèlement à une nouvelle architecture mémoire multiplierait les risques d’exécution. L’utilisation de MGX permet à l’entreprise de concentrer davantage de ressources d’ingénierie sur son processeur, son compilateur et son logiciel d’inférence.

Ce choix n’élimine pas la qualification. Raptor doit toujours implémenter correctement NVLink, fonctionner avec les autres appareils de NVIDIA et atteindre des objectifs de performance et de fiabilité au niveau du système.

Il réduit toutefois le nombre de nouveaux éléments que les clients doivent accepter simultanément. Un rack familier peut faciliter l’évaluation d’un accélérateur inconnu par une équipe d’infrastructure.

Le résultat exerce une pression sur les entreprises concurrentes d’accélérateurs autant que sur les fournisseurs de GPU. Une startup proposant uniquement une puce rapide est désormais en concurrence avec des processeurs intégrés dans des conceptions de racks validées et maintenables.

Comment NVLink Fusion fonctionne autour de Raptor

NVLink Fusion sépare le choix du processeur de la construction du rack, tout en maintenant l’interconnexion de NVIDIA au centre du système.

L’architecture comporte deux niveaux de réseau. NVLink relie les accélérateurs dans un domaine scale-up, tandis que Spectrum-X transporte le trafic à travers un cluster scale-out plus vaste.

À l’intérieur du rack, les commutateurs NVLink fournissent une communication à haute bande passante et à faible latence entre les appareils Raptor. Cette connexion est importante lorsqu’un modèle ou ses données de travail ne peuvent pas rester sur un seul accélérateur.

En dehors de ce domaine, les SuperNIC ConnectX et Spectrum-X Ethernet relient les systèmes à travers le centre de données. Les DPU BlueField peuvent gérer des tâches d’infrastructure telles que le réseau, l’isolation et le déplacement des données.

Les CPU Vera servent de processeurs hôtes. MGX définit le cadre mécanique et électrique qui regroupe ces éléments dans des tiroirs et racks déployables.

Comprendre le fonctionnement de NVLink Fusion exige de distinguer l’accès de la normalisation. NVIDIA ouvre son fabric à du silicium tiers approuvé, mais NVLink reste une technologie contrôlée par NVIDIA.

La conception est donc horizontalement inclusive sans devenir neutre vis-à-vis des fournisseurs. Les partenaires accèdent à la plateforme, tandis que NVIDIA conserve son influence sur les interfaces, la qualification, les feuilles de route et les composants environnants.

Ce modèle offre des avantages pratiques. Un rack partagé peut prendre en charge différents types d’accélérateurs sans obliger un opérateur à créer une conception physique distincte pour chaque processeur.

Un constructeur de centres de données peut normaliser l’espace au sol, les connexions de refroidissement, la distribution électrique et les pratiques de maintenance. La capacité de calcul peut ensuite varier selon les exigences de la charge de travail.

NVIDIA apporte également un réseau de fabrication établi. Les fabricants d’équipements d’origine et les fabricants de conception produisent déjà des systèmes dérivés de MGX et des plateformes GPU à l’échelle du rack de NVIDIA.

L’explication technique de l’entreprise décrit l’accès aux interfaces NVLink, aux chiplets, aux commutateurs, au câblage et à la technologie de racks. Elle comprend également des conceptions d’alimentation et de refroidissement liquide.

Pour d-Matrix, cette infrastructure répond à un problème que les benchmarks bruts d’accélérateurs ne peuvent pas saisir. Les clients achetant de la capacité d’inférence évaluent les calendriers de déploiement, la facilité de maintenance, l’utilisation et le risque opérationnel au même titre que les jetons par seconde.

Un processeur qui arrive tardivement ou exige un rack unique peut perdre même avec des résultats de laboratoire favorables. La cohérence de l’infrastructure peut l’emporter sur un avantage de performance limité.

Cette approche permet également aux clients de combiner l’inférence spécialisée avec des charges de travail fondées sur les GPU. NVIDIA affirme que les racks Raptor peuvent fonctionner aux côtés de systèmes Vera Rubin NVL72 plutôt que de les remplacer.

Un déploiement possible orienterait la génération de jetons sensible à la latence vers Raptor tout en conservant d’autres étapes des modèles sur les GPU. Les entreprises n’ont pas publié de configuration de production complète démontrant ce flux de travail.

Les logiciels restent essentiels à toute division de ce type. Les environnements d’exécution des modèles doivent placer correctement les tâches, gérer la mémoire et déplacer les données sans annuler les gains apportés par le matériel spécialisé.

d-Matrix a développé sa propre pile logicielle pour Corsair et Raptor. L’intégration à l’écosystème NVIDIA plus large déterminera si les acheteurs bénéficient d’une plateforme unique et gérable ou de deux systèmes adjacents.

Cette distinction comptera pour les développeurs. L’hétérogénéité matérielle permet de mieux adapter les charges de travail, mais elle peut introduire des compilateurs, outils de supervision, profils de performances et parcours de débogage distincts.

NVLink réduit les frictions de communication entre les appareils. Il ne rend pas automatiquement leurs modèles de programmation identiques.

La valeur du partenariat dépend donc de la coordination au-dessus de la liaison physique. Les entreprises doivent transformer des composants compatibles en modèles de déploiement reproductibles que les opérateurs cloud peuvent proposer sous forme de services.

La conception mémoire de Raptor est le pari au cœur du rack

NVIDIA fournit les fondations du système, mais Raptor doit encore justifier pourquoi les clients ont besoin d’un autre processeur d’inférence.

Raptor étend l’approche centrée sur la mémoire utilisée par la précédente plateforme Corsair de d-Matrix. Sa caractéristique déterminante est un boîtier tridimensionnel qui place une puce de calcul directement au-dessus de DRAM personnalisée.

La DRAM offre une densité plus élevée que la SRAM, la mémoire plus rapide largement utilisée dans Corsair. Toutefois, la DRAM conventionnelle est plus éloignée du calcul et nécessite généralement davantage d’énergie pour déplacer chaque bit.

La conception de d-Matrix expose de nombreuses petites banques mémoire directement aux moteurs de calcul grâce à des connexions verticales denses. L’objectif est d’associer la capacité de la DRAM à une bande passante locale bien plus élevée.

Lors de Hot Chips 2026, l’entreprise a présenté un boîtier comprenant une puce de calcul TSMC gravée en 4 nanomètres, liée au-dessus d’une puce DRAM personnalisée. L’interface utilise un pas de connexion de 36 microns.

La conception présentée offre 32GB par carte et une bande passante interne annoncée de 100 téraoctets par seconde. Ces chiffres décrivent les transferts à l’intérieur du boîtier, et non la bande passante réseau entre accélérateurs distincts.

Des informations indépendantes sur la conception DRAM 3D ont également souligné une réserve importante. De nombreux résultats de performances publiés restent des projections fondées sur du silicium précoce.

d-Matrix a mesuré l’interface verticale à 0,37 picojoule par bit. L’entreprise a comparé ce chiffre à environ 2,4 picojoules pour les transferts vers une puce de base HBM4.

Un article de recherche associé a projeté environ 4,7 fois plus de débit par carte que les conceptions basées sur HBM. Ni une projection ni une mesure d’interface n’établit les performances d’un système de production complet.

La gestion thermique représente un autre défi. La puce logique est placée au-dessus afin qu’une plaque froide puisse la contacter directement, tandis que la DRAM située en dessous sert également d’interposeur.

Le boîtier complet dispose d’un budget de puissance divulgué de 422 watts. L’interface mémoire verticale représente 296 watts lorsqu’elle fonctionne à pleine capacité.

La chaleur affecte la rétention de la DRAM, qui détermine combien de temps les cellules mémoire conservent les données avant actualisation. À la température de fonctionnement annoncée, la conception nécessite des opérations d’actualisation sensiblement plus fréquentes.

d-Matrix indique que des banques mémoire plus petites limitent le coût de bande passante qui en résulte. L’entreprise inclut également des banques de réserve, une correction d’erreurs et une redondance destinées à assurer un fonctionnement fiable.

Ces détails expliquent pourquoi l’intégration à un rack mature à refroidissement liquide est importante. L’architecture de Raptor ne requiert pas simplement un connecteur. Elle exige une alimentation, un refroidissement et une validation conçus autour d’un boîtier inhabituel.

La technologie cible la génération de jetons, car cette phase déplace souvent les poids du modèle à répétition tout en effectuant relativement peu de calculs par octet. Une plus grande bande passante mémoire locale peut maintenir les unités de calcul occupées.

Le préremplissage, qui traite une invite entrante, présente un profil de performances différent. Il peut exiger davantage de calculs et favoriser une configuration d’accélérateurs différente.

Cette différence soutient l’argument de l’inférence désagrégée. Les opérateurs pourraient attribuer des processeurs distincts au préremplissage et au décodage, à condition que les logiciels et le réseau assurent une transmission efficace.

Pourtant, la valeur de Raptor ne peut être déduite de la seule bande passante. Les performances utiles dépendent de la prise en charge des modèles, des formats numériques, de l’ordonnancement, de la taille des lots, de la longueur du contexte et de la latence de réponse acceptable.

La capacité mémoire compte également. Une carte de 32GB ne peut pas héberger seule tous les grands modèles, de sorte que les charges de travail plus importantes exigent une répartition entre plusieurs appareils.

Cette exigence rend le domaine d’extension NVLink plus déterminant. La conception mémoire interne de Raptor et le tissu externe de NVIDIA doivent fonctionner ensemble sans créer un nouveau goulot d’étranglement.

Le XPU d-Matrix Raptor constitue donc un pari composite. Son boîtier 3D doit fonctionner avec un rendement de production adéquat, et le rack doit transformer ce boîtier en performances applicatives fiables.

La plateforme ouverte de NVIDIA conserve des limites

Le principal affrontement n’oppose pas d-Matrix aux GPU NVIDIA. Il oppose une intégration contrôlée par NVIDIA à une infrastructure de rack neutre vis-à-vis des fournisseurs.

NVIDIA décrit sa plateforme d’IA comme verticalement intégrée et horizontalement ouverte. Cette formule résume sa stratégie, mais les acheteurs devraient examiner ce que signifie chaque volet.

L’intégration verticale réunit les processeurs, commutateurs, adaptateurs réseau, DPU, logiciels, conceptions de racks et relations d’approvisionnement de NVIDIA. L’ouverture horizontale permet à certains CPU et XPU externes d’entrer dans cet environnement.

Cette structure élargit le choix des processeurs dans un système dont le tissu essentiel reste contrôlé par NVIDIA. Elle est plus ouverte qu’un rack uniquement composé de GPU, mais moins neutre qu’une interconnexion régie par l’industrie.

Cette limite est commercialement utile à NVIDIA. Si les accélérateurs personnalisés gagnent des parts de marché, l’entreprise peut encore fournir des composants réseau et d’infrastructure à forte valeur ajoutée autour d’eux.

Elle peut également maintenir NVLink au centre à mesure que les systèmes d’IA passent des serveurs à des ordinateurs à l’échelle du rack. Le rack devient le produit, tandis que les processeurs individuels deviennent des éléments configurables.

d-Matrix en bénéficie parce qu’elle peut atteindre des acheteurs qui préparent déjà leurs installations pour des équipements NVIDIA. Le partenariat réduit le coût organisationnel de tester un processeur moins familier.

Cependant, d-Matrix hérite également d’une dépendance au processus de qualification et à la feuille de route d’infrastructure de NVIDIA. Des changements concernant les commutateurs, CPU, logiciels ou conditions commerciales peuvent affecter ses plans système.

Les entreprises n’ont pas divulgué la structure financière du partenariat. Elles n’ont pas non plus précisé quelles couches logicielles seront partagées ni comment les clients achèteront et prendront en charge des racks complets.

Ces questions sans réponse sont importantes, car l’ouverture comporte plusieurs dimensions. Le matériel peut être physiquement interopérable tandis que l’approvisionnement, la gestion et le développement restent étroitement liés à un seul fournisseur.

Le modèle concurrent met l’accent sur des interfaces industrielles ouvertes. La conception de rack Helios d’AMD utilise OCP Open Rack Wide, UALink pour la connectivité scale-up et Ultra Ethernet pour les clusters plus importants.

Helios associe des accélérateurs AMD Instinct, des processeurs EPYC et le réseau Pensando. Sa conception publiée comprend 72 accélérateurs, reflétant l’évolution du secteur vers des systèmes denses à l’échelle du rack.

UALink vise à permettre à plusieurs fournisseurs de connecter des accélérateurs via une spécification commune. Cette approche promet une portabilité plus large, bien qu’une spécification ouverte ne garantisse ni une maturité produit équivalente ni un volume de déploiement identique.

L’avantage de NVIDIA tient au fait que NVLink fonctionne déjà sur plusieurs générations de systèmes commercialisés. Ses partenaires de fabrication disposent également d’une expérience pratique des racks denses à refroidissement liquide.

La voie ouverte offre une plus grande indépendance théorique. La voie NVIDIA offre un parcours d’intégration établi sous la direction architecturale d’une seule entreprise.

Aucun des deux choix n’élimine totalement l’enfermement propriétaire. Un acheteur adoptant Raptor dépend également du logiciel de d-Matrix, de sa chaîne d’approvisionnement en mémoire 3D et de la capacité de la startup à prendre en charge ses futurs produits.

Le paysage concurrentiel plus large comprend Groq, Cerebras, AMD, Intel et des accélérateurs conçus par des hyperscalers. Une vue d’ensemble du marché de l’inférence avait précédemment identifié ces entreprises comme des alternatives ciblant des charges de travail dominées par les GPU.

Plusieurs se sont depuis rapprochées d’offres de systèmes complets. Groq, par exemple, est également entré dans la stratégie d’infrastructure d’inférence en expansion de NVIDIA.

Cette tendance suggère que NVIDIA cherche à absorber la spécialisation plutôt qu’à y résister. Un XPU performant peut devenir une raison supplémentaire d’adopter les technologies réseau et de rack de NVIDIA.

Pour d-Matrix, rejoindre cette plateforme est pragmatique. Cela signifie également que le défi qu’elle lance à NVIDIA est plus étroit que ne le suggère le récit simple d’une puce rivale.

Le partenariat dispute quel processeur exécute l’inférence. Il ne dispute pas qui définit une grande partie de l’infrastructure environnante.

La livraison, les benchmarks et les clients décideront de l’issue

L’annonce établit une intention architecturale. Elle n’établit ni la préparation à la fabrication, ni la demande commerciale, ni les performances en production.

Le premier point d’observation est le tape-out prévu de Raptor avant la fin de 2026. Le tape-out correspond au moment où la conception d’une puce est finalisée pour la fabrication.

Respecter cette échéance soutiendrait le calendrier actuel. Ne pas la respecter réduirait le temps disponible pour la fabrication, l’encapsulation, les tests, le travail logiciel et la qualification des racks avant fin 2027.

Le deuxième signal est une performance système reproductible de manière indépendante. Les acheteurs ont besoin de résultats issus de racks Raptor complets, et non de chiffres de bande passante isolés ou d’exécutions de modèles projetées.

Ces évaluations devraient divulguer les modèles, longueurs de contexte, tailles de lots, objectifs de latence, paramètres de précision et consommation électrique. Les jetons par seconde sans ces conditions peuvent masquer des compromis importants.

Les performances par utilisateur seront particulièrement pertinentes pour l’argument de l’entreprise en faveur d’un service de jetons premium. Un débit global élevé importe moins si les requêtes individuelles attendent dans de grands lots.

Les mesures énergétiques devraient couvrir l’ensemble du rack. L’efficacité au niveau du boîtier peut être diluée par les CPU, commutateurs, équipements de refroidissement, réseau et capacités inactives.

Le troisième signal est le déploiement chez des clients nommés. d-Matrix indique que Raptor est évalué par des hyperscalers et des laboratoires de pointe, mais n’a pas identifié ces organisations.

Une instance cloud engagée, un service d’inférence géré ou un cluster de production annoncé renforcerait l’argument commercial du partenariat. Les seules évaluations ne démontrent pas une intention d’achat.

La disponibilité initiale reste prévue pour le quatrième trimestre 2027. Ce long délai donne aux systèmes concurrents le temps d’améliorer leur mémoire, leur réseau et leurs logiciels d’inférence.

Il expose également d-Matrix à l’incertitude industrielle. L’entreprise doit produire une puce DRAM personnalisée, la lier à une logique avancée, obtenir des rendements acceptables et valider le boîtier sous une chaleur soutenue.

Son affirmation de détenir plus de 100 brevets ne résout pas ces questions de production. Les brevets protègent des idées techniques, tandis que les clients ont besoin de volumes fiables et d’un service prévisible.

NVIDIA a également du travail à accomplir. Les composants Vera, BlueField, ConnectX, Spectrum-X et NVLink concernés doivent atteindre la maturité requise selon des calendriers compatibles.

Astera Labs doit fournir ses éléments de connectivité dans le cadre de la conception intégrée. Les fabricants de racks doivent ensuite qualifier les plateaux sans câbles, le refroidissement, le firmware et la gestion système.

Les logiciels suivent un calendrier parallèle. d-Matrix doit prendre en charge les modèles et frameworks actuels lorsque Raptor sera commercialisé, et pas seulement ceux disponibles durant sa conception.

Les architectures de modèles peuvent évoluer rapidement. Les mélanges clairsemés d’experts, les fenêtres de contexte plus longues, les charges de travail multimodales et les nouvelles techniques de décodage modifient les schémas de mémoire et de communication.

Un processeur spécialisé réussit lorsque son architecture reste utile malgré ces évolutions. Il doit également bénéficier de mises à jour de compilateur assez rapides pour suivre le rythme des modèles largement utilisés.

La plateforme de NVIDIA peut réduire les risques liés au déploiement physique, mais elle ne peut pas garantir l’adoption logicielle. Les développeurs et les opérateurs cloud doivent toujours avoir une raison d’orienter les charges de travail vers Raptor.

Le scénario le plus convaincant combinerait une faible latence par utilisateur, une consommation énergétique compétitive et une intégration simple des modèles. Une faiblesse dans l’un de ces domaines peut limiter le taux d’utilisation.

Les acheteurs devraient également observer comment NVIDIA positionne Raptor aux côtés de ses propres GPU et autres produits d’inférence. Un accès technique équivalent ne garantit pas nécessairement une visibilité commerciale équivalente.

Une dernière préoccupation concerne la concentration de la plateforme. La prise en charge de XPU externes offre aux clients davantage de choix en matière de processeurs, tout en plaçant davantage de décisions relatives aux racks sous l’influence de NVIDIA.

Ce résultat ne relève ni d’une ouverture totale ni d’une exclusion pure et simple. Il s’agit d’un marché à plusieurs niveaux, où la concurrence subsiste à l’intérieur d’une frontière d’infrastructure de plus en plus commune.

La collaboration entre d-Matrix et NVLink Fusion comptera si Raptor franchit cette frontière sous la forme d’un service commercialisé, mesurable et largement disponible. D’ici là, son importance réside dans la stratégie.

d-Matrix a reconnu qu’une meilleure puce d’inférence ne suffit pas sans un rack crédible. NVIDIA a reconnu que des processeurs spécialisés peuvent rejoindre sa plateforme sans affaiblir sa position dans l’infrastructure.

Au cours des prochains mois, surveillez dans cet ordre le tape-out, les benchmarks de systèmes complets et les déploiements nommés. Chaque étape montrera si cette feuille de route devient un produit.

Pour les acheteurs d’infrastructure, la question utile n’est pas de savoir si Raptor bat tous les GPU. Il faut plutôt déterminer s’il offre un profil d’inférence intéressant sans ajouter une complexité opérationnelle inacceptable. Ces éléments détermineront si le rack de NVIDIA devient un tremplin pour le choix des accélérateurs ou un nouveau point de dépendance durable.

 
 

Commencez pour Gratuit

Un premier assistant IA local avec gestion des connaissances personnelles

Pour une meilleure expérience IA,

remio ne supporte que Windows 10+ (x64) et M-Chip Macs actuellement.

Votre partenaire IA au travail
Faites-en plus avec remio

Planifiez. Créez. Livrez.
Tout au même endroit.

bottom of page