Le mod Nvidia DLSS 5 déplace le rendu neuronal vers un second GPU, mais les 127 % nécessitent du contexte
La scène des mods DLSS 5 de Nvidia a produit une expérience frappante : déplacer le rendu neuronal vers un second GPU pour récupérer jusqu’à 127 % de performances. Le développeur Marcelo Guibout a testé cette idée avec deux cartes GeForce RTX 5060 Ti. L’une rendait le jeu, tandis que l’autre traitait l’image finalisée.
Cette séparation modifie l’équation des performances autour de DLSS 5. Nvidia a conçu son nouveau moteur de rendu neuronal pour améliorer l’éclairage, les matériaux, la peau, les cheveux et d’autres éléments visuels complexes. Toutefois, le modèle consomme un temps GPU considérable lorsqu’il entre en concurrence avec le rendu conventionnel sur la même carte.
Le module complémentaire MGPU Bridge de Guibout déplace cette concurrence hors du GPU de rendu. L’approche rappelle les configurations PhysX dédiées utilisées par certains passionnés de PC il y a des années. Elle ne recrée pas SLI, car les deux cartes ne se partagent pas le travail de rendu ordinaire.
Les premiers chiffres sont encourageants, mais il ne s’agit pas de benchmarks de jeu conventionnels. Les démonstrations couvrent un matériel limité, de courtes sessions et une implémentation injectée sans données natives du moteur. La voie du second GPU implique également des écrans supplémentaires, de la latence, des limites de compatibilité et une autre carte graphique.
Le mod Nvidia DLSS 5 sépare deux tâches coûteuses
MGPU Bridge traite le rendu neuronal comme une étape finale détachable plutôt que comme une tâche supplémentaire en concurrence au sein du pipeline de rendu principal.
L’expérience est apparue le 7 septembre, une semaine après la publication par Nvidia des détails techniques de DLSS 5. Guibout a montré le système traitant des séquences de The Blood of Dawnwalker et du gameplay de Cyberpunk 2077.
La démonstration à deux GPU utilisait deux cartes RTX 5060 Ti 16GB. Les deux cartes fonctionnaient via des connexions PCIe 5.0 x8 dans la machine de test principale. Ce système comportait également un processeur Ryzen 7 7800X3D et 32GB de mémoire DDR5.
MGPU Bridge est un module complémentaire ReShade, ce qui signifie qu’il se rattache à la sortie graphique d’un jeu via le framework ReShade. Il identifie l’adaptateur qui rend le jeu et crée un appareil Direct3D 12 distinct sur le second GPU.
La carte de rendu produit d’abord une image complète. MGPU Bridge copie ensuite cette image via une allocation de mémoire partagée entre adaptateurs. Le second GPU applique DLSS Neural Rendering et affiche le résultat par sa propre sortie.
Cette organisation évite de renvoyer l’image traitée vers la première carte. Chaque GPU nécessite donc un écran connecté dans la conception actuelle. Le résultat neuronal apparaît sur le moniteur connecté au second GPU.
Ce point distingue l’expérience du rendu multi-GPU traditionnel. SLI répartissait le travail de rendu entre les cartes avant qu’une image ne soit complète. MGPU Bridge laisse la charge de rendu du jeu sur une carte et ne déplace que la passe neuronale finale.
La documentation du projet qualifie le logiciel de code de recherche plutôt que de produit grand public. Elle souligne également que le processus de rendu original du jeu reste inchangé. Le pont lit l’image finalisée et effectue son travail ailleurs.
Cette conception est possible parce que la passe neuronale se situe près de la fin du pipeline graphique. Elle accepte une image et renvoie une image modifiée. Une opération terminale peut être placée sur un autre processeur plus facilement qu’un travail intégré dans tout le moteur.
Le concept rappelle les cartes PhysX dédiées, qui traitaient la physique tandis qu’un GPU distinct gérait les graphismes. Toutefois, la comparaison ne décrit que la répartition du travail. MGPU Bridge n’utilise pas l’ancienne architecture PhysX et ne ressuscite pas le modèle SLI abandonné de Nvidia.
Guibout a également testé une machine distincte équipée d’un Ryzen 5 5600 et de mémoire DDR4. Ce résultat suggère que le pont ne nécessite pas de processeur haut de gamme. Toutefois, les deux systèmes mesurés utilisaient toujours deux cartes RTX 5060 Ti pour leurs principales comparaisons.
L’expérience crée une tension importante pour Nvidia. DLSS a commencé comme un moyen de récupérer des performances en rendant moins de pixels. DLSS 5 ajoute une étape neuronale coûteuse qui peut consommer une grande partie de la capacité économisée grâce à l’upscaling.
Déplacer cette étape vers un autre appareil rend à nouveau visible le bénéfice initial en matière de performances. Cela révèle également à quel point le rendu génératif reste exigeant dans le cadre budgétaire d’une image en temps réel.
Pourquoi l’augmentation rapportée de 127 % doit être lue avec prudence
Le pourcentage le plus élevé décrit une amélioration par rapport à un résultat de rendu neuronal fortement contraint, et non un gain universel par rapport aux performances DLSS ordinaires.
Les chiffres publiés provenaient de The Blood of Dawnwalker en 1920 par 1080. Guibout a comparé trois configurations dans les modes DLAA, Quality, Performance et Ultra Performance.
La super résolution DLSS est restée active pendant toute la comparaison. La première configuration désactivait uniquement l’étape de rendu neuronal DLSS 5. Elle représentait le plafond de performances approximatif pour chaque mode de rendu sélectionné.
En mode DLAA, le test a atteint entre 67 et 70 images par seconde sans rendu neuronal. L’exécution de la passe neuronale sur la carte de rendu a réduit les performances à 44 FPS. Son déport a restauré la fréquence rapportée entre 67 et 70 FPS.
Le mode Quality a produit entre 98 et 99 FPS sans l’étape neuronale. Ce résultat est tombé entre 54 et 55 FPS lorsqu’une carte gérait les deux charges de travail. La configuration à deux GPU a atteint 91 FPS.
Le mode Performance a montré un écart plus large. Le système a produit entre 127 et 131 FPS sans rendu neuronal, 59 FPS avec le travail neuronal sur la carte de rendu, puis entre 106 et 107 FPS après déport.
Le mode Ultra Performance a atteint 172 FPS avec l’étape neuronale désactivée. Il a fourni entre 69 et 71 FPS lorsque la carte de rendu traitait également le rendu neuronal. La configuration avec seconde carte a atteint 157 FPS.
Le chiffre phare allant jusqu’à 127 % provient de la comparaison d’environ 69 FPS avec 157 FPS. Il s’agit d’une récupération substantielle. Toutefois, la configuration déportée n’a pas fonctionné 127 % plus vite que le plafond sans rendu neuronal.
Elle a plutôt récupéré l’essentiel des performances perdues lorsque le rendu neuronal occupait le GPU principal. En Ultra Performance, 157 FPS restaient en dessous du plafond de 172 FPS. Les modes Quality et Performance ont montré des écarts restants similaires.
Guibout estime que la conclusion la plus importante concerne la montée en puissance selon les modes. Réduire la résolution de rendu interne diminue normalement le travail de rendu conventionnel. Toutefois, l’étape neuronale continue de fonctionner à la résolution de sortie finale.
Son coût diminue donc beaucoup moins que le coût de rendu. Sur une seule carte, le traitement neuronal occupe une part croissante de l’image à mesure que le rendu conventionnel devient moins coûteux.
Ce comportement explique pourquoi la configuration à une carte n’a capté que 39 % de l’augmentation de performances disponible entre DLAA et Ultra Performance. La voie déportée aurait conservé 86 % de cette augmentation disponible.
Ces résultats révèlent un goulot d’étranglement plutôt que des performances gratuites. Le second GPU absorbe une charge de travail qui existait déjà. La carte principale peut alors consacrer une plus grande part de son budget d’image au jeu.
Les températures rapportées confortent cette interprétation. Le déplacement de l’étape neuronale a réduit la température de la carte de rendu de 21 degrés Celsius sur une machine. Une autre configuration a montré un écart d’environ 10 degrés.
Il s’agit de mesures au sein de systèmes particuliers, et non de prévisions thermiques universelles. Un fonctionnement plus frais ne signifie pas non plus que l’ensemble de la machine consomme moins d’énergie. La charge de travail s’exécute désormais sur deux processeurs et deux systèmes de refroidissement.
Guibout décrit explicitement les vidéos comme des démonstrations techniques, et non comme des benchmarks. Cyberpunk 2077 a fourni des observations de compatibilité, de stabilité et de consommation. Les chiffres de fréquence d’images publiés provenaient de The Blood of Dawnwalker.
Le projet n’a pas non plus évalué la qualité visuelle. Par conséquent, les chiffres ne permettent pas de déterminer si la sortie neuronale injectée préservait les détails, la stabilité des mouvements, la direction artistique ou les couleurs sur un gameplay plus étendu.
Le résultat reste important, car son mécanisme est cohérent. Un GPU saturé doit planifier le rendu et l’inférence neuronale sur les mêmes ressources finies. Déplacer une charge de travail ailleurs permet au processeur d’origine de récupérer de la marge.
Ce qui reste incertain est la manière dont cette récupération évolue avec des cartes plus rapides, des résolutions plus élevées, différents jeux et des intégrations natives. Ces variables pourraient modifier à la fois le coût neuronal et le coût de rendu sous-jacent.
Le post-traitement neuronal constitue le véritable conflit de performances
L’expérience est importante parce que DLSS 5 transforme l’IA d’assistante de reconstruction en une étape majeure du rendu avec sa propre demande de calcul soutenue.
Les versions antérieures de DLSS reconstruisaient principalement des images de résolution plus élevée à partir d’entrées de résolution inférieure. Les versions ultérieures ont ajouté la reconstruction de rayons et la génération d’images intermédiaires. Ces systèmes utilisaient l’apprentissage automatique pour améliorer la sortie tout en réduisant certaines parties du travail de rendu conventionnel.
DLSS 5 modifie le rôle de ce modèle. Nvidia le décrit comme un moteur de rendu génératif qui contribue à l’apparence finale affichée. Il apprend des motifs visuels à partir de données du monde réel et les applique aux graphismes conventionnels.
Selon la présentation technique de Nvidia, le modèle utilise un processus de diffusion en espace pixel à une étape. Les modèles de diffusion génèrent ou transforment des images en apprenant comment les structures visuelles sont liées, bien que Nvidia ait adapté ce processus à une utilisation en temps réel.
Le système natif reçoit l’image rendue actuelle, les vecteurs de mouvement, l’état temporel et les contrôles artistiques. Les vecteurs de mouvement décrivent le déplacement des éléments de l’image entre les images. L’état temporel aide le modèle à conserver une sortie cohérente au fil du temps.
Nvidia indique que le modèle reste causal et déterministe. Dans ce contexte, causal signifie qu’il n’a pas besoin d’images futures. Déterministe signifie que des entrées identiques devraient produire le même résultat, ce qui importe pour des graphismes de jeu prévisibles.
L’entreprise indique également que DLSS 5 peut fonctionner à des résolutions allant jusqu’à 4K sur le matériel RTX 50-series. Son modèle cible des effets que le rendu conventionnel en temps réel peine à reproduire à moindre coût, notamment la diffusion sous-cutanée et la lumière traversant le feuillage.
Cette charge de travail diffère de l’upscaling ordinaire. Générer des modifications détaillées de matériaux et d’éclairage à la résolution de sortie peut rester coûteux même lorsque le jeu rend son image initiale avec moins de pixels.
MGPU Bridge exploite cette séparation. Le rendu conventionnel devient moins coûteux lorsque les joueurs sélectionnent des modes DLSS plus agressifs. L’étape de post-traitement continue de traiter l’image finale, laissant sa charge de travail relativement stable.
Le résultat produit un renversement inhabituel. Une fonction associée aux performances peut consommer suffisamment de temps GPU pour affaiblir les gains apportés par sa propre composante de super résolution.
L’objectif de Nvidia ne se limite pas à des fréquences d’images plus élevées. Son annonce de DLSS 5 présente le rendu neuronal comme une fonction de qualité visuelle. L’entreprise souhaite que le modèle améliore l’éclairage et les matériaux au-delà de ce que les développeurs peuvent simuler dans le cadre d’une image normale.
Cette distinction est importante lors de l’interprétation des résultats sur un seul GPU. Une fréquence d’images plus basse ne signifie pas automatiquement que DLSS 5 a échoué. Les joueurs échangeraient des performances contre des améliorations neuronales, tout comme ils échangent déjà des performances contre le ray tracing.
La question est de savoir si ce compromis reste intéressant. Une fonctionnalité exigeante doit apporter des améliorations visibles qui justifient des fréquences d’images natives plus faibles, une latence accrue ou un recours plus important aux images générées.
Les premiers tests officiels renforcent cette préoccupation. Le premier déploiement natif est arrivé dans NBA 2K27, où des tests RTX 50 ont relevé un impact substantiel sur les performances. Malgré cela, presque toutes les cartes Blackwell testées se sont approchées d’un résultat jouable en 1080p.
L’intégration native devrait présenter des avantages par rapport au pont de Guibout. Un moteur de jeu peut fournir des vecteurs de mouvement précis, des informations de profondeur et des masques. Les masques permettent aux développeurs d’appliquer le traitement neuronal uniquement là où il apporte des détails visuels utiles.
MGPU Bridge ne dispose pas de ces informations. Il ne voit que l’image couleur finale une fois le travail du moteur terminé. Le second GPU déduit les mouvements par flux optique, une méthode qui estime le mouvement en comparant le contenu des images.
Le pont ne fournit aucun tampon de profondeur du moteur au modèle. Il ne peut pas non plus accéder aux masques définis par les développeurs ni à l’ensemble des contrôles artistiques disponibles via une intégration officielle.
Cette limitation rend l’expérience à la fois moins représentative et plus révélatrice. Elle ne peut pas montrer comment un jeu correctement intégré se comportera. Elle démontre toutefois que la charge de travail neuronale finale peut fonctionner indépendamment du périphérique de rendu.
Pour les concepteurs de GPU, cela soulève une question architecturale plus large. Le matériel de jeu futur devrait-il consacrer davantage de ressources isolées au post-traitement neuronal ? L’alternative consiste à laisser l’inférence neuronale et le rendu continuer à se concurrencer au sein d’un seul grand processeur.
Un second GPU de vente au détail constitue une réponse peu pratique pour la plupart des joueurs. Un bloc neuronal dédié, une meilleure planification asynchrone ou une coordination plus étroite entre processeurs intégrés répondraient plus efficacement au même conflit.
Le correctif à deux GPU ajoute de la latence, du coût et des limites de compatibilité
MGPU Bridge restaure de la capacité de rendu en acceptant des complications au niveau du système qui l’empêchent de devenir aujourd’hui une solution DLSS 5 grand public.
La limite la plus immédiate est matérielle. Les mesures documentées utilisaient deux cartes RTX 5060 Ti 16GB. Nvidia a initialement positionné la prise en charge officielle de DLSS 5 autour de sa série RTX 50, même si des passionnés ont expérimenté des méthodes modifiées sur du matériel plus ancien.
Des configurations de générations mixtes ont commencé à apparaître dans les tests de la communauté. Le dépôt indique qu’un utilisateur emploie une RTX 4080 Super comme carte de rendu et une RTX 5060 Ti comme processeur neuronal. Cette observation reste plus limitée qu’une étude matérielle contrôlée.
Direct3D 12 est une autre exigence. MGPU Bridge crée un périphérique D3D12 et se connecte au chemin D3D12 de ReShade. Les jeux Direct3D 11 et Vulkan ne fonctionnent pas avec l’implémentation actuelle.
L’extension nécessite également ReShade 6.8.0 ou une version plus récente avec une prise en charge complète des extensions. La version standard limitée aux effets ne chargera pas le fichier requis. Les utilisateurs doivent aussi fournir le composant de rendu neuronal de Nvidia depuis leur propre installation compatible.
Deux moniteurs représentent un obstacle pratique plus important. La seconde carte graphique affiche directement son image traitée, évitant ainsi un transfert supplémentaire via la connexion PCIe. Une seconde carte sans écran peut fonctionner, mais Guibout a mesuré un débit inférieur de 33 % et une latence approximativement doublée.
Même avec deux écrans, la latence reste non résolue. Le projet a mesuré environ 8,3 millisecondes pour chaque passage neuronal en 1080p sur la seconde carte. Il n’a pas mesuré la latence complète de photon à photon, qui couvre toute la période comprise entre une action d’entrée et l’émission de lumière mise à jour par l’écran.
Cette distinction empêche toute affirmation catégorique sur la réactivité. Le temps de transfert, le traitement neuronal, la synchronisation, l’affichage et les files d’attente d’images peuvent tous contribuer au délai perçu.
L’article source indique que le chemin d’affichage double la latence d’affichage. Toutefois, la documentation de Guibout emploie un langage plus prudent, car des mesures de bout en bout restent indisponibles. La sortie aurait semblé jouable lors de courtes sessions, mais les impressions subjectives ne peuvent remplacer des tests instrumentés.
Le logiciel présente d’autres contraintes expérimentales. Sa plus longue session propre documentée sur Cyberpunk 2077 a duré 20 minutes en 1440p. La stabilité à plus long terme reste non testée.
Modifier la résolution, le mode DLSS ou les préréglages graphiques pendant le streaming peut rompre la connexion actuelle. Ces changements reconstruisent la swapchain d’un jeu, la structure qui gère les images en attente d’affichage. MGPU Bridge se lie aux dimensions et au format d’origine.
La génération d’images n’est pas non plus caractérisée. Combiner le pont avec des images générées introduirait une autre étape de planification et potentiellement une autre file d’attente. Cette interaction nécessite des tests contrôlés avant que quiconque puisse affirmer que les deux techniques fonctionnent bien ensemble.
La gestion des couleurs est incomplète. Un jeu testé a produit une image délavée, et réduire le réglage de tonalité l’a corrigée sur la machine du développeur. Cette solution de contournement ne permet pas d’établir un comportement colorimétrique précis selon les moniteurs, les formats ou la sortie à plage dynamique élevée.
Les superpositions externes peuvent créer d’autres problèmes, car le processus contient désormais deux swapchains. Les outils de surveillance peuvent alterner entre le flux d’affichage du jeu et celui du pont. Ce comportement peut rendre les relevés de performances de base difficiles à interpréter.
Ces limites expliquent pourquoi Guibout affirme que le projet ne correspond pas à la vision de Nvidia pour DLSS 5. Ce n’est pas non plus une raison d’acheter une autre carte graphique. L’expérience isole un principe technique dans un ensemble restreint de conditions.
L’argument financier serait difficile même si la compatibilité s’améliorait. Un second GPU exige un autre emplacement, une alimentation suffisante, une circulation d’air adéquate et de la bande passante sur la carte mère. Les ordinateurs de bureau compacts et la plupart des portables de jeu ne peuvent pas accueillir cette configuration.
La consommation énergétique totale compte également. La carte de rendu fonctionne à une température plus basse parce qu’elle délègue du travail, mais le second processeur effectue ce travail à sa place. Les mesures de consommation au niveau du système doivent prendre en compte les deux périphériques avant que quiconque ne décrive la déportation comme plus efficace.
L’intégration native demeure la voie la plus solide pour les jeux ordinaires. Les développeurs peuvent utiliser les vecteurs de mouvement du moteur, la profondeur, les informations sémantiques et les masques afin de réduire le travail neuronal inutile. Les équipes de pilotes peuvent également optimiser la synchronisation sans dépendre d’une configuration d’affichage tierce.
Toutefois, l’intégration native n’invalide pas l’expérience. Elle rend sa contribution plus précise. MGPU Bridge montre que le post-traitement neuronal n’a pas besoin, par définition, de partager la carte de rendu.
Ce qui transformerait l’expérience du second GPU pour DLSS 5 en une véritable orientation
Trois signaux détermineront si les coprocesseurs neuronaux deviennent une architecture durable ou restent une démonstration pour passionnés.
Le premier signal est celui de tests indépendants de latence. Les testeurs ont besoin de mesures de photon à photon pour comparer DLSS 5 natif sur un seul GPU et les configurations à second GPU. Les fréquences d’images moyennes ne suffisent pas à décrire la réactivité lorsque les images terminées transitent par un autre périphérique de traitement.
Les tests devraient aussi inclure les distributions de temps d’image. Une moyenne élevée peut masquer une diffusion irrégulière, des blocages de synchronisation ou des sorties neuronales perdues. Une cadence stable compte autant que le débit maximal pendant une partie active.
Si des tests indépendants constatent une latence modeste et constante, le concept de coprocesseur gagnera en crédibilité. Des délais importants ou imprévisibles l’affaibliraient, en particulier pour les jeux d’action où la réponse aux commandes est essentielle.
Le deuxième signal est une montée en charge matérielle plus large. Deux RTX 5060 Ti identiques ne fournissent qu’un seul point sur une vaste courbe de performances. Des cartes de rendu plus rapides pourraient révéler les limites d’un processeur neuronal plus lent, tandis que des résolutions de sortie plus élevées pourraient alourdir considérablement le passage neuronal.
Les systèmes à cartes mixtes méritent une attention particulière. De nombreux passionnés possèdent un ancien GPU de rechange, mais la voie actuelle dépend toujours d’un matériel neuronal compatible. Une architecture utile nécessiterait des règles d’association prévisibles plutôt que des combinaisons par essais et erreurs.
Les tests en 1440p et en 4K permettraient également de déterminer si les transferts PCIe ou l’inférence neuronale deviennent la principale contrainte. Les configurations de lignes PCIe varient fortement selon les cartes mères grand public, en particulier lorsque deux grands périphériques sont installés.
Si la méthode fonctionne avec plusieurs cartes et configurations de lignes, elle confortera le modèle de séparation sous-jacent. Si les gains disparaissent en dehors de GPU de milieu de gamme identiques, son importance pratique se réduira.
Le troisième signal réside dans la réponse de Nvidia par le logiciel ou le matériel. L’entreprise pourrait améliorer la planification sur un seul GPU, réduire le coût du modèle neuronal ou exposer la prise en charge multi-adaptateur via Streamline. Les futurs GPU pourraient aussi ajouter davantage de capacité neuronale isolée.
La conception officielle de Nvidia reçoit déjà des données de moteur plus riches que le mod. De meilleurs masques et informations de mouvement devraient réduire le traitement gaspillé tout en améliorant la stabilité de l’image. Les développeurs pourraient donc résoudre une grande partie du conflit sans second périphérique.
L’expérience MGPU Bridge identifie néanmoins une frontière de charge de travail qui mérite d’être surveillée. Le rendu neuronal consomme désormais suffisamment de calcul soutenu pour influencer la manière dont un pipeline d’images devrait être divisé.
L’avenir le plus plausible n’est pas un retour au jeu à deux cartes. Il s’agit d’une séparation plus délibérée entre les graphismes conventionnels et le traitement génératif d’images au sein d’un même système.
Cette séparation pourrait passer par des blocs matériels dédiés, des chiplets, des processeurs intégrés ou des API multi-adaptateurs explicites. La forme exacte importe moins que le principe de planification mis en évidence par le mod Nvidia DLSS 5.
Pour les joueurs, le conseil actuel reste simple. Considérez les résultats publiés comme la preuve d’un mécanisme, et non comme une recommandation d’achat ou un benchmark universel.
Pour les développeurs et les chercheurs en matériel, l’expérience pose une question plus précise. Si le rendu neuronal devient une étape finale permanente, doit-il continuer à concurrencer le moteur de rendu pour les mêmes ressources ?
La prochaine vague de données indépendantes sur la latence, de tests GPU plus larges et de mises à jour de l’intégration par Nvidia devrait répondre à cette question. D’ici là, MGPU Bridge reste une vitrine technique inventive, avec de véritables preuves de performances et des contraintes tout aussi réelles.



