La mod Nvidia DLSS 5 sposta il rendering neurale su una seconda GPU, ma il 127% va contestualizzato
La scena delle mod per Nvidia DLSS 5 ha prodotto un esperimento sorprendente: spostare il rendering neurale su una seconda GPU e recuperare fino al 127% delle prestazioni. Lo sviluppatore Marcelo Guibout ha testato l'idea con due schede GeForce RTX 5060 Ti. Una scheda eseguiva il rendering del gioco, mentre l'altra elaborava l'immagine completata.
Questa separazione cambia l'equazione delle prestazioni attorno a DLSS 5. Nvidia ha progettato il suo nuovo renderer neurale per migliorare illuminazione, materiali, pelle, capelli e altri elementi visivi complessi. Tuttavia, il modello richiede una notevole quantità di tempo GPU quando compete con il rendering convenzionale sulla stessa scheda.
L'add-on MGPU Bridge di Guibout sposta questa competizione fuori dalla GPU di rendering. L'approccio ricorda le configurazioni PhysX dedicate utilizzate anni fa da alcuni appassionati PC. Non ricrea SLI, perché le due schede non dividono il normale lavoro di rendering.
I primi dati sono incoraggianti, ma non costituiscono benchmark di gioco convenzionali. Le dimostrazioni riguardano hardware limitato, sessioni brevi e un'implementazione iniettata priva di dati nativi del motore. Il percorso con una seconda GPU introduce inoltre display aggiuntivi, latenza, limiti di compatibilità e un'altra scheda grafica nell'equazione.
La mod Nvidia DLSS 5 separa due attività costose
MGPU Bridge tratta il rendering neurale come una fase finale separabile, anziché come un altro compito in competizione nella pipeline di rendering principale.
L'esperimento è apparso il 7 settembre, una settimana dopo la pubblicazione da parte di Nvidia dei dettagli tecnici di DLSS 5. Guibout ha mostrato il sistema mentre elaborava filmati di The Blood of Dawnwalker e gameplay di Cyberpunk 2077.
La dimostrazione con doppia GPU ha utilizzato due RTX 5060 Ti da 16GB. Entrambe operavano su connessioni PCIe 5.0 x8 nella macchina principale del test. Il sistema includeva anche un processore Ryzen 7 7800X3D e 32GB di memoria DDR5.
MGPU Bridge è un add-on per ReShade, quindi si collega all'output grafico di un gioco attraverso il framework ReShade. Identifica l'adattatore che esegue il rendering del gioco e crea un dispositivo Direct3D 12 separato sulla seconda GPU.
La scheda di rendering produce prima un frame completo. MGPU Bridge copia quindi quel frame attraverso un'allocazione di memoria condivisa tra adattatori. La seconda GPU applica DLSS Neural Rendering e presenta il risultato attraverso la propria uscita.
Questa configurazione evita di rimandare l'immagine elaborata alla prima scheda. Di conseguenza, nel design attuale ogni GPU richiede un display collegato. Il risultato neurale appare sul monitor connesso alla seconda GPU.
Questo aspetto distingue l'esperimento dal rendering multi-GPU tradizionale. SLI divideva il lavoro di rendering tra le schede prima del completamento di un frame. MGPU Bridge lascia il carico di rendering del gioco su una scheda e trasferisce soltanto il passaggio neurale finale.
La documentazione del progetto definisce il software codice di ricerca, non un prodotto per consumatori. Sottolinea inoltre che il processo di rendering originale del gioco rimane invariato. Il bridge legge il frame completato ed esegue altrove il proprio lavoro.
Questo design è possibile perché il passaggio neurale si trova vicino alla fine della pipeline grafica. Riceve un'immagine e restituisce un'immagine modificata. Un'operazione terminale può essere collocata su un altro processore più facilmente rispetto a un lavoro integrato nell'intero motore.
Il concetto richiama le schede PhysX dedicate, che elaboravano la fisica mentre una GPU separata gestiva la grafica. Tuttavia, il paragone descrive soltanto la divisione del lavoro. MGPU Bridge non utilizza la vecchia architettura PhysX e non riporta in vita il modello SLI abbandonato da Nvidia.
Guibout ha testato anche una macchina separata con Ryzen 5 5600 e memoria DDR4. Il risultato suggerisce che il bridge non richieda un processore di fascia alta. Tuttavia, entrambi i sistemi misurati utilizzavano comunque due RTX 5060 Ti per i confronti principali.
L'esperimento crea una tensione importante per Nvidia. DLSS è nato come mezzo per recuperare prestazioni renderizzando meno pixel. DLSS 5 aggiunge una costosa fase neurale che può consumare gran parte della capacità risparmiata con l'upscaling.
Spostare quella fase su un altro dispositivo rende di nuovo visibile il beneficio prestazionale originario. Espone però anche quanto il rendering generativo resti esigente entro un budget di frame in tempo reale.
Perché l'aumento riportato del 127% richiede una lettura attenta
La percentuale più elevata descrive un miglioramento rispetto a un risultato di rendering neurale fortemente limitato, non un guadagno universale rispetto alle normali prestazioni di DLSS.
I dati pubblicati provengono da The Blood of Dawnwalker a 1920 per 1080. Guibout ha confrontato tre configurazioni nelle modalità DLAA, Quality, Performance e Ultra Performance.
La super resolution DLSS è rimasta attiva per tutto il confronto. La prima configurazione disabilitava soltanto la fase di rendering neurale di DLSS 5. Rappresentava il tetto prestazionale approssimativo per ciascuna modalità di rendering selezionata.
In modalità DLAA, il test ha raggiunto tra 67 e 70 frame al secondo senza rendering neurale. L'esecuzione del passaggio neurale sulla scheda di rendering ha ridotto le prestazioni a 44 FPS. L'offloading ha ripristinato il valore riportato tra 67 e 70 FPS.
La modalità Quality ha prodotto tra 98 e 99 FPS senza la fase neurale. Il risultato è sceso tra 54 e 55 FPS quando una sola scheda gestiva entrambi i carichi. La configurazione con seconda GPU ha raggiunto 91 FPS.
La modalità Performance ha mostrato un divario più ampio. Il sistema ha prodotto tra 127 e 131 FPS senza rendering neurale, 59 FPS con il lavoro neurale sulla scheda di rendering e tra 106 e 107 FPS dopo l'offloading.
La modalità Ultra Performance ha raggiunto 172 FPS con la fase neurale disabilitata. Ha erogato tra 69 e 71 FPS quando la scheda di rendering elaborava anche il rendering neurale. La configurazione con la seconda scheda ha raggiunto 157 FPS.
Il dato da titolo, fino al 127%, deriva dal confronto tra circa 69 FPS e 157 FPS. Si tratta di un recupero sostanziale. Tuttavia, la configurazione con offloading non era il 127% più veloce rispetto al tetto privo di rendering neurale.
Ha invece recuperato gran parte delle prestazioni perse quando il rendering neurale occupava la GPU primaria. In Ultra Performance, 157 FPS rimanevano sotto il tetto di 172 FPS. Le modalità Quality e Performance hanno mostrato divari residui simili.
Guibout sostiene che il risultato più importante riguardi la scalabilità tra le modalità. Ridurre la risoluzione di rendering interna normalmente diminuisce il lavoro di rendering convenzionale. Tuttavia, la fase neurale continua a operare alla risoluzione finale di output.
Il suo costo diminuisce quindi molto meno del costo di rendering. Su una singola scheda, l'elaborazione neurale occupa una quota crescente del frame man mano che il rendering convenzionale diventa più economico.
Questo comportamento spiega perché la configurazione con una sola scheda abbia catturato solo il 39% dell'aumento di prestazioni disponibile tra DLAA e Ultra Performance. Il percorso con offloading avrebbe invece mantenuto l'86% di tale aumento disponibile.
Questi risultati rivelano un collo di bottiglia, non prestazioni gratuite. La seconda GPU assorbe un carico di lavoro già esistente. La scheda principale può quindi dedicare una quota maggiore del proprio budget di frame al gioco.
Le temperature riportate supportano questa interpretazione. Lo spostamento della fase neurale ha ridotto la temperatura della scheda di rendering di 21 gradi Celsius su una macchina. Un'altra configurazione ha mostrato una differenza di circa 10 gradi.
Si tratta di misurazioni all'interno di singoli sistemi, non di previsioni termiche universali. Un funzionamento più fresco non significa neppure che l'intera macchina consumi meno energia. Il carico di lavoro viene ora distribuito su due processori e due sistemi di raffreddamento.
Guibout descrive esplicitamente i video come dimostrazioni tecniche, non benchmark. Cyberpunk 2077 ha fornito osservazioni su compatibilità, stabilità e consumo energetico. I dati pubblicati sui frame rate provengono da The Blood of Dawnwalker.
Il progetto non ha nemmeno valutato la qualità visiva. Di conseguenza, i numeri non possono stabilire se l'output neurale iniettato abbia preservato dettaglio, stabilità del movimento, direzione artistica o colore in un gameplay più ampio.
Il risultato resta rilevante perché il suo meccanismo è coerente. Una GPU satura deve pianificare rendering e inferenza neurale sulle stesse risorse finite. Spostare uno dei carichi altrove offre al processore originale spazio per recuperare.
Resta incerto come questo recupero possa scalare su schede più veloci, risoluzioni più alte, giochi diversi e integrazioni native. Queste variabili potrebbero modificare sia il costo neurale sia il costo di rendering sottostante.
Il post-processing neurale è il vero conflitto prestazionale
L'esperimento è importante perché DLSS 5 trasforma l'AI da assistente alla ricostruzione in una fase di rendering principale con una propria domanda di calcolo sostenuta.
Le versioni precedenti di DLSS ricostruivano soprattutto immagini a risoluzione più elevata a partire da input a risoluzione inferiore. Le versioni successive hanno aggiunto ray reconstruction e frame intermedi generati. Questi sistemi utilizzavano il machine learning per migliorare l'output riducendo al contempo porzioni del lavoro di rendering convenzionale.
DLSS 5 cambia il ruolo di quel modello. Nvidia lo descrive come un renderer generativo che contribuisce all'aspetto finale visualizzato. Apprende pattern visivi dai dati del mondo reale e li applica alla grafica convenzionale.
Secondo la panoramica tecnica di Nvidia, il modello utilizza un processo di diffusione nello spazio dei pixel a singolo passaggio. I modelli di diffusione generano o trasformano immagini apprendendo come si relazionano le strutture visive, sebbene Nvidia abbia adattato il processo all'uso in tempo reale.
Il sistema nativo riceve il frame renderizzato corrente, i vettori di movimento, lo stato temporale e i controlli artistici. I vettori di movimento descrivono dove gli elementi dell'immagine si sono spostati tra i frame. Lo stato temporale aiuta il modello a mantenere un output coerente nel tempo.
Nvidia afferma che il modello rimane causale e deterministico. In questo contesto, causale significa che non richiede frame futuri. Deterministico significa che input identici dovrebbero produrre lo stesso risultato, aspetto importante per una grafica di gioco prevedibile.
L'azienda afferma inoltre che DLSS 5 può funzionare fino alla risoluzione 4K su hardware RTX serie 50. Il modello punta a effetti che il rendering convenzionale in tempo reale fatica a riprodurre economicamente, tra cui la diffusione nella pelle e la luce che attraversa il fogliame.
Questo carico di lavoro differisce dall'upscaling ordinario. Generare cambiamenti dettagliati di materiali e illuminazione alla risoluzione di output può restare costoso anche quando il gioco renderizza l'immagine iniziale con meno pixel.
MGPU Bridge sfrutta questa separazione. Il rendering convenzionale diventa meno costoso quando i giocatori selezionano modalità DLSS più aggressive. La fase di post-processing continua a intervenire sull'immagine finale, mantenendo un carico di lavoro relativamente stabile.
Il risultato produce un'inversione insolita. Una funzione associata alle prestazioni può consumare abbastanza tempo GPU da indebolire i guadagni offerti dalla propria componente di super resolution.
L'obiettivo di Nvidia non è semplicemente ottenere frame rate più elevati. Il suo annuncio di DLSS 5 presenta il rendering neurale come una funzione dedicata alla qualità visiva. L'azienda vuole che il modello migliori illuminazione e materiali oltre ciò che gli sviluppatori possono simulare entro un normale frame.
Questa distinzione è importante nell'interpretazione dei risultati con una sola GPU. Un frame rate inferiore non significa automaticamente che DLSS 5 abbia fallito. I giocatori scambierebbero prestazioni con miglioramenti neurali, proprio come già scambiano prestazioni con il ray tracing.
La questione è se questo compromesso resti conveniente. Una funzionalità esigente deve offrire miglioramenti visibili che giustifichino frame rate nativi inferiori, maggiore latenza o una dipendenza più forte dai frame generati.
I primi test ufficiali rafforzano questa preoccupazione. La prima implementazione nativa è arrivata in NBA 2K27, dove i test RTX 50 hanno rilevato un impatto significativo sulle prestazioni. Nonostante ciò, quasi tutte le schede Blackwell testate hanno raggiunto prestazioni prossime alla giocabilità a 1080p.
L'integrazione nativa dovrebbe offrire vantaggi rispetto al bridge di Guibout. Un motore di gioco può fornire vettori di movimento accurati, informazioni sulla profondità e maschere. Le maschere consentono agli sviluppatori di applicare l'elaborazione neurale solo dove contribuisce con dettagli visivi utili.
MGPU Bridge non dispone di queste informazioni. Visualizza l'immagine a colori finale dopo che il motore ha completato il proprio lavoro. La seconda GPU ricava il movimento tramite flusso ottico, un metodo che stima il movimento confrontando il contenuto delle immagini.
Il bridge non fornisce al modello alcun buffer di profondità del motore. Non può inoltre accedere alle maschere definite dagli sviluppatori né ai controlli artistici completi disponibili tramite un'integrazione ufficiale.
Questa limitazione rende l'esperimento al tempo stesso meno rappresentativo e più rivelatore. Non può mostrare le prestazioni di un gioco integrato correttamente. Tuttavia, dimostra che il carico di lavoro neurale finale può funzionare indipendentemente dal dispositivo di rendering.
Per i progettisti di GPU, ciò solleva una questione architetturale più ampia. L'hardware gaming futuro dovrebbe dedicare più risorse isolate al post-processing neurale? L'alternativa è lasciare che l'inferenza neurale e il rendering continuino a competere all'interno di un unico grande processore.
Una seconda GPU retail è una risposta poco pratica per la maggior parte dei giocatori. Un blocco neurale dedicato, una migliore pianificazione asincrona o un coordinamento più stretto tra processori integrati affronterebbero lo stesso conflitto in modo più efficiente.
La soluzione della seconda GPU aggiunge latenza, costi e limiti di compatibilità
MGPU Bridge ripristina capacità di rendering accettando complicazioni a livello di sistema che oggi gli impediscono di diventare una soluzione DLSS 5 mainstream.
Il limite più immediato è l'hardware. Le misurazioni documentate hanno utilizzato due schede RTX 5060 Ti 16GB. Nvidia ha inizialmente posizionato il supporto ufficiale a DLSS 5 attorno alla propria serie RTX 50, anche se gli appassionati hanno sperimentato percorsi modificati su hardware meno recente.
Configurazioni con generazioni miste hanno iniziato a comparire nei test della community. Il repository segnala un utente che esegue una RTX 4080 Super come scheda di rendering e una RTX 5060 Ti come processore neurale. Questa osservazione resta più circoscritta di un'indagine hardware controllata.
Direct3D 12 è un altro requisito. MGPU Bridge crea un dispositivo D3D12 e si collega al percorso D3D12 di ReShade. I giochi Direct3D 11 e Vulkan non funzionano con l'implementazione attuale.
L'add-on richiede inoltre ReShade 6.8.0 o versioni successive con supporto completo agli add-on. La build standard con soli effetti non caricherà il file necessario. Gli utenti devono anche fornire il componente di rendering neurale di Nvidia tramite una propria installazione compatibile.
Due monitor rappresentano un ostacolo pratico maggiore. La seconda scheda grafica visualizza direttamente l'immagine elaborata, evitando un ulteriore trasferimento attraverso la connessione PCIe. Una seconda scheda senza monitor può funzionare, ma Guibout ha misurato un throughput inferiore del 33% e una latenza approssimativamente raddoppiata.
Anche con due schermi, la latenza resta irrisolta. Il progetto ha misurato circa 8,3 millisecondi per ogni passaggio neurale a 1080p sulla seconda scheda. Non ha misurato la latenza completa da fotone a fotone, che copre l'intero periodo tra un'azione di input e l'emissione di luce aggiornata dal display.
Questa distinzione impedisce affermazioni definitive sulla reattività. Il tempo di trasferimento, l'elaborazione neurale, la sincronizzazione, la presentazione sul display e le code dei frame possono tutti contribuire al ritardo percepito.
L'articolo di origine afferma che il percorso del display raddoppia la latenza del display. Tuttavia, la documentazione di Guibout usa un linguaggio più cauto perché le misurazioni end-to-end restano indisponibili. L'output sarebbe sembrato giocabile durante brevi sessioni, ma le impressioni soggettive non possono sostituire test strumentati.
Il software presenta altri vincoli sperimentali. La più lunga sessione pulita documentata di Cyberpunk 2077 è durata 20 minuti a 1440p. La stabilità sul lungo periodo resta non testata.
La modifica della risoluzione, della modalità DLSS o dei preset grafici durante lo streaming può interrompere la connessione attuale. Tali modifiche ricostruiscono la swapchain del gioco, la struttura che gestisce i frame in attesa di visualizzazione. MGPU Bridge si collega alle dimensioni e al formato originali.
Anche la generazione di frame non è ancora caratterizzata. Combinare il bridge con frame generati introdurrebbe un'altra fase di pianificazione e possibilmente un'altra coda. Questa interazione richiede test controllati prima che chiunque possa affermare che le due tecniche funzionano bene insieme.
La gestione del colore è incompleta. Un gioco testato ha restituito un'immagine slavata, e ridurre l'impostazione del tono l'ha corretta sul computer dello sviluppatore. Questo espediente non dimostra un comportamento cromatico accurato su monitor, formati o output ad alta gamma dinamica differenti.
Gli overlay esterni possono creare ulteriori problemi perché il processo ora contiene due swapchain. Gli strumenti di monitoraggio possono alternare tra il flusso di visualizzazione del gioco e quello del bridge. Questo comportamento può rendere confuse le letture prestazionali di base.
Questi limiti spiegano perché Guibout afferma che il progetto non rappresenta la visione di Nvidia per DLSS 5. Non è nemmeno un motivo per acquistare un'altra scheda grafica. L'esperimento isola un principio tecnico in un insieme ristretto di condizioni.
Il caso economico sarebbe difficile anche se la compatibilità migliorasse. Una seconda GPU richiede un altro slot, alimentazione sufficiente, flusso d'aria e larghezza di banda della scheda madre. I desktop compatti e la maggior parte dei laptop gaming non possono ospitare questa configurazione.
Anche il consumo energetico totale conta. La scheda di rendering opera a temperature più basse perché cede parte del lavoro, ma il secondo processore esegue quel lavoro al suo posto. Le misurazioni del consumo a livello di sistema devono includere entrambi i dispositivi prima che qualcuno descriva l'offloading come più efficiente.
L'integrazione nativa resta la strada più solida per i giochi comuni. Gli sviluppatori possono utilizzare vettori di movimento del motore, profondità, informazioni semantiche e maschere per ridurre l'elaborazione neurale non necessaria. I team dei driver possono inoltre ottimizzare la sincronizzazione senza fare affidamento su un sistema di visualizzazione di terze parti.
Tuttavia, l'integrazione nativa non invalida l'esperimento. Rende più specifico il suo contributo. MGPU Bridge mostra che il post-processing neurale non deve necessariamente condividere la scheda di rendering.
Cosa trasformerebbe l'esperimento DLSS 5 con seconda GPU in una direzione concreta
Tre segnali determineranno se i coprocessori neurali diventeranno un'architettura duratura o resteranno una dimostrazione per appassionati.
Il primo segnale è costituito da test indipendenti della latenza. I recensori hanno bisogno di misurazioni da fotone a fotone tra DLSS 5 nativo su singola GPU e configurazioni con seconda GPU. I frame rate medi da soli non possono descrivere la reattività quando i frame completati passano attraverso un altro dispositivo di elaborazione.
I test dovrebbero includere anche le distribuzioni dei tempi dei frame. Una media elevata può nascondere una consegna irregolare, blocchi di sincronizzazione o output neurale scartato. Una cadenza stabile conta quanto il throughput di picco durante il gameplay attivo.
Se test indipendenti rileveranno una latenza modesta e costante, il concetto di coprocessore diventerà più credibile. Ritardi elevati o imprevedibili lo indebolirebbero, soprattutto nei giochi d'azione in cui la risposta agli input è importante.
Il secondo segnale è una scalabilità hardware più ampia. Due RTX 5060 Ti identiche forniscono un solo punto su un'ampia curva delle prestazioni. Schede di rendering più veloci potrebbero mettere in evidenza un processore neurale più lento, mentre risoluzioni di output superiori potrebbero rendere il passaggio neurale sostanzialmente più pesante.
I sistemi con schede miste meritano particolare attenzione. Molti appassionati possiedono una GPU di riserva meno recente, ma il percorso attuale dipende ancora da hardware neurale compatibile. Un'architettura utile dovrebbe richiedere regole di abbinamento prevedibili anziché combinazioni per tentativi.
I test a 1440p e 4K chiarirebbero inoltre se i trasferimenti PCIe o l'inferenza neurale diventano il vincolo principale. Le configurazioni delle linee PCIe variano ampiamente tra le schede madri consumer, soprattutto quando vengono installati due dispositivi di grandi dimensioni.
Se il metodo funziona con diverse schede e configurazioni di linee, sosterrà il modello di separazione sottostante. Se i guadagni scompaiono al di fuori di GPU midrange identiche, la sua rilevanza pratica si restringerà.
Il terzo segnale è la risposta di Nvidia tramite software o hardware. L'azienda potrebbe migliorare la pianificazione su singola GPU, ridurre il costo del modello neurale o esporre il supporto multi-adapter tramite Streamline. Le GPU future potrebbero anche aggiungere maggiore capacità neurale isolata.
Il design ufficiale di Nvidia riceve già dati del motore più ricchi rispetto alla mod. Maschere migliori e informazioni sul movimento dovrebbero ridurre l'elaborazione sprecata migliorando al tempo stesso la stabilità dell'immagine. Gli sviluppatori potrebbero quindi risolvere gran parte del conflitto senza un secondo dispositivo.
Tuttavia, l'esperimento MGPU Bridge individua un confine di carico di lavoro che vale la pena osservare. Il rendering neurale ora consuma abbastanza capacità di calcolo continua da influenzare il modo in cui una pipeline di frame dovrebbe essere suddivisa.
Il futuro più plausibile non è un ritorno al gaming con due schede. È una separazione più deliberata tra grafica convenzionale ed elaborazione generativa delle immagini all'interno di un unico sistema.
Questa separazione potrebbe avvenire tramite blocchi hardware dedicati, chiplet, processori integrati o API multi-adapter esplicite. La forma esatta conta meno del principio di pianificazione messo in luce dalla mod Nvidia DLSS 5.
Per i giocatori, il consiglio attuale resta semplice. Considerate i risultati pubblicati come prova di un meccanismo, non come una raccomandazione d'acquisto o un benchmark universale.
Per gli sviluppatori e i ricercatori hardware, l'esperimento pone una domanda più precisa. Se il rendering neurale diventa una fase finale permanente, dovrebbe continuare a competere con il renderer per le stesse risorse?
Il prossimo ciclo di dati indipendenti sulla latenza, test su GPU più ampi e aggiornamenti dell'integrazione Nvidia dovrebbe rispondere a questa domanda. Fino ad allora, MGPU Bridge resta un'ingegnosa vetrina tecnica con prove prestazionali reali e vincoli altrettanto reali.



