top of page

El mod de Nvidia DLSS 5 traslada el renderizado neuronal a una segunda GPU, pero el 127% necesita contexto

8 sept
14 min de lectura

La escena de mods de DLSS 5 de Nvidia ha dado lugar a un experimento llamativo: trasladar el renderizado neuronal a una segunda GPU y recuperar hasta un 127% de rendimiento. El desarrollador Marcelo Guibout probó la idea con dos tarjetas GeForce RTX 5060 Ti. Una tarjeta renderizaba el juego, mientras la otra procesaba la imagen terminada.

Esa división cambia la ecuación de rendimiento en torno a DLSS 5. Nvidia diseñó su nuevo renderizador neuronal para mejorar la iluminación, los materiales, la piel, el cabello y otros elementos visuales complejos. Sin embargo, el modelo consume un tiempo considerable de GPU cuando compite con el renderizado convencional en la misma tarjeta.

El complemento MGPU Bridge de Guibout saca esa competencia de la GPU de renderizado. El enfoque recuerda a las configuraciones PhysX dedicadas que algunos entusiastas de PC usaban años atrás. No recrea SLI, porque las dos tarjetas no dividen el trabajo de renderizado convencional.

Las primeras cifras son alentadoras, pero no son benchmarks convencionales de juegos. Las demostraciones abarcan hardware limitado, sesiones breves y una implementación inyectada sin datos nativos del motor. La ruta con una segunda GPU también incorpora pantallas adicionales, latencia, límites de compatibilidad y otra tarjeta gráfica a la ecuación.

El mod de Nvidia DLSS 5 separa dos tareas costosas

MGPU Bridge trata el renderizado neuronal como una etapa final separable, en lugar de otra tarea que compite dentro de la canalización principal de renderizado.

El experimento apareció el 7 de septiembre, una semana después de que Nvidia publicara los detalles técnicos de DLSS 5. Guibout mostró el sistema procesando imágenes de The Blood of Dawnwalker y gameplay de Cyberpunk 2077.

La demostración con dos GPU utilizó dos tarjetas RTX 5060 Ti de 16 GB. Ambas operaban mediante conexiones PCIe 5.0 x8 en la máquina principal de prueba. Ese sistema también incluía un procesador Ryzen 7 7800X3D y 32 GB de memoria DDR5.

MGPU Bridge es un complemento de ReShade, lo que significa que se conecta a la salida gráfica de un juego mediante el marco ReShade. Identifica el adaptador que renderiza el juego y crea un dispositivo Direct3D 12 independiente en la segunda GPU.

La tarjeta de renderizado produce primero un fotograma terminado. MGPU Bridge copia después ese fotograma mediante una asignación de memoria compartida entre adaptadores. La segunda GPU aplica DLSS Neural Rendering y muestra el resultado a través de su propia salida.

Esta disposición evita enviar la imagen procesada de vuelta a la primera tarjeta. Por tanto, cada GPU necesita una pantalla conectada en el diseño actual. El resultado neuronal aparece en el monitor conectado a la segunda GPU.

Ese aspecto distingue el experimento del renderizado multi-GPU tradicional. SLI dividía el trabajo de renderizado entre tarjetas antes de completar un fotograma. MGPU Bridge deja la carga de renderizado del juego en una tarjeta y traslada únicamente la pasada neuronal final.

La documentación del proyecto denomina al software código de investigación, en lugar de producto de consumo. También subraya que el proceso de renderizado original del juego permanece intacto. El puente lee el fotograma terminado y realiza su trabajo en otro lugar.

Este diseño es posible porque la pasada neuronal se sitúa cerca del final de la canalización gráfica. Recibe una imagen y devuelve una imagen alterada. Una operación terminal puede colocarse en otro procesador con más facilidad que un trabajo integrado a lo largo de todo el motor.

El concepto recuerda a las tarjetas PhysX dedicadas, que procesaban la física mientras una GPU separada manejaba los gráficos. Sin embargo, la comparación solo describe la división del trabajo. MGPU Bridge no utiliza la antigua arquitectura PhysX ni revive el modelo SLI abandonado por Nvidia.

Guibout también probó otra máquina con un Ryzen 5 5600 y memoria DDR4. Ese resultado sugiere que el puente no requiere un procesador de gama alta. Sin embargo, ambos sistemas medidos seguían utilizando dos tarjetas RTX 5060 Ti para sus comparaciones principales.

El experimento genera una tensión importante para Nvidia. DLSS comenzó como una forma de recuperar rendimiento al renderizar menos píxeles. DLSS 5 añade una costosa etapa neuronal que puede consumir gran parte de la capacidad ahorrada por el escalado.

Trasladar esa etapa a otro dispositivo vuelve a hacer visible el beneficio original de rendimiento. También revela lo exigente que sigue siendo el renderizado generativo dentro de un presupuesto de fotogramas en tiempo real.

Por qué el aumento reportado del 127% exige una lectura cuidadosa

El mayor porcentaje describe una mejora respecto a un resultado de renderizado neuronal muy limitado, no una ganancia universal respecto al rendimiento habitual de DLSS.

Las cifras publicadas procedían de The Blood of Dawnwalker a 1920 por 1080. Guibout comparó tres configuraciones en los modos DLAA, Quality, Performance y Ultra Performance.

La superresolución DLSS permaneció activa durante toda la comparación. La primera configuración desactivaba únicamente la etapa de renderizado neuronal de DLSS 5. Representaba el techo aproximado de rendimiento para cada modo de renderizado seleccionado.

En modo DLAA, la prueba se ejecutó entre 67 y 70 fotogramas por segundo sin renderizado neuronal. Ejecutar la pasada neuronal en la tarjeta de renderizado redujo el rendimiento a 44 FPS. Descargarla restauró la tasa reportada de entre 67 y 70 FPS.

El modo Quality produjo entre 98 y 99 FPS sin la etapa neuronal. Ese resultado cayó a entre 54 y 55 FPS cuando una tarjeta manejaba ambas cargas de trabajo. La configuración con una segunda GPU alcanzó 91 FPS.

El modo Performance mostró una brecha mayor. El sistema produjo entre 127 y 131 FPS sin renderizado neuronal, 59 FPS con el trabajo neuronal en la tarjeta de renderizado y entre 106 y 107 FPS tras descargarlo.

El modo Ultra Performance alcanzó 172 FPS con la etapa neuronal desactivada. Entregó entre 69 y 71 FPS cuando la tarjeta de renderizado también procesaba el renderizado neuronal. La configuración con la segunda tarjeta alcanzó 157 FPS.

La cifra destacada de hasta un 127% procede de comparar aproximadamente 69 FPS con 157 FPS. Es una recuperación considerable. Sin embargo, la configuración descargada no funcionó un 127% más rápido que el techo sin renderizado neuronal.

En cambio, recuperó la mayor parte del rendimiento perdido cuando el renderizado neuronal ocupaba la GPU principal. En Ultra Performance, 157 FPS seguían por debajo del techo de 172 FPS. Los modos Quality y Performance mostraron brechas restantes similares.

Guibout sostiene que el hallazgo más importante se refiere al escalado entre modos. Reducir la resolución de renderizado interno normalmente disminuye el trabajo de renderizado convencional. Sin embargo, la etapa neuronal continúa operando en la resolución de salida final.

Por tanto, su coste disminuye mucho menos que el coste de renderizado. En una sola tarjeta, el procesamiento neuronal ocupa una parte cada vez mayor del fotograma a medida que el renderizado convencional se abarata.

Este comportamiento explica por qué la configuración con una tarjeta capturó solo el 39% del aumento de rendimiento disponible entre DLAA y Ultra Performance. Según se informa, la ruta descargada retuvo el 86% de ese aumento disponible.

Esos resultados revelan un cuello de botella, no rendimiento gratuito. La segunda GPU absorbe una carga de trabajo que ya existía. La tarjeta principal puede entonces dedicar una mayor parte de su presupuesto de fotograma al juego.

Las temperaturas reportadas respaldan esa interpretación. Trasladar la etapa neuronal redujo la temperatura de la tarjeta de renderizado en 21 grados Celsius en una máquina. Otra configuración mostró una diferencia de unos 10 grados.

Se trata de mediciones dentro de un sistema, no de previsiones térmicas universales. Un funcionamiento más frío tampoco significa que la máquina completa consuma menos energía. La carga de trabajo ahora se distribuye entre dos procesadores y dos sistemas de refrigeración.

Guibout describe explícitamente los vídeos como demostraciones técnicas, no como benchmarks. Cyberpunk 2077 aportó observaciones de compatibilidad, estabilidad y consumo. Las cifras de tasa de fotogramas publicadas procedían de The Blood of Dawnwalker.

El proyecto tampoco evaluó la calidad visual. En consecuencia, las cifras no pueden responder si la salida neuronal inyectada preservó el detalle, la estabilidad de movimiento, la dirección artística o el color en un gameplay más amplio.

El resultado sigue siendo relevante porque su mecanismo es coherente. Una GPU saturada debe programar el renderizado y la inferencia neuronal sobre los mismos recursos finitos. Trasladar una carga de trabajo a otro lugar da al procesador original margen para recuperarse.

Lo que sigue siendo incierto es cómo escala esa recuperación en tarjetas más rápidas, resoluciones más altas, juegos distintos e integraciones nativas. Esas variables podrían modificar tanto el coste neuronal como el coste de renderizado subyacente.

El posprocesamiento neuronal es el verdadero conflicto de rendimiento

El experimento importa porque DLSS 5 transforma la IA de asistente de reconstrucción en una importante etapa de renderizado con su propia demanda sostenida de cómputo.

Las versiones anteriores de DLSS reconstruían principalmente imágenes de mayor resolución a partir de entradas de menor resolución. Las versiones posteriores añadieron reconstrucción de rayos y fotogramas intermedios generados. Esos sistemas empleaban aprendizaje automático para mejorar la salida mientras reducían partes del trabajo de renderizado convencional.

DLSS 5 cambia el papel de ese modelo. Nvidia lo describe como un renderizador generativo que contribuye a la apariencia final mostrada. Aprende patrones visuales a partir de datos del mundo real y los aplica a los gráficos convencionales.

Según la visión técnica general de Nvidia, el modelo utiliza un proceso de difusión de un paso en el espacio de píxeles. Los modelos de difusión generan o transforman imágenes aprendiendo cómo se relacionan las estructuras visuales, aunque Nvidia adaptó este proceso para su uso en tiempo real.

El sistema nativo recibe el fotograma renderizado actual, vectores de movimiento, estado temporal y controles artísticos. Los vectores de movimiento describen dónde se desplazaron los elementos de la imagen entre fotogramas. El estado temporal ayuda al modelo a mantener una salida coherente a lo largo del tiempo.

Nvidia afirma que el modelo sigue siendo causal y determinista. En este contexto, causal significa que no necesita fotogramas futuros. Determinista significa que entradas idénticas deberían producir el mismo resultado, lo que importa para unos gráficos de juego predecibles.

La empresa también afirma que DLSS 5 puede ejecutarse en resoluciones de hasta 4K en hardware de la serie RTX 50. Su modelo apunta a efectos que el renderizado convencional en tiempo real tiene dificultades para reproducir de forma económica, incluida la dispersión en la piel y el paso de la luz a través del follaje.

Esa carga de trabajo difiere del escalado convencional. Generar cambios detallados de materiales e iluminación a resolución de salida puede seguir siendo costoso incluso cuando el juego renderiza su imagen inicial con menos píxeles.

MGPU Bridge aprovecha esa separación. El renderizado convencional se abarata a medida que los jugadores seleccionan modos DLSS más agresivos. La etapa de posprocesamiento continúa abordando la imagen final, por lo que su carga de trabajo se mantiene comparativamente estable.

El resultado produce una inversión inusual. Una función asociada al rendimiento puede consumir suficiente tiempo de GPU como para debilitar las ganancias aportadas por su propio componente de superresolución.

El objetivo de Nvidia no es simplemente lograr tasas de fotogramas más altas. Su anuncio de DLSS 5 presenta el renderizado neuronal como una función de calidad visual. La empresa quiere que el modelo mejore la iluminación y los materiales más allá de lo que los desarrolladores pueden simular dentro de un fotograma normal.

Esa distinción importa al interpretar los resultados con una sola GPU. Una tasa de fotogramas menor no significa automáticamente que DLSS 5 haya fallado. Los jugadores estarían intercambiando rendimiento por mejoras neuronales, del mismo modo que ya intercambian rendimiento por ray tracing.

La cuestión es si ese intercambio sigue siendo atractivo. Una función exigente debe ofrecer mejoras visibles que justifiquen tasas de fotogramas nativas más bajas, mayor latencia o una dependencia más intensa de fotogramas generados.

Las primeras pruebas oficiales refuerzan esa preocupación. El primer despliegue nativo llegó en NBA 2K27, donde las pruebas de RTX 50 detectaron un impacto considerable en el rendimiento. Aun así, casi todas las tarjetas Blackwell probadas se acercaron a un resultado jugable a 1080p.

La integración nativa debería tener ventajas sobre el puente de Guibout. Un motor de juego puede proporcionar vectores de movimiento precisos, información de profundidad y máscaras. Las máscaras permiten a los desarrolladores aplicar trabajo neuronal solo donde aporta detalle visual útil.

MGPU Bridge no dispone de esa información. Ve la imagen final en color una vez que el motor ha terminado su trabajo. La segunda GPU calcula el movimiento mediante flujo óptico, un método que estima el movimiento comparando el contenido de las imágenes.

El puente no proporciona al modelo el búfer de profundidad del motor. Tampoco puede acceder a máscaras definidas por los desarrolladores ni a los controles artísticos completos disponibles mediante una integración oficial.

Esa limitación hace que el experimento sea a la vez menos representativo y más revelador. No puede mostrar cómo rendirá un juego correctamente integrado. Sin embargo, demuestra que la carga de trabajo neuronal final puede operar de forma independiente del dispositivo de renderizado.

Para los diseñadores de GPU, esto plantea una cuestión arquitectónica más amplia. ¿Debería el hardware de gaming futuro dedicar más recursos aislados al posprocesamiento neuronal? La alternativa es permitir que la inferencia neuronal y el renderizado sigan compitiendo dentro de un único procesador grande.

Una segunda GPU de consumo es una respuesta poco práctica para la mayoría de jugadores. Un bloque neuronal dedicado, una mejor programación asíncrona o una coordinación más estrecha entre procesadores integrados abordarían el mismo conflicto de forma más eficiente.

La solución de la segunda GPU añade latencia, coste y límites de compatibilidad

MGPU Bridge recupera capacidad de renderizado al aceptar complicaciones a nivel de sistema que hoy le impiden convertirse en una solución DLSS 5 generalizada.

La limitación más inmediata es el hardware. Las mediciones documentadas utilizaron dos tarjetas RTX 5060 Ti de 16GB. Nvidia situó inicialmente el soporte oficial de DLSS 5 en torno a su serie RTX 50, aunque los entusiastas han experimentado con rutas modificadas en hardware más antiguo.

Las configuraciones de generaciones mixtas han empezado a aparecer en pruebas de la comunidad. El repositorio informa de un usuario que ejecuta una RTX 4080 Super como tarjeta de renderizado y una RTX 5060 Ti como procesador neuronal. Esa observación sigue siendo más limitada que un estudio de hardware controlado.

Direct3D 12 es otro requisito. MGPU Bridge crea un dispositivo D3D12 y se conecta a la ruta D3D12 de ReShade. Los juegos de Direct3D 11 y Vulkan no funcionan con la implementación actual.

El complemento también necesita ReShade 6.8.0 o posterior con compatibilidad completa para complementos. La compilación estándar, limitada a efectos, no cargará el archivo necesario. Los usuarios también deben proporcionar el componente de renderizado neuronal de Nvidia mediante su propia instalación compatible.

Dos monitores representan un obstáculo práctico mayor. La segunda tarjeta gráfica muestra directamente su imagen procesada, evitando otra transferencia a través de la conexión PCIe. Una segunda tarjeta sin monitor puede funcionar, pero Guibout midió un rendimiento un 33% inferior y aproximadamente el doble de latencia.

Incluso con dos pantallas, la latencia sigue sin resolverse. El proyecto midió unos 8,3 milisegundos por cada pasada neuronal a 1080p en la segunda tarjeta. No ha medido la latencia completa de fotón a fotón, que cubre todo el periodo desde una acción de entrada hasta que la luz actualizada sale de la pantalla.

Esa distinción impide hacer afirmaciones firmes sobre la capacidad de respuesta. El tiempo de transferencia, el procesamiento neuronal, la sincronización, la presentación en pantalla y las colas de fotogramas pueden contribuir al retraso percibido.

El artículo fuente afirma que la ruta de visualización duplica la latencia de pantalla. Sin embargo, la documentación de Guibout emplea un lenguaje más cauteloso porque siguen sin existir mediciones de extremo a extremo. Según se informa, la salida se sintió jugable durante sesiones cortas, pero las impresiones subjetivas no pueden sustituir a pruebas instrumentadas.

El software tiene otras restricciones experimentales. Su sesión limpia más larga documentada de Cyberpunk 2077 duró 20 minutos a 1440p. La estabilidad a más largo plazo sigue sin probarse.

Cambiar la resolución, el modo DLSS o los ajustes gráficos durante la ejecución puede romper la conexión actual. Esos cambios reconstruyen la swapchain de un juego, la estructura que gestiona los fotogramas que esperan mostrarse. MGPU Bridge se vincula a las dimensiones y al formato originales.

La generación de fotogramas tampoco está caracterizada. Combinar el puente con fotogramas generados introduciría otra etapa de programación y posiblemente otra cola. Esa interacción necesita pruebas controladas antes de que alguien pueda afirmar que ambas técnicas funcionan bien juntas.

La gestión del color está incompleta. Uno de los juegos probados devolvió una imagen deslavada, y reducir el ajuste de tono la corrigió en la máquina del desarrollador. Esa solución no establece un comportamiento de color preciso entre monitores, formatos o salida de alto rango dinámico.

Las superposiciones externas pueden crear más problemas porque el proceso ahora contiene dos swapchains. Las herramientas de monitorización pueden alternar entre el flujo de visualización del juego y el del puente. Ese comportamiento puede hacer confusas las lecturas básicas de rendimiento.

Estos límites explican por qué Guibout dice que el proyecto no es la visión de Nvidia para DLSS 5. Tampoco es una razón para comprar otra tarjeta gráfica. El experimento aísla un principio técnico bajo un conjunto limitado de condiciones.

El caso financiero sería difícil incluso si mejorara la compatibilidad. Una segunda GPU requiere otra ranura, alimentación suficiente, flujo de aire y ancho de banda de la placa base. Los ordenadores de sobremesa compactos y la mayoría de portátiles gaming no pueden alojar esa configuración.

También importa el consumo energético total. La tarjeta de renderizado funciona más fría porque cede trabajo, pero el segundo procesador realiza ese trabajo en su lugar. Las mediciones de potencia a nivel de sistema deben incluir ambos dispositivos antes de que alguien describa la descarga de trabajo como más eficiente.

La integración nativa sigue siendo la vía más sólida para los juegos convencionales. Los desarrolladores pueden usar vectores de movimiento del motor, profundidad, información semántica y máscaras para reducir el trabajo neuronal innecesario. Los equipos de controladores también pueden optimizar la sincronización sin depender de una disposición de pantalla de terceros.

Sin embargo, la integración nativa no invalida el experimento. Hace que su aportación sea más específica. MGPU Bridge demuestra que el posprocesamiento neuronal no tiene por qué compartir la tarjeta de renderizado por definición.

Qué convertiría el experimento de la segunda GPU para DLSS 5 en una dirección real

Tres señales determinarán si los coprocesadores neuronales se convierten en una arquitectura duradera o siguen siendo una demostración para entusiastas.

La primera señal son las pruebas independientes de latencia. Los analistas necesitan mediciones de fotón a fotón entre DLSS 5 nativo con una sola GPU y configuraciones con una segunda GPU. Las tasas medias de fotogramas por sí solas no pueden describir la capacidad de respuesta cuando los fotogramas terminados viajan a través de otro dispositivo de procesamiento.

Las pruebas también deberían incluir distribuciones de tiempo de fotograma. Una media alta puede ocultar una entrega irregular, bloqueos de sincronización o salida neuronal perdida. Un ritmo estable importa tanto como el rendimiento máximo durante el juego activo.

Si las pruebas independientes encuentran una latencia moderada y consistente, el concepto de coprocesador ganará credibilidad. Los retrasos grandes o impredecibles lo debilitarían, especialmente en juegos de acción donde importa la respuesta a las entradas.

La segunda señal es una escalabilidad más amplia del hardware. Dos RTX 5060 Ti idénticas proporcionan solo un punto en una gran curva de rendimiento. Las tarjetas de renderizado más rápidas podrían poner en evidencia un procesador neuronal más lento, mientras que resoluciones de salida más altas podrían hacer que la pasada neuronal sea considerablemente más exigente.

Los sistemas con tarjetas mixtas merecen especial atención. Muchos entusiastas poseen una GPU antigua de repuesto, pero la ruta actual sigue dependiendo de hardware neuronal compatible. Una arquitectura útil necesitaría reglas de emparejamiento predecibles en lugar de combinaciones de prueba y error.

Las pruebas a 1440p y 4K también aclararían si las transferencias PCIe o la inferencia neuronal se convierten en la principal limitación. Las configuraciones de líneas PCIe varían mucho entre las placas base de consumo, especialmente cuando se instalan dos dispositivos grandes.

Si el método funciona con varias tarjetas y configuraciones de líneas, respaldará el modelo subyacente de separación. Si las ganancias desaparecen fuera de GPU de gama media idénticas, su importancia práctica se reducirá.

La tercera señal es la respuesta de Nvidia mediante software o hardware. La empresa podría mejorar la programación con una sola GPU, reducir el coste del modelo neuronal o exponer compatibilidad multiadaptador a través de Streamline. Las futuras GPU también podrían añadir más capacidad neuronal aislada.

El diseño oficial de Nvidia ya recibe datos del motor más ricos que el mod. Mejores máscaras e información de movimiento deberían reducir el procesamiento desperdiciado y mejorar al mismo tiempo la estabilidad de la imagen. Por tanto, los desarrolladores podrían resolver gran parte del conflicto sin un segundo dispositivo.

Aun así, el experimento MGPU Bridge identifica un límite de carga de trabajo que merece seguimiento. El renderizado neuronal consume ahora suficiente computación sostenida como para influir en cómo debería dividirse una canalización de fotogramas.

El futuro más plausible no es un regreso al gaming con dos tarjetas. Es una separación más deliberada entre los gráficos convencionales y el procesamiento generativo de imágenes dentro de un mismo sistema.

Esa separación podría darse mediante bloques de hardware dedicados, chiplets, procesadores integrados o API multiadaptador explícitas. La forma exacta importa menos que el principio de programación expuesto por el mod Nvidia DLSS 5.

Para los jugadores, el consejo actual sigue siendo sencillo. Consideren los resultados publicados como evidencia de un mecanismo, no como una recomendación de compra ni una prueba de rendimiento universal.

Para desarrolladores e investigadores de hardware, el experimento plantea una pregunta más precisa. Si el renderizado neuronal se convierte en una etapa final permanente, ¿debería seguir compitiendo con el renderizador por los mismos recursos?

La próxima ronda de datos independientes de latencia, pruebas con más GPU y actualizaciones de integración de Nvidia debería responder a esa pregunta. Hasta entonces, MGPU Bridge sigue siendo una innovadora demostración técnica con evidencia real de rendimiento y limitaciones igualmente reales.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page