top of page

Nvidia DLSS 5 Mod 将神经渲染移至第二块 GPU,但 127% 需要放在语境中解读

9月8日
讀畢需時 13 分鐘

Nvidia 的 DLSS 5 Mod 社区带来了一项引人注目的实验:将神经渲染移交给第二块 GPU,从而恢复最高 127% 的性能。开发者 Marcelo Guibout 使用两块 GeForce RTX 5060 Ti 测试了这一思路。一块显卡负责渲染游戏,另一块则处理已完成的图像。

这种分工改变了 DLSS 5 的性能计算方式。Nvidia 将其新型神经渲染器设计为改善光照、材质、皮肤、毛发及其他复杂视觉元素的工具。然而,当该模型与传统渲染在同一块显卡上竞争资源时,会占用大量 GPU 时间。

Guibout 的 MGPU Bridge 插件将这种竞争移出渲染 GPU。该方法让人联想到多年前部分 PC 发烧友采用的独立 PhysX 配置。它并非重现 SLI,因为两块显卡并不分担常规渲染工作。

早期数据令人鼓舞,但它们并非传统意义上的游戏基准测试。演示仅涵盖有限的硬件、较短的测试时段,以及缺少原生引擎数据的注入式实现。双 GPU 路径还会带来额外显示器、延迟、兼容性限制,以及增加一块显卡等因素。

Nvidia DLSS 5 Mod 将两项高成本任务拆分开来

MGPU Bridge 将神经渲染视为可拆分的最终阶段,而非在主渲染管线内竞争资源的另一项任务。

该实验于 9 月 7 日亮相,距 Nvidia 公布 DLSS 5 技术细节仅一周。Guibout 展示了系统处理 The Blood of Dawnwalker 画面,以及 Cyberpunk 2077 游戏画面的过程。

这项双 GPU 演示使用了两块 RTX 5060 Ti 16GB 显卡。在主测试机中,两块显卡均通过 PCIe 5.0 x8 连接运行。该系统还配备 Ryzen 7 7800X3D 处理器和 32GB DDR5 内存。

MGPU Bridge 是一款 ReShade 插件,这意味着它通过 ReShade 框架接入游戏的图形输出。它识别负责渲染游戏的适配器,并在第二块 GPU 上创建独立的 Direct3D 12 设备。

渲染显卡首先生成完整帧。随后,MGPU Bridge 通过跨适配器共享内存分配复制该帧。第二块 GPU 应用 DLSS Neural Rendering,并通过自身输出呈现结果。

这种安排避免将处理后的图像传回第一块显卡。因此,在当前设计下,每块 GPU 都需要连接一台显示器。神经渲染结果会通过连接至第二块 GPU 的显示器显示。

这一点将该实验与传统多 GPU 渲染区分开来。SLI 会在一帧完成前让显卡分担渲染工作。MGPU Bridge 则将游戏的渲染负载保留在一块显卡上,仅迁移最终的神经处理环节。

项目文档将该软件称为研究代码,而非面向消费者的产品。文档还强调,游戏原有的渲染流程不会受到影响。该桥接程序读取完成帧,并在其他位置执行其工作。

这一设计得以实现,是因为神经处理环节位于图形管线的末端附近。它接收一张图像并返回经过调整的图像。相较于嵌入引擎各处的工作,终端操作更容易部署到另一颗处理器上。

这一概念令人联想到独立 PhysX 显卡,它们负责处理物理效果,而另一块 GPU 负责图形渲染。不过,这一类比仅描述了工作分工。MGPU Bridge 并未采用旧 PhysX 架构,也并未复活 Nvidia 已放弃的 SLI 模式。

Guibout 还测试了另一台配备 Ryzen 5 5600 和 DDR4 内存的机器。该结果表明,桥接方案不需要旗舰级处理器。不过,两套测量系统在主要对比中均使用了两块 RTX 5060 Ti。

这项实验为 Nvidia 带来了一个重要矛盾。DLSS 最初旨在通过渲染更少像素来恢复性能。DLSS 5 加入了高成本的神经处理阶段,它可能消耗超分辨率节省下来的大量计算能力。

将该阶段移交给另一台设备,可让原本的性能收益再次显现。它也揭示了生成式渲染在实时帧预算下依然有多么苛刻。

为何所称的 127% 提升需要谨慎解读

最高百分比描述的是相对于受到严重限制的神经渲染结果的提升,而非相较普通 DLSS 性能的普遍增益。

公布的数据来自以 1920×1080 分辨率运行的 The Blood of Dawnwalker。Guibout 在 DLAA、Quality、Performance 和 Ultra Performance 模式下比较了三种配置。

在整个对比过程中,DLSS 超分辨率始终处于开启状态。第一种配置仅禁用了 DLSS 5 的神经渲染阶段。它代表各所选渲染模式下大致可达到的性能上限。

在 DLAA 模式下,未启用神经渲染时,测试运行在 67 至 70 帧/秒之间。在渲染显卡上运行神经处理后,性能降至 44 FPS。卸载该负载后,帧率恢复至所称的 67 至 70 FPS。

Quality 模式下,未启用神经阶段时可达到 98 至 99 FPS。当一块显卡同时处理两项工作负载时,该结果降至 54 至 55 FPS。双 GPU 配置则达到 91 FPS。

Performance 模式呈现出更大的差距。系统在未启用神经渲染时达到 127 至 131 FPS,神经工作位于渲染显卡上时为 59 FPS,卸载后则达到 106 至 107 FPS。

Ultra Performance 模式在禁用神经阶段时达到 172 FPS。当渲染显卡同时处理神经渲染时,帧率为 69 至 71 FPS。第二块显卡配置达到 157 FPS。

最高 127% 的标题数字,来自约 69 FPS 与 157 FPS 的比较。这确实是显著的性能恢复。然而,卸载后的配置并非比无神经渲染的性能上限快 127%。

相反,它恢复了神经渲染占用主 GPU 时损失的大部分性能。在 Ultra Performance 下,157 FPS 仍低于 172 FPS 的上限。Quality 和 Performance 模式也呈现类似的剩余差距。

Guibout 认为,更重要的发现涉及不同模式下的扩展表现。降低内部渲染分辨率通常会减少传统渲染工作量。然而,神经阶段仍会以最终输出分辨率运行。

因此,其成本下降幅度远小于渲染成本。随着传统渲染变得更轻,一块显卡上的神经处理会在单帧中占据越来越大的比重。

这一行为解释了为何单卡配置仅捕获了 DLAA 与 Ultra Performance 之间可用性能增幅的 39%。据称,卸载路径保留了该可用增幅的 86%。

这些结果揭示的是瓶颈,而非免费性能。第二块 GPU 吸收的是原本已经存在的工作负载。主显卡随后便可将更多帧预算用于游戏本身。

公布的温度数据支持这一解读。在一台机器上,转移神经阶段使渲染显卡温度降低了 21 摄氏度。另一种配置显示的差距约为 10 摄氏度。

这些是在特定系统内测得的数据,并非普遍适用的散热预测。更低的工作温度也不代表整机耗能更少。工作负载如今运行在两颗处理器和两套散热系统之上。

Guibout 明确将这些视频描述为技术演示,而非基准测试。Cyberpunk 2077 用于提供兼容性、稳定性和功耗方面的观察。公布的帧率数据则来自 The Blood of Dawnwalker。

该项目也未评估视觉质量。因此,这些数字无法回答注入式神经输出是否能在更广泛的游戏过程中保留细节、运动稳定性、美术风格或色彩。

这一结果依然重要,因为其机制是合理的。饱和运行的 GPU 必须在有限资源上调度渲染与神经推理。将其中一项工作负载移往别处,便能让原处理器获得恢复空间。

尚不确定的是,这种恢复会如何随更快的显卡、更高分辨率、不同游戏及原生集成而扩展。这些变量可能同时改变神经成本和底层渲染成本。

神经后处理才是真正的性能冲突

这项实验之所以重要,是因为 DLSS 5 将 AI 从重建辅助工具转变为拥有持续计算需求的主要渲染阶段。

早期 DLSS 版本主要根据低分辨率输入重建高分辨率图像。后续版本加入了光线重建和中间帧生成。这些系统利用机器学习改善输出,同时减少部分传统渲染工作。

DLSS 5 改变了该模型的角色。Nvidia 将其描述为参与最终显示效果的生成式渲染器。它从真实世界数据中学习视觉模式,并将这些模式应用于传统图形。

根据 Nvidia 的技术概述,该模型采用单步像素空间扩散过程。扩散模型通过学习视觉结构之间的关系来生成或转换图像,不过 Nvidia 为实时使用调整了这一过程。

原生系统接收当前渲染帧、运动矢量、时序状态和美术控制参数。运动矢量描述图像元素在帧与帧之间的移动位置。时序状态帮助模型维持输出随时间变化的一致性。

Nvidia 表示,该模型保持因果性和确定性。在这里,因果性意味着它不需要未来帧。确定性意味着相同输入应产生相同结果,这对于可预测的游戏视觉效果至关重要。

该公司还表示,DLSS 5 可在 RTX 50 系列硬件上以最高 4K 分辨率运行。其模型针对传统实时渲染难以低成本再现的效果,包括皮肤散射和光线穿过树叶的效果。

这种工作负载不同于普通超分辨率。即使游戏以更少像素渲染初始图像,在输出分辨率下生成细致的材质和光照变化仍可能成本高昂。

MGPU Bridge 利用了这种分离。随着玩家选择更激进的 DLSS 模式,传统渲染会变得更轻。后处理阶段则继续处理最终图像,因此其工作负载相对稳定。

结果形成了一种不同寻常的反转。原本与性能相关的功能,可能占用足够多的 GPU 时间,从而削弱其自身超分辨率组件带来的收益。

Nvidia 的目标并不只是更高的帧率。其 DLSS 5 公告将神经渲染定位为视觉质量功能。该公司希望模型能够增强光照和材质,超越开发者在正常单帧内可模拟的效果。

在解读单 GPU 结果时,这一区别十分重要。较低的帧率并不自动意味着 DLSS 5 失败。玩家是在以性能换取神经增强效果,就像他们已经会为了光线追踪而牺牲性能一样。

关键在于,这种权衡是否仍然具有吸引力。一项高要求功能必须带来可见的改进,才能证明降低原生帧率、增加延迟或更依赖生成帧是合理的。

早期官方测试进一步印证了这一担忧。首个原生部署出现在 NBA 2K27 中,RTX 50 测试发现其性能影响显著。即便如此,几乎所有受测 Blackwell 显卡在 1080p 下都接近可流畅游玩的水平。

原生集成理应比 Guibout 的桥接方案更具优势。游戏引擎可以提供准确的运动矢量、深度信息和遮罩。遮罩让开发者仅在能够带来有用视觉细节的区域应用神经网络处理。

MGPU Bridge 不具备这些信息。它只能看到引擎完成工作后的最终彩色图像。第二块 GPU 通过光流推导运动信息,这种方法通过比较图像内容来估计物体运动。

该桥接方案不会向模型提供引擎深度缓冲区,也无法访问开发者定义的遮罩或官方集成所能提供的完整艺术控制能力。

这一限制让实验既缺乏代表性,又更具启发性。它无法说明正确集成后的游戏会有怎样的表现,却证明了最终阶段的神经网络工作负载能够独立于渲染设备运行。

对 GPU 设计者而言,这引出了一个更广泛的架构问题:未来的游戏硬件是否应为神经网络后处理投入更多独立资源?另一种选择,则是让神经网络推理与渲染继续在同一颗大型处理器内部竞争资源。

对大多数玩家来说,第二块零售 GPU 并不现实。专用神经处理模块、更好的异步调度,或集成处理器之间更紧密的协作,能够更高效地解决同样的冲突。

第二块 GPU 的解决方案带来延迟、成本与兼容性限制

MGPU Bridge 通过接受系统层面的复杂性来恢复渲染能力,而这些复杂性使其目前无法成为主流的 DLSS 5 解决方案。

最直接的限制来自硬件。已有记录的测试使用了两张 RTX 5060 Ti 16GB 显卡。Nvidia 最初将官方 DLSS 5 支持定位于 RTX 50 系列,尽管爱好者已经在旧硬件上尝试通过修改后的路径运行它。

社区测试中已经开始出现混合代际配置。该仓库称,有用户以 RTX 4080 Super 作为渲染显卡、RTX 5060 Ti 作为神经处理器运行。这一观察仍远不及经过控制的硬件调查。

Direct3D 12 是另一项要求。MGPU Bridge 会创建一个 D3D12 设备,并接入 ReShade 的 D3D12 路径。当前实现不支持 Direct3D 11 和 Vulkan 游戏。

该附加组件还需要 ReShade 6.8.0 或更高版本,并且必须具备完整的附加组件支持。仅包含标准特效的版本无法加载所需文件。用户还必须通过自己的兼容安装提供 Nvidia 的神经渲染组件。

双显示器构成了更大的实际障碍。第二张显卡会直接显示处理后的图像,从而避免经由 PCIe 连接再次传输。无显示器连接的第二张显卡也可以工作,但 Guibout 测得其吞吐量低 33%,延迟约为两倍。

即使配备双显示器,延迟问题依然没有解决。该项目测得,第二张显卡每次 1080p 神经网络处理约需 8.3 毫秒。它尚未测量完整的光子到光子延迟,即从输入操作发生到更新后的光线离开显示器之间的全过程。

这种区别使得人们无法对响应性作出明确结论。传输时间、神经网络处理、同步、显示输出和帧队列都会增加用户实际感受到的延迟。

原始文章称,该显示路径会使显示延迟翻倍。不过,由于端到端测量仍不可用,Guibout 的文档采用了更谨慎的表述。据称,在短时间体验中,输出感觉仍可游玩,但主观印象无法替代仪器测试。

该软件还存在其他实验性限制。其最长的已记录稳定 Cyberpunk 2077 游戏时长为 1440p 下的 20 分钟,长期稳定性尚未经过测试。

在串流过程中更改分辨率、DLSS 模式或图形预设,可能会破坏当前连接。这些调整会重建游戏的交换链,即管理等待显示帧的结构。MGPU Bridge 会绑定至初始的尺寸和格式。

帧生成同样尚未得到充分验证。将该桥接方案与生成帧结合,会引入另一个调度阶段,并可能增加一个队列。在任何人宣称两种技术能够良好协同之前,这种交互仍需要受控测试。

色彩管理并不完整。一款受测游戏输出的画面偏灰发白,开发者在自己的设备上降低色调设置后得以修正。但这种临时方案并不能证明其在不同显示器、格式或高动态范围输出下具备准确的色彩表现。

外部叠加层也可能带来额外问题,因为该过程现在包含两个交换链。监控工具可能在游戏的显示流和桥接方案的显示流之间交替读取,这会让基本性能数据变得难以理解。

这些限制解释了 Guibout 为什么表示,该项目并不是 Nvidia 对 DLSS 5 的愿景。它也不是购买另一张显卡的理由。这项实验只是在一组狭窄条件下,隔离并验证了一项技术原理。

即使兼容性得到改善,其经济性也很难成立。第二张 GPU 需要额外插槽、充足供电、散热空间和主板带宽。紧凑型台式机和大多数游戏笔记本都无法容纳这种配置。

整机能耗同样重要。渲染显卡因为分担了任务而运行得更凉爽,但第二个处理器会接手这些工作。在任何人将卸载描述为更高效之前,系统级功耗测量必须同时覆盖两台设备。

对于普通游戏而言,原生集成依然是更强的路径。开发者可以利用引擎运动矢量、深度、语义信息和遮罩来减少不必要的神经网络工作。驱动团队也可以在不依赖第三方显示配置的情况下优化同步。

不过,原生集成并不会否定这项实验,只会让它的贡献更加具体。MGPU Bridge 表明,神经网络后处理并不必然需要与渲染显卡共享同一张卡。

什么能让 DLSS 5 第二块 GPU 实验成为真正的发展方向

三个信号将决定神经协处理器会成为持久架构,还是仍只是爱好者的演示。

第一个信号是独立的延迟测试。评测者需要对单 GPU 原生 DLSS 5 与双 GPU 配置进行光子到光子延迟测量。当完成的帧需要经由另一台处理设备传输时,仅凭平均帧率无法描述响应性。

测试还应包括帧时间分布。较高的平均值可能掩盖不规律的输出、同步停顿或丢失的神经网络输出。在实际游戏过程中,稳定的帧节奏与峰值吞吐量同样重要。

如果独立测试发现延迟较低且稳定,协处理器概念将更具可信度。较大或不可预测的延迟则会削弱其价值,尤其是在输入响应至关重要的动作游戏中。

第二个信号是更广泛的硬件扩展性。两张相同的 RTX 5060 Ti 只能提供一条庞大性能曲线上的单个数据点。更快的渲染显卡可能会暴露较慢的神经处理器,而更高的输出分辨率可能会让神经网络处理负载明显加重。

混合显卡系统尤其值得关注。许多爱好者拥有闲置的旧 GPU,但当前路径仍然依赖兼容的神经网络硬件。一个实用的架构需要可预测的配对规则,而不是依靠反复试错的组合。

在 1440p 和 4K 下进行测试,也将说明 PCIe 传输还是神经网络推理会成为主要约束。消费者主板的 PCIe 通道配置差异很大,尤其是在安装两张大型设备时。

如果该方法能够在多种显卡和通道配置下运行,它将支持其底层的分离模型。如果性能收益在匹配的中端 GPU 之外消失,其实际意义将受到限制。

第三个信号是 Nvidia 通过软件或硬件作出的回应。该公司可以改进单 GPU 调度、降低神经网络模型的成本,或通过 Streamline 提供多适配器支持。未来 GPU 也可能增加更多独立的神经网络处理能力。

Nvidia 的官方设计本就能获得比该 Mod 更丰富的引擎数据。更好的遮罩和运动信息应能减少浪费的处理,同时提升图像稳定性。因此,开发者可能无需第二台设备,就能解决这一冲突的大部分问题。

不过,MGPU Bridge 实验指出了一个值得关注的工作负载边界。神经渲染如今已消耗足够持续的计算资源,足以影响帧管线应如何划分。

最可能的未来并不是重返双显卡游戏,而是在同一系统内更有意识地分离传统图形处理与生成式图像处理。

这种分离可以通过专用硬件模块、小芯片、集成处理器或明确的多适配器 API 来实现。具体形式不如 Nvidia DLSS 5 Mod 所揭示的调度原则重要。

对玩家而言,目前的建议依然简单:将已发布的结果视为一种机制的证据,而不是购物建议或通用基准。

对开发者和硬件研究人员而言,这项实验提出了一个更尖锐的问题:如果神经渲染成为永久性的最终阶段,它是否还应继续与渲染器争夺相同资源?

下一轮独立延迟数据、更广泛的 GPU 测试,以及 Nvidia 的集成更新,应能回答这个问题。在此之前,MGPU Bridge 仍是一项富有创意的技术展示,既有真实的性能证据,也有同样真实的限制。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page