Modder们仍在继续尝试降低NVIDIA DLSS 5高昂的性能开销。最新的成果是一款面向GeForce RTX 50系列显卡的FP8/NVFP4混合版Neural Rendering(神经渲染)模型,不过其实际提升相当有限:在4K分辨率下,DLSS 5神经渲染的完整耗时仅缩短了约1-2%。
据X平台用户SwurvGaming发现,这一实验性实现出现在OptiScaler-DLSSNR-PreSR-Multipass项目的0.7.1版本中。由于Blackwell架构的第五代Tensor Core能够原生加速NVFP4格式,将DLSS 5的部分计算从FP8转移到该格式,看起来是提升推理速度的一条显而易见的途径。
在其中一项测试中,一名RTX 5080用户报告称,使用新混合模型运行DLSS 5时,帧率从130 FPS提升至165 FPS。然而实际优势要小得多。根据项目的更新说明,与原始FP8实现相比,混合模型在4K分辨率下仅将DLSS 5神经渲染的完整处理耗时缩短了约1-2%。开发者本人也将Blackwell上的这一改进形容为"非常微不足道"。
更重要的是,这并不意味着游戏整体性能提升了1-2%——这里所说的仅仅是神经渲染处理耗时的缩短。模型中不受支持的形式仍会自动回退到FP8。
考虑到NVFP4本身的潜在优势,这一结果尤其耐人寻味。NVIDIA解释称,该格式相比FP8可以降低显存需求,同时利用Blackwell Tensor Core的原生加速。然而,要将神经网络有效迁移到如此低的精度,需要进行相应的量化与优化,而不是简单地转换现有模型。
随后开发者对混合路径进行了进一步优化。在0.7.2版本中,NVFP4 Hybrid组合方案已成为Blackwell显卡的推荐选项。在《博德之门3》的一项120秒测试中,该方案实现了55.16渲染FPS,而FP8方案为54.57 FPS。不过开发者特别提醒,如此微小的差距尚未被证实能够稳定复现。
与此同时,NVIDIA自身也在持续优化DLSS 5。该公司此前向Wccftech透露,这项技术相比GTC 2026上的最初演示版本已经快了约五倍,且进一步改进仍在开发之中。NVIDIA同时还确认了对RTX 40系列显卡的官方支持。
DLSS 5仍是NVIDIA计算量最大的DLSS模型,因此降低其性能成本尤为重要。不过就目前而言,社区的实验表明,简单地将现有FP8模型迁移至NVFP4,并不能带来一些人所期待的巨大加速。





