我提前体验了 DLSS 5,它居然把 GTA5 变成了 GTA6?

「生成」可以用 AI 去生成,但「创造」永远都该由人类来创造。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

2026 年 3 月,黄仁勋在 NVIDIA GTC 2026 发布了 DLSS 5——这是英伟达最新一代的「深度学习采样」( Deep Learning Super Sampling)技术,但和以往不同的是,这一次生成式 AI 深度介入其中,并且给游戏带来了剧烈的变化,黄仁勋称之为:

图形领域的 GPT 时刻。

但生成式 AI 在带来「真实」画面质感的同时,也意味着对游戏画面进行了「重绘」——因而在这项技术发布之初,就引起了巨大的争议。

Image

▲《生化危机 9》女主角格蕾丝,DLSS 5 开关前后对比

时隔半年,爱范儿终于第一时间「上手体验了」DLSS 5,并与英伟达的技术人员进行了深度交流。一圈体验下来,DLSS 5 在不同游戏里的表现差异很大。但有一点很明确——它已经和我们过去熟悉的 DLSS 不太一样了。

其中让我最意外的一个例子,是已经发布十多年的《GTA 5》——这个发行于 2013 年的老游戏,在打开 DLSS 5 后,有那么几个瞬间,真的让我以为是还没发售的《GTA 6》。

Image

▲黄仁勋在 NVIDIA GTC 2026 上的演讲,图片来源:PC Mag

DLSS 5 初体验:GTA 5,画面好得像 GTA 6

《NBA 2K27》是首款实装了 DLSS 5 的游戏,就在 8 月底,《NBA 2K27》开启了抢先体验,意外地把一个尚未正式公开提供的 DLSS 5 Neural Rendering 运行库打包在了游戏包体里。

于是,有 Modder 就把这个运行库提取了出来,并接入到了不同游戏中——目前,我们可以体验到的 DLSS 5 就是源自这个非官方版本,运行效果并不能代表游戏制作团队意愿,但 DLSS 5 的能力已经初见端倪。

Image

▲来自 Mod 社区制作的《控制》DLSS 5 游戏界面,图片来源:The Verge

根据泄露的信息来看,《NBA 2K27》里的这个模型是纯端侧运算,大约是 1.48 亿参数,采用 FP8 精度存储,占用游戏包体里约 150MB 的空间。

经过多个游戏的验证,可以初步判断,DLSS 5 很适合一类游戏:写实游戏

《GTA 5》就是一个很典型的例子。这款大名鼎鼎的开放世界,游戏最早发布于 2013 年。放到今天来看,洛圣都的开放世界设计依旧先进,游戏剧情也相当引人入胜,但即便是几经翻新,游戏画面也还是能看出一些老态——

路人的皮肤比较平,衣服和身体之间缺少细腻的接触阴影,室内和街道上的光线相对简单,树叶、玻璃和金属也没有今天 3A 游戏里那么丰富的材质表现。

DLSS 5 刚好可以为这些地方补充细节。

Image

▲来自玩家制作的《GTA 5》DLSS 5 游戏界面,图片来源:Lootward

Image

▲来自玩家制作的《GTA 5》DLSS 5 游戏界面,图片来源:Lootward

Image

▲来自玩家制作的《GTA 5》DLSS 5 游戏界面,图片来源:Lootward

它会重新理解画面里的角色、道具和环境,再补充更加自然的光照和材质细节——于是,我们看到老麦的脸上有了更多褶子,明暗关系更复杂,衣服材质更为丰富,场景的光影也更接近现实。

这些变化单独拿出来都不算惊艳,但同时铺满洛圣都之后,整个游戏焕然一新!

Image

▲来自玩家制作的《GTA 5》开启 DLSS 5 后实机截图

英伟达负责 DLSS 技术研究的 Edward Liu 告诉爱范儿:

Better input, better output.

输入越好,输出越好。

对 DLSS 5 而言,《GTA 5》就是一段绝佳的上下文——Rockstar 十多年前已经完成了一个非常完整的写实世界,城市结构、模型材质和整体美术都经得起时间检验,只是当年的硬件没有条件,能把所有光照和材质细节都做得像今天这么复杂——而 DLSS 5 用生成式 AI 弥补了这一切。

Image

▲来自玩家制作的《GTA 5》开启 DLSS 5 后实机截图

《赛博朋克 2077》也是类似的情况。

夜之城是个光怪陆离的赛博都市,有着极其惊艳的城市设计和画面表现,但只要你游戏玩得多了,就能发现游戏中明显的资源分配痕迹——主角和重要 NPC 可以做得很精细,但街边成百上千个路人的脸却只是很扁平的一张贴图。

Image

▲来自玩家制作的《赛博朋克 2077》开启 DLSS 5 实机截图

毕竟,CDPR 可以花费大量时间把强尼·银手打造得像基努里维斯一样逼真,却不可能把每一个过路的 NPC 都按照电影 CG 的规格进行处理。

这时候,DLSS 5 就能大派用场。

它可以给大量过去没有必要精修的角色增加皮肤质感、阴影、眼睛反射和衣物细节,让原本承担「背景」功能的人物看起来更完整、更真实。

Image

▲来自玩家制作的《赛博朋克 2077》路人 NPC,DLSS 5 关

Image

▲来自玩家制作的《赛博朋克 2077》路人 NPC,DLSS 5 开

类似的提升放到环境里也成立,大量植物、玻璃、金属、布料都能得到更丰富真实的光照反馈。

Image

▲来自玩家制作的《赛博朋克 2077》开启 DLSS 5 实机截图

Image

▲来自玩家制作的《赛博朋克 2077》开启 DLSS 5 实机截图,具有丰富的光影效果

体育游戏和 DLSS 5 也是绝配。

过去我们评价 FIFA、NBA 2K 的画面,经常会说球员已经「很像真人」,但很像真人和真正接近一场电视转播,还是有区别。球员本身就有现实世界里的参照物,皮肤、汗水、眼球反射、球衣和球馆灯光越接近真实,游戏的目标也就完成得越好。

这也是《NBA 2K27》成为 DLSS 5 首批落地游戏的合理原因。

在 NVIDIA 展示的效果里,最明显的提升不只发生在明星球员脸上。手指和篮球之间多了接触阴影,耳廓和眼窝拥有更自然的遮蔽关系,皮肤和球衣的材质更加复杂,连观众席里拿着摄像机的普通 NPC 也能得到类似的增强。

Image

▲《NBA 2K27》DLSS 5 关,图片来源:NVIDIA

Image

▲《NBA 2K27》开启 DLSS 5 效果,图片来源:NVIDIA

过去这些效果也能通过传统渲染完成,只是成本很高。开发者当然可以给一个 NPC 的耳朵计算更准确的皮肤散射,也可以给几万人的观众席增加更复杂的阴影和反射,但没有多少游戏愿意为这些细节付出如此高的性能代价——即便可以,玩家的电脑也跑不动这么复杂的运算。

DLSS 5 提供了一种新的解法:直接让 AI 根据已有画面,把这些细节补出来。

这才是 DLSS 5 最大的价值——很多过去受限于开发时间、算力预算而被省掉的视觉细节,可以一次性铺到整个游戏世界里,而玩家只需要往电脑里装一张英伟达的 50 系显卡。

现实世界无法计算,那就让 AI 把它画出来

回头看 DLSS 的发展脉络,从 DLSS 1 到 DLSS 4,这套技术始终围绕着一个很明确的目标:

用 AI 提高有限 GPU 算力的利用效率,再把这些性能换成更好的游戏体验。

超分辨率(Super Resolution)是少渲染一些像素,再通过 AI 重建到更高分辨率;帧生成(Frame Generation)是利用前后帧信息生成新的画面;光线重构(Ray Reconstruction)则通过神经网络重新组织稀疏的光追信息。

这些技术要解决的,基本都是一个相对确定的问题——低分辨率要变成高分辨率,低帧率要变成高帧率,低质量光影要变成高质量光影。

Image

Image

但 DLSS 5 开始处理另一类问题:它会生成原始画面中并不存在的视觉信息。

比如更复杂的皮肤次表面散射、更明显的眼窝遮蔽、更自然的头发透光、叶片透射,以及布料和人体之间的接触阴影——在绝大多数游戏里,这些细节并没有被完整呈现,但 DLSS 5 会根据模型对现实世界的理解,把它们直接生成出来。

为什么到了 DLSS 5,英伟达的技术路线突然有了这么大刀阔斧的改动?这与实时图形领域已经面对多年的一个问题有关:

随着游戏画面越来越逼真,游戏显卡已经算不出现实世界的样子了。

按照英伟达技术人员的说法,相比早期可编程 Shader 时代,今天 GPU 可以投入实时图形的计算预算已经增长了超过 40 万倍,但离真正完整模拟现实世界的光传输仍然有着好几个数量级的差距。

Image

头发就是一个很好的例子——逆光照过人物时,光线会进入大量发丝,在其中发生折射、反射和散射,才呈现出我们肉眼所见的「海飞丝」效果;人的皮肤也一样,耳朵在逆光下为什么会泛红,是因为光进入人体组织之后发生多次散射,再从另外的位置离开。

这些现象理论上都能通过物理模拟计算出来,只是计算量非常夸张。

Image

▲来自玩家制作的《赛博朋克 2077》路人 NPC,DLSS 5 开

在电影工业里,影视级 CG 可以花几小时甚至几十小时渲染一帧,但在实时运行的游戏中,留给 GPU 的时间通常只有十几毫秒。

英伟达最新的路径追踪 (Path Tracing) 技术,已经让今天的游戏向真实世界迈进了一大步,但想让游戏里的发丝、皮肤、布料全部达到电影 CG 级别,就算英伟达的显卡再更新几代也很难做到。

生成式 AI 给了英伟达一个新的方向——

一个见过大量现实世界信息的模型,不需要真的模拟阳光穿过耳朵时经过了哪些组织,也能知道逆光下耳朵应该呈现什么状态;它不用完整追踪每一束穿过头发的光,也知道头发边缘大致应该如何透光。

传统计算机图形学要通过物理规律一步步算出最终画面,而生成模型则可以直接学习「最终画面应该是什么样」。

Image

▲来自玩家制作的《赛博朋克 2077》开启 DLSS 5 实机截图,具有丰富的光影质感

Image

最好的办法是把这两套方法合二为一。

游戏引擎继续负责几何、角色、动画、材质和基础光照,确定这个虚拟世界里究竟有什么;DLSS 5 再根据这些信息,以及模型对于真实世界的理解,对最终画面进行一次生成。

用英伟达工程师 Edward Liu 的话讲,就是「重构」(Reconstruction)和「生成」(Generation)的区别——此前 DLSS 的核心任务更多是 Reconstruction,也就是重建画面;到了 DLSS 5,Generation 真正进入实时图形管线,开始创造新的画面。

当然,生成游戏画面,可不能像普通生图模型那样自由发挥。

强尼·银手不可能在游戏中突然换一张脸, NBA 2K 里的篮球也不能变成足球,GTA 里的广告牌也不会每一帧都发生变化。

Image

DLSS 5 推出 3D 引导神经网络渲染技术,所以 DLSS 5 会读取游戏输出的色彩、动作等信息,把原来的游戏画面作为生成时最重要的约束;游戏持续输出画面,DLSS 5 持续理解,再生成一个更接近真实世界的版本;下一帧到来之后,整个过程再次发生……

至于开启 DLSS 5 的性能,如 NVIDIA 所示:

Image

▲《NBA 2K27》4K 分辨率 DLSS 5 性能表现,图片来源:NVIDIA

Image

▲《NBA 2K27》1080p 分辨率 DLSS 5 性能表现,图片来源:NVIDIA

到了这里,DLSS 5 已经开始接近另外一个当下热门的 AI 概念:

世界模型。

DLSS 5,就是一个「世界模型」

过去两年,我们已经看过太多世界模型的 Demo——输入一张图片或者一句话,AI 生成一个可以移动的游戏场景。

按下方向键,角色往前走,模型根据上一帧和玩家的操作继续生成下一帧;转动镜头,它又根据自己对空间和现实世界的理解,把原本看不到的地方生成出来。

Image

▲由 Genie 3 驱动的 Project Genie,图片来源:Google DeepMind

整个世界并不是提前一帧一帧制作好的,而是在人的行动过程中持续被预测和生成。

从这个角度来看,DLSS 5 和世界模型的技术原理其实非常相似。

只不过,一个是靠语言提示词来约束,另一个则靠游戏画面来约束。

DLSS 5 生成的画面源头,还是源自游戏本身——角色位置、建筑几何、动作捕捉、游戏规则都已经存在,DLSS 5 不需要凭空预测这个世界下一秒会发生什么。

Image

▲生成模型会根据 Prompt、故事板、参考图和 3D 条件生成不同结果,图片来源:NVIDIA

它的核心在于:先理解眼前这个世界是什么,再根据自己学习到的世界知识,生成一个新的视觉结果。

每一帧游戏画面,本身就成了模型的输入。

这其实比一段文字 Prompt 信息量要大得多。

一帧游戏截图就已经可以告诉 AI 大模型,人物站在哪里,脸朝向什么方向,太阳从哪里照过来,面前是一块金属还是一片玻璃,,哪些东西正在运动,以及它们在前后帧之间发生了什么变化……

游戏引擎持续提供世界状态,AI 持续理解,再把这个世界重新画出来——而这一切都发生在毫秒之间。

Image

▲DLSS 5 NVIDIA 官方效果对比

所以如果把「世界模型」理解成一个能够理解世界规律,并根据当前状态生成合理结果的 AI 大模型。那么 DLSS 5 已经可以视为一个专门为游戏适配的世界模型。

过去,世界模型每一次大更新,我们对世界模型的想象都是颠覆游戏业界:未来可能只需要输入一句话,就可以生成一个《GTA》一样的世界。

人物、建筑、道路甚至游戏玩法都由 AI 即时生成,传统游戏引擎和游戏开发团队最终都会被取代。

但 DLSS 5 证明了,世界模型和电子游戏之间,也许还有另一种连接方式。

先进的 AI 不会取代 Rockstar 这样的顶级游戏团队,而是成为他们最重要的助力。

Rockstar 可以继续负责设计洛圣都、写人物、做任务、调车辆驾驶、安排街道和建筑,AI 只负责把这个已经非常优秀的世界变得更真实。

从目前的实际效果看,这可能反而是世界模型技术进入游戏最现实的方式。

Image

▲DLSS 5 NVIDIA 官方开发者控制界面模型切换演示

换言之,世界模型未必真的用于「创造世界」,也可以先负责「理解世界」。

理解之后,再把那些没有必要由开发者一项项手工制作,也没有必要让 GPU 暴力计算的东西补出来。反过来讲,理解现实世界,并不代表就理解了游戏。

这也是 DLSS 5 现在最明显的问题。

《最终幻想 7 重生》就是一个很好的反例——

克劳德、蒂法这些角色本来就处在一种经过精心控制的审美区间。他们有真实的皮肤、头发和服装,却依然保留着非常鲜明的日式 CG 风格,五官比例、皮肤状态甚至年龄感,都不是按照现实意义上的真人来设计的。

Image

▲来自玩家制作的《最终幻想 7 重生》DLSS 5 效果对比,图片来源:Reddit

DLSS 5 当然没有 JRPG 角色的审美,它只知道一个真实的人脸通常应该有什么。

于是,《最终幻想 7 重生》里的角色在开启了 DLSS 5 后,反而变得让人啼笑皆非——美型的角色有了深眼窝、法令纹和粗皮肤,确实是更真实了,但一点也不《最终幻想》。PC Gamer 的编辑在体验时,就把处理后的克劳德(Cloud)开玩笑叫作「Claude」。

其实,从「真实性」的角度看,模型可能没有做错什么。

但从《最终幻想》的角度看,它完全搞错了。

还有一些游戏,DLSS 5 的作用也不太明显。

像《最后生还者》《漫威蜘蛛侠》这种本身已经拥有极高美术完成度的作品,DLSS 5 带来的提升非常有限。

这其实更能说明问题。

《最后生还者》里的乔尔应该有多少皱纹,艾莉的皮肤是什么状态,一间废弃房屋里阳光应该从哪里照进来,画面里的尘埃和植物该到什么程度,这些细节早就已经被顽皮狗的艺术家们反复打磨过。

Image

▲来自玩家制作的《最后生还者 第二部》DLSS 5 效果对比,图片来源:DVESF

当人类的表达已经足够完整,AI 当然没有太多可以增补的东西。

这让我觉得,DLSS 5 最终可能会把游戏开发中的一个矛盾放得越来越大。

以前游戏开发者面对的是资源不足——

时间不够、算力不够、人手不够,所以很多东西做不到。

生成式 AI 会逐渐把这部分问题解决掉。

满街的路人 NPC、葡萄园里的葡萄、街道两边的大楼……这些过去需要开发者精修、占用 GPU 算力的场景,以后很可能交给模型来处理就好。

Image

▲来自玩家制作的《霍格沃茨之遗》DLSS 5 效果对比,图片来源:PC Gamer

但另一个问题反而变得更为棘手。

角色为什么长这样?世界为什么是如此构成?玩法应该遵循什么逻辑?

这也是英伟达自 DLSS 5 发布以来,就一直大篇幅强调「艺术家保持控制」的原因。

Image

▲DLSS 5 为开发者提供画面强度与遮罩控制,图片来源:NVIDIA

在英伟达的设想里,DLSS 5 可以通过一系列的组件和功能告诉开发者:「如果想变得更真实,我可以做到什么。」

而游戏艺术家们则负责回答:「这是不是我想要的样子。」

这可能才是 DLSS 5 进入游戏行业之后,最让我好奇的变化。

Image

▲DLSS 5 在不同模型下的画面表现,图片来源:NVIDIA

我们过去担心 AI 太强,艺术家会变得无足轻重。但 DLSS 5 实际展示出来的情况可能恰好相反。

当技术只能做到六十分的时候,大家首先讨论的是怎么做到八十分;当 AI 可以轻易把越来越多东西做到九十分之后,最重要的问题就会变成,到底什么才是那最后的十分。

《GTA 5》当然可以借助 AI 跨过十多年的技术鸿沟,变成如今看来也毫不过时的游戏,但 DLSS 5 不可能真正地把《GTA 5》变成《GTA 6》。

Image

▲《GTA 6》游戏截图,图片来源:Rockstar Games

因为真正让这个游戏成为工业奇迹的,除了持之以恒的玩法打磨、锐意进取的玩法创新和史无前例的规模开发,还有最重要的部分:

凝聚了无数开发者经验与智慧,最终表现出来的——创造力。

「生成」可以用 AI 去生成,但「创造」永远都该由人类来创造。

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

肖钦鹏
肖钦鹏
文章: 13