如果你是个手游玩家,应该早就习惯了一种「妥协」,想要好的画面就得忍受手机发热和续航血崩,反之就需要把画质调到流畅,降低帧率。
虽然现在的 SoC 已经大幅提升了能效比,但面对长达数小时游玩以及越来越多的手游大作,玩家仍然需要有所妥协,这个矛盾贯穿了整个移动游戏的发展过程,市面上那种打游戏专用的手机散热器(散热背夹)依然畅销就非常好理解了。
技术总是在进步,这不,在 9 月 8 日上海举办的 Arm Everywhere China 年度大会上,Arm 发布了新一代移动计算平台 Arm CSS for Mobile 2,其中最值得游戏玩家关注的一件事是 GPU 里第一次装进了专门跑神经网络的加速器,不仅最高可以带来 4 倍性能提升,而且功耗只有 1 瓦(1W)。
放弃「蛮力」计算,渲染这件事的思路变了
GPU 算得更快、光影算得更准、渲染的分辨率更高是玩家永恒的追求,也是 GPU 发展路线中基本不变的原则,但继续按照传统的方式,想要更好的画面,理论上就得堆算力、提升 GPU 的规模,自然也要多耗电,尤其是在手机上,这笔帐算下来,通常结果都是「不值得这么做」。
神经网络给出了另一条发展路线,不再事事都靠传统渲染管线硬算,而是通过重建、增强、生成的方式把画面细节补出来。游戏用较低的分辨率渲染,再由神经网络把它放大到高分辨率;帧率也可以用类似的方式插出来,直接翻倍。
听起来,这些靠 AI 补出来的画面、补出来的帧有点像「作弊」,但对玩家而言,屏幕上呈现的效果和省下来的那部分电,都是实打实的。
这次 Arm 端出了 Mali G2-Ultra NX,从命名上也能看出来,这是去年 Mali G1-Ultra 的迭代版本,但新增了一个表明神经网络加速器的 NX 后缀,把 NX 直接放进名字中,也表明 NX 在其中的重要性。
值得注意的是,Mali G2-Ultra NX 加速器不是作为一个独立模块被摆到 GPU 外面,而是直接放进了 GPU 内部,让图形处理和神经网络计算在同一条管线里协同运行。这个设计的好处很直接,数据不用在不同引擎之间来回搬,延迟和功耗都省下来了。
Mali G2-Ultra NX 自然也成了首款集成专用神经网络加速器的 Mali GPU。
Arm 公布的数据显示,结合 Arm 神经网络技术,Mali G2-Ultra NX 在神经网络处理场景下 1W 功耗下的表现最高提升 4 倍。在移动芯片行业里,两代产品之间的提升通常是两位数百分比,能效直接翻四倍这种量级并不常见。
同时它也没有放弃传统渲染。新 GPU 引入了全新的执行引擎和第三代光线追踪单元,在现有游戏内容上相比上一代仍有最高 14% 的性能提升。也就是说,Mali G2-Ultra NX 不仅可以让基于新技术开发的游戏从中获利,老游戏也同样可以获得不错的提升。
光追在移动端彻底放开
对游戏开发者来说,这里面最解渴的一项可能是神经降噪。
光线追踪在移动端一直很尴尬,想要干净的光追画面,需要采样足够多的光线,采样一多功耗就压不住;采样少了画面就一片噪点。结果就是,手游里的高级光照效果通常只能小心翼翼地用在局部,不敢大面积铺开,就更不用谈全局了。
神经降噪把这道门槛降下来了,用较少的光线采样得到带噪的结果,再交给神经网络清理干净。加上超分辨率和帧率生成这两项,开发者手上就有了一整套在功耗预算内换取画质的工具,而不是只能靠砍效果来保住帧率。
今年 6 月,我们就受到 Arm 邀请,提前看到了 Arm 与 Sumo Digital 联合开发的手游《光影新生》的技术演示,当时我们就对其中运用的神经帧率提升 NFRU(Neural Frame Rate Upscaling)和神经超采样与降噪 NSSD(Neural Super Sampling and Denoising)技术留下了非常深刻的印象(此前文章链接)。
此次,我们则是更加深入地了解了搭载这些技术的 Mali G2-Ultra NX 能带来什么,目标很明确,在移动端的功耗和散热限制下,做出接近主机水准的光影表现。
技术要从实验室走向玩家屏幕
技术再好,如果开发者用不上,就还是 PPT。这次比较务实的一点是,引擎层和内容层的进展是同步公布的。
引擎方面,腾讯游戏公共技术线的 AI 游戏中台 MagicDawn 和 Unity 中国的团结引擎都已经集成了 Arm 神经网络技术。Unity 中国首席执行官张俊波的说法是,原生集成的意义在于让开发者「开箱即用」地拿到神经图形能力,不必自己从底层啃起,对中小团队来说,这基本决定了这项技术是能用还是只能看别人用。
具体游戏的时间表也有了,除了前面提到的《光影新生》,在今年科隆游戏展上荣获最佳移动游戏的网易《燕云十六声》计划在今年向玩家推出支持神经超级采样的版本;Arm 还联合腾讯游戏《暗区突围:无限》开展神经超级采样与降噪(NSSD)的共研演示;叠纸游戏的《无限暖暖》也在推进 NSS 集成。
腾讯游戏公共技术线负责人陈冬提到的思路是把底层技术创新、开发者和真实内容场景连起来,让新一代图形体验真正落到玩家手上。这话听着像市场营销的表述,但从名单上看,确实是引擎、内容、终端在共同推动这项技术,让玩家可以在手机端玩到更出色的游戏,不用再眼巴巴看着过去只有 PC 和主机才能拥有的画质表现。
据悉,在终端这一环 vivo 已将 Arm 神经网络技术引入基于 Arm 最新计算平台打造的最新旗舰手机,希望借终端侧的优化能力加速这项技术的普及。我相信,凭借 Arm 已经无处不在的行业影响力,这些技术以及基于这些技术打造的游戏将会如雨后春笋般大量涌现。
AI 时代,游戏也需要强大的 CPU
SoC 重要的不仅仅只有 GPU,这次发布的另一半是 Arm C2 CPU 集群,由 C2-Ultra 和面向能效的 C2-Pro 组成,配了双 SME2 单元。这部分虽然跟画质关系不大,但与游戏中的 AI 功能关联度极高。
现在的 AI 正在从「你问一句它答一句」变成智能体形态,AI 可以自己规划步骤、调用工具、跨应用把事情办完。这类活儿里,CPU 干的是编排调度的工作,维护上下文、分派任务、协调各个模型和服务,所以 CPU 的响应速度直接决定了 AI 助手用起来是流畅还是卡顿。
C2 CPU 集群把 SME2 计算能力翻了一倍,最新小语言模型的运行速度可提升最高 70%。与上一代 C1-Ultra 相比,C2-Ultra 的 AI 性能最高提升 1.7 倍,单线程性能最高提升 15%,相同性能下功耗最高降低 38%。
游戏里的实时语音翻译、更聪明的 NPC、端侧运行的小模型,都吃 CPU 上的 AI 性能。比如你在国际服中跟讲不同语言的队友开黑,其中用到的音频克隆和实时翻译就需要靠 CPU 提供加速。
玩家能期待什么
把我们此次在 Arm Everywhere China 年度大会上看到的这些技术拼起来,接下来一两年手游的变化大概是会呈现出画质天花板会提升一截、主机级的光影效果在手机上从演示逐渐落地;人机对战难度也能匹配上高水平玩家,不再那么「傻瓜式」。同样的画质下手机会更凉、更耐用,逐步发展起来的折叠屏也会从中受益,因为高分辨率大屏最需要超分和帧生成这类技术来兜底。
要提醒的是,这些都需要时间。芯片、引擎、游戏,一环扣一环。首批搭载的游戏今年会露面,真正铺开还得看明年。
对整天纠结画质和续航的手游玩家来说,这可能是内存、存储、手机大涨价浪潮中最实在的一个好消息了。










