


授权转载自知乎用户:绝地求生盒子君
原文链接:https://zhuanlan.zhihu.com/p/76974828
(3)

接下来就是谈谈PowerVR,Series 6、6XT是这家公司最繁荣时期,很多电视盒子、平板SoC都用了GX6250、G6430、G6400,苹果A8X使用了GXA6850;手机SoC方面,联发科有一款有名的MT6595使用了G6200,代表机型魅族MX3,另一款有名的Helio X10同样也是G6200,很多千元机型都采用了X10,还有苹果A7使用了G6430,A8使用了GX6450。目前已经从Series 6、7的Rogue架构发展到Furian架构,不过只有旗舰8XT和9XT Plus是基于Furian架构,其余的中低端还是基于Rogue架构。


早些年PowerVR可谓风光无限,被称为苹果御用GPU,IP授权费用比ARM的Mali贵很多,安卓阵营的几家多数都没选择原因其一是费用较贵,其二就是面积较大,整体成本更高不如用Mali实惠,只有联发科是二者都使用。不过直到苹果后来突然宣布不再使用Imagination Technologies的一切图形技术并终止专利费支付,转向自研,这一消息传出后股价在当日一度下挫近70%,随后宣布卖身并很快被中资背景私募基金的凯桥以5.5亿英镑收购。已有消息称苹果从2016年3月到10月份期间已经从Imagination Technologies至少挖来了25名高级人才,安排负责自主GPU设计。被变相挖空的IMG惨遭重创,近两年过得十分惨淡。纵观各个行业我们都能知道,对于研发授权IP企业,长期依赖另一家有需求的企业购买授权是非常不利的,一旦客户有了自己研发能力,那这家企业也就面临失去收益最大的来源,IMG长期依赖苹果以至被摒弃后堕落也在所难免。
在搭载PowerVR苹果A系上性能跟同期Adreno300系、400系、500系打得有来有回,并且驱动开销小再加上苹果A系CPU单核性能强劲,所以在驱动开销方面的表现远超高通以及ARM,上文谈Adreno和Mali时也说到了,不过驱动开销跟Tegra比还是黯然失色,跟A8同期Tegra K1在GFXBench驱动开销2离屏同样使用OpenGL测试,二者成绩几乎相同,要知道K1用的CPU是Cortex-A15,而A8的CPU则是强得多的Typhoon;3DMark的驱动开销测试Vulkan部分,Tegra K1成绩远甩MTK X30上的GT7400 Plus,

因为只是对比Vulkan开销测试,CPU部分影响没OpenGL那么大,X30用的CPU大核是Cortex-A73。而高通家Adreno到了540测Vulkan开销也才缩小了跟PowerVR和老黄的差距。PowerVR在苹果A系上性能虽十分强劲,但对安卓平台不是那么友好,实际运行3D图形场景发挥不出理论性能,兼容性也不怎么好,这也跟软件厂商适配有密切关系,毕竟安卓平台两大主力是Adreno和Mali,安卓平台上的PowerVR市场占比远不及这两家,游戏开发者没有为其深度适配优化自然实际表现不怎么好。
自SGX 5以来PowerVR就已经是统一渲染架构了,不久后又发布了基于全新Rogue架构Series 6。先看一下Rogue架构,就拿7XTPlus为参考,每条单独流水线内Shader ALU含有两个32bit FMA ALU、四个16bit FMA ALU和一个SFU,以及在7XTP上增加的两个32bit INT ALU组成,这样每个时钟一个SIMD通道并行执行一对FMA指令,FP32 ALU和FP16 ALU分离两种精度单独存在。每个USC集群包含16级流水线,这样算下来每个USC集群有32个单精度(FP32) ALU,按PowerVR的意思这里USC集群换个说法就是GPU的一个核心,每个核心32 ALU,7XTPlus可选配2-16个USC集群(2-16个核心)。


PowerVR最大的不足是面积上,即使是如此还比Mali要好些的,当Chipworks发布A10的Die Shot图后,我们可以清晰看到6核心Series 7XT还是占据整个SoC挺大一块,相比面积效率有天生优势的Adreno,IMG需要在下代架构着重改进的就是功耗/性能/面积(PPA)。

虽然被苹果摒弃后经历这么大波折,IMG还是继续发布了新的图形IP,以及神经网络加速器(NNA),但至今还没见到移动SoC采用基于Furian架构的8XT和9XTP,联发科P90采用了依然基于Rogue架构的GM9446,至于为什么不采用9XTP哪怕双核心都行呀,我们应该都会想到基于Furian的IP比较昂贵,考虑到成本问题还是用中端9XMP,新的Furian架构更好是肯定的。Furian的设计首要目标是改进功耗和性能,具体来说就是每毫瓦性能、每平方毫米性能。官方宣称相比于7XT Plus可提升35%的着色器性能、80%的填充率性能(未细说是像素还是纹理)、70-90%的综合性能。

深度好文,详解PowerVR Furian GPU架构的改变(一)imgtec.eetrend.com https://imgtec.eetrend.com/d6-imgtec/article/2017-03/9496.html

深度好文,详解PowerVR Furian GPU架构的改变(二)imgtec.eetrend.com https://imgtec.eetrend.com/d6-imgtec/article/2017-03/9498.html

Furian的每条单独流水线内Shader ALU由Rogue一个SIMD通道含有两个FMA ALU,改为一个MAD ALU和一个MUL ALU,这样并行相乘,与Rogue相同数量的USC每时钟的运算量增加了50%。我们根据已发布的8XT来看,Furian每个USC集群由16级流水线扩展为32级流水线,还有一个改变明显之处是将两个USC集群包含在一个SPU(着色处理单元)内,整体集群少了,纹理单元就可以上去了,每时钟周期的双线性采样翻番到8个。这样算下来每个SPU(按PowerVR的意思相当于一个核心)含有64个FMA ALU和MUL ALU。可选配1-16个SPU(1-16个核心)。



然后去年底又发布新一代Series9,其中最引人注目的是基于Furian架构的9XTP,这个就很恐怖了。贯穿整个设计的全面PPA优化,包括低级架构性的调优;为了显著增加FLOP密度,每个USC集群由8XT的32级流水线扩展为40级流水线,这样算下来每个SPU含有80个FMA ALU和MUL ALU;增加高达50%的fps/mm²密度,提升了游戏/基准计算密度;YUV加速到平面YUV的2和3倍;
Imagination Announces PowerVR Series9XTP, Series9XMP, and Series9XEP GPU Coreswww.anandtech.com



并通过PVRIC4视觉无损压缩功能降低带宽和增加缓存大小,这是新一代功能强大的图像压缩技术,且不会出现明显的图像质量损失。PVRIC4支持随机访问视觉无损图像压缩,确保带宽和内存占用节省至少50%,并使系统能够克服性能的带宽限制。不过视觉无损压缩不是无损压缩,而是让你视觉看起来无损的压缩,例如下面第二张图所示紫色这部分采用视觉无损压缩(视觉上看不出,但其实是有损的),黑色部分仍然采用无损压缩。


全新的Series 9XTP多方面改进又给对手造成巨大压力,又一次与Mali、Adreno拉开非常大差距,下一代Adreno和Mali比较难追回这代差。预计6核心规模的9XTP性能超过苹果A12X没什么问题,而3核心规模的9XTP就能跟A12打得有来有回。
笔者是一枚通粉,这些年用过挺多搭载高通SoC的手机,我对高通有比较久的情怀,就像苹果对于果粉、小米对于米粉而言,最好的支持就是它家的产品买买买,虽然被某代产品坑过踩到雷,但总体上还是一直支持的。
参考资料:
Anandtech:https://www.anandtech.com/
TechInsights:https://www.techinsights.com/
ChipRebel:https://www.chiprebel.com/
ARM:https://www.arm.com/products/silicon-ip-multimedia
ImgTec:http://imgtec.eetrend.com/
百度贴吧、微博 @zhu3536
百度贴吧、微博@ioncannon
百度贴吧、微博 @暂时就叫这名吧
微博、知乎 小扁蓝·超威
知乎 @远方/百度贴吧 @卧楼听松
百度贴吧 @HikkiFans/微博 @宇多田圣人惠
百度贴吧: 还是那个小新
百度贴吧: ssim指标
我在:微博@死磕菊为花畜海军/百度贴吧 @数码爱好者,QQ:1042298677。