最近英伟达官方的HPC性能页面更新了H100 SXM、L40和L4的数据,我把这里面AMBER和GMX的数据和我自己在去年10月做的测试对比了一下,由于不确定Xeon 8480C(英伟达定制版8480)的单核性能,就粗略地把8369B和13900K数据取平均来对比:H100 SXM的性能比4090强0~5%;L40性能比4090差,毕竟TGP只有300W,SM数量比4090多也没用;L4的性能连3060Ti都不如。(用去年10月的测试对比是因为英伟达用的软件版本和CUDA版本与我去年10月测试一致) GMX在多卡H100 SXM下的并行效率相较于A100 SXM下明显降低,STMV体系用A100 SXM跑,前4卡的性能提升是完全线性的,而用H100 SXM跑,完全不线性。多卡L40跑GMX的性能,英伟达更是只留了STMV,其他几个体系都不好意思展示出来。这下GMX开发者该急了。 顺便看了一下Lammps以及其他几个HPC应用,H100 SXM相较于A100 SXM的性能提升全都不到1倍,个别甚至不到0.5倍,所以现阶段完全不推荐买H100去跑任何HPC应用。 总的看来,英伟达应该是已经基本抛弃HPC了。
