国内刊号:11-2560/TP
国际刊号:1000-9825
发布日期:
作者:水超洋,于献智,王银山,谭光明
单位:水超洋,中国科学院 计算技术研究所, 北京 100190;中国科学院大学, 北京 10019011,于献智,中国科学院 计算技术研究所, 北京 100190;中国科学院大学, 北京 10019002,王银山,中国科学院 计算技术研究所, 北京 100190;中国科学院大学, 北京 10019003,谭光明,中国科学院 计算技术研究所, 北京 100190;中国科学院大学, 北京 10019004
关键词:HPL;异构系统;跨平台;性能建模;E级计算
基金:国家重点研发计划(2018YFB0204400,2016YFB0201305,2016YFB0200803,2016YFB0200300);中国科学院战略性先导科技专项(C类)(XDC01030000);国家自然科学基金(61972377,61432018,61702483);中国科学院前沿科学重点研究计划(QYZDJ-SSW-JSC035)
随着异构系统成为建造超级计算机的重要选择,如何让CPU与加速器协调工作以充分发挥异构系统的计算性能具有重要意义.HPL是高性能计算领域最重要的基准测试程序,传统面向纯CPU系统的HPL算法通过加速器加速矩阵乘法的做法已经无法取得很好的性能.针对这一问题,提出了基于国产处理器-国产加速器异构系统的HPL性能模型和多线程细粒度流水HPL算法.完成了一个轻量级跨平台异构加速框架HPCX,以实现跨平台的HPL算法.该性能模型能够准确地预测类似异构系统的HPL性能.该HPL算法在NVIDIA GPU平台上性能超过了NVIDIA官方闭源nvhpl程序9%.在国产处理器-国产加速器平台512个节点的规模上,优化的HPL算法实现了2.3 PFLOPS实测峰值性能和71.1%的浮点效率.
来源:2021年第8期
《软件学报》期刊编辑部