高性能计算系统性能评价白皮书-中国计算机学会_33页_15mb
报告摘要
高性能计算系统性能评价白皮书内容总结
本白皮书围绕高性能计算(HPC)系统性能评价体系的构建与应用展开,提出以综合评价指标为核心,全面牵引系统设计与选型,以实现存算平衡、数据为中心的新型数字基础设施目标。核心内容包括以下方面:
-
背景与发展趋势
随着数字经济的发展,数据作为关键生产要素,推动了高性能计算向以数据为中心的转型。国家政策如《“十四五”数字经济发展规划》要求加强数字基础设施建设,促使HPC系统从“大计算”向“大计算+大数据”(HPDA)演进。当前HPC呈现五大趋势:多元应用驱动异构算力体系、AI计算迅猛发展、存算资源融合以提升效率、高速互联技术推动全光化、按需弹性运维与容器化应用普及。特别是在数据密集型场景下,存储系统的重要性愈发凸显,成为系统综合性能的关键环节。 -
综合性能评价框架
白皮书提出以算力(科学计算与AI性能)、存力(存储性能)、运力(网络性能)及效率(能效与平衡性)为六大维度,构建综合评价体系。具体指标包括:- 科学计算性能:HPL(双精度线性方程组求解)、HPCG(稀疏矩阵计算)。
- AI计算性能:ResNet-50图像推理性能、MaskR-CNN图像训练速度。
- 存储性能:文件系统带宽(单客户端/多流/聚合)、多协议互通效率。
- 网络性能:点对点通信带宽、延迟、吞吐能力。
- 系统能效:单位功耗浮点计算能力、存储容量。
- 系统平衡性:内存与核心比、BurstBuffer容量比例、I/O与存储带宽比等。
-
评价方法与标准建设
现有HPC评价规范存在碎片化问题,侧重细分领域且缺乏综合评测。白皮书提出采用几何平均数计算各维度评分,并通过指标权重设计(如科学计算占0.6、AI性能占0.5、存储性能占0.2等)实现多维度平衡。同时,基于Top500集群数据,初步划定存算配比范围(如超大型集群内存与核心比为6~10,小型集群为1~4),并计划不断完善。现有国家标准与行业规范涉及数据存储能效、分布式存储技术、能效评价等,但仍缺乏统一的综合评价标准。 -
典型应用场景分析
- IO密集型系统:如基因测序集群,需处理PB级数据,依赖高聚合带宽(如324GB/s)与多协议互通能力,存储性能成为核心瓶颈。
- IO+计算密集型系统:如气象预报集群,需平衡计算能力(239PFLOPS)、内存带宽(112GB/s)与存储吞吐能力,支持复杂数据处理流程。
- AI密集型系统:如自动驾驶集群,强调GPU加速(如NVIDIA A100显卡贡献82.5%算力)、低延迟网络(<15ms)及大容量存储(24PB),以应对实时数据处理与模型训练需求。
-
未来工作重点
白皮书提出三方面改进方向:- 开发统一评测程序,降低跨架构系统测试门槛;
- 建立“优秀高性能计算系统”榜单,推广标杆案例;
- 构建评测社区,协同优化性能指标与标准体系。
同时,计划逐步迭代评价方法,结合技术演进与用户反馈,完善指标权重分配与应用场景适配性分析。
该白皮书标志着我国HPC性能评价体系从单一计算性能向多维综合性能的转变,旨在通过科学指标牵引,提升系统的实际能效与资源利用率,推动绿色节能与存算融合的技术路径。
试读结束,高清完整版pdf/doc/ppt,请点下载