【中国计算机学会】高性能计算系统性能评价白皮书
报告摘要
白皮书提出以高性能计算系统综合评价指标作为评估新方法,旨在构建存算平衡、以数据为中心的系统,实现系统设计优化与能效提升。内容涵盖六个核心维度:算力(科学计算、AI计算)、存力、运力、效率(能效与平衡性),并给出综合评测方法及典型场景配置方案。
白皮书指出,随着数据成为关键生产要素,存储系统的重要性日益凸显。传统以算力为核心的评估体系已不足以满足新型数字基础设施需求,需通过综合性能评价实现算力、存力、运力的协同优化。当前高性能计算呈现五大发展趋势:多元应用驱动异构算力、AI计算迅猛发展、资源集约化架构融合、高速光互联网络普及、容器化运维技术应用及数据密集型超算体系构建。
在指标体系设计中,科学计算性能包含HPL(双精度线性方程组求解)和HPCG(稀疏矩阵共轭梯度法)两个维度,分别代表稠密与稀疏计算场景。AI计算性能通过ResNet-50和MaskR-CNN模型进行图像推理与训练任务评估。存储性能包含单客户端带宽、聚合带宽、IO速率等指标,并强调多协议互通能力。网络性能关注点对点带宽、延迟及带宽利用率。系统能效通过单位功耗计算能力与存储容量衡量。系统平衡性则需评估内存与核心比、BurstBuffer与存储层级容量/带宽比等五项指标。
白皮书基于TOP500超算集群数据,将系统划分为超大型(>30PFLOPS)、大型(10-30PFLOPS)、中型(1-10PFLOPS)三类,对应不同存储与计算资源配置比例。例如超大型集群需保持内存与存储带宽比值在4-8区间,而中型集群的该区间为1-4。同时提出多协议互通访问效率(HDFS/NFS与POSIX协议速率比值平均)作为重要评估参数。
典型应用场景分析表明:基因测序集群需高聚合吞吐能力(如达324GB/s),气象预报集群要求计算与存储协同(如文件系统带宽达112GB/s),自动驾驶集群则突出AI算力与低时延需求(如<15ms通信延迟)。当前评价基准仍存在碎片化问题,缺乏综合体系,需建立覆盖算力、存力、运力、能效的完整规范。
白皮书未来规划包括:开发标准化评测程序、定期发布优秀系统榜单、构建行业评测社区三个重点方向。通过指标权重动态设置(科学计算占60%、网络性能占40%等)与平衡性范围界定,推动性能评价从单一维度向多维协同演进。该方法通过几何平均数计算各维度综合得分,配合性能雷达图可视化呈现,可有效指导系统设计与选型,提升数字基础设施整体效能。
试读结束,高清完整版pdf/doc/ppt,请点下载