2023-01-15-中国计算机学会-高性能计算系统性能评价白皮书_33页_15mb
报告摘要
高性能计算系统性能评价白皮书总结
核心内容
本白皮书旨在提出一种基于六个维度的高性能计算系统综合评价指标,以更全面地评估高性能计算系统的综合性能,包括算力、存力、运力和效率等。该评价体系不仅关注计算性能,还强调存储、网络和能效的重要性,以推动建设以数据为中心的新型计算系统。白皮书提出了一套初步的评价规范,并通过实际案例展示了该方法的应用,同时展望了未来标准体系的演进方向。
主要观点
- 数据为核心:高性能计算系统正从“大计算”向“大计算+大数据”(HPDA)发展,数据密集型应用对存储和处理能力提出了更高要求。
- 综合性能评估:当前计算性能已不再是评价高性能计算集群的唯一标准,系统综合性能日益受到重视。
- 平衡性与能效:系统需在计算、存储、网络等维度之间保持平衡,同时提升能源利用效率。
- 多协议互通:随着应用场景的多样化,存储系统需支持多种协议,以提升数据处理效率。
- 评价体系迭代:白皮书内容将根据技术发展和社区反馈持续迭代,旨在建立一套科学、合理、具有产业影响力的标准规范体系。
关键信息
六个评价维度
-
科学计算性能
- HPL双精度浮点计算性能(单位:PFLOPS)
- HPCG双精度浮点计算性能(单位:TFLOPS)
-
AI计算性能
- 图像推理任务的计算性能(单位:VFLOPS)
- 图像训练任务的计算性能(单位:图片/秒)
-
存储性能
- 文件系统单客户端单流带宽(单位:GB/s)
- 文件系统单客户端多流带宽(单位:GB/s)
- 文件系统聚合带宽(单位:GB/s)
- 文件系统聚合IO操作速率(单位:IOPS)
- 多协议平均访问效率(单位:百分比)
-
网络性能
- 点对点通信带宽(单位:Gbps)
- 点对点通信延迟(单位:微秒)
- 网络对分带宽与注入带宽比值(单位:百分比)
-
系统能效
- 单位功耗的浮点计算性能(单位:FLOPS/W)
- 单位功耗的可得存储容量(单位:TB/W)
-
系统平衡性
- 内存容量与处理器核心数比
- BurstBuffer容量与内存容量比
- 长久存储与BurstBuffer容量比
- 内存与BurstBuffer带宽比
- BurstBuffer与文件系统带宽比
综合评价计算方法
- 采用几何平均数对每个维度的性能评分进行计算。
- 每个维度的评分基于指标权重进行加权计算。
- 最终输出包括“评测数据详表”和“性能雷达图”两个结果。
指标权重与建议值范围(初步)
| 维度 | 指标 | 权重 |
|---|---|---|
| 科学计算性能 | HPL双精度浮点计算性能 | 0.6 |
| HPCG双精度浮点计算性能 | 0.4 | |
| AI计算性能 | 图像推理任务的计算性能 | 0.5 |
| 图像训练任务的计算性能 | 0.5 | |
| 存储性能 | 文件系统单客户端单流带宽 | 0.2 |
| 文件系统单客户端多流带宽 | 0.2 | |
| 文件系统聚合带宽 | 0.2 | |
| 文件系统聚合IO操作速率 | 0.2 | |
| 多协议平均访问效率 | 0.2 | |
| 网络性能 | 点对点网络带宽 | 0.4 |
| 点对点消息延迟 | 0.3 | |
| 网络对分带宽与注入带宽比值 | 0.3 | |
| 系统能效 | 单位功耗的浮点计算性能 | 0.6 |
| 单位功耗的可得存储容量 | 0.4 | |
| 系统平衡性 | 内存容量与处理器核心数比 | 0.2 |
| BurstBuffer容量与内存容量比 | 0.2 | |
| 长久存储容量与BurstBuffer容量比 | 0.2 | |
| 内存与BurstBuffer带宽比 | 0.2 | |
| BurstBuffer与文件系统带宽比 | 0.2 |
按算力分类的建议值范围
| 指标 | 超大型集群 (>30PFLOPS) | 大型集群 (10-30PFLOPS) | 中型集群 (1-10PFLOPS) |
|---|---|---|---|
| 内存容量与核心数比 | 6~10 | 2~8 | 1~3 |
| BurstBuffer容量与内存容量比 | 4~6 | 2~5 | 1~4 |
| 长久存储容量与BurstBuffer容量比 | 20~40 | 10~30 | 2~20 |
| 内存带宽与BurstBuffer带宽比 | 1500~5000 | 1000~3000 | 800~2000 |
| BurstBuffer带宽与文件系统带宽比 | 4~8 | 2~6 | 1~4 |
典型应用场景与系统设计
1. IO密集型(以基因测序为例)
- 需要高性能存储系统支持大文件小IO读写、格式转换、数据压缩与解压等操作。
- 存储容量需求高,需支持PB级数据处理。
- 典型配置:
- CPU:8748核心
- 内存:93312GB
- 网络:100G HDR Infiniband
- 存储:100 PB,聚合吞吐能力324GB/s
2. IO密集+计算密集型(以气象预报为例)
- 需要高计算性能与高存储吞吐能力。
- 典型配置:
- CPU:14400核心
- 内存:57600GB
- 网络:100Gbps
- 存储:12PB,聚合吞吐能力112GB/s
3. AI密集型(以自动驾驶为例)
- 需要高性能GPU支持AI训练,以及高带宽存储系统满足大体量数据缓存和处理。
- 典型配置:
- CPU:19840核心
- GPU:1240块NVIDIA A100加速卡
- 内存:119040GB
- 网络:200Gbps
- 存储:24PB,聚合吞吐能力79GB/s
未来展望
- 开发评测程序:降低在不同架构超算上运行评测程序的难度,推动评测体系标准化。
- 构建优秀系统榜单:定期选取性能优异、有特色的系统,形成“优秀高性能计算系统”榜单。
- 建立评测社区:通过社区推动性能指标的持续优化与完善,实现多方协作与标准演进。
白皮书强调,高性能计算系统的评价应以数据为中心,关注存储、网络与能效等关键因素,推动系统设计与选型的平衡性与高效性。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载