数据密集型超算发展白皮书(2023)-48页_8mb
报告摘要
数据密集型超算发展白皮书2023总结
核心内容
数据密集型超算是高性能计算(HPC)与人工智能(AI)、大数据等新一代信息技术融合后产生的新型计算模式,代表了高性能计算的未来发展趋势。随着数据成为国家基础性战略资源和关键生产要素,数据密集型超算在多个行业应用中展现出巨大潜力,如基因测序、AI大模型训练、气象预测等。
主要观点
- 数据驱动是数据密集型超算的核心,数据质量和规模对AI智能高度有决定性影响。
- HPC与AI的融合正在加速科学研究和生产效率的提升,推动科研迈向科学智能时代。
- 超算互联已上升为国家级战略,数据基础设施的建设是实现超算互联的关键。
- 数据安全成为超算发展的重点,各国通过法律法规和技术创新提升数据安全水平。
- 绿色节能和能效比提升是超算可持续发展的核心目标,存储闪存化和分布式全闪存储成为趋势。
- 全栈自主可控是中国超算发展的战略方向,通过关键技术突破和创新,保障国家数据安全和产业独立。
关键信息
1.1 数据密集型趋势下,高性能计算面临六大挑战和需求
- 应用层面:数据模型的多样化,带来新的近数据计算架构需求。
- 算力层面:AI赋能科学研究,数据规模和质量决定了AI智能高度。
- 连接层面:超算互联是未来趋势,一体化数据基础设施是共性需求。
- 安全层面:数据资产安全成为重点,需构建全栈安全体系。
- 自主可控层面:超算系统需具备从硬件到软件的全栈自主能力。
- 绿色节能层面:通过软硬件优化和新技术,提升能效比,降低碳排放。
1.2 数据密集型应用加速发展,对存储性能提出更高要求
- 数据量激增:全球数据量预计从2018年的33ZB增长到2025年的175ZB,中国将成为全球最大的数据圈。
- 存储需求变化:数据模型对存储的带宽和IOPS要求显著提升,如基因组序列比对、气象数值预报等应用。
- 混合负载:多技术融合带来多样业务负载,超算存储系统需支持高带宽、高IOPS和大规模并发访问。
1.3 HPC和AI融合,加速改变科研及生产效率
- AI加速科学研究:通过AI优化传统计算流程,如DeePMD将计算效率提升1000倍。
- 数据决定AI高度:数据质量与数量对AI模型的精度和性能有决定性作用。
- 大模型训练挑战:数据准备时间长、数据来源分散、训练效率低、故障恢复慢等问题亟需解决。
1.4 超算互联上升至世界各国国家战略,数据基础设施先行
- 美国HPDF项目:投资3-5亿美元,构建高性能数据密集型基础设施,支持科学发现和数据共享。
- 欧洲EuroHPC JU:推动一体化超算基础设施建设,加强数据流通和安全保护。
- 中国超算互联网:通过互联网思维连接全国超算中心,构建一体化算力网络和服务平台,提升数据和算力协同效率。
1.5 超算安全关系国计民生,数据资产安全成为重点
- 国家级网络攻击:超算中心成为黑客攻击的重点目标,需加强安全防护。
- 数据安全法规:中国、美国、欧盟等国家和地区陆续出台数据安全相关法律,提升数据战略地位。
- 数据保护机制:包括主动健康监测、防病毒、防勒索、数据冗余保护等。
1.6 中国“数据基础设施”关键根技术有突破、有创新,可支持全栈自主可控
- 关键根技术突破:如“天河”“神威”超级计算机、国产处理器等,推动超算平台自主可控。
- 闪存技术发展:全闪存储成为主流,提升性能和能效,降低能耗和碳排放。
- 存储系统优化:通过分布式全闪存储、多协议融合、统一数据管理等方式,构建高效、安全、绿色的数据底座。
1.7 提高能效比和降低碳排放,支持超算发展和持续演进
- 能效挑战:超算系统能耗高,PUE值是衡量能效的重要指标。
- 软硬件优化:通过改进制造工艺、采用液冷技术、动态电压频率调整(DVFS)等方式提升能效。
- 绿色发展趋势:政策推动数据中心节能,如PUE降低至1.25以下,全闪存储成为实现绿色节能的关键。
技术架构
2.1 HPC与AI走向融合,构建“5A”新型超算架构
- Any Application:支持多协议融合,承载多样化应用生态。
- Any Workload:应对动态混合负载,支持高性能计算、AI和大数据应用。
- Anywhere:实现跨域数据统一管理,支持多地域访问。
- Any Condition:保障系统稳定可靠,支持任何业务状态在线。
- Any View:统一智能管理平台,实现多维度数据透视和统一调度。
2.2 Any Application: 新型应用不断涌现,数据密集型超算应具备丰富的应用生态承载及演进能力
- 多协议支持:如S3、NFS、HDFS、POSIX等,满足多样化业务需求。
- 容器化支持:提高部署效率和资源利用率,支持快速扩容和缩容。
- 科学计算工作流优化:提升业务效率,支持数据全生命周期管理。
2.3 Any Workload: 多技术融合带来多样负载,数据密集型超算应具备承载动态混合负载及应用加速能力
- 高性能存储需求:如自动驾驶、AI大模型训练等,对存储系统提出高带宽和高IOPS要求。
- Burst Buffer技术:用于加速大规模应用,减少数据迁移和计算延迟。
- 分布式全闪存储:成为解决超算“性能墙”和“能耗墙”的关键,提升存储效率和能效。
2.4 Anywhere: 多地域超算互联,需要跨域全局数据统一管理能力
- 跨域数据管理:通过全局文件系统(GFS)实现多地域数据同步和统一视图。
- 数据流动优化:支持数据按需分级和流动,提升数据访问效率。
- 统一数据平台:实现边缘-中心协同,满足多场景数据处理需求。
优秀实践
3.1 国家超算济南中心
- 构建数据密集型超算应用标杆,采用统一存储底座提升算力效率。
- 实现PB级数据存储和计算,支持多种数据密集型应用。
3.2 上海交通大学
- 推动AI存力基座建设,支持教育科研数据处理。
- 通过统一存力基座,提升数据处理效率和科研成果转化。
3.3 中国医学科学院
- 构建全栈自主可控的基因测序平台,提升科研效率。
- 通过GPU加速和统一存储,支持基因测序与精准医疗。
3.4 科大讯飞
- 打造高性能、稳定可靠的统一数据管理底座,支持大模型训练。
- 强强联合,实现算力与存力的全栈方案,提升AI模型训练效率。
结论
数据密集型超算正在成为推动科研创新和数字经济发展的重要引擎。面对数据爆炸、算力需求提升、超算互联、安全挑战和绿色转型等多重需求,构建以应用为中心、多技术融合、跨域数据统一管理、高性能存储和全栈自主可控的“5A”架构是未来发展的关键。通过技术创新和政策支持,中国在超算领域正逐步实现突破,引领全球数据基础设施的发展趋势。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载