华为:2024年EMS弹性内存存储技术白皮书_24页_1mb
报告摘要
EMS弹性内存存储技术白皮书总结
清华大学
概述
本白皮书介绍了华为云推出的弹性内存存储服务(EMS),一种以内存为主要存储介质的云基础设施服务。随着基于大模型的生成式AI技术快速发展,cloud数据中心中的算力与存力失衡成为关键瓶颈。持久化存储性能不足、DRAM利用率低、HBM内存墙等问题严重影响AI训练和推理效率。
存力痛点分析
当前AI场景面临三大存力挑战:
- 持久化存储性能不足:传统存储介质如OBS的访问带宽受限,模型读写耗时长。
- DRAM利用率低:AI服务器内存配置过剩,实际利用率普遍低于50%,以GPT-3为例,LLM训练时DRAM利用率<35%。
- HBM内存墙:大模型参数增长速度快于硬件内存容量,内存带宽与算力增长失衡。
EMS解决方案
华为云通过创新三层架构(Elastic Memory Service)解决上述问题:
- 引入内存解耦池化技术,将AI服务器DRAM资源池化,提升利用率20%以上;
- 利用多级分级存储机制,通过DRAM间接扩展HBM容量,解决模型参数存储和运算瓶颈;
- 针对不同AI场景提供加速技术:
- 推理:以存代算、显存扩展、计算卸载,显著降低首token时延迟;
- 训练:拓扑感知的检查点保存、NPU通信加速恢复、选择性持久化,提升恢复速度40%;
- 推荐模型:Embedding池化存储、均衡打散、增量检查点,优化高维数据访问效率。
核心优势
EMS架构具有的高资源弹性、高资源利用率和高性能特点,可支持AI集群资源使用率提升30%,计算成本降低25%。典型应用场景包括大语言模型、多模态模型推理和大规模推荐系统训练。未来还将扩展至OLTP数据库、向量数据库等通用计算场景。
结论
EMS作为全球首创弹性内存服务,通过创新的三层云架构设计,有效缓解了AI时代的数据存储困境。其池化管理、分级存储和场景化加速技术,为AI基础设施提供了更经济、高效的解决方案,是中国混合计算转型的关键支撑。
缩略语:
- EMS: Elastic Memory Service
- HBM: High-Bandwidth Memory
- DRAM: Dynamic Random Access Memory
- AI: Artificial Intelligence
- NPU: Neural Processing Unit
本文档内容基于《EMS弹性内存存储技术白纸书 V1.0》提炼,旨在提供精炼理解和关键洞察。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载