【华为云】2024EMS弹性内存存储技术白皮书_24页_1mb
报告摘要
EMS弹性内存存储技术白皮书总结
EMS(Elastic Memory Service)是华为云推出的全球首创云基础设施服务,旨在解决AI场景中“存力”瓶颈问题。随着生成式AI技术的突破,AI应用从传统分类任务扩展至生成任务,推动云计算向智能算力转型。但现有云架构面临持久化存储性能不足、DRAM利用率低及HBM内存墙三大挑战,亟需新型存储方案优化。
背景和动机
- AI技术发展:基于大模型的生成式AI快速普及,预计2026年超80%企业将采用该技术,2030年全球AI计算(FP16)总量将达105ZFLOPS,远超通用算力需求。模型参数量以指数级增长,传统存储介质(如HDD/SSD)无法满足高吞吐和低延迟需求,而HBM内存容量和带宽增长缓慢,成为算力发挥的限制因素。
- 存力痛点:
- 持久化存储性能不足:模型参数和Checkpoint数据量庞大,导致从对象存储服务(如OBS)读写耗时长达数十分钟,远高于AI训练和推理的秒级时延需求。
- DRAM利用率低:AI服务器DRAM通常按最大负载配置,实际利用率偏低。例如,GPT-3模型训练中,HBM内存仅能支持约16个对话上下文长度的请求缓存,限制了并行处理能力。
- HBM内存墙:HBM内存容量及带宽增长显著滞后于模型需求,导致AI加速器需频繁等待数据读取,降低算力效率。
EMS解决方案
EMS通过将传统“计算-存储”两层架构升级为“计算-内存-存储”三层架构,引入内存层,解决上述问题:
-
三大核心功能:
- 高性能缓存层:利用DRAM缓存HDD/SSD数据,提升数据访问速度,缓解持久化存储性能不足问题。
- 内存解耦池化:将AI服务器DRAM资源池化,动态分配以提高利用率。支持融合部署(本地DRAM池化)和分离部署(独立内存服务器),通过高速网络总线实现跨节点共享和高效访问。
- 扩展HBM性能:通过DRAM容量和带宽补充HBM,解决内存墙问题,提升训练和推理效率。
-
关键技术架构:
- 软件架构:包含领域专用服务SDK(支持多AI场景)、分布式内存池(管理跨节点存储、负载均衡、数据恢复)及管理控制面(统一运维)。
- 分级存储:将数据分层存储于HBM、DRAM和SSD,通过算法主动调度卸载与取回,平衡效率与成本。
- 数据冗余:基于副本和纠删码技术,确保检查点数据高可用性,应对DRAM易失性问题。
-
场景化加速技术:
- AI推理优化:
- 以存代算:将多轮对话的KV缓存存储至EMS内存池,避免重复计算,降低首token时延,提升吞吐量。
- 显存扩展:动态卸载KV缓存及模型权重至共享内存池,支持更大批处理大小和模型规模。
- 计算卸载:将自注意力模块的KV缓存和轻量计算卸载至内存池,利用CPU与AI加速器的异构计算特性优化性能。
- AI训练优化:
- 并行拓扑感知检查点保存:在数据并行训练中,利用模型重复性实现多副本存储,降低写入开销。
- NPU通信加速检查点恢复:通过卡间参数面通信直接读取本地检查点,避免跨节点传输,提升恢复效率。
- 选择性检查点持久化:按策略仅持久化关键检查点版本,减少存储压力并避免写入阻塞。
- 推荐模型优化:
- Embedding池化存储:集中管理Embedding表,通过本地缓存和异步更新提高访问效率。
- Embedding均衡打散:基于哈希分片机制,均匀分配Embedding数据至多节点,提升负载均衡。
- 增量检查点:仅存储更新过的Embedding数据,节省存储空间并提高训练效率。
- AI推理优化:
应用与优势
EMS已应用于大语言模型(LLM)、多模态模型和推荐模型等场景,提供高资源弹性、高利用率及高性能。通过三层架构设计,其以内存为核心介质,结合池化、分级存储和冗余技术,解决传统存储瓶颈问题。未来还将扩展至通用计算场景(如OLTP、HTAP数据库、Redis缓存等),进一步提升云服务的综合性能。
技术价值
EMS通过内存资源的灵活调度和优化,显著降低AI训练和推理的时延与成本,同时提升存储基础设施的扩展性和可靠性。其创新性在于将内存作为中间层,实现存算协同,为AI时代提供高效、低成本的云存储解决方案。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载