2023分布式异构智能算力的管理和调度技术研究报告-中国移动研究院_26页_1mb
报告摘要
分布式异构智能算力的管理和调度技术研究报告总结
研究背景
随着数字经济的快速发展,算力作为社会数字化转型的重要基石,已成为承载信息数据的关键基础设施。根据最新数据,至2023年,中国智能算力规模达到1785EFlops,增速高达72%,对新型智能算力需求激增。为满足异构算力的协同及调度需求,本研究聚焦于分布式异构算力资源管理技术方案,涵盖资源分类整合、池化重构与智能分配,并探索统一调度架构、资源实时感知与任务匹配调度机制,旨在提升算力的整体利用率。
异构算力的发展和应用场景需求
异构算力指由CPU、GPU、FPGA、ASIC等多种计算硬件构成的系统,能够满足不同场景的应用需求。目前主要的异构算力类型包括GPU、APU、TPU、FPGA、ASIC与DPU。异构算力的应用场景广泛,主要包括:
- 机器学习和深度学习;
- 高性能计算(HPC)等科学计算;
- 图形处理渲染和游戏开发;
- 物联网(IoT);
- 区块链。
据信通院与IDC统计,互联网行业是智能算力需求最大的行业,占53%。
分布式异构算力管理和调度的关键技术能力
分布式异构算力管理的核心包括以下三个方面:
1. 异构算力的虚拟化和池化
该技术将异构资源整合为统一池,支持动态资源分配与细粒度管理。典型技术包括:
- MIG:将单个GPU逻辑划分为多个实例;
- vGPU:通过硬件支持实现GPU虚拟化;
- API劫持技术与应用程序监视器技术则支撑更敏捷的资源调度。
2. 分布式异构算力的调度能力
调度是匹配任务与资源的关键,Kubernetes通过设备插件实现异构算力的发现与分配。常用的调度策略包括:
- 批量调度;
- 网络拓扑调度;
- 实时资源状态调度。
3. 分布式异构算力的度量和标识
包括设备静态参数、动态度量指标与综合性能指标的评估体系。同时,通过统一的能力抽象与接口服务,保证算力调度与交易的可行性。
当前业界技术实现情况
1. 中国移动智算体系
通过自研容器和API劫持技术实现异构资源的池化管理,支持跨节点资源调度,提升资源利用率。
2. 浪潮AIStation
基于Kubernetes实现对CPU、GPU、寒武纪、昇腾等多种异构资源的统一分配与管理,并支持多种调度机制,如网络亲和性调度、GPU细粒度分配等。
3. 新华三傲飞平台
支持多种异构资源调度策略(如Gang调度、抢占式调度),实现AI与HPC资源的融合管理。
总结与展望
未来,分布式异构算力的管理仍需在度量、适配、跨异构计算生态等方面进一步攻关。构建从硬件到软件的开放生态,有助于提升算力资源的整体利用率,为智算产业的发展提供更高效的支撑能力。
试读结束,高清完整版pdf/doc/ppt,请点下载