新型智算中心算力池化技术白皮书-33页_1mb
报告摘要
算力池化技术白皮书总结(中国移动研究院)
背景与问题
白皮书探讨了数字经济时代下,人工智能快速发展对智能算力需求的爆发,智算中心作为算力基础设施正取代通用数据中心。传统智算中心面临的主要问题是GPU资源利用率低于30%(例如AWS数据为20%,Facebook为低于30%),以及资源碎片化导致分配率低,原因包括粗放资源分配、算力未被完全激活、网络瓶颈等,亟需提升资源效率和降低TCO。
算力池化定义与目标
算力池化是指通过云计算技术整合异构算力资源(如GPU、AI芯片),构建统一资源池,实现统一调度和按需分配。目标是提高资源利用率、减少碎片化、降低成本,核心能力包括:化整为零(精细化分配)、隔空取物(跨节点调用资源)、化零为整(整合碎片资源)、变静为动(动态资源管理)。
架构与关键技术
算力池化平台技术架构基于定制化Kubernetes,分为池化资源管理、资源服务代理和池化运行时三类模块。关键技术包括:API劫持技术(通过Runtime API劫持实现细粒度资源分配),应用程序监视器技术(远程调用资源不依赖硬件支持),软件定义资源分配(支持算力1%、显存1MB精度),还包括资源细粒度分配、服务等级管理、任务队列化等,以实现高效率和灵活性。
产业实践
业界厂商和中国移动已实施多项实践:趋动科技的OrionX平台采用API劫持技术;VMware的BitFusion和Radium提供GPU共享;中兴TECS OpenPalette支持多容器共享;华为基于Volcano的CCE平台实现GPU混部和智能调度。中国移动在自身智算中心中试点自研容器CETI,结合高速无损网络提升资源利用效率。
展望与倡议
面对AIGC等需求增长,白皮书呼吁产业界共同推进算力池化成熟。倡议包括联合攻关关键技术(如异构算力调度)、构建统一标准体系、推动开源实现,目标是创建标准化算力池化平台,赋能产业生态发展。
试读结束,高清完整版pdf/doc/ppt,请点下载