黄坚:大规模智算集群的管理与性能调优实践-24页
报告摘要
大规模智算集群管理与性能调优实践总结
演讲嘉宾黄坚,天翼云云网产品事业部研发专家。主要研究方向包括云原生、AI算力基础设施、AI智算平台研发、大规模智算集群性能诊断和调优,以及国产算力生态适配。
主要内容
-
大规模智算集群痛点问题
- 计算密度大、显存需求高、通信开销比例高
- 整体算力标准化程度高,但工程化交付复杂,涉及设备检查、上电、环境搭建、软硬件部署与调测等一系列环节
- 算力建设与设备维护挑战:智算业务与底层算力高耦合、性能优化工具无法单一依赖、百万级器件管理难度大
-
运维管理实战思路与方案
- 性能调优与集群健康检查:
对比单机与集群集群性能,强调配置正确性检查:加速卡、网卡、网络环境、驱动版本及其一致性检查
集群安装部分需涉及超大规模的设备、环境、拓扑管理 - 运维挑战解决方案:
通过集群健康检查驱动诊断、RDMA网络连通性检查、big performance链路连接管理来保障集群稳定性
训练任务中,通过指标分析(如power usage、gpu_utilization、sm_active、tensor_active等)实际监控运行状态
- 性能调优与集群健康检查:
-
云骁智算平台介绍
- 云骁-计算加速平台是集成异构计算、高速存储、无损网络、算力加速与高效运营五大能力的平台,为智算数据中心提供整体解决方案
- 平台功能:
算力加速:具备大规模模型训练的优化与并行(Model、Pipeline、Data并行)
故障诊断模块:提供软硬件故障诊断与集群级运维支持 - 国产化进展:
构建基于国产GPU的算力体系,支持大模型训练与推理;自研RDMA网络和存储技术,打造信创算力底座
开发生态加快信创进程:TeleCloudOS替代openStack,LAVA分布式存储引擎优化大规模数据存储性能
表现优异:性能测试指标领先,在大模型训推方面支持昇腾生态,实现“一云多芯”资源池管理和智能调度
-
应用实践与未来展望
- 云骁智算平台已在全国范围内部署,广泛应用于高阶智能模型的训练与分析场景
- 未来重点关注:
- 百亿级参数模型的分布式训练优化
- 故障快速恢复和资源自动交付机制的完善
- 降低使用门槛,推动非CUDA生态技术演进与国产平台并行发展
- 推动大模型训练推理平台的自主研发,全生命周期管理能力建全完善
总结
黄坚通过介绍天翼云近期在云骁智算平台的技术特点和智算集群运维管理方面所做的工作,展示了大规模智算平台在硬件层、软件层、可靠性层的技术布局与国产化成果。工程化的交付模式和平台的智能化运维管理为大模型和AI算力的可持续释放提供了坚实支撑。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载