快手+云原生时代下大规模+GPU+资源利用率优化最佳实践(演讲PPT)-29页_4mb
报告摘要
总结
背景与趋势
GPU算力需求强劲并推动云原生化,导致服务场景多样化和动态增长,引起成本问题与资源利用率低下。优化目标是提升GPU资源利用率,改善在线服务稳定性,应对峰均差值。
GPU虚拟化
通过技术选型(如内核态劫持、NVidia MPS、vCUDA),实现多容器共享GPU资源,提供VGPU实例。方案包括负载感知、反亲和策略,性能测试显示吞吐量介于原生整卡与MPS之间,拉高利用率,降低部署密度和成本。
GPU混部
允许多类型任务(在线与离线)共享GPU卡,通过显存隔离与优先级调度,实现算力抢占和避让。结果提升峰均利用率约6-7PP,保障实时服务。
GPU潮汐混部实践
采用时间分片策略,高峰时段占位在线服务,低谷时段释放资源给训练任务。集约调度与弹性扩缩容优化资源转化率,日均利用率提升3-5PP,节省年化成本数千万元。
持续演进与展望
GPU硬件性能持续增强,支持多场景混合共享,计划深化实时负载感知、多队列优先级优化,向极致利用率目标演进。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载