李笙维:DataFunSummit非数据中心GPU上的大模型并行训练-33页_4mb
报告摘要
总结:非数据中心GPU上的大模型并行训练
研究背景
大模型参数量爆炸式增长,对算力系统架构提出新要求,大规模并行训练仍是基础模型训练主要手段。并行训练方法包括数据并行(DP)、模型并行(MP)、张量并行(TP)和平流水线并行(PP),以及混合并行。非数据中心GPU(如RTX 3090/4090)虽算力性价比高,但通信带宽受限,且存在供应不足问题,研究该方向具有重要意义。
研究进展
实验室针对非数据中心GPU上的大模型并行训练,开展了关键技术研究:
- 高性价比训练:通过建模方法,比较不同GPU(如3090 NVLink集群)的性价比,发现3090 NVLink配置在特定场景下优势显著,提升了大模型训练的成本效益。
- 高效率并行训练:开发了TriRace等通信计算调度方法,优化混合并行训练中的通信操作,实现通信与计算重叠,提升训练效率;针对张量并行,提出了Oases方法,显著加速训练并减少通信开销。
- 显存优化:设计Mbapp方法,使用异构内存交换技术,在商品级GPU(如3090)上缓解显存墙问题,支持模型训练。
- 高可编程性:提出Merak框架,解耦模型设计与并行训练,结合符号算子和自动划分算法,实现3D并行训练(数据-流水线-张量),简化开发流程。
总结与展望
非数据中心GPU上的大模型并行训练旨在提高模型可访问性(Affordable)、效率(Efficient)和易用性(User-friendly)。未来需解决大规模异构并行计算效率问题,探索深度学习编译器和通信优化技术,以适应日益增长的应用需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载