【李笙维】DataFunSummit非数据中心GPU上的大模型并行训练_33页_4mb
报告摘要
非数据中心GPU上的大模型并行训练总结
核心内容
本研究聚焦于在非数据中心GPU上进行大规模深度学习模型的并行训练,旨在解决大模型训练中面临的计算、通信和存储资源瓶颈问题。随着深度学习模型参数量的爆炸式增长,传统的并行训练方法在非数据中心GPU(如NVIDIA 3090、4090)上面临新的挑战,因此需要探索更高效的并行训练策略与优化技术。
主要观点
- 大模型训练的挑战:模型参数量增长迅速,对算力、通信带宽和显存提出了更高的要求,传统数据中心GPU在某些方面(如通信带宽)存在劣势,导致性价比下降。
- 并行训练的基本方法:主要包括数据并行(DP)、模型并行(MP)和混合并行(Hybrid Parallelism)。
- 数据并行:将数据分发到多个设备,每个设备拥有完整的模型参数,优点是逻辑简单,但需要频繁的梯度同步通信。
- 模型并行:将模型参数分发到多个设备,适用于显存受限的场景,但通信开销较大,设备利用率较低。
- 混合并行:结合数据并行和模型并行的优点,适用于复杂模型结构,但难以找到性能优异的混合策略。
- 非数据中心GPU的特性:通信带宽受限、显存较小,因此需要专门的优化方法,如通信计算重叠、显存交换等。
- 研究进展:
- 高性价比训练:提出基于算力性价比(RCC)模型的并行训练策略,通过NVLink连接的3090集群在大模型训练中表现出更高的性价比。
- 高效率训练:
- TriRace:面向混合并行训练的通信调度方法,能够显著提升训练效率。
- Oases:面向张量并行的自动通信计算重叠方法,可在显存受限的场景下显著提升训练速度。
- 显存优化:
- Mbpp:针对商品级GPU(如3090)的流水线并行异构内存交换方法,有效缓解显存墙问题,提高内存利用率。
- 高可编程性训练:
- Merak:提出一种解耦模型设计与并行训练的框架,支持数据、流水线和张量并行的混合应用,提升训练的灵活性与可编程性。
关键信息
- 并行训练方法:
- 数据并行:每个设备有完整的模型参数,数据分片。
- 模型并行:参数分片,设备间通信频繁。
- 混合并行:结合多种并行方式,提升整体效率,但策略复杂。
- 性能提升:
- TriRace方法在混合并行训练中可实现1.45倍加速。
- Oases方法在张量并行中可实现1.95倍加速。
- Mbpp方法在流水线并行中可提升训练吞吐量3.04至4.59倍。
- 硬件限制与优化:
- 非数据中心GPU显存较小,需采用内存交换技术。
- 通信带宽受限是影响性能的关键因素,需设计通信计算重叠策略。
- 框架设计:
- Merak框架支持数据、流水线和张量并行的解耦,提高可编程性。
- Merak框架基于PyTorch,使用Megatron-LM的3D并行策略,适用于社区模型(如transformers)。
研究总结与展望
研究总结
- 高性价比:通过优化硬件配置与通信策略,实现更经济的模型训练。
- 高效率:采用通信计算重叠与显存优化技术,显著提升训练速度。
- 高可编程性:实现模型设计与并行训练的解耦,提升框架的灵活性与易用性。
研究展望
- 技术方向:
- 大规模异构并行计算:未来需进一步提升并行计算的通用性与效率。
- 深度学习编译器:是提升并行训练可编程性的关键技术方向。
- 通信优化:随着模型规模增大,通信带宽的不足将更加明显,需持续优化通信策略。
- 应用验证:需要在更大规模和更真实的应用场景中进行测试与验证。
- 研究价值:提升非数据中心GPU在大模型训练中的应用能力,让更多研究者能够更便宜、更快、更方便地进行大模型训练。
参考与致谢
- 作者信息:博士研究生 李笙维,国防科技大学计算机学院。
- 联系方式:18682152613,swli@nudt.edu。
- 实验室信息:并行与分布计算全国重点实验室。
- 研究建议:实验室长期招收有志于MLSys相关领域的硕士博士研究生。
- 更多研究:详见导师主页:https://dblp.org/pid/143/4279.html。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载