2025-01-19-百度智能云-2024年大模型时代的异构计算平台报告_42页_9mb
报告摘要
大模型时代的异构计算平台总结
GPT-3开启大模型时代
大模型如GPT-3(1750亿参数)带来了AI性能的质变,显著提升了通用性。例如,使用GPT-3在文本生成任务中效果比BERT提升40%,在多种任务如数学计算、阅读理解等方面表现优异。大模型训练需求随爆款应用(如AIGC和ChatGPT)增长,参数量和计算量激增,需要TB级数据和算力支持。
超大模型训练对基础设施的需求
超大模型训练对算力和存储要求极高。主要挑战包括算力墙(如GPT-3计算量314ZFlops,A100显存80GB不够)和存储墙。通过分布式技术如数据并行、流水线并行和张量并行解决。数据并行处理梯度同步问题,流水线并行减少卡间空等,张量并行切分参数以节省显存。专家并行模式(MoE)通过条件计算减少模型计算量。硬件方面,使用A100或昆仑芯GPU,机内互联如NVSwitch,集群网络需高效拓扑(如8导轨CLOS架构)来支持AllReduce和All2All通信。计算资源需求巨大,百亿参数模型训练可能耗时数天。
软硬结合的联合优化
优化涉及动态与静态图结合,Graph Capture组件捕获动态图,Abstract Backend Layer支持多后端(如TensorRT和TVM)。图优化包括通用DCE/CSE和算子融合,提升计算密度,减少访存。算子实现优化通过手写、模板化及搜索方法提升性能。通信优化如SHARP算法卸载计算到交换机,提高AllReduce性能,综机构建减少哈希冲突。
大模型发展推动基础设施演进
大模型趋势包括参数规模持续增长(如人类大脑模型规模),多模态发展(文本、图像等),加速算力需求从V100到A800昆仑芯增长上千倍。基础设施演进体现为集群从单机单卡到万卡异构资源,端到端自动化任务切分和放置基于cost model搜索最优策略,提升性能。AI平台如百度百舸整合存储、训练和推理加速,支持城市大脑、自动驾驶等场景的异构计算。基于统一视图的资源感知和弹性调整使调度更智能化,性能提升显著。
试读结束,高清完整版pdf/doc/ppt,请点下载