2024年大模型时代的异构计算平台报告_42页_9mb
报告摘要
大模型时代的异构计算平台发展面临多维度挑战。GPT-3开启大模型时代,表明参数量从175B达到模型效果跃升,同时展现多模态模型(如ViT-G、DALL-E)和语言模型(如BERT、T5)的技术演进趋势。超大模型训练对基础设施提出三重需求:参数量激增导致算力墙问题,单卡需32年计算而需分布式加速;海量数据存储墙要求多卡协同处理;高通信带宽需求推动网络架构创新。
软硬件联合优化针对训练需求设计多维度策略。数据并行通过切分数据集和梯度同步(如AllReduce)实现加速,同步更新策略保障收敛稳定性但存在显存冗余。流水线并行(PP)按Transformer层竖切,模型并行(MP)按MatMul操作横切,分组参数切片(Sharding)降低显存占用。混合专家模式(MoE)通过条件计算实现动态负载分配,专家网络间通过All2All操作协同计算。
硬件资源选型与网络架构需匹配大模型需求。单机采用高算力GPU(如A100)和高速互联(NVSwitch或InfiniBand)提升性能,集群需支持万卡级规模和低延迟P2P通信。通信优化解决哈希冲突问题,通过调整四元组选路策略减少链路争抢;All2All加速利用NVLink降低网络压力;SHARP技术将计算卸载至交换机,通信次数从O(logn)降至O(1),提升算法带宽和计算并行度。
大模型发展推动基础设施演进方向包括:(1)多模态训练需要异构资源(如V100/GPU/昆仑芯)协同;(2)弹性调度支持异构集群(RoCE/IB网络)中的任务切分与资源匹配;(3)统一视图的端到端优化,基于计算与通信成本模型(CostModel)自动化选择最优并行策略。百度百舸平台集成AI加速、数据湖存储、弹性训练等组件,满足城市大脑、生命科学等场景的计算需求。
试读结束,高清完整版pdf/doc/ppt,请点下载