面向超万卡集群的新型智算技术白皮书-32页_8mb
报告摘要
面向超万卡集群的新型智算技术白皮书总结
核心内容
本白皮书由中国移动通信集团有限公司编制,旨在探讨超万卡集群在人工智能时代的重要作用及其面临的挑战和解决方案。随着大模型参数量从千亿级向万亿级跃迁,超万卡集群成为支撑大模型训练、推理和应用的关键基础设施。白皮书从背景、挑战、设计原则、关键技术到未来展望,系统性地分析了超万卡集群的发展路径和技术需求。
主要观点
- 大模型驱动算力需求激增:大模型的快速发展推动了智能算力的爆发式增长,超万卡集群成为大模型训练和推理的必要基础设施。
- 超万卡集群成为趋势:全球科技企业纷纷部署超万卡集群,以提升AI研发效率,推动技术进步与产业创新。
- 挑战与机遇并存:超万卡集群面临算力使用效率、数据处理、网络互联、系统高可用性及绿色低碳等多重挑战,同时也为智算基础设施带来新的发展机遇。
- 设计原则与架构创新:超万卡集群需遵循“极致算力”、“协同调优”、“长稳可靠”、“灵活供给”、“绿色低碳”五大设计原则,采用四层一域的总体架构设计,实现算力、网络、存储的协同管理。
- 关键技术突破:包括高能效计算技术、融合存储技术、高可靠网络技术、高容错平台技术及绿色机房设计等,是构建超万卡集群的关键支撑。
关键信息
超万卡集群背景与趋势
- 大模型发展推动算力需求指数级增长,2018年BERT模型参数量为1.1亿,2021年GPT-3达到1750亿,未来将迈向十万亿参数级别。
- 多模态应用如文生视频、文生音频等不断涌现,进一步推动AI技术发展。
- 国内外科技企业加速部署超万卡集群,如Google、Meta、Microsoft等均构建了大规模计算集群,支撑AI研发与创新。
- 中国移动作为行业引领者,推动超万卡集群建设,加速智算基础设施发展。
超万卡集群面临的挑战
-
极致算力使用效率:
- 需要优化GPU利用率和集群线性加速比。
- 网络带宽、通信协议、软硬件适配调优是关键。
-
海量数据处理:
- 存储系统面临协议处理、吞吐性能和数据管理的挑战。
- 需要采用多协议融合、自动分级存储等技术,实现高效的数据处理能力。
-
超大规模互联:
- ScaleOut和ScaleUp网络需要高带宽、低延迟、无阻塞通信。
- 需要部署高可靠、高吞吐的网络架构,如Spine-Leaf和胖树组网。
-
高可用与易运维:
- 需要具备自动断点续训、快速故障定位与修复能力。
- 需要构建智能运维系统,实现全链路可视化监控与管理。
-
高能耗高密度机房设计:
- 需要高效制冷、弹性供电、敏捷部署和绿色能源应用。
- 液冷技术、高密度机柜设计、绿色能源利用是关键。
超万卡集群的核心设计原则和总体架构
- 五大设计原则:
- 极致集群算力
- 协同调优系统
- 长稳可靠训练
- 灵活算力供给
- 绿色低碳发展
- 总体架构:
- 由机房配套、基础设施、智算平台、应用使能四层和运维域组成。
- 强调算力、网络、存储的协同管理和统一纳管。
超万卡集群关键技术
4.1 集群高能效计算技术
- 提升单芯片能力,包括优化GPU架构、显存访问性能、引入DPU多计算能力融合。
- 推动GPU能效比提升,实现高性能与低能耗的平衡。
4.2 高性能融合存储技术
- 采用多协议融合,实现数据零拷贝、格式零转换。
- 支持高吞吐存储,实现10TB/s聚合吞吐带宽和亿级IOPS。
- 引入自动分级存储,提升存储系统整体效率。
4.3 大规模机间高可靠网络技术
- 支持零丢包无损网络,采用DCQCN和动态ECN技术优化网络拥塞控制。
- 部署端口级或算网协同负载均衡技术,实现高吞吐网络。
- 引入DPFR技术,实现毫秒级故障恢复和网络收敛。
4.4 高容错高效能平台技术
- 构建智能运维系统,实现作业路径可视、环境健康检查、故障诊断与集群资源管理。
- 支持断点续训,实现分钟级恢复,保障训练稳定性与效率。
4.5 新型智算中心机房设计
- 强调高效制冷、弹性供电、敏捷部署和绿色低碳。
- 推动液冷技术应用,提升散热能力与能效。
- 推广模块化和预制化建设,实现快速部署与扩展。
- 探索绿色能源技术,如分布式光伏、风力发电、氢能应用等。
未来展望
- 超节点与Scaleup技术:未来将通过超节点架构提升算力密度,突破单机8卡限制。
- 大规模逻辑集群:突破物理距离限制,实现跨节点互联,支持大规模并行计算。
- 软件框架创新:提升自动化能力,实现跨平台、跨集群、边缘训推等能力。
- 潜在换道超车技术:探索存算一体、光子芯片等下一代技术,突破传统冯诺伊曼架构限制,推动AI算力升级。
缩略语列表
| 缩略语 | 英文全称 | 中文解释 |
|---|---|---|
| AI | Artificial Intelligence | 人工智能 |
| C2C | Chip-to-Chip | 芯片到芯片 |
| CDU | Cooldown Distribution Unit | 冷却分配单元 |
| CPO | Co-Packaged Optics | 光电共封装 |
| DCQCN | Data Center Quantized Congestion Notification | 数据中心量化拥塞通知 |
| DP | Data Parallel | 数据并行 |
| DPFR | Data Plane Fast Recovery | 数据面故障快速恢复 |
| DPU | Data Processing Unit | 数据处理单元 |
| DSA | Domain Specific Architecture | 特定领域架构 |
| ECMP | Equal Cost Multi Path | 等价多路径 |
| ECN | Explicit Congestion Notification | 显示拥塞通知 |
| FC | Fully connected | 全互联拓扑 |
| GSE | Global Scheduled Ethernet | 全调度以太网 |
| HBM | High Bandwidth Memory | 高带宽内存 |
| IaaS | Infrastructure as a Service | 基础设施即服务 |
| IB | InfiniBand | “无限宽带”技术 |
| IOPS | Input/Output Per Second | 每秒输入/输出操作次数 |
| MFU | Model FLOPs Utilization | 集群有效算力 |
| MoE | Mixture of Experts | 专家并行 |
| MP | Model Parallel | 模型并行 |
| MTBF | Mean Time Between Failure | 平均故障间隔时间 |
| MTTR | Mean Time To Repair | 平均修复时间 |
| NICC | New Intelligent Computing Center | 新型智算中心 |
| NFS | Network File System | 网络文件系统 |
| NPO | Near Packaged Optics | 近封装光学 |
| OISA | Omnidirectional Intelligent Sensing Express Interconnect Architecture | 全向智感互联 |
| P2P | Point to Point | 点对点 |
| PFC | Priority-based Flow Control | 基于优先级的流量控制 |
| POSIX | Portable Operating System Interface | 可移植操作系统接口 |
| PP | Pipeline Parallel | 流水线并行 |
| PUE | Power Usage Effectiveness | 电能利用效率 |
| RDMA | Remote Direct Memory Access | 远程直接数据存取 |
| RoCE | RDMA over Converged Ethernet | 融合以太网承载RDMA |
| S3 | Sample Storage Service | 简单存储服务 |
| TTA | Time to Accuracy | 模型训练至预定精度的时长 |
| UEC | Ultra Ethernet Consortium | 超以太网联盟 |
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载