2022-12-21-中国移动-新一代智算中心网络技术白皮书(2022)_27页_899kb
报告摘要
新一代智算中心网络技术白皮书总结
核心内容
本白皮书由中国移动通信研究院牵头,联合华为、云脉芯联、中科驭数、中兴通讯等单位共同编制,旨在探讨新一代智算中心网络的发展情况、技术趋势及关键技术,为未来智算中心网络架构的演进提供参考。
主要观点
- 政策驱动:国家“东数西算”工程推动智算中心建设,提升算力网络的协同与资源共享能力。
- 产业需求:智算中心在AI、自动驾驶、智能制造等场景中发挥关键作用,网络性能成为提升算力的核心要素。
- 技术趋势:智算中心网络向超大规模、超高带宽、超低时延、超高可靠及智能化方向发展。
- 网络挑战:包括超大规模组网、高性能传输、高可靠连接及智能化运维等方面的技术瓶颈。
关键信息
智算中心发展情况
-
政策形势
- 国家将智算中心纳入新型基础设施,推动算力网络建设。
- “东数西算”上升为国家战略,8个枢纽节点和10个数据中心集群布局。
- 智算中心成为AI训练、智能产业、智慧城市等应用的重要底座。
-
产业趋势
- 截至2021年底,我国数据中心机架规模达520万标准机架,服务器规模1900万台,算力总规模超过140EFLOPS。
- 智算中心数量快速增加,部分城市已投入运行,部分项目正在建设中。
- 典型智算中心如阿里云张北超级智算中心、商汤科技临港超算中心、南京智算中心等,具备超强算力支持。
-
技术趋势
- 专用算力芯片(如GPU、NPU、VPU)逐渐成为智算中心的主流。
- 存储系统向异构介质(SSD、SCM)演进,网络带宽、存储协议栈处理成为新的性能瓶颈。
- 网络与应用协同设计成为解决算力与网络带宽不匹配问题的重要手段。
智算中心网络发展趋势
-
网络演进
- 从“以云为中心”向“以AI为中心”演进,智算中心网络需要支持超大规模、超低时延、超大带宽和超高可靠性。
- 系统级端网协同是提升网络性能的关键。
-
网络挑战
- 面临四大关键挑战:超大规模组网、超高性能传输、超高可靠连接、网络智能化运维。
智算中心网络关键技术
超大规模网络关键技术
-
新型拓扑
- 采用直连拓扑,如Dragonfly,减少转发跳数,提升网络效率。
- 自适应路由技术实现动态路径选择,优化网络负载与时延。
-
高效能IPv6演进
- 避免IPv6VxLAN的封装成本,直接使用IPv6扩展头进行租户与业务隔离。
- 支持多租户、安全隔离与业务链能力。
-
智算中心间网络连接
- 需要支持跨智算中心的高效互联,引入全光网络、广域确定性网络、空芯光纤等技术。
- 需要优化传输层协议(如RoCEv2)以适应长距离、高带宽、低时延的场景。
超高性能网络关键技术
-
自适应路由
- 通过动态路径选择优化网络吞吐与时延,提升网络韧性。
-
静态转发时延优化
- 减少转发模块的处理时间,如Serdes、PHY/MAC、PP、BM等,实现更短的转发延迟。
-
端网协同
- 利用DPU进行网络协议栈卸载,提升网络处理能力。
- 需要改进RoCEv2协议,支持多路径、减少连接数依赖、选择性重传等。
-
在网计算
- 通过在交换机中实现Reduce、AllReduce等计算操作,减少数据交互次数与入网数据量。
- 可靠组播技术可显著降低组播任务完成时间。
-
DPU卸载
- 支持NVMe-oF裸载,实现存储协议栈卸载,降低主机CPU负载。
- 支持GPU Direct RDMA,绕过主机内存直接访问GPU内存,提升算力聚合效率。
-
智能ECN
- 利用AI算法动态调整ECN门限,实现无损队列的智能拥塞控制。
- 结合Telemetry技术,实现网络状态实时采集与智能决策。
-
基于信元交换的网络级负载均衡
- 信元交换技术实现动态负载均衡,提升网络资源利用率。
- 可扩展到整个网络层面,解决小规模流与大流量负载不均衡问题。
网络可靠性及智能运维关键技术
-
数据面故障感知与恢复
- 故障收敛性能从秒级提升至亚毫秒级,实现故障的快速感知、传递与恢复。
- 数据面硬件卸载成为趋势,降低控制面参与度。
-
基于意图的网络仿真校验
- 将用户意图转化为可验证的网络配置与性能指标。
- 支持网络仿真、资源评估、策略一致性检查等功能。
-
智能运维闭环网络
- 实现从故障预防、定位到恢复的全流程智能化运维。
- 依赖网络健康度监控、智能故障定位与恢复引擎,提升运维效率与网络可靠性。
总结和展望
新一代智算中心网络是支撑数字经济发展的关键基础设施,需从网络架构、协议演进、设备形态、技术实现等多个维度进行创新。白皮书指出,未来智算中心网络将更加注重智能化、可编程性、高可靠性与高效运维能力,推动网络与计算、存储的深度融合。中国移动希望联合行业力量,推动关键技术成熟与落地,打造高效、开放、解耦的智算中心网络体系。
术语与缩略词
| 英文缩写 | 英文全称 | 中文全称 |
|---|---|---|
| BDP | Bandwidth Delay Product | 超大的带宽时延积 |
| OTN | Optical Transport Network | 光传送网 |
| RDMA | Remote Direct Memory Access | 远程直接数据存取 |
| AI | Artificial Intelligence | 人工智能 |
| VxLAN | Virtual eXtensible Local Area Network | 虚拟扩展局域网 |
| PP | Packet Process | 包处理 |
| BM | Buffer Management | 缓存管理 |
| PS | Parameter Server | 参数服务器 |
| HPC | High Performance Computing | 高性能计算 |
| DPU | Data Processing Unit | 数据处理单元 |
| NVMe | NVM Express | 非易失性内存主机控制器接口规范 |
| NVMe-oF | NVMe over Fabric | 基于网络的非易失性内存主机控制器接口规范 |
| DAS | Direct-Attached Storage | 直连式存储 |
| NAS | Network Attached Storage | 网络附属存储 |
| ECN | Explicit Congestion Notification | 明确的拥塞通知 |
| PFC | Priority-Based Flow Control | 基于优先级流量控制 |
| ML | Machine Learning | 机器学习 |
| ECMP | Equal Cost Multipath | 等价多路径 |
| UCMP | Unequal Cost Multipath | 非等价多路径 |
| ICT | Information and Communications Technology | 信息与通信技术 |
| KPI | Key Performance Indicator | 关键绩效指标 |
| NOC | Network Operations Center | 网络操作中心 |
| CC | Congestion Controlled | 拥塞控制 |
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载