2021-11-25-华为-智能无损网络(HPC场景)_74页_2mb
报告摘要
HPC高性能计算业务对网络提出的要求
- 高吞吐和低时延:HPC场景下,计算、存储节点间通信对网络性能要求严格。
- 流量模型:包括松耦合、紧耦合、数据密集型等多种计算场景,各有不同需求。
- RDMA替代TCP:减少协议开销,提升吞吐与降低CPU占用,但对丢包敏感。
- 无损网络技术需求:交换机需支持PFC、ECN等技术以避免丢包,保障高性能计算。
HPC高性能计算网络演进
- 从TCP到RDMA:优化协议栈处理,降低时延并减少CPU负担。
- 从IB到RoCE:采用RoCEv2等以太网协议实现RDMA无损传输,RoCE成为主流选择。
- InfiniBand的劣势:成本高、封闭架构、运维困难,难以大规模扩展。
- iWarp的退化:性能差、无法满足RDMA需求,逐渐被市场放弃。
- RoCE的优势:性能接近InfiniBand,成本低,兼容标准交换机。
基于以太网的智能无损网络技术
- 智能无损技术架构:
- 流量控制层:PFC(基于优先级流控)用于防止丢包。
- 拥塞控制层:静态/动态 ECN(显式拥塞通知)、AI ECN、DCQCN/iQCN等机制应对拥塞。
- 流量调度层:动态负载分担,优化资源利用。
- 应用加速层:网算一体(INC)技术减少数据传输等待时间,提升计算效率。
- 基于流的拥塞控制技术:结合ECN/AI ECN、DCQCN/iQCN算法,优化拥塞调整策略。
- 基于端口的流量控制技术:
- 以太PAUSE:传统流控机制。
- PFC死锁检测与预防:避免循环拥塞,保障网络稳定性。
- 流量调度技术:
- 动态负载分担:调整流量路径,优化链路利用率。
- 大小流区分调度:防止大象流阻塞老鼠流。
应用加速技术
- 网算一体(INC):部分计算任务转移到交换机,提升数据交互效率,降低时延。
- 适用于HPC场景的计算优化:减少通信频率,提升并行计算效率。
智能无损网络运维技术
- Telemetry技术:主动数据上送,实时监控流量指标,提升运维效率。
- RoCEv2智能流量分析:深度分析流量特征,可视化展示丢包、时延、吞吐等关键信息。
- 流表老化机制:运维资源优化,防止缓存占用过多。
华为智能无损网络方案(HPC场景)
- 组网架构推荐:Spine-Leaf无阻塞设计,满足高性能互联需求。
- 核心设备选型:
- Leaf交换机:CE8850-64CQ-EI、CE8851-32CQ8DQ-P、CE9860-4C-EI等。
- Spine交换机:CE8850-64CQ-EI、CE9860-4C-EI、CE16808等。
- 组网要素规划:
- N = 接入端口数 = 计算节点数 + 2 × 存储节点数。
- Leaf和Spine数量计算满足1:1收敛比,避免拥塞。
- 扩容建议:
- ≥4K接入端口推荐使用CE16808/Spine-Leaf全互联互连。
- Spine数量建议为2的幂次,避免不均分负载。
总结
华为在HPC场景下提出完整的智能无损网络解决方案,通过RDMA、无损以太网协议、流量控制和智能运维技术等手段,实现高性能、低时延、高吞吐的网络架构,适用于大规模HPC计算集群。网络侧设备选型灵活,支持多种部署场景,适用于从中小型到超大规模的HPC组网需求。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载