2024大模型时代智算网络性能评测挑战报告-中国移动_18页_7mb
报告摘要
智算网络性能评测挑战总结
智算中心网络技术概况
- 智算中心由GPU芯片计算基础设施和高速以太网交换芯片网络基础设施构成,是AI算力核心载体。
- GPU芯片市场规模从2022年到2026年增长4倍,Nvidia计划推出H200芯片,其算力约为H100的2倍。
- AI训练依赖集合通信原语(如AllReduce),网络性能直接影响集群有效算力,2%的丢包率会导致RDMA吞吐率归零。
- 智算中心网络需连接异构算力资源(CPU、GPU、内存),贯穿数据计算与存储全流程,网络性能提升对整体算力具有关键作用。
- 通算中心与智算中心网络存在差异:
- 通算中心以流级负载均衡为主,链路利用率低,易产生拥塞;
- 智算中心则需支持大模型训练的突发同步流量,网络协议需适应高带宽、低时延需求。
全调度以太网技术创新
- GSE(全调度以太网)通过三大核心技术改进实现网络优化:
- 从“流”分发升级为“报文容器”分发,提升带宽利用率;
- 从盲发+被动控制转向感知+主动控制,减少拥塞;
- 从局部决策发展为全局调度,实现集中式管理与分布式控制。
- GSE技术体系涵盖四层架构(物理层、链路层、网络层、传输层)及运维体系:
- 物理层:低时延Phy、高速光接口、故障快速检测;
- 链路层:报文分发重组、链路级安全及容错机制;
- 网络层:新型组播/任播协议、组网拓扑优化;
- 传输层:改进的RDMA、拥塞控制算法。
- 部署场景灵活:
- 场景一:仅网侧运行GSE,网卡不感知;
- 场景二:部分功能下沉网卡,实现端网协同;
- 支持国产GPU生态系统,如华为昇腾和英伟达。
- 技术优势:
- 逐包分发技术可降低Leaf上行带宽需求,同等芯片容量下,Leaf端口速率越低,组网规模越大;
- 以128T交换容量为例,Leaf上行100G组网规模为256台GPU服务器(2K张GPU卡),包均衡能力提升4倍。
智算网络技术评测面临的挑战
- 性能指标复杂:
- 需模拟GPU实际计算与周期性通信行为,确保测试结果客观反映真实场景;
- 评测需覆盖有效带宽、长尾时延等新指标。
- 模拟能力不足:
- 测试仪需具备千卡级甚至万卡级仿真实验能力,以支持大模型训练场景的通信验证。
- 工具与标准滞后:
- 评测体系需适应算网软硬件快速迭代,但当前测试设备端口数量和规模难以匹配网络演进速度;
- 不同模型对网络的性能评价标准需统一,以支持多样化AI应用需求。
- 协同测试困难:
- 需同时评估网卡与网络设备,私有拥塞控制协议等优化需具备灵活可编程能力;
- 端网协同趋势下,测试工具需支持多维度自动化配置与运维。
- 推进计划:
- 中国移动联合中国信通院等机构启动GSE推进计划,制定普适统一评估方法,推动新型智算中心网络标准建设;
- 建议在CCSA成立国家层面的GSE推进委员会,统筹技术标准、设备兼容性及产业应用推广。
总结
智算中心网络发展面临算力需求激增与网络性能瓶颈的双重压力,传统以太网协议难以满足大模型训练的高吞吐、低延迟要求。GSE技术通过改进报文分发、主动拥塞控制和全局调度机制,构建无损高带宽网络,但评测体系仍需突破模拟能力、工具适配性及标准化等瓶颈。中国移动正推动GSE技术生态建设,通过开放兼容的架构和协作机制,助力AI算力基础设施发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载