2025年GPUScale-up互联技术白皮书_24页_4mb
报告摘要
引言
随着AI和机器学习的发展,GPU集群需处理更大数据集、更深层神经网络及更多并发任务,同时降低执行时延并提升效率。以太网技术因其高速链路、大容量交换机和成熟生态系统,成为GPU互联的优选方案。字节跳动提出自研Scale-up网络协议EthLink,支持Load/Store和RDMA语义,覆盖AI集群全场景需求。
GPU架构分析
当前GPU架构中,计算引擎负责数据处理,Load-Store单元(LSU)负责数据传输。LSU通过Load/Store指令实现寄存器与DeviceMemory间的数据搬运,时延约10ns,单次传输数据量为寄存器级(32/64bit)。若发生CacheMiss,需通过GlobalMemory传输,时延升至100ns,数据量为CacheLineSize(64/128/256Byte)。由于LSU传输数据块较小,大块数据搬运需多次指令,消耗计算引擎算力资源。为优化,新型GPU(如NVIDIA Hopper系列)引入TensorMemoryAccelerator(TMA),通过DMA语义完成GlobalMemory与SharedMemory间的数据传输,减少计算引擎负担。
GPU互联方案
AI训练和推理任务需多GPU协同,数据可能分散在多个GPU的GlobalMemory中,需通过Scale-up网络(如PCIe、NVLINK、UALINK)或ScaleOut网络(如IB、RoCEv2)传输。Scale-up网络适用于小块数据高时延敏感场景,依赖Load/Store语义;ScaleOut网络用于大块数据传输,基于RDMA语义。当前主流GPU仍依赖Load/Store操作进行Scale-up数据传输,但需消耗算力资源。大模型训练中,张量并行等场景需高带宽,因此Scale-up网络需兼容RDMA语义,以减少算力消耗。然而,RDMA语义存在交互复杂、时延高、不适用于小块数据等缺点。
下一代Scale-up互联方案需求分析
- Load/Store语义适合小块数据传输,需在Scale-up网络中保留以满足控制信息传递和非连续内存访问需求;
- RDMA语义需整合至Scale-up网络,以支持大块数据高效传输,同时降低对算力资源的占用;
- Scale-up网络需同时支持GlobalMemory与SharedMemory间的数据交换,确保多场景兼容;
- 传统RDMA协议效率较低,需设计更简洁的接口以适配GPU内部模块交互;
- 随着网络规模扩大,系统软件应承担CacheCoherency维护,而非依赖硬件;
- 相同传输路径需保序,不同路径可乱序,以提升整体效率;
- 多协议栈部署需实现网络负载均衡,避免因多路径导致的报文乱序问题。
EthLink网络方案
EthLink基于以太网构建,优化其可靠性、低时延和有效载荷率,旨在替代传统Scale-up协议(如PCIe、UALINK)。其系统架构分为Scale-up语义层(含GPU操作和事务层)和Scale-up网络层。
- 协议栈设计:GPU操作包括Load/Store和RDMA,事务层将操作转换为MemoryRead/Write、Atomic和Message语义,形成对应网络报文。
- 可靠传输机制:采用LLR(链路层重传)和CBFC(基于信用的流控)解决丢包问题。LLR降低对FEC的需求,支持低延迟FEC(如RS-272);CBFC提供更细粒度的流量控制,结合虚拟通道(VC)提升效率。
- 报文优化:设计OEFH(优化报文头)取代传统ETH+IP+UDP头,缩短报文长度并兼容现有以太网结构。
- 缓存一致性:数据从GlobalMemory加载至SharedMemory时缓存至Cache,Store至GlobalMemory则直接写入,系统软件负责定期清除Cache以确保一致性。
- 网络拓扑:支持多协议栈部署,单GPU服务器可配置1-4个以太网接口,Scale-up网络域最大支持1024个节点。通过Multi-Path实现负载均衡,但需上层应用处理乱序问题。
- 链路状态反馈:交换机通过SwitchEventNotification向GPU发送端口状态(如portdown),辅助动态路径切换,避免丢包。
EthLink通过整合Load/Store与RDMA语义,优化以太网协议栈,解决传统方案的高延迟、低带宽及算力消耗问题,为AI集群提供高效、灵活的互联支持。
试读结束,高清完整版pdf/doc/ppt,请点下载