ETH-X_Scale_Up互联协议白皮书V1.0_103页_7mb
报告摘要
ETH-X Scale Up 互联协议白皮书 V1.0 总结
核心内容
ETH-X Scale Up 互联协议旨在为高性能计算、人工智能训练、大数据处理等场景提供跨 GPU 高效数据访问能力。该协议通过分层架构设计,支持 GPU 与 GPU、GPU 与 Switch、计算 DIE 与 IO DIE 之间的高效互联,满足大规模 GPU 集群中对带宽、延迟和内存一致性等关键性能指标的需求。
主要观点
-
Scale Up 互联目标
Scale Up 互联旨在实现多个 GPU、CPU 的协同计算,通过共享内存池,使集群像一个超级 GPU 一样工作。它支持 GPU 与 GPU 之间的高密度通信,同时允许 CPU 作为控制节点进行任务调度和上下文管理。 -
互联拓扑
Scale Up 网络主要运行在两种拓扑结构上:- 直联拓扑:实现简单,适合 fullmesh 传输,充分利用互联带宽。
- Switch 互联拓扑:支持带宽池化,适用于不均衡流量模式,提升网络效率。
-
应用场景与语义需求
- 计算通信 Overlap:通过计算/通信 Kernel 分离或融合实现通信时延隐藏,提升系统性能。
- Direct Copy:适用于大块结构化数据的批量传输,依赖 DMA 引擎实现,但存在启动延迟和预处理开销。
- Direct Access:适用于小粒度、非连续数据访问,减少数据中转,降低延迟,但可能因同步等待机制导致资源空转。
- 统一虚拟地址(UVA):支持多 GPU 共享一个统一的虚拟地址空间,简化异构计算编程模型,提升内存访问效率。
-
内存一致性模型
Scale Up 域内需要支持 释放一致性内存模型(Release Consistency Model),包括 Acquire-Release、Relaxed 语义。同时,针对多 GPU 通信场景,需考虑 全局一致性,以避免因局部一致性导致的数据错误。 -
事务层与数据链路层设计
- 事务层:定义了 PAXI(Peer-to-Peer AXI)协议,实现 GPU-GPU 事务的封装、解析、流量控制和顺序保障。
- 数据链路层:提供 ETH-X 专用的 GPU-Switch 互通协议,包含 ETH.DMA 和 ETH.MEM 两大能力集合,支持 Direct Copy 和 Direct Access 语义。
- 物理层:支持 50Gbps、100Gbps、200Gbps 和 800Gbps 速率,采用 IEEE 802.3 标准,支持 FEC 前向纠错、CRC 校验和轻量级 FEC 技术,优化传输效率。
-
流控与负载均衡
- CBFC(Credit-Based Flow Control):提供基于信用的流控机制,支持多路径负载均衡(ECMP)和 QoS 调度。
- PFC(Priority-based Flow Control):基于 IEEE 802.1Q 标准,实现基于优先级的流控。
- LLR(Link-Level Retry):链路层重传机制,增强可靠性。
- ECMP:实现多路径负载均衡,提升网络利用率和系统吞吐量。
-
专用拷贝引擎(SU Engine)
为提升 Direct Copy 语义的传输效率,ETH-X 提出专用拷贝引擎,减少总线穿越流量,避免数据切分与聚合带来的额外开销,支持大粒度数据的直接传输。 -
未来需求探讨
- Scale Up 与 Scale Out 融合:通过复用 Scale Up 的专用拷贝引擎,实现跨网络的统一数据传输,降低组网成本。
- GNAI 统一编程接口:引入 GPU Network Abstract Interface(GNAI),抽象不同厂商的通信 API,提供统一的软件接口,简化异构平台的通信框架实现。
关键信息
- PAXI 事务层:定义了 GPU-GPU 访存协议,支持 AXI4.0 和 APB3.0 接口,具备事务封装、解析、流控和顺序保障能力。
- 信用机制(Credit):用于流控,确保接收端有足够的缓冲区资源来处理数据包,提升传输效率和可靠性。
- 虚拟通道(VC):支持 Lossless 和 Best Effort 两种类型,Lossless VC 需要 CBFC 信用机制来保障传输顺序。
- 统一地址空间:支持多 GPU 之间直接访问对方内存,提升内存利用率和编程效率。
- 释放一致性内存模型:是现代处理器常用的内存模型,需通过额外机制在 Scale Up 域内实现,如内存屏障和同步原语。
- ETH-X 协议栈:包括事务层(PAXI)、数据链路层(GPU-Switch 互通协议)和物理层,支持高性能、低延迟、高带宽的 GPU 互联。
- Die-to-Die 互联:通过 UCIe 标准实现 IO 芯片与计算芯片的解耦,支持灵活的通信方式和协议转换。
结构与功能需求
- IOD 模块:支持 AXI 事务引擎、内存屏障、专用拷贝引擎和聚合引擎,提升跨卡通信效率。
- 内存模型:支持 Direct Access 和 Direct Copy 两种访问方式,确保内存事务的保序和一致性。
- 流控与负载均衡:支持 CBFC、PFC、ECMP 和 QoS,实现高负载下的低尾时延和高效数据传输。
- 可靠性增强:通过 LLR、FEC、CRC 和无损以太网技术,保障数据在 Scale Up 域内的可靠传输。
- 未来方向:探索 Scale Up 与 Scale Out 的融合,以及 GNAI 统一编程接口,提升异构系统的兼容性和性能。
总结
ETH-X Scale Up 互联协议通过分层设计和多种机制(如 PAXI、CBFC、LLR、ECMP)实现高效、低延迟、高带宽的 GPU 互联。该协议不仅满足当前大规模 GPU 计算需求,还为未来 Scale Up 与 Scale Out 融合、统一编程接口等方向提供了技术基础。通过统一虚拟地址空间、专用拷贝引擎、内存一致性模型和灵活的流控与负载均衡机制,ETH-X 为高性能计算系统提供了一种标准化、可扩展的互联方案。
试读结束,高清完整版pdf/doc/ppt,请点下载