RDMA_Telemetry技术白皮书_19页_739kb
报告摘要
RDMA Telemetry 技术白皮书总结
核心内容概述
RDMA(Remote Direct Memory Access)是一种高性能网络通信技术,最初由InfiniBand协议支持,后演进为RoCEv2,使其能够在通用以太网上运行。RDMA Telemetry技术是为满足智算中心对网络质量监控的高精度、实时性需求而诞生的,用于对RoCEv2网络进行端到端、分段式的性能监测,实现对I/O质量、吞吐量及网络延迟的精细化管理。
主要观点
1. RDMA技术发展与应用场景
- RDMA技术通过减少CPU资源消耗和传输延迟,提升了网络通信性能。
- InfiniBand是最早的RDMA实现,但其封闭性限制了通用部署。
- RoCEv2作为新一代RDMA协议,兼容以太网设备,支持跨子网路由,成为智算中心的主流选择。
- RoCEv2与NVMe over Fabrics结合,构建了高性能存储网络,实现了存算分离架构下的低延迟访问。
2. RDMA网络质量监控的挑战
- 传统监控工具(如SNMP)精度不足,无法捕捉微秒级延迟变化。
- 丢包检测粗糙,难以定位微量丢包。
- 实时性差,无法及时发现瞬时网络拥塞问题。
3. RDMA Telemetry技术的诞生与优势
- RDMA Telemetry专为RoCEv2网络设计,提供I/O质量可视与吞吐量可视两大功能。
- 具备以下优势:
- 精准故障定位:通过分段测量(计算侧、网络侧、存储侧)实现性能瓶颈的快速识别。
- 实时性能监控:采用硬件级计数器,精度达到微秒级。
- 智能化运维支持:支持自定义告警、异常事件标注和历史趋势分析。
- 广泛的场景适应性:适用于AI训练、分布式存储、金融交易等多种场景。
关键信息
1. I/O质量可视功能
- 功能简介:对存储网络中GPU与存储服务器之间的I/O读写操作进行分段测量。
- 测量指标:
- DPL(数据准备时延):仅存在于写操作,反映计算侧数据准备效率。
- RTT(往返时延):通过计算侧与存储侧时延差值衡量网络性能。
- DAL(数据访问时延):反映存储侧处理请求的效率。
- 交互流程:
- 读操作:包含请求、响应、数据传输等阶段,通过时间戳计算各段时延。
- 写操作:仅支持拉取模式,通过NAK报文统计丢包情况,区分有效与无效吞吐。
- 测量策略:
- 重点保障流量:持续监控,适用于关键业务。
- 非重点保障流量:轮询监控,适用于非关键业务,降低系统负载。
2. 吞吐量可视功能
- 功能简介:针对GPU集群间基于RoCEv2协议的写操作进行吞吐量监测。
- 测量指标:
- FCT(Flow Completion Time):反映端到端通信延迟。
- FET(Flow Effective Throughput):衡量有效数据传输速率。
- FNR(Flow NAK Rate):反映网络丢包情况及可靠性。
- 运行机制:
- 流量识别与采样:识别RoCEv2报文并进行采样。
- 全生命周期跟踪:记录首包、末包、NAK报文等关键信息。
- 数据分析与上报:通过gRPC协议将数据传输至分析器,生成可视化报表。
3. RDMA Telemetry可视化
- 实现方式:与gRPC协议配合,将测量数据上传至SeerAnalyzer-DC分析器。
- 可视化能力:
- 按主机IP或存储IP维度展示I/O时延、数据准备时延、数据访问时延、网络RTT等指标。
- 支持拓扑图形式呈现主机与存储的交互关系。
- 提供I/O时延趋势图,便于运维团队分析网络性能变化。
典型组网应用
1. AI训练存储网络I/O质量监测
- 应用场景:用于监控GPU服务器与存储服务器之间的I/O操作。
- 测量模型:将存储网络划分为计算侧、网络路径、存储侧三个区段进行测量。
- 应用价值:
- 快速定位I/O性能瓶颈。
- 提升跨团队协作效率。
- 为基础设施优化提供数据支持。
2. AI训练计算平面梯度同步性能优化
- 应用场景:用于监控GPU服务器之间的梯度同步通信。
- 测量模型:通过吞吐量可视功能监测写操作的FCT、FET、FNR等指标。
- 应用价值:
- 实现微秒级延迟监控。
- 快速识别网络拥塞或GPU瓶颈。
- 提升训练效率,减少GPU空转。
总结
RDMA Telemetry技术通过分段式、实时性的性能监测,为智算中心提供了高精度、智能化的网络质量保障方案。它不仅能够精准识别I/O操作延迟和吞吐量瓶颈,还支持对网络链路的实时分析与可视化,从而提升运维效率和系统稳定性。该技术的广泛应用将为AI训练、大规模数据存储等高性能计算场景提供坚实支撑。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载