云边协同AI_网络技术白皮书_43页_2mb
报告摘要
云边协同AI网络技术白皮书总结
核心内容
本白皮书由开放数据中心标准推进委员会(ODCC)发布,聚焦云边协同AI网络技术,旨在分析AI大模型在云边协同场景下的流量特性与网络需求,探讨云边协同AI网络的关键技术,并展望未来发展趋势。白皮书重点涵盖边缘算力集群网络和云边互联网络两个核心部分,涉及AI推理与训练的网络挑战、技术目标及实现手段。
主要观点
-
云边协同AI发展趋势:
- 云边协同将成为AI算力基础设施的重要发展方向。
- 随着LLM的广泛应用,算力需求呈现爆发式增长,边缘算力成为中心算力的快速补充。
- 云边协同AI发展分为三个阶段,其中阶段一和阶段二被本白皮书重点覆盖。
-
AI大模型对网络的影响:
- 训练:需要高带宽、低时延、无损网络和灵活组网。
- 推理:强调低时延响应、高吞吐、高并发处理和网络安全性。
- 两种场景都对算力集群网络和云边互联网络提出了新的挑战。
-
边缘算力集群网络技术目标:
- 前端网络需支持低时延(<30ms)、高吞吐(<=100Gbps)和安全协议(SSL/TLS/IPSec)。
- 后端网络需满足高吞吐(>=800Gbps)、低时延(<2us)和无损传输。
- 网络需支持多租户、灵活调度、大容量NAT和异构组网。
-
云边互联网络技术目标:
- 需要高可用性、高安全性、差异化QoS保障和高性能转发能力。
- 网络需支持多链路冗余、隧道可靠、流量分类、调度与队列管理、加解密优化等。
关键信息
云边协同AI发展阶段
- 阶段一:边缘算力作为中心算力的快速补充,主要处理LLM推理请求响应、管控流量和训练数据传输。
- 阶段二:推理下沉至边缘算力中心,实现低时延和成本优化,适合多业务融合场景。
- 阶段三:推理和训练进一步下沉至近场边缘侧,实现云边端协同AI。
边缘算力集群网络挑战
- 超高带宽传输:训练和推理过程中,GPU间通信流量大,需保障高带宽传输。
- 超低时延与抖动:网络时延和抖动对AI训练和推理性能影响显著。
- 灵活组网与扩展:边缘算力集群需具备灵活组网、可扩展性及多业务融合能力。
- 网络安全性:需保障数据和模型的安全传输与访问控制。
- 网络兼容性:需支持异构算力(GPU、CPU、NPU)与多业务共存。
云边互联网络挑战
- 高带宽与低时延:云边数据传输需高带宽和低时延,保障AI业务稳定运行。
- 高可用性:需确保云边通信链路的可用性达到99.9%至99.99%。
- 高安全性:包括数据加密、设备身份认证、访问控制、攻击防御等。
- 差异化QoS保障:需支持不同业务流量的优先级调度,保障关键AI业务的性能。
- 高性能转发:需满足高并发、大带宽、低延迟的转发需求,包括硬件加速、用户态转发架构、会话管理等。
技术目标与关键技术
边缘算力集群技术目标
| 技术目标 | 前端网络 | 后端scale-up网络 | 后端scale-out网络 |
|---|---|---|---|
| 延时 | <30ms | <2us | <20us |
| 吞吐量 | <=100Gbps | >=800Gbps | >=800Gbps |
| 安全性 | SSL/TLS/IPSec | optional | optional |
关键技术
-
边缘算力集群前端网络:
- 管控流量承载
- 多租户支持与隔离
- 大容量NAT能力
- 长距离RDMA技术
-
边缘算力集群后端网络:
- 负载均衡
- HyperPort(链路聚合)
- 端到端调度
- 无损网络无阻塞技术
- 异构组网
- Fast CNP(快速拥塞通知)
- 网络可靠性
-
云边互联网络关键技术:
- 高可用技术(设备、链路、隧道、接入点)
- 高安全技术(数据加密、设备认证、访问控制、攻击防御)
- 差异化QoS保障(流量分类、调度、队列管理)
- 高性能转发技术(硬件加速、用户态架构、会话管理、加解密优化)
未来展望
- 持续研究高集成、低功耗的边缘算力网络技术。
- 探索边边协同、云边端协同的网络技术。
- 深化LLM分布式推理与训练技术研究。
- 推动AI算力后端网络的云边协同技术发展。
编写团队
- 项目经理:杨帅(腾讯)
- 工作组长:陈炜(腾讯)
- 贡献专家:腾讯、博通、安擎、中国移动、百度、中国信通院等
参考及缩略语
- AI:Artificial Intelligence(人工智能)
- LLM:Large Language Model(大语言模型)
- GPGPU:General-Purpose computing on Graphics Processing Units(通用图形处理器)
- NPU:Neural Processing Unit(神经网络处理单元)
- NCP:NVIDIA Cloud Partner(英伟达云合作伙伴)
- CoT:Chain of Thought(思维链)
- TTFT:Time To First Token(首Token时延)
- TPOT:Time Per Output Token(每Token输出时延)
- RDMA:Remote Direct Memory Access(远程直接内存访问)
- RoCEv2:RDMA over Converged Ethernet version 2(基于融合以太网的远程直接内存访问)
- DCQCN:Data Center Quantized Congestion Notification(数据中心量化拥塞通知)
- QoS:Quality of Service(服务质量)
- QoE:Quality of Experience(体验质量)
- CDN:Content Delivery Network(内容分发网络)
- NAT:Network Address Translation(网络地址转换)
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载