面向新型智算中心的以太网弹性通道(FlexLane)技术白皮书_24页_2mb
报告摘要
中国移动通信有限公司研究院发布的《面向新型智算中心的以太网弹性通道(FlexLane)技术白皮书(2025)》聚焦AI大模型发展对算力和网络可靠性的需求。随着ChatGPT、Deepseek等大语言模型(LLM)的普及,智算中心需应对海量数据交换带来的可靠性挑战。现有光模块年失效率超0.2%,且大规模集群中链路数量激增,导致传统固定多通道架构难以满足AI业务零中断要求。白皮书提出FlexLane技术,通过灵活多通道架构突破原有固定组合限制,实现链路可靠性提升万倍以上,助力AI网络互联达到5个9(99.999%)的高可靠性标准。
FlexLane技术基于高速接口,分为软件升级和硬件演进两种部署模式。软件方案通过上层协议实现通道状态查询和故障隔离,检测到单通道故障后可立即降速运行,需通过握手信号同步配置;硬件方案则集成物理层故障检测功能,支持主动降速/升速策略。该技术可实时监测通道信号质量(如SER、光功率、温度等),在故障发生前进行预防性隔离,同时根据流量变化动态关闭部分通道以节能。实验数据显示,使用FlexLane接口的链路故障概率较标准接口降低7个数量级,例如双通道场景下可靠性达1×10⁻¹⁴,万卡集群中每小时故障概率降至3×10⁻¹⁰。
应用场景覆盖智算中心内部及互联场景。在内部互联中,FlexLane通过降速策略(如400G链路单通道故障降为300G)平衡带宽损失与可靠性,避免AI训练中断。在中心间互联中,支持多通道故障隔离后,10km单模链路故障概率降至1×10⁻²⁸,超大网络可实现全年无链路失效。技术兼容现有标准(如IEEE8023),与LAG、链路级重传(LLR)等方案协同,并可升级至下一代16TE接口。白皮书强调FlexLane的优势:通过降速规避故障、兼容性高、支持动态节能,为智算中心提供低成本的可靠性保障。
联合编撰单位包括中国信息通信研究院、华为、中兴、清华大学等产学研力量,明确技术不涉及国家敏感战略信息。该方案既可通过软件升级部署,也可通过硬件优化实现性能提升,未来有望推动高可靠网络技术标准化,支撑AI训练与推理业务持续运行。
试读结束,高清完整版pdf/doc/ppt,请点下载