网络赋能AI的思考和实践-中国移动研究院_23页_9mb
报告摘要
网络赋能AI的思考和实践总结
核心内容
随着数字经济高质量发展和通用智能技术的加速发展,通信网络正从传统通信网络向新型信息通信网络转变。网络与AI的融合成为推动科技跨越、产业优化和生产力提升的重要方向,形成了“AI赋能网络”和“网络赋能AI”双向驱动的融合趋势。6G网络和算力网络作为新一代信息通信网络的重要组成部分,正通过创新技术体系和架构设计,为AI提供更强大的支持。
主要观点
- 网络与AI的融合趋势:网络正从信息交换平台向“连接+算力+能力”的新型信息服务平台演进,AI的普及和应用需要网络提供泛在算力和高效传输能力。
- 6G架构赋能AI:提出“三体、四层、五面”的6G总体架构,其中数据面和计算面是新增的关键功能面,支持AI模型的数据采集、处理、存储和算力资源的按需调度。
- 算网一体创新技术:通过算力路由、在网计算等核心技术,实现算力与网络的深度融合,提升AI计算效率和网络性能。
- AI大模型与网络性能的关联:AI大模型训练依赖高性能网络,网络性能直接影响算力加速比和系统稳定性。
- 广域高通量网络需求:面对超算和智算业务的快速增长,广域网络需要支持海量数据的高效传输,尤其是在长距离、高丢包率等复杂环境中。
关键信息
网络与AI的双向驱动
- AI赋能网络:AI通过优化网络运行效率、降低运维成本、提升用户体验,推动网络向智能化方向发展。
- 网络赋能AI:新型信息通信网络为AI提供泛在化、平台化的服务支持,使AI成为社会级服务。
6G架构与数据面、计算面
- 数据面:构建统一可信的数据服务框架,支持数据采集、预处理、分析、存储和转发,为AI提供高质量数据。
- 计算面:以任务为中心进行算网联合编排,提供计算即服务,实现算网一体内生设计目标。
- 服务使能层:对AI服务需求进行分解和编排,实现资源调度和业务保障。
- 数字孪生体:为AI提供真实训练环境和可靠预验证平台。
算力路由技术
- 问题:云边和边边调度中存在“性能反转”问题,造成算力资源闲置和网络成本增加。
- 解决方案:在路由中引入计算信息,实现联合调度,提升性能。
- 进展:中国移动推动IETF成立算力路由工作组CATS,完成标准立项,研发样机并验证性能提升。
在网计算(NACA)
- 技术优势:通过流量压缩、缩短传输路径、线速处理、降低时延等方式,显著提升分布式AI系统的性能。
- NACA架构:围绕拓扑映射、编程范式、计算实现、资源管理形成“四个统一”,提升通用性。
- 标准推进:CCSA牵头完成《在网计算应用场景和技术需求》标准立项。
- 试验验证:基于CFITI试验网进行性能测试,验证在网计算的可行性。
广域高通量网络
- 需求背景:东数西训、东数西渲等场景需要广域网络支持海量数据的高质量传输。
- 技术体系:提出端网协同的广域高通量网络技术体系,支持在长肥网络(LFN)环境下保持高吞吐。
- 测试结果:广域RDMA协议单流吞吐量是传统TCP协议的16倍,显著提升数据传输效率。
未来展望
- “芯合”平台:中国移动联合合作伙伴推出支持智算应用一键式跨架构迁移的“芯合”平台,降低AI应用向国产芯片迁移的成本和复杂度。
- 全调度以太网(GSE):通过革新以太网转发机制,实现无阻塞、高带宽、低时延的新型智算中心网络,推动AI产业发展。
- 技术攻关与标准建设:深化算力指标定义、通告频率优化、多维选路等关键技术研究,推动CATS架构等标准体系的建设,丰富算网一体产业生态。
产业实践与挑战
- 应用场景竖井化:不同应用场景(如AI、HPC、大数据)对网络和计算资源有不同需求,需定制化支持。
- 设计实现封闭化:当前只有Infiniband支持在网计算,但其生态封闭,成本高。
- 编程方式不友好:应用开发者需掌握网络设备编程,学习门槛高。
- 未来方向:推动算力路由、在网计算、全调度以太、广域高通量网络等关键技术突破,实现算网一体与AI的深度融合。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载