鲍中帅:万卡级超大规模智算集群网络运维挑战及实战-24页_9mb
报告摘要
万卡级智算集群网络运维挑战及实践
经过十余年从业经验,鲍中帅作为科大讯飞基础架构网络总监,专注于大规模网络架构设计及运维,在业内首次提出超大规模国产万卡智算集群网络架构。
大模型发展背景与国产化集群简介
近年来,国际大模型产业竞争呈“激烈迅猛”之势,ChatGPT自2022年发布以来用户量已突破17亿,谷歌、OpenAI等不断迭代产品。根据政策导向和技术趋势,到2026年超过80%企业将使用通用人工智能。面对“卡脖子”问题,我国AI产业加速国产化,科大讯飞自2019年起,持续投入国产AI芯片软件生态建设,建成5个国产化云服务集群,日服务请求20亿次,模型包含国产化GPU芯片、算子优化和异构调度等核心能力,特别是图文识别领域领先国际。
万卡智算集群运维关键痛点
万卡算力集群存在系统复杂、规模庞大等问题,据统计:
- 10,000+计算加速卡,500+台交换机,30+台存储设备,30,000+根光纤
- 34%训练中断由网络引起,其中光模块问题占比最高
- 丢包率0.001%导致训练效率降低579%
- 动态时延提升使GPU利用率下降明显
而运维难点包括:
- 光链路闪断、硬件/软件兼容性问题
- 缺乏自动化诊断能力
- 故障定位响应慢
运维创新实践与解决方案
鲍中帅团队通过多方面创新缓解运维难题:
- 构建智算运维评价体系:基于训练作业流,建立指标树和度量模型,实现 “用好”到“提升可训练时长” 转变
- 全系统可靠性理论指导:建立网络-协议-调度-训练系统关系模型,提升系统可用率
- 故障预测及识别技术:通过光模块数据特征工程、异常挖掘和联合创新分析,将故障预测准确率提升到89%
- 运维组织与流程优化:
- 构建多元化团队协作机制
- 推行AI运维平台建设,实现故障定界分钟级,提升运维效率
- 完善备件管理体系,形成三级响应机制,小时级备件交付
实现80+高层专家赋能、场景化交付,提高运维响应能力,保障AI集群持续稳定运行。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载