软件与服务行业国产算力三问三答系列之一:万卡集群对AI意味着什么_15页_1mb
报告摘要
国产万卡集群对AI的意义分析总结
核心内容
万卡集群是由一万张及以上计算加速卡(如GPU、TPU等)构成的高性能计算系统,主要用于训练参数量和数据量巨大的大模型。随着大模型参数量从千亿级迈向万亿级,万卡集群成为支撑AI技术发展和“AI+”应用的重要基础设施。其核心价值在于显著缩短大模型训练时间,提升模型迭代速度,从而增强市场竞争力。
主要观点
-
万卡集群的重要性
- 万卡集群是大模型训练的基础设施,支持模型参数和数据规模的指数级增长。
- 集群整合高性能GPU、存储、网络和智算平台,形成“超级计算机”,提升训练效率。
- 随着Scaling Laws(伸缩法则)的验证,更大和更先进的集群有助于实现模型能力的快速迭代。
-
全球万卡集群发展趋势
- 国际科技巨头(如OpenAI、Google、Meta、特斯拉等)纷纷布局万卡集群,推动大模型技术创新。
- 国内运营商、互联网大厂和AI研发企业也在加速建设万卡集群,推动国产大模型发展。
-
国产万卡集群的突破与前景
- 国产万卡集群逐步成熟,支撑我国AI大模型训练底座,缩小与国际先进水平的差距。
- 集群互联和液冷技术是万卡集群的关键技术差异,未来将重点关注集群化和液冷等新兴方向。
- 国产大模型厂商如华为、字节跳动、科大讯飞等已建成或规划超万卡集群,推动模型研发和训练效率提升。
关键信息
技术趋势
- 计算效能提升:通过单芯片能力提升、超节点技术、服务器内卡间通信优化等手段提高集群性能。
- 通信网络优化:构建大规模、大带宽、低时延、高可靠性的通信网络,支撑集群高效运行。
- 节能技术应用:液冷技术成为解决高密度高能耗问题的重要手段。
企业案例
- 华为:昇腾AI集群从4000卡升级至16000卡,支持全国25个城市的人工智能计算中心建设。
- 字节跳动:搭建12288卡Ampere架构训练集群,研发MegaScale生产系统,实现训练效率提升。
- 中国移动:部署2万张AI加速卡,建设哈尔滨、呼和浩特、贵阳三个自主可控万卡集群,总规模近6万张GPU卡。
- 中国电信:在上海建设15,000卡国产万卡算力池,成为业内领先的全国产化云智一体公共智算中心。
- 科大讯飞:与华为合作,建成支持万亿参数大模型训练的“飞星一号”平台。
行业影响
- 万卡集群的建设与应用将推动大模型在多模态、长文本、数理推理等领域的突破,加速商业化进程。
- 国产万卡集群的发展将带动整个AI产业链的升级,包括芯片、服务器、通信网络和液冷技术等领域。
投资建议
- 国产万卡集群正处于突破期,建议关注集群化和液冷等新兴技术方向。
- 全产业链机遇显著,包括算力基础设施、芯片研发、数据中心建设等。
风险提示
- 实际需求落地不及预期:AI发展仍处于初期阶段,存在需求不确定性的风险。
- 行业竞争格局变化:美国制裁政策可能影响国产芯片和算力生态的发展。
投资评级说明
- 行业评级:看好(相对表现优于相关证券市场代表性指数)、中性、看淡。
- 公司评级:买入、增持、中性、减持、无投资评级。
图表目录
- 图1:GB2003.2万卡集群方案
- 图2:Mate集群内部网络方案
- 图3:大模型涌现能力的8个示例
- 图4:2024年上半年海外大模型发展梳理
- 图5:Kimi chat长文本处理能力或领先全球
- 图6:商汤日日新5.0多模态能力突出
- 图7:训练时常、数据集大小、模型参数与模型性能的关系
- 图8:腾讯云发布新一代HCC高性能计算集群大模型训练再次提速
- 图9:字节跳动万卡集群MegaScale实现55.2% MFU,相比Megatron-LM提高1.34倍
表格目录
- 表1:我国各主体万卡集群建设情况
结论
万卡集群已成为AI大模型训练的重要基础设施,推动模型能力快速提升和市场应用拓展。在全球AI军备竞赛背景下,国产万卡集群正逐步成熟,具备追赶国际先进水平的潜力。未来,随着集群互联、液冷技术及超大规模算力生态的完善,国产算力有望在AI领域占据重要地位,带来新的投资机遇。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载