算力大时代,AI算力产业链全景梳理_99页_5mb
报告摘要
算力大时代,AI算力产业链全景梳理总结
核心观点
生成式AI技术突破,如ChatGPT,显著提升了AI模型的训练和推理需求,带动算力基础设施的全面升级。AI算力产业链的放量顺序为:先进制程制造 -> 以Chiplet为代表的2.5D/3D封装、HBM -> AI芯片 -> 板卡组装 -> 交换机 -> 光模块 -> 液冷 -> AI服务器 -> IDC出租运维。预计未来两年,算力板块将保持高景气度,重点推荐AI算力产业链相关公司。
摘要
生成式AI技术取得突破,成为未来几年重要的生产力工具,深刻影响多个产业环节。AI模型训练和推理均需要强大算力支撑,其中训练算力需求增长迅速,预计2023年-2027年全球大模型训练端峰值算力需求年复合增长率达78.0%,云端推理端则有望达到113%。AI算力需求的增长将带动产业链上下游全面放量,其中先进封装、HBM、AI芯片、光模块、液冷等环节将迎来爆发式增长。IDC市场在AI推动下也将逐步释放需求,液冷方案的渗透率有望加快提升。
AI算力产业链放量顺序
- 先进制程制造:提供高性能芯片基础。
- Chiplet、2.5D/3D封装、HBM:解决内存墙和成本问题,成为高性价比替代方案。
- AI芯片:如英伟达A100、H100,成为AI算力核心。
- 板卡组装:AI芯片的组装与集成。
- 交换机:AI数据中心对端口需求提升。
- 光模块:速率与数量显著增长,800G光模块成为主流。
- 液冷:满足高功率密度需求,降低PUE。
- AI服务器:市场持续扩张,GPU为主要成本构成。
- IDC出租运维:算力需求提升,推动数据中心建设。
AI芯片需求爆发式增长
AI大规模落地应用对AI芯片提出了更高要求,GPU作为当前最广泛使用的AI芯片,具备并行计算优势,适用于AI训练与推理。NVIDIA在AI芯片市场占据主导地位,2022年数据中心AI加速芯片市场份额达82%。国内厂商如寒武纪、海光信息、龙芯中科等正在逐步缩小与国际龙头的差距。
- GPU:在AI芯片市场中占据主导地位,支持多种精度计算,如FP16、FP8等。
- NPU:如华为昇腾、谷歌TPU,适用于特定场景,具备高能效比和高算力。
- 异构计算:CPU+GPU或CPU+NPU成为主流,兼顾性能与效率。
光模块和交换机需求提升
AI数据中心内部数据流量增大,推动光模块和交换机的升级:
- 光模块:2023年市场将向800G方向发展,需求主要来自英伟达和谷歌。
- 交换机:随着AI应用扩展,交换机端口数和速率需求提升,叶脊网络架构成为主流。
液冷渗透率提升
AI大模型训练和推理所需的GPU服务器功率密度大幅提升,液冷方案成为必然选择。液冷数据中心在散热能力和经济性方面优势明显,预计未来液冷渗透率将快速提升,海底数据中心也可能迎来产业化关键节点。
AI服务器市场增长
AI服务器作为算力基础设施的核心,预计未来三年全球市场规模将分别达到395亿、890亿、1601亿美元,年复合增长率分别为96%、125%、80%。中国AI服务器市场也将持续增长,预计2023-2025年市场规模将分别达到134亿、307亿、561亿美元,年复合增长率分别为101%、128%、83%。
IDC需求释放
IDC作为算力基础设施的重要环节,预计将在AI推动下逐步释放需求。2022年受供需失衡影响,IDC行业普遍承压,但随着AI应用的扩展和云计算回暖,IDC市场有望在2023年迎来增长。
国内厂商表现
- 浪潮信息:全球AI服务器龙头,AI服务器订单饱满。
- 工业富联:为英伟达提供芯片组装服务。
- 紫光股份:旗下新华三提供AI服务器和交换机。
- 中科曙光:高性能计算及国产化服务器龙头。
- 中兴通讯:布局液冷数据中心。
- 拓维信息:华为昇腾核心合作伙伴。
- 联想集团:全球领先的ICT设备企业。
图表目录摘要
- 图表1:AIGC发展历程
- 图表2:国内外公司AIGC相关产品
- 图表3:GPT模型示意图
- 图表4:NVIDIA DGX A100 AI服务器
- 图表5:全球算力规模及增速
- 图表6:我国算力规模及增速
- 图表7:全球AI服务器市场规模测算
- 图表8:中国AI服务器市场规模测算
- 图表9:光模块和交换机速率演进示意图
- 图表10:CPU+AI芯片的异构计算
- 图表11:2021年中国AI芯片市场规模占比
- 图表12:CPU与GPU架构对比
- 图表13:NVIDIA GPU主要产品线
- 图表14:NVIDIA Fermi架构至Hopper架构的变化
- 图表15:低精度比特位宽为AI计算带来的好处
- 图表16:不同精度计算消耗的能量和硅片面积
- 图表17:NVIDIA数据中心GPU支持的比特位宽变化
- 图表18:V100中FP32硬件单元和FP64硬件单元的数量关系
- 图表19:专门的硬件单元Tensor Core加速矩阵乘加计算
- 图表20:A100与H100的FP16 Tensor Core吞吐量对比
- 图表21:FP16 Tensor Core与FP8 Tensor Core吞吐量对比
- 图表22:FP16 Tensor算力快速增长
- 图表23:FP16 Tensor每单位核心的算力明显优于FP16
- 图表24:AI训练服务器需要更高的内存容量
- 图表25:NLP负载中存储和计算的能量消耗占比
- 图表26:GDDR与HBM差异
- 图表27:语言模型的参数数量呈指数级增长
- 图表28:GPU之间通过PCIe连接
- 图表29:GPU之间通过NVLink连接
- 图表30:NVLink 1.0—NVLink 4.0
- 图表31:NVSwitch连接多颗GPU
- 图表32:NVSwitch支撑的GPU计算集群
- 图表33:NPU典型架构
- 图表34:麒麟970NPU加速图像识别
- 图表35:脉动阵列运行矩阵乘法的示意图
- 图表36:谷歌TPU架构及其内部的脉动阵列
- 图表37:谷歌TPU
- 图表38:Tesla FSD搭载NPU模块
- 图表39:AI训练与AI推理对比
- 图表40:云端推理占比逐步提升
- 图表41:AIGC引发内容生成范式革命
- 图表42:NVIDIA云端训练GPU与推理GPU参数对比
- 图表43:不同规模大模型所需的显存容量估计
- 图表44:边缘端AI推理芯片及其算力案例
- 图表45:大模型参数量及训练所需Tokens
- 图表46:神经网络的前向传播过程
- 图表47:神经网络的反向传播过程
- 图表48:不同大模型训练过程中的算力利用率
- 图表49:全球大模型训练所需算力/AI芯片数量测算
- 图表50:大模型云端推理所需算力/AI芯片数量测算(算力角度)
- 图表51:大模型云端推理所需算力/AI芯片数量测算(显存角度)
- 图表52:AI芯片市场竞争格局
- 图表53:2022年AI加速芯片市场份额
- 图表54:全球独显GPU市场份额
- 图表55:国内外主流图形渲染GPU产品性能对比
- 图表56:2022年人工智能加速芯片在云上部署情况
- 图表57:英伟达芯片在AI学术论文中的出现频次
- 图表58:国内外主流GPGPU产品性能对比
- 图表59:谷歌TPUv4与英伟达A100性能指标对比
- 图表60:TPUv4与英伟达A100在不同模型中的表现
- 图表61:国内外主流ASIC产品性能对比
- 图表62:CUDA构建强大生态支持所有主流深度学习框架
- 图表63:CUDA生态和ROCm生态对照
- 图表64:异腾计算产业生态示意图
- 图表65:寒武纪软件开发平台
- 图表66:每百万门晶体管的成本在28nm后开始上升
- 图表67:先进制程芯片的研发费用大幅上升
- 图表68:Chiplet有利于提升良率
- 图表69:用Chiplet技术的7nm + 14nm的造价vs7nm
- 图表70:先进封装的层次
- 图表71:先进封装依据互连密度和性能排名
- 图表101:通用服务器与AI服务器的不同
- 图表102:GPU与CPU产品特点
- 图表103:GPU与CPU内部结构
- 图表104:AI服务器训练及推理区别
- 图表105:AI服务器产业链概览
- 图表106:各类型服务器成本结构拆分
- 图表107:浪潮AI服务器售价及GPU成本占比估算
- 图表108:全球AI服务器市场规模测算
- 图表109:中国AI服务器市场规模测算
- 图表110:2022年上半年全球AI服务器市场份额
- 图表111:2022年中国AI服务器市场份额
- 图表112:浪潮信息服务器产品体系
- 图表113:拓维信息研发体系
- 图表114:传统三层网络架构
- 图表115:叶脊网络架构
- 图表116:英伟达DGX A100 SuperPOD采用胖树网络三层架构示意图
- 图表117:英伟达DGXA100SuperPOD系统示意图
- 图表118:Mellanox HDR200Gb/s Infiniband网卡示意图
- 图表119:DGX H100服务器背板连接图
- 图表120:NVLink不同代际的升级Roadmap
- 图表121:PCIe不同代际的性能参数表
- 图表122:A100和H100 POD采用IB和NVLink网络的示意图
- 图表123:GH200的网络连接示意图
- 图表124:GH200的网络连接示意图
- 图表125:Intel的100G硅光模块示意图
- 图表126:硅光、InP、体材料铌酸锂和薄膜铌酸锂调制器的对比示意图
- 图表127:交换机发展示意图
- 图表128:LPO方案的优势
- 图表129:光模块厂商目前拥有的800G光模块产品
- 图表130:北美云厂商资本开支
- 图表131:中际旭创股价复盘
- 图表132:微软Azure的DGX H100 AI超级计算机系统
- 图表133:不同网络架构的对比
- 图表134:2022年全球前五大以太网交换机厂商
- 图表135:2021年中国交换机市场份额
- 图表136:交换机发展示意图
- 图表137:交换机内部SerDes功耗占比大幅提升
- 图表138:网络部分的功耗在数据中心中占比大幅提升
- 图表139:CPO可以降低功耗
- 图表140:CPO所降低的功耗拆分示意图
- 图表141:“东数西算”工程设立8个节点
- 图表142:“东数西算”工程设立10个集群
- 图表143:中国IDC标准机架规模
- 图表144:IDC机房的各类消耗
- 图表145:我国数据中心能耗分布
- 图表146:液冷数据中心制冷架构示意图
- 图表147:各类制冷方式情况梳理
- 图表148:浪潮信息液冷服务器产品
- 图表149:中兴通讯全液冷数据中心项目获奖
- 图表150:华北地区某数据中心节能改造示意图
- 图表151:数据港Capex支出构成
- 图表152:数据港OPEX支出构成
- 图表153:水下数据中心示例图
- 图表154:中国海上风电装机量
- 图表155:海上风电经济性指标测算
- 图表156:建设在海边的水下数据中心
- 图表157:IDC机房的各类消耗
- 图表158:我国数据中心能耗分布
- 图表159:水下数据中心与传统陆上IDC部分指标对比
- 图表160:微软Natick项目测试指标
- 图表161:微软Natick项目第二阶段——水下数据中心
- 图表162:微软Natick项目第二阶段位置图
- 图表163:不同大语言模型的预训练数据集结构
- 图表164:Google在分布式集群计算资源利用率方面处于相对领先地位
- 图表165:TPUv4在多个下游场景中表现优于A100
- 图表166:TPUv4在BERT上表现优于A100
- 图表167:TPUv4在ResNet上表现优于A100
- 图表168:目前学界/业界提升模型计算效率的策略分类
- 图表169:OPT-175B survived 143K steps
- 图表170:Fine-tuning performance of the T5 Base, Large, and 11B on the GLUE devset
- 图表171:SAM提升模型对标签噪声的稳健性,并优化模型训练效率
- 图表172:当模型性能超越一般人时,Alignment成为挑战
- 图表173:ZeRO优化下POS实现显存占用优化至基准方法的26.2%
- 图表174:ZeRO-Offload对GPU/CPU计算的切分
- 图表175:PipeDream结合模型并行、数据并行和流水并行降低通信成本
- 图表176:不同并行化策略下计算资源利用率情况
- 图表177:LoRA只调试低秩的A、B,预训练权重保持不变
- 图表178:LoRA调试下GPT-2模型实现训练参数压缩,同时性能优化
- 图表179:LoRA调试策略下训练参数大幅减少,同时性能与Fine-tune持平或更好
- 图表180:通过调整学习率,ResNet-50 mini-batch训练可实现8K内性能不损失
- 图表181:对于AlexNet网络,不同层的权值和其梯度的范数的比值差异很大
- 图表182:LARS优化器主要根据范数的比值来调节每一层的学习率
- 图表183:W/O LARS时AlexNet-BN 8K训练存在性能损失
- 图表184:W/LARS时AlexNet-BN 8K训练不存在性能损失
- 图表185:LARS优化器将ResNet50无损训练批量提升至32K
- 图表186:LARS与LAMB算法对比
- 图表187:LAMB优化器训练下BERT模型的训练批量可扩展至32K
- 图表188:GEM算法
投资建议
- 重点推荐公司:浪潮信息、工业富联、紫光股份、中科曙光、中兴通讯、拓维信息、联想集团。
- 关注公司:中际旭创、天孚通信、新易盛、华工科技、源杰科技、太辰光、光迅科技、光库科技、中瓷电子、剑桥科技、博创科技、联特科技、德科立、仕佳光子、英维克、高澜股份、网宿科技、曙光数创、润泽科技、宝信软件、奥飞数据、数据港、光环新网。
总结
生成式AI的突破推动了算力需求的爆发式增长,AI算力产业链将全面放量,其中先进制程制造、Chiplet封装、HBM、AI芯片、光模块、液冷、AI服务器和IDC出租运维等环节均将受益。NVIDIA在AI芯片市场占据主导地位,而国内厂商正在加速追赶。随着AI技术的不断发展,AI服务器和IDC市场也将迎来快速增长。投资建议关注产业链核心环节和具有技术优势的国内厂商。
试读结束,高清完整版pdf/doc/ppt,请点下载