电子行业电子AI+系列专题报告(一):AI大语言模型的原理、演进及算力测算-20230424-国信证券-36页_3mb
报告摘要
电子AI+系列专题报告(一)AI大语言模型的原理、演进及算力测算
核心内容
本报告围绕AI大语言模型的原理、演进及算力测算展开,重点分析了Transformer模型架构、GPT系列模型的发展历程以及大语言模型在训练和推理过程中对算力的需求。同时,报告还探讨了与AI大语言模型相关的产业链公司及潜在风险。
主要观点
1. 人工智能与机器学习基础
- 人工智能(AI)是研究、开发用于模拟、延伸和扩展人类智能的理论、方法和技术。
- 机器学习(ML)是实现AI的一种途径,通过算法使计算机从数据中学习,提升性能。
- 深度学习(DL)是机器学习的子集,主要由人工神经网络(ANN)组成,通过多层结构实现复杂模式识别。
2. Transformer模型架构
- Transformer模型是一种非串行的神经网络架构,基于Encoder-Decoder结构,引入“注意机制”(Attention),使得模型能够并行处理整个文本序列。
- Transformer模型在大规模分布式集群中训练表现优异,具有并行运算、关注上下文信息、表达能力强等优势。
3. GPT系列模型演进
- GPT-1:采用“预训练+微调”半监督学习方法,模型参数量为11.7亿,主要用于单序列文本生成。
- GPT-2:引入多任务学习机制,将多样化的NLP任务转化为语言模型问题,提升模型的通用性。
- GPT-3:参数量达1750亿,性能实现跨越式提升,支持few-shot learning。
- GPT-3.5(ChatGPT):引入人类反馈强化学习机制(RLHF),通过有监督学习微调模型,使其更符合人类意图。
关键信息
1. 算力需求测算(以GPT-3为例)
-
训练阶段:
- 参数量:1750亿
- 训练样本token数:3000亿
- 所需运算次数:3.15×10^23 FLOPs
- 所需算力:121.528 PFLOPS
- 所需A100 GPU芯片:1558颗
- 对应价值:约2337万美元
- 所需DGX A100服务器:195台
- 对应价值:约3880.5万美元
-
推理阶段:
- 每日推理token数:7.9万亿
- 所需运算次数:4.76×10^24 FLOPs
- 所需算力:55 EFLOPs
- 所需A100 GPU芯片:约70.6万颗
- 对应价值:约105.95亿美元
- 所需DGX A100服务器:约8.8万台
- 对应价值:约175.12亿美元
2. 产业链相关公司
-
工业富联:全球领先的电子设备制造(EMS)公司,提供云计算、通信及移动网络设备、工业互联网解决方案。
- 2022年云计算业务收入达2124.44亿元,同比增长19.6%。
- 为苹果、亚马逊、谷歌等企业提供定制化服务器产品。
-
沪电股份:服务器、交换机高阶硬板核心供应商,产品涵盖Backplane、Line Card、HDI Interposer等,市场占有率高。
3. 风险提示
- 宏观AI推广不及预期
- AI投资规模低于预期
- AI服务器渗透率提升低于预期
- AI监管政策收紧
总结
本报告系统性地分析了AI大语言模型的原理、演进及算力需求,指出Transformer模型在自然语言处理任务中的重要性,以及GPT系列模型在参数规模和学习机制上的持续优化。同时,报告测算GPT-3在训练和推理阶段的算力需求,显示其对GPU和AI服务器的依赖程度极高,对相关产业链公司如工业富联、沪电股份等具有重要影响。最后,报告提醒投资者注意AI推广、投资规模、服务器渗透率及监管政策等潜在风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载