电子-电子AI+系列专题报告(一):AI大语言模型的原理、演进及算力测算_36页_3mb
报告摘要
电子AI+系列专题报告(一)AI大语言模型的原理、演进及算力测算
核心内容
本报告聚焦于AI大语言模型的原理、演进趋势以及算力需求测算,重点分析了GPT系列模型的发展历程,并以GPT-3为例,对训练和推理阶段的算力需求进行了详细测算。
主要观点
- 机器学习与深度学习:机器学习是实现人工智能的重要途径,深度学习作为其子集,通过大规模模型和海量数据显著提升了性能。
- Transformer模型架构:作为现代大语言模型的基础,Transformer模型采用非串行结构,引入Attention机制,支持并行处理和上下文理解,适用于大规模分布式训练。
- GPT系列模型演进:GPT模型从GPT-1到GPT-3,参数量和训练数据量呈指数级增长,性能不断提升。GPT-3.5引入人类反馈强化学习(RLHF)机制,以提升模型与人类意图的一致性。
- 算力需求激增:大语言模型对算力的需求显著增加,GPT-3的训练和推理阶段分别需要1558颗A100 GPU芯片和70.6万颗A100 GPU芯片,对应的算力需求分别为121.528PFLOPS和55EFLOPS。
关键信息
一、人工智能、机器学习与神经网络简介
- 人工智能旨在模拟、延伸和扩展人类智能,而机器学习是其实现方式之一。
- 机器学习包含数据、模型和算法三要素,依赖于大数据和强大的算力。
- 深度学习通过多层神经网络结构,有效处理高维数据,优于传统机器学习模型。
二、Transformer模型结构分析
- Encoder-Decoder架构:Transformer模型采用该架构,用于处理源语言和目标语言之间的转换。
- 词嵌入与位置编码:词嵌入将词语映射为向量,位置编码则帮助模型理解词语的顺序。
- Attention机制:通过Q、K、V矩阵计算注意力分数,实现对上下文信息的关注。
- Multi-head Attention:将Attention机制扩展至多个子空间,防止过拟合,提高模型泛化能力。
- Decoder结构:包含Masked Multi-Head Attention和Cross-Attention层,确保模型在推理阶段不会使用未来信息。
三、大规模语言模型算力需求测算(以GPT-3为例)
- 训练阶段:
- GPT-3参数量为1750亿个,训练样本token数为3000亿个。
- 每次训练时间要求30天,所需运算次数为3.15×10^23 FLOPs,算力需求为121.528 PFLOPS。
- 需要1558颗A100 GPU芯片,对应价值约2337万美元,需195台DGX A100服务器,价值约3880.5万美元。
- 推理阶段:
- 每日推理token数为79330亿个,所需运算次数为4.76×10^24 FLOPs,算力需求为55EFLOPS。
- 需要70.6万颗A100 GPU芯片,对应价值约105.95亿美元,需8.8万台DGX A100服务器,价值约175.12亿美元。
四、产业链相关公司
- 工业富联:
- 电子设备制造(EMS)行业龙头,提供云计算、通信及移动网络设备、工业互联网解决方案。
- 2022年云计算业务收入2124.44亿元,占总营收41.5%。
- 产品包括服务器、存储设备、边缘数据中心、浸没式液冷技术等。
- 沪电股份:
- 服务器、交换机高阶硬板核心供应商,产品广泛应用于通信、数据中心及汽车电子领域。
- 在服务器和交换机领域市占率高,产品包括Backplane、Line Card、HDI Interposer等。
五、风险提示
- 宏观AI推广不及预期
- AI投资规模低于预期
- AI服务器渗透率提升低于预期
- AI监管政策收紧
总结
本报告系统分析了AI大语言模型的原理、演进及算力需求,指出Transformer模型在大语言模型中的核心地位,以及GPT系列模型在参数量和性能上的快速提升。以GPT-3为例,详细测算其训练和推理阶段的算力需求,表明大语言模型对算力的依赖性极高。同时,报告也介绍了相关产业链公司,如工业富联和沪电股份,它们在AI服务器制造、云计算设备代工及高阶PCB供应方面具有显著优势。最后,报告提醒投资者注意AI发展可能面临的政策与市场风险。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载