【计算机】大模型推理算力知多少_12页_990kb
报告摘要
大模型推理算力知多少?总结
核心内容
本报告分析了大模型推理过程中算力成本高昂的问题,指出显存带宽是限制大模型应用落地的关键瓶颈。同时,报告探讨了英伟达L40s芯片在算力成本优化方面的初步作用,并提出了对大模型应用前景的展望与投资建议。
主要观点
1. Transformer模型为访存密集型任务
- Transformer模型在生成过程中,需对已计算的token信息(如KV缓存)进行反复访问,导致显存带宽成为主要限制因素。
- 全球最先进的AI芯片计算速度远高于显存带宽,因此在推理任务中,显存带宽限制了算力的利用效率。
- 在大模型推理中,应综合考虑“计算访存比”和“算力利用率”,而不能仅依据FLOPs(浮点运算次数)来估算算力需求。
2. 算力成本与用户体验的平衡
- 实践中通过多种优化技术(如参数量化、模型蒸馏、算子融合、Flash Attention等)来提升GPU利用率,但这些优化手段存在取舍,无法同时兼顾算力成本与用户体验。
- 增大Batch Size(并发量)可提升QPS(每秒处理请求数),但也会增加单个请求的时延,影响用户体验。
- GPT-3.5的推理算力需求估计为5万张A100芯片,若考虑GPT-4等更高级模型的需求,算力需求将持续保持高景气。
3. 英伟达L40s开启降本第一步
- L40s在特定场景下(如中等规模模型推理、图像生成)的性价比超过A100,且供货周期较短。
- L40s填补了部分中等规模模型的需求,但A/H系列芯片在超大模型训练与推理方面仍具有不可替代的优势。
- L40s的发布将为英伟达及其产业链带来更快的实际业绩增长,而非长期难以交付的高增长订单。
关键信息
推理算力瓶颈
- Transformer模型生成过程:每个token生成都需要访问显存,因此访存密集型。
- 显存带宽限制:在GPT-3的生成阶段,访存量是计算量的5倍,显存带宽成为主要瓶颈。
- 算力利用率:当前估算公式未考虑显存带宽限制,导致算力利用率严重偏低(如仅计算输出时,算力利用率不足1.1%)。
推理算力需求测算
- GPT-3.5所需A100数量:估算至少需要5万张A100芯片。
- 算力需求公式:需考虑输入与输出token数、Batch Size、显存预留倍数等因素,不能简单套用“2参数量token数”公式。
- 不同精度下的算力需求:
- TF32:41.55万张A100
- INT8:10.39万张A100
- INT4:5.19万张A100
L40s芯片表现
- 性价比优势:在GPT-40B微调和图像生成等场景中,L40s的性能表现优于A100。
- 供货周期:相比A/H系列,L40s供货周期较短,有利于快速部署。
- 市场定位:L40s满足中等规模模型需求,A/H系列仍主导超大模型市场。
投资建议
- C端标准化工具类产品:如金山办公、万兴科技、同花顺、科大讯飞、福昕软件等,有望率先享受AI大模型带来的产业红利。
- B端应用企业:如恒生电子、拓尔思、税友股份等,具备行业数据与客户资源,有望优先受益。
- 算力相关厂商:包括浪潮信息、中科曙光、优刻得、紫光股份、海光信息、寒武纪、拓维信息、神州数码等AI服务器及芯片企业,是大模型产业化的重要支撑。
风险提示
- AI技术迭代不及预期:若AI技术进展缓慢,可能影响模型优化与应用落地。
- 商业化落地不及预期:如ChatGPT盈利模式尚不成熟,后续商业化进展存在不确定性。
- 政策支持不及预期:新技术新行业的推广依赖政策支持,存在政策不达预期的风险。
- 全球宏观经济风险:AI垂直领域的发展与下游经济状况密切相关,存在全球性经济波动风险。
总结
大模型推理面临显著的算力成本挑战,其核心瓶颈在于显存带宽而非计算能力。随着L40s等新芯片的推出,算力成本有望逐步下降,从而推动大模型在更多场景中的应用落地。未来,随着算力性价比的提升,大模型在C端和B端的应用前景将更加广阔。投资者可重点关注具备技术优势和市场定位的AI相关企业。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载