计算机行业专题报告-大模型推理算力知多少?-财通证券_12页_1mb
报告摘要
大模型推理算力分析与展望
核心观点
Transformer架构使推理成为访存密集型任务,显存带宽成为限制大模型发展的主要瓶颈,当前AI硬件计算能力远超其带宽性能。
关键发现
-
访存密集型挑战
Transformer模型每生成一个token需反复与显存交互,访存量远超计算量。以GPT-3为例,单请求访存量可达计算量的5倍,造成算力利用率不足(A100系列实际利用率仅1%-19%)。 -
算力成本与用户体验矛盾
提升BatchSize可提高QPS但显著增加时延(如8卡A100每秒需2分钟生成1000token)。大模型应用(如GPT-4)采用限流策略控制算力成本,但高成本仍是规模化落地障碍。 -
英伟达L40s降本潜力
L40s在特定场景下性价比优于A100,供货周期短,已在图像生成等非超大型模型领域显现降本效果。但超大型模型端仍需依赖A/H系列芯片。
实际需求测算
以GPT-3.5为参照,考虑显存、精度和流量等因素,承载其推理任务至少需5万张A100卡。若纳入更高流量场景、更精细精度或GPT-4全开放需求,推理算力需求长期呈现高景气。
投资建议
关注以下方向:
- C端工具:金山办公、万兴科技、科大讯飞等
- B端卡位企业:恒生电子、拓尔思、税友股份等
- 算力相关:浪潮信息、海光信息、寒武纪、神州数码等AI服务器/芯片厂商,以及星环科技等数据库企业
风险提示
AI技术迭代不及预期、商业化落地缓慢、政策支持不足及宏观经济波动。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载