计算机行业AIGC系列之二十三:算力网络再讨论!从Dojo架构到算法的硬件延伸_39页_3mb
报告摘要
算力网络再讨论!从Dojo架构到算法的硬件延伸
核心内容
本文围绕算力网络的发展趋势,重点分析了Tesla Dojo算力网络系统、Google TPU系列以及华为星河AI网络白皮书等案例,揭示了算力与网络之间的紧密联系。核心观点如下:
- 硬件架构的设计需服从于算法需求,网络性能对算力提升具有决定性作用。
- 算力网络的演进将带来高速网络需求的显著增长,400G以上光通信与RoCE网络成为关键方向。
- 从Tesla Dojo到Google TPU、再到华为星河AI网络,算力网络的架构设计日益多样化,体现出对不同应用场景的适配性。
主要观点
1. 算力网络的三大规律
- 带宽与连接架构是决定算力性能的关键因素。随着模型训练的复杂性提升,网络连接性能成为瓶颈。
- 高速chip-to-chip连接方案(如NVLink、CXL)是高速网络与光通信需求的底层逻辑。这些方案提供了更高的带宽和更低的时延。
- 单SoC性能提升+芯片堆叠,不意味着算力集群线性提升。网络设计成为影响整体算力的关键环节。
2. Tesla Dojo架构特点
- 最小计算单元是D1 Compute Die,由354个Training nodes组成,每个node具备1 TFlop算力和1.25 MB SRAM。
- D1 Die采用TSMC 7nm工艺,面积为645 mm²,功耗400 W,总带宽达5 TB/s。
- 25个D1芯片组成一个Training Tile,Tile为供电、散热和对外连接的核心单元。
- 6个Tile搭配20个DIP(Dojo Interface Processor),用于内存扩展、网络连接与对外接口。
- DIP提供800GBps内存带宽和32GB HBM内存,支持大规模并行计算。
- Dojo通过软件优化实现灵活资源调配,可将计算资源“切块”使用,提高利用率。
3. Google TPU演进路径
- TPU v1-v4 均围绕“矩阵乘法优化”设计,从推理到训练,逐步实现全光组网。
- TPU v4采用3D组网方式,通过6个面的光连接,实现高带宽、低延迟的集群通信。
- OCS(Optical Circuit Switch) 是TPU v4网络的核心,采用全光学交换方式,提高端口效率和网络扩展性。
- TPU v4采用单模WDM光模块,实现800G向1.6T演进,适应高带宽需求。
4. 华为星河AI网络白皮书
- 端口带宽提升至400G,并向800G演进,支持大规模无收敛组网。
- 高可靠、可运维、开放性是星河AI网络的三大核心优势。
- 采用RoCE网络,结合高性能交换机,实现与InfiniBand相当的性能,降低运维成本。
关键信息
- 算力网络发展趋势:从传统GPU服务器向专用算力网络(如Dojo、TPU)演进,网络性能成为核心考量。
- 网络技术演进方向:400G及以上光通信、RoCE网络、全光交换(如OCS)等是未来重点。
- 应用场景驱动算力网络发展:Tesla、Google、华为等企业的算力网络均围绕特定场景(如自动驾驶、AI训练、大模型等)设计。
- Dojo的创新点:CFP精度、分布式架构、高效资源调配、低时延与高带宽设计。
相关标的
算力网络与流量环节
- 中际旭创
- 新易盛
- 天孚通信
- 华工科技
- 中兴通讯
- 紫光股份
- 锐捷网络
- 源杰科技
- 盛科通信
AI服务器计算环节
- 浪潮信息
- 胜宏科技(电子)
- 神州数码(tmt)
华为产业链
- 软通动力(大模型+OS+数据库)
- 华大九天(tmt,EDA)
- 长电科技(电子,封测)
- 润达医疗(医疗AI)
- 赛意信息(MetaERP)
- 中软国际
- 广电运通
- 神州数码
特斯拉与智能车产业链
- 德赛西威
- 立讯精密(电子)
- 双环传动(机械&汽车)
- 精锻科技
- 爱柯迪
- 岱美股份
风险提示
- 信息技术迭代可能产生新的网络通信方案,颠覆现有格局。
- GPU、DSA、智联汽车、机器人等领域的竞争激烈,需关注产业链地位与管理能力。
- 若未能准确把握趋势,可能误选次优标的,影响投资回报。
通信算力网络相关公司估值表
| 证券代码 | 证券简称 | 收盘价(元) | 总市值(亿元) | 2023E净利润(亿元) | 2024E净利润(亿元) | 2023E PE | 2024E PE |
|---|---|---|---|---|---|---|---|
| 600941.SH | 中国移动 | 99.86 | 13,717.52 | 1,373.64 | 1,478.02 | 9.99 | 9.28 |
| 601728.SH | 中国电信 | 6.04 | 5,204.52 | 309.10 | 347.57 | 16.84 | 14.97 |
| 600845.SH | 宝信软件 | 45.45 | 908.03 | 26.48 | 33.31 | 34.29 | 27.26 |
| 000938.SZ | 紫光股份 | 25.20 | 720.74 | 26.56 | 32.58 | 27.13 | 22.12 |
| 300628.SZ | 亿联网络 | 37.96 | 479.74 | 29.74 | 39.09 | 16.13 | 12.27 |
| 002396.SZ | 星网锐捷 | 19.63 | 116.39 | 6.52 | 8.72 | 17.85 | 13.35 |
| 000988.SZ | 华工科技 | 32.93 | 331.11 | 12.10 | 15.52 | 27.36 | 21.33 |
| 300308.SZ | 中际旭创 | 111.08 | 891.78 | 16.45 | 30.34 | 54.20 | 29.39 |
| 300502.SZ | 新易盛 | 44.64 | 316.91 | 13.61 | 17.59 | 23.29 | 18.02 |
| 301165.SZ | 锐捷网络 | 44.91 | 255.17 | 6.94 | 9.46 | 36.76 | 26.98 |
| 600050.SH | 中国联通 | 5.11 | 1,625.18 | 84.52 | 97.40 | 19.23 | 16.69 |
总结
Tesla Dojo、Google TPU和华为星河AI网络等案例,展示了算力网络从传统架构向更高效、更灵活的方向演进。随着AI大模型、自动驾驶和机器人等场景的发展,算力网络对带宽、时延、资源利用率的要求不断提升。400G及以上光通信、RoCE网络、全光交换(如OCS)等技术成为关键趋势。投资者应关注相关硬件与软件协同发展的企业,尤其是那些能提供高效网络解决方案的公司,如中际旭创、紫光股份、华工科技等。同时,也要警惕技术迭代带来的不确定性,以及产业链竞争对投资回报的影响。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载