AI云计算新范式:规模效应+AIInfra+ASIC芯片
核心内容
AI云计算正在形成新的范式,主要体现在规模效应、AI基础设施(AIInfra)能力和算力自主化三个方面。云计算在AI的推动下,营收增速回暖、Capex增长加速已成为市场共识。然而,AI云时代的竞争格局和云厂商利润率仍存在分歧,本报告重点分析了AI云的盈利模式与竞争格局。
主要观点
- 规模效应:AI云具有更高的资本密集度,同时通过多租户、多场景和内部负载的削峰填谷,提高算力利用率,降低单位成本。
- AIInfra能力:作为连接算力与应用的桥梁,AIInfra涵盖硬件组网、算力调度、模型优化和应用定向优化。不同厂商的AIInfra能力差异显著,影响推理成本。
- 算力自主化:ASIC芯片成为算力自主化的方向,其在特定任务中具备性价比,但受限于生态不成熟和使用场景的局限性,目前仍难以完全替代GPU。
- 云厂商竞争格局:大型互联网云厂商(如腾讯、阿里、谷歌、Meta等)因具备庞大的内部负载和AI应用,具有显著的成本优势,有望在未来AI云市场中占据主导地位。
关键信息
1. 规模效应
- 资本密集度:AI云的建设成本高,但通过多租户和内部负载的调度,可以实现更高的算力利用率。
- 多租户与内部负载:云厂商可通过多租户模式和内部AI应用的负载调度,平抑算力需求的波动,提高ROI。
- 算力利用率:通过多租户、大规模AI应用和内部非实时负载,AI云可实现更高效的算力使用。
2. AIInfra能力
- 定义与作用:AIInfra是算力与应用之间的“桥梁”,通过优化算力资源的使用,提高计算效率。
- 主要功能:
- 硬件层面:组网、算力资源调度。
- 模型层面:提供丰富的工具库和框架库,优化模型推理效率。
- 应用层面:定向优化,提升特定应用的性能。
- AIInfra差异:不同厂商在AIInfra工程能力上存在明显差距,影响推理成本和整体效率。
3. 算力自主化
- ASIC芯片趋势:ASIC芯片具备更高的性价比,但其开发和生态仍不成熟,对通用性有一定牺牲。
- 海外启示:谷歌、AWS、Meta等已开始布局ASIC芯片,并基于特定架构(如脉动阵列)进行优化。
- 国内进展:DeepSeek、阿里云、腾讯云等厂商在ASIC和自研芯片方面有所尝试,但整体仍处于探索阶段。
4. 重点标的
- 互联网云厂商:腾讯、阿里巴巴、谷歌、微软、Meta、亚马逊等具备庞大的内部负载和AI应用,有望在AI云市场中占据优势。
- ASIC芯片厂商:博通在ASIC辅助设计方面具备优势,是算力自主化的重要参与者。
重点公司估值与风险提示
- 估值表:报告提供了重点公司(如腾讯、阿里、谷歌、微软、Meta、亚马逊、博通)的估值信息。
- 风险提示:
- 内容和互联网平台监管环境变化风险;
- 大模型性能进步不及预期;
- AI应用落地进展不及预期。
附图与数据
- 图1:云计算按服务方式的分层。
- 图2:AI云与传统云在资本开支、产能利用率、技术能力等方面的要求。
- 图3:AI云的ROI由规模效应、AIInfra优化和算力自主化共同推动。
- 图4:主要AI算力芯片分类。
- 图5:英伟达GPU与谷歌TPU、亚马逊Trainium2等的架构对比。
- 图6:谷歌TPU/亚马逊Trainium基于XLA的开发生态。
- 图7:MTIA v2软件堆栈基于Triton编程语言。
- 图8:Pytorch使用无CUDA的Triton编译语言实现较高的GPU调用效率。
- 图9:DeepSeek应用理论收入及成本对比,理论利润/成本比达545%。
- 图10:字节在2024年提出的MegaScale训练框架的MFU优化效果。
表格数据
表1:主要云厂商2023年与2024年云收入及利润率
| 公司 |
2023年云收入(亿美元) |
2023年YoY |
云收入占比 |
2024年云收入(亿美元) |
2024年YoY |
云收入占比 |
云经营利润率 |
| 亚马逊 |
908 |
13% |
16% |
1,076 |
19% |
17% |
37% |
| 微软智能云 |
797 |
- |
35% |
956 |
20% |
37% |
40%以上 |
| 谷歌 |
331 |
26% |
11% |
432 |
31% |
17% |
14% |
| 阿里巴巴 |
994 |
2% |
11% |
1,135 |
8% |
12% |
9% |
| 金山云 |
70 |
-14% |
100% |
78 |
10% |
100% |
-6% |
| 中国移动 |
833 |
66% |
8% |
1,004 |
20% |
10% |
- |
| 中国联通 |
510 |
42% |
14% |
686 |
17% |
18% |
- |
| 中国电信 |
972 |
68% |
19% |
1,139 |
17% |
22% |
- |
表2:主要云厂商Capex同比增速
| 公司 |
23Q3 |
23Q4 |
24Q1 |
24Q2 |
24Q3 |
24Q4 |
| 微软 |
70% |
69% |
79% |
78% |
79% |
97% |
| 亚马逊 |
-24% |
-12% |
5% |
54% |
81% |
91% |
| Meta |
-30% |
-15% |
-2% |
36% |
41% |
94% |
| 谷歌 |
11% |
45% |
91% |
91% |
62% |
30% |
| 阿里巴巴 |
-57% |
28% |
221% |
75% |
240% |
259% |
| 腾讯控股 |
- |
- |
- |
- |
- |
- |
| 百度 |
61% |
90% |
57% |
-22% |
-53% |
-36% |
表3:主要大模型性能排名
| Arena Score排名 |
模型 |
Arena分数 |
模型厂商 |
是否开源 |
| 1 |
Grok-3-Preview-02-24 |
1412 |
xAI |
闭源 |
| 2 |
GPT-4.5-Preview |
1411 |
OpenAI |
闭源 |
| 3 |
chocolate (Early Grok-3) |
1402 |
xAI |
闭源 |
| 4 |
Gemini-2.0-Flash-Thinking-Exp-01-21 |
1384 |
谷歌 |
闭源 |
| 5 |
Gemini-2.0-Pro-Exp-02-05 |
1380 |
谷歌 |
闭源 |
| 6 |
ChatGPT-4o-latest (2025-01-29) |
1377 |
OpenAI |
闭源 |
| 7 |
DeepSeek-R1 |
1363 |
DeepSeek |
开源 |
| 8 |
Gemini-2.0-Flash-001 |
1357 |
谷歌 |
闭源 |
| 9 |
o1-2024-12-17 |
1352 |
OpenAI |
闭源 |
| 10 |
Qwen2.5-Max |
1336 |
阿里巴巴 |
闭源 |
| 13 |
DeepSeek-V3 |
1318 |
DeepSeek |
开源 |
| 14 |
GLM-4-Plus-0111 |
1311 |
阶跃星辰 |
闭源 |
| 16 |
Claude 3.7 Sonnet |
1309 |
Anthropic |
闭源 |
| 18 |
Step-2-16K-Exp |
1305 |
阶跃星辰 |
闭源 |
| 28 |
Hunyuan-Large-2025-02-10 |
1271 |
腾讯 |
闭源 |
| 29 |
Meta-Llama-. -B -Instruct-bf |
- |
Meta |
开源 |
表4:主要云厂商AI芯片布局与AI应用
| 公司 |
AI芯片布局 |
大模型及AI开发框架 |
已推出的核心AI应用 |
可在AI芯片上运行的内部工作负载 |
| 字节跳动 |
外购:23万片H100;自研:未提及 |
大模型:豆包;开发平台:Coze AI |
AI视频工具:即梦;AI Agent:小悟空 |
云计算:火山引擎;推荐系统:抖音、TikTok等 |
| 阿里巴巴 |
外购:英伟达芯片;自研:12nm含光800(推理) |
大模型:通义千问2.5;开发平台:百炼AI |
AI Chatbot:通义;AI助手:淘宝问问等 |
云计算:阿里云;推荐系统:淘宝、阿里国际站等 |
| 腾讯 |
外购:23万片H100;自研:紫霄(推理) |
大模型:Huanyuan large 389B MoE;开发平台:腾讯云AI平台 |
AI Chatbot:混元助手、腾讯元宝;AI视频平台:腾讯智影 |
云计算:腾讯云;推荐系统:微信视频号等 |
| 百度 |
外购:英伟达芯片;自研:7nm昆仑芯二代 |
大模型:文心4.0 Turbo;深度学习框架:飞桨 |
AI搜索:百度AI智能问答;AI Chatbot:文心一言 |
云计算:百度云;推荐系统:百度地图等 |
表5:主要云厂商AIInfra能力对比
| 平台 |
IaaS重要AI Infra工作 |
MaaS/PaaS重要AI Infra工作 |
AIInfra具体能力/实现方式 |
| 字节跳动 |
Gödel调度器 |
MegaScale训练框架 |
高GPU利用率,优化通信效率 |
| 腾讯 |
高性能网络IHN |
TACO推理加速套件 |
降低推理成本,支持无缝切换 |
| 阿里巴巴 |
灵骏计算集群+HPN 7.0 |
PAI-ChatLearn训练框架 |
提升对齐训练效率,支持自定义流程 |
| DeepSeek |
Fire-Flyer AI-HPC集群 |
HAI LLM训练框架 |
优化通信、计算能力,提升效率 |
表6:GPU/ASIC芯片成本对比
| 芯片产品 |
NVIDIA H100 |
NVIDIA B200 |
Google/博通 TPU v5p |
Google/博通 TPU v6e |
AWS/Marvell Trainium 2 |
| 制程 |
4nm |
4nm |
5nm |
4nm |
5nm |
| 峰值计算性能-BF16/FP16 (TFlops) |
990 |
2250 |
459 |
926 |
431 |
| 存储(GB) |
96 |
192 |
96 |
32 |
96 |
| 存储类型 |
HBM3 |
HBM3e |
HBM2e |
HBM3 |
HBM3 |
| 预计存储成本 |
1150 |
2700 |
1000 |
400 |
1150 |
| 制造、封测等成本 |
1350 |
2150 |
800 |
550 |
1000 |
| 总成本 |
2500 |
4850 |
1800 |
950 |
2150 |
| 业务毛利率 |
85%~90% |
85%~90% |
65%~70% |
65%~70% |
47%~53% |
表7:典型训练场景下各芯片成本与性能对比
| 芯片产品 |
NVIDIA H100 |
NVIDIA B200 |
NVIDIA GB200 Superchip |
Google/博通 TPU v5p |
AWS/Marvell Trainium 2 |
| 单卡FP16峰值性能(TOPS) |
990 |
2250 |
5000 |
459 |
650 |
| 单卡单日算力(PFLPOS) |
34214 |
77760 |
172800 |
15863 |
22464 |
| 集群单日算力(ZFLOPS) |
821 |
1866 |
4147 |
381 |
539 |
| 算力芯片硬件成本(亿美元) |
43.3 |
79.3 |
168.3 |
14.5 |
10.6 |
| 折旧年限 |
4 |
4 |
4 |
4 |
4 |
| 年折旧费用(亿美元) |
10.8 |
19.8 |
42.1 |
3.6 |
2.7 |
| 能源成本 |
- |
- |
- |
- |
- |
| 每瓦特AI计算性能(TFLOPS/Watt) |
1.4 |
2.3 |
2.1 |
0.7 |
0.9 |
| 服务器中AI计算单元功耗(千瓦) |
700W |
1000W |
2400W |
700W |
700W |