20260724-国信证券-人工智能行业专题(19)_从Nebius看新兴云与开源模型Token优化_36页_1mb
报告摘要
人工智能行业专题(19) 从Nebius看新兴云与开源模型Token优化
核心内容
Nebius 是一家全栈自研 AI 原生云基础设施公司,总部位于荷兰阿姆斯特丹,2024 年重组后定位为“从硅片到 API”的 AI 云服务提供商。公司继承了 Yandex 20 年的分布式基础设施经验,具备超过 1000 名 AI 工程师,形成“裸金属算力→多租户 AI 云→Token Factory 托管推理→智能代理层”的四层产品架构。
主要观点
- 全栈垂直整合:Nebius 通过硬件自研、编排自控、模型自优化三层能力叠加,显著提升开源模型的推理效率,将成本最高降低 70%。
- 成本优势:相比 AWS,Nebius 的 GPU 租赁价格便宜 57.1% 至 81.8%,在基础设施方面具有显著优势。
- 技术优势:采用裸金属架构,去除了传统云的虚拟化损耗,使用 InfiniBand 网络,实现超低延迟和高吞吐量。
- Token Factory:Nebius 推出的托管推理平台,通过模型优化、后训练、推理调度等手段,实现单卡 Token 产出提升 2-3 倍。
- 开源替代闭源模型:Token Factory 能够将开源模型优化至接近闭源模型的性能,推动 AI 推理从“闭源模型依赖”向“开源模型替代”的迁移。
- 战略收购:Nebius 通过收购 Eigen AI 和 Tavily,进一步强化其在 AI 推理优化、实时搜索和智能代理领域的技术能力。
- 财务表现:Nebius 2026 年 Q1 营收同比增长 684%,毛利率由 52% 提升至 74%,收入指引为 30-34 亿美元,ARR 目标为 70-90 亿美元。
关键信息
成本优化
- 硬件成本:Nebius 使用定制 ODM 机箱,节省 10-15% OEM 溢价;自研液冷方案降低服务器功耗约 20%。
- 弹性打包:通过 K8s + SLURM 双栈编排,回收约 5-15% 闲置算力,提升 GPU 利用率。
- 无通用云搭售:避免了传统云的 200+ 种服务分摊成本。
Token Factory 优化
- 模型优化:Eigen AI 提供的 AWQ 4-bit 量化和 SpAtten 稀疏注意力,显著提升模型吞吐量。
- 推理效率:单卡 Token 吞吐量提升 2-3 倍,客户部署成本降低。
- 案例表现:Revolut 成本压缩至 1/29;Cosine 实现模型性能与闭源模型持平;Shopify 推理速度提升 2.2 倍,成本下降 68%;Coinbase AI 支出接近减半。
技术架构与能力
- 四层产品架构:从裸金属基础设施到智能代理层,服务范围从超大客户扩展至中小企业。
- 网络通信:采用 InfiniBand 网络,相比 RoCE 等方案更优,提升 AI 训练效率。
- 算力管理:K8s + SLURM 双栈调度,实现资源利用率最大化。
合作与客户
- 大客户:与微软、Meta 签订超长期合同,总规模达 174 亿至 270 亿美元。
- 合作伙伴:包括 Revolut、Cosine、Shopify、Coinbase 等,覆盖金融、电商、AI 编程等领域。
财务与扩张
- 收入增长:2026 年 Q1 营收达 3.99 亿美元,季末现金储备达 93 亿美元。
- 资本开支:2026 年资本开支指引为 200-250 亿美元,其中 60% 由自筹资金支持。
- 数据中心:签约电力容量从 2025 年 8 月的 >1 GW 增长至年底 4 GW,预计 2027-2028 年逐步投产。
风险提示
- 宏观经济波动:可能影响公司业务及行业增长。
- 下游需求不及预期:AI 需求增长若低于预期,将影响公司收入。
- 核心技术升级不及预期:若 AI 技术进展缓慢,将影响公司竞争力。
- 竞争加剧:AI 快速迭代和普及可能降低云业务利润率。
投资评级
- 投资评级:优于大市(维持)
- 评级说明:基于报告发布日后 6-12 个月内的相对市场表现,股价表现优于市场代表性指数 10% 以上。
分析师承诺
- 作者保证报告所采用的数据均来自合规渠道。
- 分析逻辑基于作者的职业理解,力求独立、客观、公正。
- 作者未就报告内容直接或间接收取任何报酬。
重要声明
- 本报告由国信证券股份有限公司制作,仅供客户使用。
- 报告内容不构成出售或购买证券的要约或邀请。
- 报告中的信息和意见不构成对任何个人的投资建议。
- 报告内容仅供参考,不承担任何法律责任。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载