智算中心发展现状与趋势研究报告_15页_434kb
报告摘要
智算中心发展趋势报告总结
核心内容概述
智算中心作为现代化算力设施,专注于服务智能计算场景,如大模型训练与推理、科学计算、智能制造和自动驾驶等。自2020年算力被纳入“新基建”以来,我国智算中心建设加速,2025年底智能算力规模超过1590 EFLOPS,2026年3月已达1882 EFLOPS。智算中心正从“算力设施”升级为“AI工厂”,在“普惠赋能”、“互联互通”和“算电协同”等方向迈向高质量发展。
主要观点与关键信息
1. 智算中心的内涵升级
- 智算中心从提供算力资源,转向生产交付智能。
- 早期以训练阶段为主,现在覆盖推理、智能体应用和物理AI。
- 服务模式从“资源出租”向“结果交付”演进,关注词元产出效率。
2. 关键技术支撑
(1)芯片级高速互联
- Scale-Up:NVLink(英伟达)、灵衢(华为)实现GPU间高速互联。
- Scale-Out:采用InfiniBand、RoCE、UEC等协议。
- 光电互连:光模块、硅光子、CPO、LPO、OCS等技术提升带宽密度和能效。
(2)集群调度与运维
- 资源池化:通过虚拟化、容器、切片等技术实现统一资源池管理。
- 集群调度:动态匹配任务与资源,支持容错和多租户隔离。
- 运维体系:构建“可观测、可诊断、可自愈”三位一体的智能运维能力。
(3)智能原生云平台
- 云服务化趋势明显,支持大模型即服务、智能体即服务。
- 提供从数据准备、模型训练、部署上线到在线监控的全生命周期服务。
- 用户可按需定制,无需管理复杂基础设施。
(4)制冷与算电协同
- 高功率密度下,液冷、风液协同、自然冷源等技术成为主流。
- 算电协同:算力优化电网,绿电支撑算力,实现“源网荷储算”一体化。
- PUE 控制在1.08-1.2之间,实现能耗与效率的平衡。
3. 现状与发展趋势
(1)向词元工厂演进
- 词元成为AI时代的统一计量单位,智算中心正从资源仓库转变为持续生产词元的“AI超级工厂”。
- 客户关注从“卡时计费”转向“词元成本”与“响应延迟”。
(2)系统性升级改造
- 架构转向异构化与专用化:GPU(训练)+ LPU/NPU(推理)+ CPU(调度)+ ASIC(专用场景)。
- CPU角色升级为“系统总指挥”,与GPU配比从1:4至1:8提升至1:1至1:2。
- 存储采用NVMe SSD,网络带宽向800Gb/s乃至1.6Tb/s演进。
(3)边缘中心快增长
- 全国算力网向“枢纽-区域-边缘”三级协同演进。
- 边缘算力承担70-90%的日常推理、实时响应及数据预处理任务。
- AI手机、智能汽车等终端设备成为算力部署新战场。
(4)算力边界快拓展
- 算力从集中式向分布式演进,覆盖空、海、地。
- 上海临港海底数据中心实现“海上风电+海水冷却”模式,PUE不高于1.15,绿电供给率超95%。
- 之江实验室推进“三体计算星座”计划,计划2032年完成全球首个太空算力网络。
4. 问题与建议
(1)电力能源供应瓶颈
- 电费占比超50%,东部电力紧张,西部绿电就地消纳能力不足。
- 建议强化算电协同规划,推动源网荷储算一体化调度,加快液冷技术规模化应用。
(2)供需错配利用率低
- 存在结构性供需失衡,高端算力紧缺,低端算力过剩。
- 建议推动算力标准化、平台互联互通,提升资源利用率。
(3)生态及供应链风险
- 高端GPU、HBM等关键部件依赖进口,存在“卡脖子”风险。
- 国产平台软件生态不成熟,需加快自主可控生态建设,推动行业标准统一,实施供应链多元化战略。
(4)私有重复建设严重
- 企业出于数据安全与合规需求,倾向私有化部署。
- 建议推广“行业共享+区域共建”模式,推动私有与公有平台协同。
总结
智算中心正从传统算力设施向“AI工厂”演进,推动算力服务从资源供给转向智能交付。在关键技术方面,高速互联、集群调度、云平台和算电协同成为核心支撑。未来趋势包括词元工厂化、边缘化、分布式和全球化。然而,电力瓶颈、供需错配、生态风险和重复建设等问题仍需系统性解决,建议通过协同规划、生态建设、共享模式等手段推动智算中心高质量发展。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载