2025年智算中心液冷整机柜服务器开放架构多样化算力兼容研究报告_41页_3mb
报告摘要
智算中心液冷整机柜服务器开放架构多样化算力兼容研究报告总结
核心内容概述
本报告由全球计算联盟发布,旨在探讨液冷整机柜服务器在智算中心中的应用及开放架构多样化算力兼容的关键技术与发展趋势。报告涵盖背景、挑战、关键技术、架构设计、应用场景及案例、结论与展望等多个章节,全面分析了液冷技术在AI算力密集场景下的优势及挑战。
主要观点
1. 背景与挑战
- AI算力需求增长:随着人工智能和数字化转型的推进,数据中心对高密度、高性能算力的需求迅速增长,传统风冷技术已无法满足高功率设备的散热需求。
- 液冷技术优势:液冷技术在高功率芯片散热、降低PUE(电能利用效率)、提升能效和降低TCO(总拥有成本)方面表现优异。
- 政策驱动:国家政策推动绿色低碳数据中心建设,要求新建大型、超大型数据中心的PUE控制在1.3以下,重点区域要求低于1.25。
- 市场增长:中国液冷数据中心市场规模快速增长,2024年已突破150亿元,年均增长率超过35%。
- 硬件形态演进:传统PCIe加速卡已无法满足新一代AI集群需求,8个OAM模组成为主流,但缺乏统一标准,影响部署与运维。
2. 技术发展
- 液冷散热技术:
- 冷板式液冷:兼容风冷设备,维护简单,成本较低,成为当前主流。
- 浸没式液冷:实现100%液体冷却,PUE更低,但对芯片材料兼容性要求高,维护成本较高。
- 混合式与全液冷部署:适应不同场景需求,如存量数据中心改造与大规模数据中心建设。
- 智算软硬件技术:
- OCP社区推动标准化,如OpenRackv3、OAI、UBB等,支持GPU加速AI/HPC系统。
- NVIDIA推动NVL72、NVL144、NVL576等超节点架构,实现高密度、高速互联。
- AI集群网络需求多样化,包括带内管理、Scale-out(东西向)、Scale-up(南北向)网络等。
3. 液冷智算开放、多算力兼容架构
- 系统架构:
- 支持多种AI加速器,通过UBB模组灵活更换。
- 单机柜部署64个AI加速器,支持千卡、万卡、十万卡规模集群。
- 硬件架构:
- 模块化设计,支持4U高度AI节点,包含GPU模组、存储与管理模块。
- 3U GPU模组实现独立演进,便于维护和升级。
- 散热架构:
- 冷板式液冷+空调混合方案,冷板+液冷门全液冷方案,以及全冷板方案。
- 通过冷板、Manifold和CDU实现热量的高效传递与管理。
- 供电系统:
- 支持2N供电系统,降低故障风险。
- 电源框支持AC与HVDC输入,输出54V DC,效率>97%。
- 单柜供电能力可达105kW以上,支持高功率密度部署。
- 网络架构:
- 支持Scale-out(东西向)与Scale-up(南北向)网络。
- 高速互联需求推动200G、400G甚至更高带宽网络部署。
- 通过多层交换机扩展,实现大规模集群互联。
- 管理架构:
- 统一管理AI节点、交换模块和机柜。
- 提供BMC管理、CDU监控、自动升级、排障等功能。
- 支持液冷原生安全性设计,如三级漏液监测和防护系统。
关键信息
1. 液冷技术应用场景
- 冷板式液冷:适用于当前主流的液冷部署,兼容性好,维护成本低。
- 浸没式液冷:适用于高功率设备,但对材料兼容性要求高,维护成本高。
- 混合式与全液冷部署:根据数据中心改造需求灵活选择,支持高密度、高能效部署。
2. 供电系统
- 支持2N供电,提供冗余保障。
- 电源框支持多种输入电压,包括AC和HVDC,效率>97%。
- 单柜供电能力可达105kW以上,支持未来更高功率需求。
3. 网络架构
- 集群带内管理网络、Scale-out网络和Scale-up网络分别满足不同场景下的通信需求。
- 高速互联技术推动200G、400G网络发展,支持大规模AI集群部署。
4. 管理架构
- 提供统一的运维管理系统,支持监控、智能节能、自动升级、排障等功能。
- BMC软件支持多厂商GPU管理,实现软件架构分层解耦,提升兼容性与可维护性。
5. 应用场景与案例
- 应用场景:适用于互联网、运营商、金融、电力、政府主导的国家或区域智算中心等。
- 典型案例:超聚变FusionPoD for AI整机柜液冷服务器,采用100%液冷设计,PUE低于1.10,支持64个GPU,实现高效、可靠、绿色部署。
未来展望
- 超节点架构:随着Scale-up和Scale-out技术的发展,超节点架构将成为主流,支持更高功率密度和更高效互联。
- 液冷整机柜部署:未来单柜功率有望突破200kW、500kW,甚至达到MW级,液冷整机柜将成为唯一可行的部署方式。
- 生态协同:呼吁行业各方合作,推动液冷技术标准化与生态体系建设,实现更高效、灵活、绿色的智算中心建设。
编写单位与成员
- 编写单位:河南昆仑技术有限公司、中移动信息技术有限公司、北京幻视摩方科技有限公司、沐曦集成电路(上海)股份有限公司、上海燧原科技股份有限公司、中航光电科技股份有限公司、软通计算机有限公司。
- 编写组成员:杨金谕、张春、高从文、李圣义、单彤、丁俊峰、熊星、曹昉、张勇、王成龙、于超琪、张丙库、卢超、赵杨、梅敬青、蔡艳召、蒋正顺、李进宝、李军。
版权声明
- 本报告版权属于全球计算联盟。
- 未经书面授权,不得复制、抄袭、影印、翻译本文档的任何部分。
- 转载或引用需注明“来源:全球计算联盟”。
总结
本报告系统分析了液冷整机柜服务器在智算中心中的应用前景与技术挑战,提出了开放、灵活、高效的液冷智算架构方案,涵盖系统、硬件、散热、供电、网络与管理等多个方面。同时,结合市场与政策趋势,强调了液冷技术在降低PUE、提升能效和实现高密度部署中的关键作用。通过标准化与模块化设计,报告为未来大规模AI集群部署提供了坚实的技术支撑与工程实践指导。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载