OrionX_AI算力资源池化解决方案技术白皮书-V3.4_39页_2mb
报告摘要
OrionX AI 算力资源池化解决方案技术白皮书总结
核心内容
OrionX 是由北京趋动科技有限公司推出的 AI 算力资源池化解决方案,旨在解决企业 AI 应用中 GPU 资源利用率低、部署复杂、资源隔离不足等问题。通过软件定义 AI 算力,OrionX 实现了 GPU 资源的统一管理、灵活调度与高效利用,支持多种部署方式与异构算力芯片,适用于大模型训练、小模型推理、混合模型场景以及多任务并行等应用。
主要观点
- 算力资源池化:OrionX 通过将物理 GPU 虚拟化为 vGPU,实现 GPU 资源的池化管理,提升资源利用率。
- 动态资源分配:支持按需分配、弹性伸缩、任务抢占、显存超分等功能,满足不同 AI 任务对算力资源的差异化需求。
- 多场景支持:适用于训练、推理、开发、教学实训、虚拟数字人、科学计算等场景。
- 异构算力兼容:支持 NVIDIA GPU、国产 AI 加速卡(如寒武纪 MLU、中科海光 DCU)等多种异构算力芯片。
- 多种部署方式:支持容器云、Kubernetes、KVM、VMware 等主流平台,实现灵活的集成方式。
- 高效性能与低损耗:OrionX 本地 vGPU 性能损耗几乎为零,远程 vGPU 性能损耗小于 2%,支持高性能网络传输。
关键信息
产品概述
- OrionX 是一个完整的 AI 算力资源池化平台,能够实现 GPU 资源的统一管理和调度。
- 通过软件定义的方式,将 AI 应用与物理 GPU 解耦,实现资源透明共享。
产品优势
- 提高利用率:支持任意大小的 vGPU 切分,提升物理 GPU 利用率至 3-10 倍。
- 高性能:本地 vGPU 性能损耗几乎为零,远程 vGPU 性能损耗小于 2%。
- 弹性扩展:支持从单台服务器到整个数据中心的 GPU 资源池化,提供全分布式部署。
- 灵活调度:支持 CPU 与 GPU 资源解耦,实现按需调度。
- 全局管理:提供统一的资源调度策略和监控界面,便于运维管理。
- 对开发人员友好:支持一键解决 GPU/CPU 配比、多机多卡模型拆分等问题,提升开发效率。
软件架构
- 逻辑架构:包括 OrionX Controller (OC)、OrionX Server Service (OSS)、OrionX Client Runtime (OCRT) 和 OrionX GUI (OG) 四个核心组件。
- 组件间通信:通过管理平面和数据平面实现高效通信。
- 管理平面:基于 TCP/IP 网络,实现组件注册、发现、信息同步等功能。
- 数据平面:支持多种高性能传输方式(如 RDMA、TCP/IP),实现低延迟、高带宽的数据交换。
部署形态
- 支持多种部署方式,包括:
- 裸金属服务器
- 容器化部署(Docker)
- Kubernetes 集成
- KVM 集成
- VMware 集成
- 适配多种 Linux 发行版(CentOS、Ubuntu、Debian)及主流云平台。
应用场景
- 大模型训练场景:
- 支持“化零为整”和“隔空取物”功能,实现多 GPU 资源的聚合与远程调用。
- 小模型推理场景:
- 支持“化整为零”功能,实现单 GPU 资源的细粒度切分与共享。
- 混合模型场景:
- 支持“随需应变”、“任务队列”、“抢占”、“显存超分”、“双类资源池”、“热迁移”等功能,提升资源调度灵活性与任务执行效率。
- 多 Arch 架构:
- 支持同时运行 AI 计算(CUDA)和图形渲染(OpenGL),满足多协议需求。
- 异构算力管理:
- 支持 NVIDIA GPU、寒武纪 MLU、中科海光 DCU 等异构算力芯片的统一调度与管理,推动国产化替代。
性能测试
测试环境
- 硬件配置:双路 Intel Xeon Gold 6132、128GB 内存、Tesla P40 GPU。
- 软件配置:KVM 环境(libvirt 1.3.0、qemu 2.5.0)、NVIDIA 显卡驱动 418.43、CUDA 9.0、cuDNN 7.4.2。
测试用例
- 使用 TensorFlow、官方 benchmark 和 synthetic 数据进行测试。
测试结果
- Native GPU:表示 AI 应用在物理 GPU 上运行的性能基准。
- Orion Local Container:表示在安装了 OrionX 的容器中运行的性能。
- Orion Local KVM:表示在安装了 OrionX 的 KVM 虚拟机中运行的性能。
- Orion Remote - 25G RDMA:表示通过远程 RDMA 网络调用 GPU 的性能。
测试结果表明,OrionX 在不同部署方式下均能提供接近或媲美物理 GPU 的性能,同时具备良好的资源利用率与扩展性。
兼容性列表
网络
- TCP/IP 以太网络
- RDMA 网络(InfiniBand 和 RoCE)
NVIDIA GPU
- Tesla 系列:H、L、A、T、V、P、M
- GeForce 系列:RTX 30、RTX 20、GTX 10、GTX 98/97/96/95/75
- Quadro 系列:RTX、GV/GP、P、M
寒武纪 MLU
- MLU-370-X4/X8
- MLU-270-X5K
中科海光 DCU
- Z100L、Z100
NVIDIA CUDA
- CUDA 12.0, 12.1
- CUDA 11.0-11.8
- CUDA 10.0-10.2
- CUDA 9.0-9.2
寒武纪 Neuware
- Neuware-3.4.2、Neuware-3.0.2、Neuware-2.8.5、Neuware-2.7.3、Neuware-2.6.4、Neuware-2.5.2
中科海光 DTK
- DTK-22.04
操作系统
- 64位 CentOS 6/7
- 64位 Ubuntu 16/18/20
云平台
- 容器环境:Docker 12.03 及以后版本
- Kubernetes 环境:Kubernetes 1.10 及以后版本
- KVM 环境:QEMU-KVM (QEMU2.8 以上)
深度学习框架
- TensorFlow(CUDA 版本:1.8-2.12)
- TensorRT(5.x、6.x、7.0-7.2、8.x)
- PyTorch(CUDA 版本:1.0-1.12)
- PaddlePaddle(1.5、1.6、2.0-2.3.2)
- ONNX(1.0-1.12)
- MXNet(1.4.1、1.6-1.9)
- XGBoost(0.72、0.8、0.9)
- NVCaffe(1.0)
- Cambricon TensorFlow/PyTorch(Neuware 版本:1.15/2.4、1.6/1.9)
- Cambricon Magicmind(0.6)
- DTK TensorFlow/PyTorch/PaddlePaddle(1.15/2.7、1.10、2.3.0)
注:兼容性测试基于 OrionX-CS-4.2.0 版本进行验证。
总结
OrionX 通过其先进的算力池化技术,解决了当前 AI 企业面临的资源利用率低、部署复杂、资源隔离不足等问题,显著提升了 GPU 资源的使用效率和灵活性。其支持多种部署方式与异构算力芯片,可满足不同场景下的 AI 应用需求。同时,OrionX 提供丰富的功能组件与管理界面,便于运维与开发人员进行资源调度与管理,为 AI 应用提供了一个高效、智能、灵活的算力资源池化平台。
展开完整摘要
试读结束,高清完整版pdf/doc/ppt,请点下载