2023-09-11-浪潮-大模型智算软件栈OGAl-v1.0_20页_2mb
报告摘要
大模型智算软件栈OGAI概述
1. 大模型:AI技术新范式
大模型技术是当前生成式AI(AIGC)发展的核心驱动力。从2020年起,大模型如GPT-3、ChatGPT、Bard等广泛进入日常生活和办公,通过零样本学习、提示词工程、指令微调和人类反馈强化学习等技术创新,强调性能和泛化能力。2022年底ChatGPT的发布推动了AIGC热情,2023年以来投资激增,国内超过100个生成式AI模型发布。开源开放如LLaMA进一步激发社区发展,Falcon和MPT等模型加剧生态丰富性。当前挑战包括大模型的高效使用、性能优化和实际应用落地。
2. 大模型研发与应用的需求和挑战
大模型应用落地面临多重挑战。首先是算力需求高,训练算力当量(如GPT-4可达GPT-3数十倍),需要大型AI集群,训练周期长、故障频发、稳定性要求高,可能导致成本增加。其次是开发复杂,训练过程涉及分布式调度优化、大数据处理(PB级数据爬取、清洗)和算法调整,工具链冗长,需简化工程化支持。部署阶段选择合适基础模型(商业vs开源)和适应行业应用是主要障碍,同时需考虑数据安全和算力管理。
3. 浪潮信息的大模型探索与实践
浪潮信息长期专注于AI算力基础设施,提供高性能AI服务器、存储和网络,市场份额全球领先。积累了丰富的性能调优经验,通过云原生调度和RDMA优化,提升了训练效率和稳定性。2021年发布了“源1.0”中文大模型,涉及2457亿参数,并通过算力调度和性能监控,将GPU利用率从30%提升到50%。实践包括数据清洗、工具链构建等,帮助客户提升大模型性能。
4. OGAI: 大模型智算软件栈
OGAI(Open GenAI Infra)是浪潮信息发布的全栈软件栈,旨在降低大模型研发和应用门槛,提供从算力建设到模型管理的SDK支持,强调性能优化、全栈流程和实战验证。设计理念包括全栈全流程、性能充分释放和最佳实践融合。
4.1 整体架构
OGAI采用5层架构(L0-L4),覆盖智算中心OS、PODsys、AIStation、YLink和MModel,实现弹性和优化。
- L0: 智算中心OS - 为公共AI平台提供多租户裸金属服务,支持快速部署、弹性扩展、性能监控和安全隔离。
- L1: PODsys - 开源工具链,用于AI集群部署,简化环境安装、监控和调度,支持一键部署和自动化运维。
- L2: AIStation - 商业化调度平台,提供云原生资源共享、高效算力分配、断点续训功能,优化分布式训练。
- L3: YLink - 开发工具链,集数据处理(如Gather、Transform)、模型训练(Megatron、DeepSpeed)和微调(LMFLo、Prompter)于一体。
- L4: MModel - 多模型纳管平台,支持模型评测、数据集管理和安全API服务。
5. 核心组件功能总结
- 智算中心OS: 提供GPU裸金属服务、多租户隔离、快速计费和监控。功能包括统一门户、配额管理、运维系统。
- PODsys: 开源部署方案,集成驱动和工具,简化集群配置,支持自动化和优化。
- AIStation: 云原生调度器,纳管资源,提供弹性训练、故障恢复和高性能通信优化。
- YLink: 工具包支持数据生成(如DataGen)、格式转换、清洗和模型训练,参考流程提升开发效率。
- MModel: 平台管理多模型版本,支持评测、数据安全和社区资源共享。
挑战和需求:大模型对算力、数据质量、工程化工具依赖高,OGAI旨在解决这些问题,加速AI应用落地。
试读结束,高清完整版pdf/doc/ppt,请点下载