> **来源:[研报客](https://pc.yanbaoke.cn)** # 关于人工智能大模型的几点思考总结 ## 核心内容概述 清华大学郑纬民教授在2025年4月11日的报告中,围绕人工智能大模型的发展趋势、生命周期管理、国产智算系统建设、企业应用路径以及相关技术成果进行了深入探讨。 --- ## 主要观点与关键信息 ### 2025年AI大模型的两个特点 - **多模态发展**:从单模态向多模态演进,支持文本、音频、图像、视频等多种数据形式。 - **性能与规模提升**:大模型在训练和推理性能上持续突破,如LLaMA-70B和MoE-567B等模型的广泛应用。 ### 人工智能大模型生命周期的五个环节 1. **数据获取**:收集海量多模态数据,面临小文件存储的挑战。 2. **数据预处理**:占训练时间的30%-65%,对文件系统提出高延迟、高随机读取需求。 3. **模型训练**:需要海量算力,如GPT4训练使用1万块A100 GPU耗时11个月。 4. **模型微调**:需可控算力,针对特定领域进行优化。 5. **模型推理**:对实时性要求高,需稳定可靠的算力支持。 --- ## 海量小文件存储挑战与解决方案 - **挑战**:现有文件系统难以同时满足扩展性和低延迟需求。 - **集中式架构**(如HDFS、Lustre):延迟低,但扩展性差。 - **分布式架构**(如CephFS):扩展性强,但延迟高。 - **解决方案**:提出“解耦合的目录树存储”架构。 - **低延迟**:目录元数据集中在一台服务器中,避免跨服务器访问。 - **可扩展性**:文件元数据分布于多台服务器,支持横向扩展。 - **实验结果**:SuperFS文件系统相较CephFS、Lustre等系统,延迟降低51-59倍。 --- ## 国产智算系统与基础软件 - **国产智算系统**:国家推动智算中心建设,如上海、北京、江苏等地均提出国产算力占比目标。 - **核心基础软件**:构建国产智算系统需要10个核心软件支持,包括: - 并行系统、通信库、编程框架(如PyTorch、飞浆PaddlePaddle) - 编译器(如CUDA、ROCM、oneAPI) - 算子库、内存管理、调度系统、存储系统等。 - **“八卦炉”系统**:清华大学自主研发,支撑国产AI算力系统,包括: - **PowerFusion**:面向国产AI芯片的智能编译器 - **FastMoE**:支持MoE模型训练的并行加速系统 - **IntelliGen**:高性能图算融合编译器 - **FastDecode**:高吞吐推理系统,支持KV-Cache分离存储 - **FastTensor**:面向不规则程序的编程语言 --- ## 企业如何利用AI大模型 - **关键步骤**: 1. 识别企业核心问题,解决这些问题将带来根本性变化。 2. 确保有足够的高质量数据支持模型训练。 3. 在数据处理和模型优化上,若人工处理能力不足,需引入AI技术。 - **应用路径**: - 选择一个基础大模型。 - 对其进行微调,适配企业需求。 - 构建企业专用大模型,实现智能化升级。 --- ## 技术应用案例 ### 诸葛弩:以数据为中心的大数据处理引擎 - **设计目标**:降低数据预处理延迟,提升效率。 - **优势**:兼容PySpark接口,采用编译优化技术,实现数据本地化处理。 - **应用效果**:在144GB数据规模下,加速比达4.2倍。 ### FastMoE:混合专家模型训练系统 - **挑战**:传统并行方式难以应对显存不足、通信量大、负载不均等问题。 - **解决方案**:采用新的并行策略,提升性能。 - **效果**:在摩尔线程MCCX-D800 8卡机上取得1.32倍加速比。 ### FastDecode:高吞吐推理系统 - **挑战**:大模型推理对显存需求大,KV-Cache占用大量资源。 - **解决方案**:使用CPU和主存处理KV-Cache,实现存算分离。 - **效果**: - Llama-13b模型,清程Pro相较云燧S60+vLLM提升1.7倍吞吐。 - 清程Max相较原有方案提升7.6倍吞吐。 --- ## Mooncake:以KVCache为中心的推理架构 - **设计理念**:以存换算,提升推理吞吐。 - **核心技术**: - 超大规模分离式内存池用于KVCache缓存和调度。 - 面向过载场景的调度策略,保障用户体验。 - **效果**:在模拟实验中,相较vLLM提升75%的请求处理能力。 --- ## AI产业化趋势 - **中国优势**:国家政策支持、企业积极性高,AI产业化进程加快。 - **DeepSeek**:代表国产AI大模型的突破,具有成本优势、模型效果好和开源特性。 - **未来方向**:重视工程基础设施、算法优化和软件生态建设,以缩小与国际先进水平的差距。 --- ## 国内AI会议与活动 - **北京**: - 全球软件开发大会(4月) - 全球人工智能开发与应用大会(6月、12月) - **上海**: - 全球软件开发大会(10月) - 全球人工智能开发与应用大会(5月) - **深圳**: - 全球人工智能开发与应用大会(8月) 这些会议聚焦AI大模型、智能硬件、多模态应用、AI Agent等前沿方向。 --- ## 总结 - **AI大模型**正朝着多模态、高性能、大规模方向发展。 - **存储与算力**是大模型训练和推理的核心瓶颈,需针对性优化。 - **国产智算系统**建设是未来AI发展的关键,需突破软件生态限制。 - **企业应用**应结合自身需求,通过选择基础模型、数据预处理和微调实现智能化升级。 - **技术成果**如SuperFS、诸葛弩、八卦炉、Mooncake等,展示了中国在AI基础设施和应用层面的快速进步。