> **来源:[研报客](https://pc.yanbaoke.cn)** # PD 分离异构算力混部实践技术白皮书总结 ## 核心内容概述 本白皮书围绕大语言模型(LLM)推理过程中的 **Prefill-Decode 分离(PD 分离)** 架构与 **异构算力混部** 技术,提出了一种面向规模化、高稳定性的 AI 推理解决方案。该方案通过将计算密集型的 Prefill 阶段与访存密集型的 Decode 阶段分别部署于不同算力资源池,结合国产 GPU MTT S5000 与国际高端 GPU(如 HXXX)的协同推理,实现了高效、低成本、安全可控的 Token 生产体系。 ## 主要观点与关键信息 ### 1. 行业背景与挑战 - **算力需求激增**:中国智能算力规模达 2185 EFLOPS(FP16),同比增长 177%。 - **行业焦点转变**:从“训练更大模型”转向“低成本、高稳定性生产高品质 Token”。 - **三大瓶颈**: - **成本瓶颈**:高并发推理带来算力消耗,Token 成本成为关键约束; - **效率瓶颈**:Prefill 与 Decode 阶段资源需求差异大,传统部署难以释放集群效率; - **国产化瓶颈**:国产算力需系统级优化方案以实现规模化部署。 ### 2. PD 分离架构优势 - **任务特性差异**:Prefill 为计算密集型,Decode 为访存密集型; - **资源匹配**:将 Prefill 任务分配给高算力芯片,Decode 分配给高带宽芯片; - **系统优化**:消除阶段间资源争抢与时延干扰,显著提升吞吐量。 ### 3. 异构算力混部战略价值 - **因材施教**:优化算力资源分配,提升整体推理效能; - **灵活多元**:降低对单一芯片供应商依赖,构建弹性算力供应体系; - **成本优化**:实现国产 GPU 对国际 GPU 的等效替代,提升性价比; - **政策响应**:支持国家“人工智能+”行动与全国一体化算力网建设。 ### 4. 技术方案与架构 - **4P2D 异构集群**:4 台 MTT S5000(Prefill) + 2 台 HXXX(Decode); - **部署比例**:2:1,实现国产 GPU 对国际 GPU 的算力等效替代; - **模型适配**:Kimi K2.6 模型,采用 FP8 精度,确保数据一致性; - **通信机制**:Mooncake RDMA 实现 KV Cache 高效传输,保障数据正确性与稳定性。 ### 5. 推理引擎与优化技术 - **统一硬件抽象层(HAL)**:兼容多类芯片指令集,降低硬件迭代成本; - **高性能算子库**:融合 FlashAttention/MLA 与硬件指令优化,逼近理论峰值; - **自适应量化技术**:QIR 量化算法实现 FP8 在异构芯片上的性能与精度对齐; - **四层联合优化框架**:涵盖芯片、模型、推理引擎、框架四层优化,提升推理效率至开源方案的 10 倍以上。 ### 6. 性能测试结果 - **单卡吞吐量**:MTT S5000 在 Prefill 阶段达到 HXXX 的 46%~54%; - **时延指标**: - **TTFT**:1~6 秒(常规并发),峰值 14.1 秒(16 并发 /128K 输入); - **TPOT**:0.011~0.020 秒,最大并发下无剧烈抖动; - **TPS**:90.91~40.00 Tokens/s,随并发增加呈线性平缓下降; - **全链路表现**:4P2D 集群全面对标 2P2D 纯 HXXX 集群,在算力总量、响应速度、生成流畅度等方面表现一致。 ### 7. 工程化能力与生产落地 - **体系化能力**:涵盖模型统一接入、异构 PD 分离、KV Cache 管理、弹性伸缩、限流熔断、监控告警与 SLO、计量计费与运营分析; - **生产可行性**: - 全链路时延满足在线服务 SLA; - TPOT 流畅稳定,极限抗压能力良好; - Mooncake RDMA 通信验证通过,为大规模部署奠定基础。 ## 行业意义与展望 - **国产算力替代路径**:支持国产 GPU 在不牺牲用户体验的前提下逐步替代国际高端产品; - **推动异构标准建设**:为行业提供可量化的容量规划与部署参考; - **支撑全国算力网建设**:促进异构算力互联互通与资源灵活调度; - **构建安全可控底座**:形成模型、算力、平台、运营协同的新型基础设施体系,助力 AI 应用规模化落地。 ## 总结 本方案通过 PD 分离与异构算力混部技术,实现了国产 GPU 与国际 GPU 的高效协同推理,不仅解决了传统部署中的效率与成本瓶颈,还为 AI 基础设施的国产化、规模化、稳定化提供了可落地的技术路径。未来,随着更多国产芯片的加入与异构算力调度标准的完善,该方案有望成为 AI 推理领域的重要基础设施范式。